KT, 자체 개발한 '믿.음 2.0' 공개…'한국적 AI'로 승부 : zum 뉴스

KT 기술혁신부문 연구원들이 서초구 KT 우면연구센터에서 믿:음 2.0을 테스트하고 있는 모습

KT가 한국 문화를 담은 자체 개발 언어모델(LLM) ‘믿:음 2.0’의 오픈소스를 AI 개발자 플랫폼 허깅페이스(HuggingFace)를 통해 공개할 예정이라고 3일 밝혔다.

이 오픈소스는 기업과 개인, 공공 누구나 상업적으로 활용할 수 있도록 제약 없이 개방된다.

KT는 한국의 정신과 방식, 지식을 기반으로 구현해 한국에 가장 잘 맞는 '한국적 AI'를 지향한다.

이를 위해 KT는 한국의 사회적 맥락과 같은 무형의 요소와 한국어 고유의 언어적·문화적 특성 등을 충분히 반영해 학습한 AI 모델을 개발했다.

이번에 KT가 선보이는 믿:음 모델은 ▲115억 파라미터 규모의 ‘믿:음 2.0 Base’ ▲23억 파라미터 규모의 ‘믿:음 2.0 Mini’ 2종으로 모두 한국어와 영어를 지원한다.

믿:음 2.0 Base는 범용 서비스에 적합한 모델로 한국 특화 지식과 문서 기반의 질의 응답에서 강력한 성능을 나타낸다. 믿:음 2.0 Mini는 Base 모델에서 증류한 지식을 학습한 소형 모델이다.

믿:음 모델은 한국어와 한국 문화 및 사회 등의 전문 분야에서 기존의 국내외 주요 모델을 상회하는 이해력과 생성 성능을 입증했다.

KT와 고려대학교가 공동 개발한 한국어 AI 역량 평가 지표인 ‘Ko-Sovereign(코-소버린)’ 벤치마크에서 유사 규모의 국내 기성 모델을 비롯해 글로벌 최고 수준의 오픈소스 모델을 능가하는 점수를 기록했다.

한국과 관련한 전문 지식의 이해도를 측정하는 대표적 벤치마크 ‘KMMLU’와 한국어 언어모델 평가 지표인 ‘HAERAE’에서도 믿:음은 국내외 주요 오픈소스 모델보다 더 우수한 성능을 기록했다.

KT는 국내 교육용 도서와 문학 작품 등의 발간물, 법률 및 특허 문서, 각종 사전 등 다양한 산업·공공·문화 영역에서 방대한 한국 특화 데이터를 확보해 믿:음 2.0 학습에 활용했다.

특히 KT는 믿:음 2.0은 AI의 윤리성 및 신뢰성을 높이기 위해 국내외 정책과 가이드라인을 기반으로 전문가들과 함께 만든 ‘AI 영향 평가 체계’를 적용해 보다 안전하고 투명한 기술을 구현하는 데 힘썼다.

KT는 마이크로소프트와의 협업으로 GPT-4에 한국적 사고를 추가 학습시키는 방식의 모델 또한 순차 공개할 예정이다.

이 기사의 카테고리는 언론사의 분류를 따릅니다.