다국어 LLM의 언어별 이해도 편차
Multilingual large language models do not comprehend all natural languages to equal degrees
Natalia Moskvina, Raquel Montero, Masaya Yoshida 외 5인·Scientific Reports·발표 2026.09· 0 인용
한국어 핵심 요약
대규모 언어 모델(LLM)은 정보 접근의 핵심 역할을 하지만, 대부분의 벤치마크가 서구권 고자원 언어에 집중되어 있어 LLM의 언어 이해 능력에 대한 이해는 제한적입니다. 영어는 LLM 성능이 가장 우수한 언어로 가정되며, 저자원 언어는 신뢰도가 낮다는 인식이 있지만, 최신 다국어 모델에서도 이러한 가정이 유효한지는 불분명합니다.
본 연구는 LLM의 언어 이해 능력 변화를 추적하기 위해 3가지 인기 모델을 인도유럽어족, 아프리카아시아어족, 튀르크어족, 중국티베트어족, 일본어족을 대표하는 12개 언어로 평가했습니다. 이 방법론을 통해 모델의 언어별 성능 차이를 정량적으로 분석했습니다.
연구 결과, LLM은 유형학적으로 다양한 언어에서 뛰어난 정확도를 보였으나, 인간 기준에는 미치지 못하는 경우가 있었습니다. 특히 예상과 달리 영어는 최고 성능 언어가 아니었으며, 여러 로맨스어, 심지어 저자원 언어보다도 체계적으로 낮은 성능을 보였습니다. 이는 토큰화, 스페인어 및 영어와의 언어 거리, 훈련 데이터 규모, 고자원/저자원 언어 및 WEIRD/비WEIRD 커뮤니티 데이터 출처 등 다양한 요인이 LLM 성능에 영향을 미침을 시사합니다.
이러한 발견은 LLM 개발 및 평가 시 언어 다양성을 고려해야 함을 강조하며, 특정 언어 편향 없이 모델 성능을 최적화하기 위한 중요한 통찰을 제공합니다. 향후 다국어 LLM의 공정하고 포괄적인 발전에 기여할 것입니다.
섹션 미리보기
연구 배경
LLM의 언어 이해 능력 평가는 주로 서구권 고자원 언어에 편중되어 있습니다. 영어는 LLM 성능이 가장 우수하다는 가정이 지배적이지만, 다국어 모델에서도 이러한 가정이 유효한지는 불분명합니다.
핵심 발견
예상과 달리 영어는 최고 성능 언어가 아니었으며, 여러 로맨스어에 비해 낮은 성능을 보였습니다. 토큰화, 언어 거리, 훈련 데이터 규모 등 다양한 요인이 LLM 성능에 영향을 미치는 것으로 나타났습니다.
관련 컴퓨터 과학 논문
부분 관측 다중 모드 헬스케어 예측을 위한 차등 프라이빗 연합 학습
2026·0
미주신경성 실신 탐지: 프라이버시 보호 ML
2026·0
AI 생성 대화의 자연스러움: 턴 주고받기 및 역할 행동 분석
2026·0
해양 공간 데이터 인프라와 오픈 사이언스 연계
2026·0