거대 언어 모델(LLM) 분야의 급속한 발전과 함께, 윤리적 사용을 보장하기 위한 강력한 안전 메커니즘, 즉 '안전장치' 또는 '가드레일' 개발의 중요성이 커지고 있습니다. 본 논문은 이 핵심 메커니즘의 현재 상태를 체계적으로 문헌 검토하고, 주요 과제와 다양한 맥락의 윤리적 문제를 다루는 포괄적인 메커니즘으로 발전시킬 방안을 논의합니다.
먼저, 주요 LLM 서비스 제공업체와 오픈소스 커뮤니티가 활용하는 안전장치 메커니즘의 현황을 설명합니다. 이어서 환각, 공정성, 프라이버시 등 가드레일이 강화해야 할 바람직하거나 바람직하지 않은 속성을 평가, 분석 및 개선하는 기술을 다룹니다. 이를 바탕으로 이러한 통제를 우회하는 기술(공격), 공격을 방어하는 기술, 그리고 가드레일을 강화하는 기술을 검토합니다.
위에서 언급된 기술들은 현재의 연구 동향을 반영하지만, 기존 방법으로는 쉽게 해결하기 어려운 여러 과제 또한 존재합니다. 본 논문은 다학제적 접근, 신경-상징적 방법, 시스템 개발 수명 주기를 종합적으로 고려하여 포괄적인 가드레일을 구현하기 위한 비전을 제시합니다.
생성 인공지능(AI)은 인간의 업무 방식에 혁신을 가져오며 생산성 향상에 기여하고 있습니다. 그러나 AI가 새로운 기술 습득, 즉 학습에 미치는 영향은 중요한 미해결 과제입니다. 장기적인 생산성, 특히 AI의 오류 가능성을 고려할 때 사용자의 학습은 필수적입니다. 본 연구는 고등학생을 대상으로 한 현장 실험을 통해 생성 AI 튜터가 학습에 미치는 영향을 탐구했습니다.
거의 천 명의 고등 수학 학생들에게 두 가지 유형의 생성 AI 튜터에 대한 접근 권한을 제공했습니다. 하나는 일반적인 ChatGPT 인터페이스를 모방한 'GPT Base'이고, 다른 하나는 학습을 보호하도록 설계된 프롬프트를 포함한 'GPT Tutor'입니다. 이를 통해 도구 설계가 학습에 미치는 차별적인 영향을 분석했습니다.
연구 결과, GPT-4 접근이 문제 해결 능력 향상에 크게 기여함이 확인되었습니다 (GPT Base는 성적 48%, GPT Tutor는 127% 향상). 그러나 AI 접근 권한이 없어진 후에는 GPT Base를 사용했던 학생들이 AI를 전혀 사용하지 않은 학생들보다 성적이 17% 하락하는 역효과가 나타났습니다. 이는 무제한적인 생성 AI 접근이 교육적 성과에 해를 끼칠 수 있음을 시사합니다.
GPT Tutor에 적용된 안전장치는 이러한 부정적인 학습 효과를 상당 부분 완화했습니다. 안전장치가 없을 경우, 학생들은 연습 문제 풀이 시 GPT-4를 '보조 도구'로만 활용하려 했고, 결과적으로 스스로 문제를 해결하는 능력은 저하되었습니다. 따라서 의사결정권자들은 기술 학습과 장기적인 생산성을 보존하기 위해 생성 AI 배포 시 설계 선택에 신중해야 합니다.