검색 증강 생성(RAG)은 외부 지식을 통합하여 AI 생성 콘텐츠의 관련성을 높이고 환각 현상을 줄이지만, 신뢰성, 안전성, 프라이버시, 공정성, 설명 가능성, 책임성 측면에서 새로운 위험을 야기합니다. 이러한 문제들은 RAG 시스템의 전반적인 신뢰성에 영향을 미치며, 현재까지 이들을 통합적으로 다루는 프레임워크는 부족합니다.
본 연구는 신뢰할 수 있는 RAG 시스템 구축을 위한 포괄적인 로드맵을 제시하여 이러한 격차를 해소합니다. 신뢰성 관련 주요 도전 과제, 기존 해결책, 그리고 미래 연구 방향을 체계적으로 분석합니다. 특히 검색 및 생성 단계와 여섯 가지 신뢰성 차원 간의 상호작용을 중심으로 분야를 정리하고, 교차 차원 분석을 통해 시너지 효과와 상충 관계를 명확히 보여줍니다.
이 분석은 신뢰할 수 있는 RAG가 큰 영향을 미칠 수 있는 실제 응용 분야를 조명합니다. 본 연구는 실세계 AI 시스템에서 신뢰할 수 있는 RAG의 추가 연구와 도입을 장려하는 데 기여할 것입니다.
거대 언어 모델(LLM)은 방대한 파라미터 기반의 지식 저장 능력을 통해 다양한 분야에서 뛰어난 성능을 보였지만, 환각 현상, 지식 업데이트의 어려움, 특정 도메인 전문성 부족 등의 한계를 지닌다. 외부 지식 기반을 활용하여 LLM을 보강하는 검색 증강 생성(RAG)은 이러한 제약을 완화하는 효과적인 대안으로 부상했다.
본 연구는 자연어 처리(NLP) 분야의 RAG 기술을 체계적으로 검토하며, 특히 검색기(retriever)와 검색 융합(retrieval fusion) 방식에 초점을 맞춘다. 질의 기반, 로짓 기반, 잠재적, 파라미터 융합 등 새로운 검색 융합 분류 체계를 제시하고, 접근성, 효율성, 활용 사례를 기준으로 구조화된 비교 분석을 수행한다.
나아가 다양한 NLP 태스크에서의 RAG 적용 사례를 탐구하고, 평가 방법론 및 벤치마크의 한계를 논의한다. 지식 기반 업데이트 유무에 따른 훈련 패러다임을 분석하며, 산업 배포 시 고려사항과 보안, 효율성, 그래프 기반 검색 등 새롭게 부상하는 도전 과제 및 미래 연구 방향을 제시한다.
거대 언어 모델(LLM)은 정적인 정보에 국한된다는 한계를 지닌다. 검색 증강 생성(RAG)은 정보 검색(IR) 기술과 딥러닝을 결합하여 LLM이 최신 외부 정보를 동적으로 통합할 수 있도록 함으로써 이러한 한계를 극복한다. 이 방법론은 주로 텍스트 영역에 초점을 맞추며, LLM이 생성하는 그럴듯하지만 부정확할 수 있는 응답에 대한 비용 효율적인 해결책을 제공하여 실제 데이터를 통해 출력의 정확성과 신뢰성을 향상시킨다.
RAG는 성능에 영향을 미칠 수 있는 여러 개념을 통합하며 복잡성이 증가하고 있다. 본 논문은 RAG 패러다임을 사전 검색, 검색, 사후 검색, 생성의 네 가지 범주로 체계화하여 검색 관점에서 상세한 시각을 제공한다. 또한 RAG의 작동 방식을 설명하고 주요 연구 분석을 통해 이 분야의 발전을 논의한다.
이 연구는 RAG에 대한 평가 방법을 소개하고, 당면 과제를 다루며 미래 연구 방향을 제시한다. 체계적인 프레임워크와 분류를 제공함으로써 RAG에 대한 기존 연구를 통합하고, 기술적 기반을 명확히 하며, LLM의 적응성과 응용 범위를 확장할 잠재력을 강조한다.
대규모 언어 모델(LLM)은 불충분한 학습 데이터와 최신 지식 부족으로 인해 추론 과정에서 사실 오류와 환각 문제를 겪습니다. 검색 증강 생성(RAG)은 외부 소스에서 관련 정보를 검색하여 더 정확한 답변을 생성함으로써 이러한 LLM의 한계를 해결할 유망한 대안으로 부상했습니다. 특히 외부 소스에 구조화된 지식이 널리 존재함에 따라, 그래프 관련 기술을 활용하여 지식 개체 간의 위상 정보를 기반으로 복잡한 추론을 달성하려는 RAG 연구가 활발히 진행되고 있습니다.
기존 연구들이 RAG 파이프라인을 요약했지만, 그래프의 역할을 주로 지식 그래프 탐색에 국한하여 검색, 프롬프팅, 파이프라인 제어 등 그래프 구조가 미치는 광범위한 영향은 충분히 탐구되지 않았습니다. 본 연구는 RAG 내에서 그래프의 기능성과 다양한 그래프 구조 데이터 전반에 걸쳐 성능을 향상시키는 영향에 대한 새로운 관점을 제시합니다.
이 설문조사는 데이터베이스 구축, 알고리즘, 파이프라인 및 작업 등 RAG에서 그래프가 수행하는 역할을 상세히 분석합니다. 또한, 현재의 도전 과제를 식별하고 미래 연구 방향을 제시함으로써 이 분야의 발전을 촉진하고자 합니다. 그래프 중심 분석을 통해 기존 방법론의 공통점과 차이점을 조명하며, 그래프 학습, 데이터베이스 시스템, 자연어 처리와 같은 분야의 미래 연구를 위한 기반을 마련합니다.