검증 벤치마킹 표준 제안
The Verification Benchmarking Standard (Verification Intelligence series, Paper 11 of 12)
현재 인공지능(AI) 벤치마크는 시스템의 생성 능력, 즉 추론, 코드 품질, 언어 유창성 등을 주로 측정한다. 그러나 기업이 AI 시스템을 배포할 때 직면하는 재작업률, 검증 비용, 잘못된 완료 빈도, 그리고 검증된 정확한 결과물을 산출하는 데 드는 총비용과 같은 실질적인 문제들은 제대로 반영하지 못하고 있다. 본 논문은 이러한 생성 능력과 배포 신뢰성 간의 격차를 포착하기 위한 새로운 벤치마킹 표준을 제안한다. 이 표준은 일곱 가지 핵심 검증 지표를 중심으로 구축되어, AI 시스템의 실제 운영 환경에서의 성능을 종합적으로 평가한…