Caramel LabCaramel Lab
#

컴퓨터비전

4의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2026.08· 0

경량 학습형 데이터 증강으로 자기 지도 학습 강화

자기 지도 학습에서 데이터 증강은 학습된 표현의 품질과 다양성에 큰 영향을 미치므로 핵심적인 역할을 한다. 그러나 기존 자기 지도 학습 방식 대부분은 고정된 확률적 증강 파이프라인에 의존하며, 적응형 대안들은 정책 탐색, 적대적 학습 또는 추가 최적화 절차에 따른 높은 비용을 요구한다. 본 논문에서는 자기 지도 시각적 표현 학습을 위한 ELM(Extreme Learning Machines) 기반의 경량 학습형 증강 프레임워크를 제안한다. 제안된 모듈은 이미지 의존적 변환 매개변수를 예측하고 이를 미분 가능한 증강 연산자를 통해 적용하여, 최소한의 추가 연산 오버헤드로 표현 모델과 공동 최적화를 가능하게 한다. 이 프레임워크는 SimCLR, BYOL, SimSiam 세 가지 대표적인 자기 지도 학습 방식에 통합되었다. CIFAR-10, CIFAR-100, Tiny ImageNet 데이터셋에 대한 광범위한 실험 결과, 제안된 방법은 대부분의 설정에서 기준선 대비 선형 평가 성능을 일관되게 향상시켰다. 특히 CIFAR 데이터셋에서 주목할 만한 성능 향상을 보였으며, 더 어려운 Tiny ImageNet 벤치마크에서도 효과적이었다. 클래스별 난이도 분석을 통해 제안된 증강 전략이 어려운 클래스에서 성능을 크게 개선하여, 전반적인 경쟁력 있는 성능을 유지하면서도 까다로운 범주에 대한 강력한 견고성을 보여주었다. 이 결과는 경량 학습형 증강이 다양한 프레임워크와 데이터셋에서 자기 지도 표현 학습을 효과적으로 향상시킬 수 있음을 입증한다.

컴퓨터 과학발표 2026.03· 18최근 1년 18

MVTec AD 2 데이터셋: 비지도 이상 감지 고도화

최근 MVTecAD 및 VisA와 같은 기존 이상 감지 벤치마크에서 분할 AU-PRO 성능이 포화 상태에 이르러, 최첨단 모델 간의 변별력이 저하되고 있습니다. 이는 모델 비교를 어렵게 하고, 특히 머신러닝 결과의 확률적 특성을 고려할 때 분야 발전을 저해하는 요인으로 작용합니다. 본 연구는 이러한 한계를 극복하고자 MVTecAD2 데이터셋을 제안합니다. 이 데이터셋은 8개 객체 범주에서 8,000개 이상의 고해상도 이미지를 포함하며, 투명 및 중첩 객체, 암시야 및 역광 조명, 높은 분산의 정상 데이터, 극히 작은 결함 등 기존 데이터셋에서 다루지 않았던 도전적이고 산업적으로 중요한 시나리오를 포함합니다. 최첨단 방법론들을 종합적으로 평가한 결과, MVTecAD2 데이터셋에서 평균 AU-PRO 성능이 60% 미만에 머무는 것을 확인했습니다. 이는 기존 모델들이 실제 산업 환경의 복잡한 이상 감지 시나리오에 여전히 취약함을 시사합니다. 또한, 본 데이터셋은 조명 조건 변화에 따른 테스트 시나리오를 제공하여 실제 분포 변화에 대한 방법론의 강건성을 평가할 수 있게 합니다. MVTecAD2는 비지도 이상 감지 분야의 새로운 연구 방향을 제시하고, 실제 산업 적용 가능성을 높이는 데 기여할 것입니다.

컴퓨터 과학발표 2026.03· 20최근 1년 10

컴퓨터 비전 딥러닝 경량화 연구

지난 10년간 딥러닝 모델은 시각 인지 과제에서 인간 수준을 넘어서는 성능을 보이며 자율주행, 모바일 기기, 로봇 공학 등 실제 응용 분야에 대한 관심을 높였습니다. 그러나 최첨단 모델들은 막대한 연산 자원을 요구하여 전력 소비, 지연 시간, 탄소 배출량 측면에서 실용적이지 않다는 문제가 있습니다. 이러한 효과성과 효율성 간의 상충 관계는 추론 시 연산 비용을 최소화하면서 만족스러운 성능을 달성하는 '연산 효율적인 딥러닝'이라는 새로운 연구 분야를 촉발했습니다. 본 연구는 빠르게 발전하는 이 분야를 네 가지 핵심 영역으로 분석합니다. 첫째, 판별력 있는 심층 표현 추출을 위한 정적 또는 동적 경량 백본 모델 개발. 둘째, 특정 컴퓨터 비전 작업에 최적화된 네트워크 아키텍처 및 알고리즘. 셋째, 딥러닝 모델 압축 기술. 넷째, 효율적인 딥 네트워크를 하드웨어 플랫폼에 배포하는 전략을 다룹니다. 또한, 네트워크 아키텍처 설계, 학습 방식, 실제 효율성, 현실적인 모델 압축 접근 방식 등 이 분야가 직면한 주요 과제들을 체계적으로 논의합니다. 이를 통해 향후 연구 방향에 대한 통찰을 제공합니다. 이 연구는 컴퓨터 비전 분야에서 딥러닝 모델의 실용적 적용을 위한 효율성 문제를 해결하는 데 기여하며, 관련 연구자들에게 포괄적인 관점과 미래 방향을 제시합니다.

컴퓨터 과학발표 2025.07· 73최근 1년 73

컴퓨터 비전 XAI 포괄적 분석

설명 가능한 인공지능(XAI)은 복잡한 모델의 출력을 인간이 이해할 수 있도록 연결하는 것을 목표로 하며, 컴퓨터 비전 분야에서 그 중요성이 커지고 있습니다. 본 연구는 귀인 기반, 활성화 기반, 섭동 기반, 트랜스포머 기반의 네 가지 주요 XAI 방법론을 선별하여 비교 분석합니다. 이는 광범위한 문헌 검토를 통해 대표적인 접근 방식들을 집중적으로 다룹니다. 각 방법론은 고유한 방식으로 모델의 의사결정을 해석합니다. Grad-CAM과 같은 귀인 기반 방식은 기울기와 특징 활성화를 활용하여 입력 이미지의 핵심 영역을 강조합니다. 활성화 기반 방식은 내부 뉴런의 반응을 분석하여 계층적 특징 표현을 밝히고, RISE와 같은 섭동 기반 방식은 모델의 내부 접근 없이 입력 변형을 통해 특징 중요도를 평가합니다. 트랜스포머 기반 방식은 자기 주의 메커니즘을 통해 전역적인 정보 흐름을 추적하여 해석 가능성을 제공합니다. 이 방법론들은 충실도, 국소화 정확도, 효율성, 의료 영상 주석과의 중첩도 등의 지표를 사용하여 평가되었습니다. 또한, XAI 기법의 다양성을 반영하는 계층적 분류 체계를 제안합니다. 분석 결과, RISE는 가장 높은 충실도를 보였으나 계산 비용이 높아 실시간 적용에 한계가 있었습니다. 트랜스포머 기반 방식은 의료 영상 분야에서 높은 IoU 점수를 기록했으나, 주의 맵 해석에 신중함이 요구됩니다. 이러한 발견은 해석 가능성과 효율성 사이의 균형을 맞추는 상황 인지적 평가 및 하이브리드 XAI 방법론의 필요성을 강조합니다. 본 연구는 윤리적, 실용적 과제를 논의하며 표준 벤치마크와 도메인별 튜닝의 중요성을 역설합니다.

연구 트렌드로 돌아가기