Caramel LabCaramel Lab
#

컴퓨터 비전

7편의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2026.09· 0

EDAFNet: 효율적 이중 주의 융합 HDR 재구성

다중 노출 저명도 범위(LDR) 이미지로부터 고명도 범위(HDR) 이미지를 재구성하는 것은 움직임 및 노출 불일치 상황에서 밝고 어두운 영역의 세부 사항을 보존하며 넓은 휘도 범위를 복원하는 것을 목표로 합니다. 그러나 높은 재구성 충실도는 종종 계산 복잡도 증가를 수반하며, 이는 실제 적용에 있어 주요 제약이 됩니다. 본 논문은 효율적인 이중 주의 융합 네트워크(EDAFNet)를 제안합니다. 이 네트워크는 CBAM 기반 초기화, 교차 노출 정렬 및 융합을 위한 계층적 지역 및 전역 주의 메커니즘, 그리고 깊이별 분리 컨볼루션을 기반으로 하는 경량 정제 모듈을 결합합니다. 이를 통해 높은 재구성 품질을 유지하면서 계산 효율성을 극대화합니다. Kalantari 데이터셋 및 Sen, Tursun, Hu 데이터셋에 대한 일반화 테스트 결과, EDAFNet은 우수한 품질-복잡도 균형을 보여주었습니다. 특히, Kalantari 테스트 장면에서 선형 도메인 PSNR 및 SSIM에서 각각 43.37dB와 0.9926으로 최고 성능을 달성했으며, HDR-VDP-2 점수도 68.88로 가장 높았습니다. 또한, 통계적 분석 결과 PSNR-l 개선이 비교 방법론 대비 유의미함을 확인했습니다. EDAFNet은 0.31M의 적은 파라미터 수와 0.464T FLOPs의 낮은 계산량으로 강력한 HDR 재구성 충실도와 경쟁력 있는 지각 품질을 제공합니다. 이는 실제 HDR 재구성 시스템 개발에 있어 효율성과 성능을 동시에 만족시키는 중요한 진전을 의미합니다.

생물학발표 2026.09· 1최근 1년 1회

옥수수 이삭 표현형 분석 자동화

옥수수(Zea mays L.)의 수확량 구성 형질 변이를 정량화하는 것은 식물 유전학 연구, 품종 개량 및 농업 기술 발전에 매우 중요합니다. 에이커당 곡물 수확량은 에이커당 식물 수, 식물당 이삭 수, 이삭당 알곡 수, 평균 알곡 무게의 함수입니다. 이삭당 알곡 수는 이삭당 알곡 줄 수와 줄당 알곡 수의 곱으로 결정됩니다. 기존의 수동 측정 방식은 시간이 많이 소요되어 데이터 수집 규모를 제한하며, 최근 이미지 처리 및 딥러닝을 활용한 자동화 노력은 높은 주석 비용과 다양한 유전자원에 대한 일반화의 어려움에 직면해 있습니다. 본 연구는 이러한 한계를 극복하기 위해 대규모 비전 모델을 활용한 제로샷(zero-shot), 무주석 옥수수 알곡 분할 방법을 탐색했습니다. 오픈 소스 대규모 비전 모델인 Segment Anything Model(SAM)을 사용하여 옥수수 이삭 이미지에서 개별 알곡을 분할하고, 그래프 기반 알고리즘을 구현하여 줄당 알곡 수를 계산했습니다. 이 접근 방식은 다양한 옥수수 이삭에서 줄당 알곡 수를 효과적으로 식별했습니다. 본 연구는 제로샷 기반 비전 모델과 이미지 처리 루틴의 결합이 농업 데이터 수집의 자동화를 향상하고 주관성을 줄일 수 있는 잠재력을 보여줍니다. 모든 코드는 오픈 소스로 공개되어 이러한 효율적인 표현형 분석 방법의 보급에 기여할 것입니다.

생물학발표 2026.08· 0

동백나무 열매 검출 위한 RGB-D 교차 양상 융합

복잡한 과수원 환경에서 RGB 이미지 기반 동백나무 열매 검출의 정확도 한계를 극복하고자, 본 연구는 듀얼 스트림 RGB-D 융합 검출 네트워크인 CIAFNet을 제안합니다. 이 네트워크는 RGB 이미지와 깊이 맵을 병렬 입력으로 활용하며, C3k2_PartialNetBlock을 통해 효율적인 양상 내 특징 추출을 수행하고, 교차 양상 상호작용 및 차이 인식 적응형 융합(CIDAF) 모듈로 교차 양상 특징을 적응적으로 융합합니다. 또한, SC-EUCB가 강화된 BiFPN을 사용하여 다중 스케일 특징 집계 및 업샘플링 시 세부 정보 복원을 최적화합니다. 자연 과수원 RGB 이미지에서 Depth Anything V2를 통해 생성된 의사 깊이 맵과 RGB 이미지를 쌍으로 구성하여 RGB-의사 깊이 데이터셋을 구축했습니다. 통제된 조건에서 Intel RealSense D435i로 수집된 동기화된 RGB-D 데이터는 의사 깊이와 센서 깊이 간의 불일치를 정량화하고 입력 적응성을 평가하는 데 사용되었습니다. 자연 과수원 테스트 세트에서 CIAFNet은 10.49 GFLOPs와 3.80 M 매개변수만으로 93.33%의 mAP@0.5를 달성했습니다. 2단계 미세 조정을 통해 통제된 조건에서 D435i로 측정된 깊이에 대한 CIAFNet의 적응성이 향상되었습니다. 후속 상대 변위 일관성 실험에서는 X, Y, Z축을 따라 평균 절대 일관성 오차가 각각 3.10, 3.15, 3.27 mm였으며, 평균 3D 유클리드 일관성 오차는 5.60 mm였습니다. 이러한 결과는 CIAFNet이 자연 과수원 RGB-의사 깊이 데이터를 사용하여 동백나무 열매 검출을 개선하며, 통제된 조건에서 상대 3D 위치 추적을 위한 시각 프런트 엔드로서의 잠재력이 있음을 보여줍니다.

기계공학발표 2026.08· 1최근 1년 1회

RSU 기반 사고 감지 및 V2X 통신 프레임워크

교통사고는 2차 충돌을 줄이고 긴급 대응을 개선하기 위해 신속한 감지 및 경고 전파가 필수적입니다. 본 논문은 실시간 사고 인식을 위한 효율적인 도로변 장치(RSU) 기반 컴퓨터 비전 프레임워크를 제안하며, 이를 차량-사물 통신(V2X)과 통합합니다. 제안된 아키텍처는 경량 컨볼루션 공간 특징 추출, 광학 흐름 기반 모션 분석, 시간적 점수 집계, 그리고 엣지 배포 가능한 RSU 파이프라인 내 저지연 V2X 경고 생성을 결합합니다. 사고 발생 가능성 추정, 감지 의사 결정, 지연 시간 제약 및 통신 신뢰성 요구 사항을 설명하기 위한 시스템 모델도 제시됩니다. 정상 교통, 단일 차량 사고, 다중 차량 충돌 및 비사고 이상 현상을 포함하는 3,300개 클립의 교통 비디오 데이터셋으로 실험 평가를 수행했습니다. 제안된 하이브리드 프레임워크는 95.8%의 정확도, 95.0%의 정밀도, 94.6%의 재현율, 94.8%의 F1-점수를 달성하여 CNN 단독 및 모션 단독 기준선보다 우수한 성능을 보였습니다. 평균 처리 지연 시간은 프레임당 약 40ms로, RSU 등급 임베디드 하드웨어에서 실시간 작동 가능성을 입증했습니다. 이러한 결과는 제안된 프레임워크가 차세대 지능형 교통 시스템을 위한 정확하고 시기적절한 사고 감지 및 신속한 V2X 경고 전파를 지원할 수 있음을 보여줍니다.

컴퓨터 과학발표 2026.08· 18최근 1년 18회

Sa2VA: 이미지 및 비디오 밀집 접지 이해 통합 모델

기존 멀티모달 대규모 언어 모델(MLLM)은 특정 모달리티 및 작업에 국한되는 한계가 있습니다. 본 연구는 이미지와 비디오 모두에 대한 밀집 접지 이해를 위한 최초의 포괄적이고 통합된 모델인 Sa2VA를 제안합니다. Sa2VA는 참조 분할 및 대화를 포함한 광범위한 이미지 및 비디오 작업을 지원하며, 최소한의 단일 단계 지시 튜닝만 필요합니다. Sa2VA는 기반 비디오 분할 모델인 SAM-2와 고급 비전-언어 모델인 MLLM을 결합하여 텍스트, 이미지, 비디오를 공유 LLM 토큰 공간으로 통합합니다. LLM을 활용하여 Sa2VA는 SAM-2가 정밀한 마스크를 생성하도록 안내하는 지시 토큰을 생성함으로써 정적 및 동적 시각 콘텐츠에 대한 접지된 멀티모달 이해를 가능하게 합니다. 또한, 모델 성능 향상을 위해 복잡한 비디오 장면에서 7만 2천 개 이상의 객체 표현을 포함하는 자동 레이블링 데이터셋인 Ref-SAV를 도입했습니다. 실험 결과, Sa2VA는 특히 참조 비디오 객체 분할에서 여러 작업에 걸쳐 강력한 성능을 달성하며 복잡한 실제 애플리케이션에 대한 잠재력을 입증했습니다. Sa2VA는 Qwen-VL 및 Intern-VL을 포함한 다양한 MLLM으로 쉽게 확장될 수 있으며, 이는 현재 오픈소스 MLLM의 빠른 발전과 함께 업데이트될 수 있습니다.

컴퓨터 과학발표 2026.04· 52최근 1년 52회

YOLOv8-YOLO11 성능 및 구조 비교 분석

딥러닝 기반 컴퓨터 비전 분야에서 YOLO는 혁신적인 모델이지만, 모든 YOLO 모델이 학술 논문이나 아키텍처 다이어그램을 제공하지 않아 모델 이해에 어려움이 있습니다. 기존 연구 또한 각 모델을 포괄적으로 다루지 못했습니다. 본 연구는 YOLOv8부터 YOLO11까지의 아키텍처를 심층적으로 비교 분석하여, 독자들이 각 모델의 작동 방식과 차이점을 신속하게 파악할 수 있도록 돕습니다. 각 YOLO 버전의 아키텍처는 관련 학술 논문, 공식 문서 검토 및 소스 코드 분석을 통해 분석되었습니다. 특히, YOLOv8부터 YOLO11까지의 모델들은 앵커 프리(anchor-free) 및 NMS(Non-Maximum Suppression) 측면에서 유사성을 공유하지만, YOLOv10은 NMS-free라는 독특한 특징을 가집니다. 각 버전은 특징 연결의 복잡성(v8), 아키텍처 구조 및 훈련(v9), 훈련 방식 또는 이중 할당(v10), 추론 및 코드 구현(v11) 등 고유한 단점을 가지고 있습니다. Roboflow 100 데이터셋 벤치마크 결과, YOLOv9가 가장 우수한 정확도를 보였으나 NMS 메커니즘으로 인해 8배 느렸습니다. YOLOv10은 가장 빠르지만 정확도가 가장 낮았으며, YOLOv8과 YOLO11은 속도와 정확도 사이에서 균형 잡힌 성능을 제공했습니다. 각 버전은 아키텍처 개선을 이루었지만, 일부 블록은 변경되지 않았음을 확인했습니다. 본 연구는 독자들이 다양한 YOLO 버전 아키텍처를 이해하고 성능 개선 방안을 모색하는 데 기여합니다. 또한, 포괄적인 아키텍처 다이어그램과 각 블록에 대한 상세 설명을 제공하여 학술 및 실용적 응용을 위한 귀중한 참고 자료가 될 것입니다.

컴퓨터 과학발표 2026.01· 14최근 1년 14회

차세대 토큰 예측 기반 대규모 멀티모달 학습

텍스트, 이미지, 비디오 등 다양한 양식(modality)을 아우르는 통합 학습 및 생성 알고리즘 개발은 인공지능 분야의 오랜 난제였습니다. 대규모 언어 모델(LLM)에서 혁신을 이끈 차세대 토큰 예측(next-token prediction) 방식은 멀티모달 영역으로의 확장에 한계가 있었으며, 이미지 및 비디오 합성에 주로 사용되는 확산 모델(diffusion model)이나 비전 인코더와 언어 모델을 통합하는 복합 프레임워크가 여전히 지배적이었습니다. 본 연구는 차세대 토큰 예측 방식만으로 학습된 멀티모달 모델인 Emu3 제품군을 소개합니다. Emu3는 확산 모델이나 복합 아키텍처 없이도 기존의 태스크별 전문 모델들과 동등한 성능을 달성합니다. 특히 인지 및 생성 작업 모두에서 최첨단 시스템과 견줄 만한 성과를 보였습니다. Emu3는 일관성 있고 고품질의 비디오 생성, 텍스트와 이미지가 혼합된 시각-언어 생성, 그리고 로봇 조작을 위한 시각-언어-행동 모델링까지 성공적으로 수행합니다. 이는 멀티모달 학습을 통합된 토큰 예측 문제로 환원함으로써 가능했습니다. Emu3는 대규모 멀티모달 모델링을 위한 견고한 기반을 마련하고, 통합된 멀티모달 인텔리전스를 향한 유망한 경로를 제시합니다. 이 모델은 확장 가능하고 통합된 멀티모달 지능 시스템 개발에 중요한 함의를 가집니다.

연구 트렌드로 돌아가기