Caramel LabCaramel Lab

2026년 38주차 · 급상승 연구 주제

적대적 생성 신경망 (GAN) 및 이미지 합성

컴퓨터 과학 · Generative Adversarial Networks and Image Synthesis

194%

1,1573,400
분야 평균 대비 +164%p

왜 지금 뜨나

사실적인 이미지, 비디오, 오디오 등을 생성하는 능력이 비약적으로 발전하며 예술, 디자인, 가상현실 등 다양한 분야에서 새로운 가능성을 열고 있습니다.

출판량은 OpenAlex 전수 데이터를 최근 12개월과 직전 12개월로 나눠 비교한 값이에요. 분야 전체가 함께 커지는 착시를 빼기 위해 분야 중앙값 성장률을 차감한 초과 성장(+164%p)으로 순위를 매겼어요.

이 주제로 잡을 수 있는 연구 방향

학부·석사 수준에서 실제로 착수 가능한 스케일로 좁힌 방향이에요. 마음에 드는 걸 고르면 카라멜 조교가 이어서 구체화해 줘요.

이 주제 전체로 아이디에이션 시작

이 주제의 대표 논문

인용 속도와 최신성으로 고른 논문이에요. 한국어 요약을 먼저 보고, 원문은 8개 섹션 풀 분석으로 이어갈 수 있어요.

1

장문 맥락 확산 언어 모델 추론 가속화

SW-SpeedDLM: Sliding Window Speculative Decoding for Diffusion Language Models Under Long Context Constraints

마스크 확산 언어 모델(MDLM)은 모든 디노이징 단계에서 양방향 어텐션을 사용하며, 이는 단계 수 T와 시퀀스 길이 n에 대해 O(Tn^2)의 높은 연산 비용을 발생시킵니다. 특히, 80억 매개변수 모델에서 n=8192, T=128일 경우 KV 캐시만 40GB를 초과하여 단일 GPU로는 긴 문서 생성이 어렵습니다. 본 연구는 이러한 한계를 극복하기 위해 사전 학습된 MDLM의 추론 래퍼인 SW-SpeedDLM을 제안합니다. SW-SpeedDLM은 세 가지 핵심 구성 요소로 이루어져 있습니다. 첫째, 분할 슬라이딩 윈도우 디노이징…

2026·5 인용

2

Swin 어텐션 기반 딥페이크 실시간 탐지

Real time detection of deepfakes using the efficient Swin attention network with global and local facial features

최근 딥페이크 생성 기술의 급속한 발전은 기존 탐지 방법론의 한계를 드러내고 있습니다. 특히 다양한 데이터셋에서 높은 탐지 정확도와 실시간 효율성을 동시에 달성하기 어렵다는 문제가 제기됩니다. 본 연구는 이러한 간극을 해소하고자, 지역 및 전역 얼굴 특징을 동시에 활용하는 하이브리드 딥러닝 프레임워크인 Efficient-Swin Attention Network (ESANet)를 제안합니다. ESANet은 경량의 EfficientNet-B0를 통해 지역 특징을 추출하고, Swin Transformer로 계층적 전역 얼굴 관계를 모델…

2026·6 인용

3

트랜스포머 및 CNN 기반 딥페이크 탐지

Cross-dataset video deepfake detection using Transformer and CNN architectures

딥페이크 생성 기술의 발전은 디지털 미디어의 신뢰성을 위협하며, 사생활 침해, 보안 문제, 허위 정보 유포 등 심각한 위험을 초래하고 있습니다. 딥러닝(DL) 기반 탐지 방법론이 유망하지만, 적용의 일관성 부족, 표준화된 파이프라인 부재, 그리고 데이터셋 간 일반화 능력의 한계로 인해 실제 환경에서의 신뢰성 있는 배포가 어렵습니다. 본 연구는 비디오 딥페이크 탐지를 위해 트랜스포머 및 CNN 기반 아키텍처를 종합적으로 평가합니다. 여러 벤치마크 데이터셋과 새롭게 구축된 얼굴 재연(facial-reenactment) 데이터셋을 활용…

2026·5 인용

4

프롬프트 임베딩 역전을 통한 텍스트 기반 편집

StyleDiffusion: Prompt-Embedding Inversion for Text-Based Editing

사전 학습된 확산 모델의 뛰어난 이미지 편집 능력 활용에 대한 연구가 활발합니다. 기존 접근 방식들은 모델 미세 조정 또는 잠재 공간에서의 이미지 역전을 사용하지만, 선택 영역의 불만족스러운 결과와 비선택 영역의 예상치 못한 변화, 그리고 입력 이미지의 모든 시각적 객체를 포함해야 하는 텍스트 프롬프트 편집의 어려움이라는 두 가지 문제에 직면합니다. 본 연구는 이러한 문제를 해결하기 위해 두 가지 개선 방안을 제안합니다. 첫째, 교차-어텐션 레이어의 값 선형 네트워크 입력만을 최적화하는 것으로 실제 이미지 재구성에 충분한 성능을 …

2026·12 인용

5

DeiTFake: 다단계 훈련 딥페이크 탐지

DeiTFake: Deepfake detection model using DeiT multi-stage training

딥페이크는 디지털 미디어의 신뢰성을 심각하게 위협하는 주요 문제로 부상하고 있습니다. 본 연구는 이러한 위협에 대응하기 위해 DeiT 기반 트랜스포머 모델인 DeiTFake와 점진적 증강 복잡도를 활용하는 2단계 훈련 전략을 제안합니다. 제안하는 방법론은 표준 증강을 적용한 전이 학습 단계로 시작하며, 이후 고급 아핀 및 색상 기반 증강을 사용한 미세 조정 단계를 거칩니다. DeiT 모델의 사전 학습된 가중치를 활용하여 조작 흔적 학습을 위한 강력한 초기화를 제공함으로써 탐지 모델의 견고성을 크게 향상시킵니다. OpenForen…

2026·5 인용

6

딥페이크 탐지 기술: 최신 동향 종합 분석

A Comprehensive Review of Deepfake Detection Techniques: From Traditional Machine Learning to Advanced Deep Learning Architectures

딥페이크 기술은 디지털 미디어의 진위성에 전례 없는 위협을 가하며, 신뢰할 수 있는 탐지 시스템의 필요성이 증대되고 있습니다. 본 체계적 문헌 연구는 2018년부터 2025년까지 발표된 딥러닝, 머신러닝, 고전적 이미지 처리 기반 딥페이크 탐지 방법론들을 분석하며, 특히 정확도, 연산 효율성, 교차 데이터셋 일반화 능력 간의 트레이드오프에 중점을 두었습니다. 세 가지 벤치마크 데이터셋(FaceForensics++, DFDC, Celeb-DF)을 활용한 엄격한 동료 심사 연구들을 분석하여, 기존 학계의 통념에 의문을 제기하는 중요한…

2026·6 인용

7

확산 모델 기반 생성 의미 통신

Generative Semantic Communication: Diffusion Models Beyond Bit Recovery

차세대 AI 기반 통신의 핵심으로 기대되는 의미 통신은 수신 측에서 전송 비트열을 복구하지 않고도 전송된 이미지나 비디오와 의미론적으로 동등한 콘텐츠를 재생성할 수 있습니다. 그러나 기존 솔루션들은 부분적인 정보만으로 복잡한 장면을 구성하는 데 한계가 있으며, 생성 방법의 효율성과 전송 정보의 복잡성 간의 균형을 맞추는 데 어려움이 있습니다. 본 연구는 이러한 격차를 해소하고자 확산 모델의 강력한 멀티미디어 콘텐츠 합성 능력을 활용하면서 의미론적 특징을 보존하는 새로운 생성 확산 유도 프레임워크를 제안합니다. 대역폭 사용량을 줄이…

2026·23 인용

8

안정적인 에지 인식 GAN 기반 의료 영상 합성

A Stable Edge‐Aware GAN Approach for Data Augmentation and Privacy‐Preserving High‐Fidelity CT Synthesis

의료 영상 합성 분야에서 GAN(생성적 적대 신경망)은 뛰어난 잠재력을 보였지만, 진단 등급의 품질, 특히 해부학적 에지 보존 및 모드 붕괴 방지 측면에서 한계가 있었습니다. 본 연구는 이러한 문제를 해결하기 위해 안정적인 에지 인식 GAN 아키텍처를 제안합니다. 이 아키텍처는 훈련 중 구조적 그라디언트를 적응적으로 강화하는 동적 학습형 양방향 커널과 공간적 일관성을 유지하기 위한 보간된 스킵 연결을 가진 계층형 생성기를 특징으로 합니다. 방법론은 CT 신장 데이터셋(12,446개 이미지)에 대해 Wasserstein 정규화를 이…

2026·6 인용

9

DC-WGAN 기반 3D 가상 골재 데이터 증강

Augmentation of 3D virtual aggregate database using deep convolutional Wasserstein generative adversarial networks

아스팔트 혼합물 수치 모델의 일반화 능력은 가상 골재 데이터베이스의 제한된 형태학적 다양성으로 인해 저해되며, 이는 아스팔트 포장의 기계적 반응 예측 신뢰도를 낮춥니다. 본 연구는 이러한 한계를 극복하고자 딥 컨볼루션 Wasserstein 생성적 적대 신경망(DC-WGAN)을 활용하여 3D 가상 골재 데이터베이스를 증강하는 새로운 프레임워크를 제안합니다. 스테레오 비전 및 다중 뷰 매칭 기술로 원본 3D 가상 골재 데이터베이스를 구축한 후, 6가지 DC-WGAN 변형 모델을 사용하여 데이터를 증강했습니다. 모델 성능과 증강된 데이…

2025·16 인용

10

다중 데이터 양식 AI 생성 콘텐츠 연구

AI-Generated Content (AIGC) for Various Data Modalities: A Survey

AI 생성 콘텐츠(AIGC)는 AI 알고리즘을 활용하여 텍스트, 이미지, 비디오, 3D 에셋 등 다양한 미디어를 생성하는 기술입니다. 최근 머신러닝(ML) 및 딥러닝(DL) 분야의 발전과 광범위한 응용 가능성으로 인해 AIGC는 상당한 주목을 받고 있으며, 본 연구는 ML/DL 기반 AIGC의 발전을 종합적으로 검토합니다. AIGC 방법론은 이미지, 비디오, 텍스트, 3D 형상, 3D 장면, 3D 휴먼 아바타, 3D 모션, 오디오 등 다양한 데이터 양식에 맞춰 개발되었으며, 각 양식은 고유한 특성과 도전 과제를 제시합니다. 또한,…

2025·39 인용

11

대형 컨볼루션 커널 기반 범용 표현 학습

Scaling Up Your Kernels: Large Kernel Design in ConvNets Toward Universal Representations

본 논문은 현대 컨볼루션 신경망(ConvNets) 설계에서 대형 컨볼루션 커널 활용 패러다임을 제안한다. 여러 개의 작은 커널을 쌓는 대신 소수의 대형 커널을 사용하는 것이 더 우수한 설계 전략이 될 수 있음을 규명하였다. 우리는 대형 커널 ConvNets의 효율성과 성능을 최적화하는 아키텍처 설계 가이드라인을 제시한다. 특히, 대형 커널 ConvNets를 위해 고안된 체계적인 아키텍처 설계 원칙을 제공하는 UniRepLKNet 아키텍처를 제안한다. 이 아키텍처는 깊은 레이어 스태킹 없이도 광범위한 공간 정보를 포착하는 대형 커널…

2025·18 인용

이번 주 트렌드 전체 보기