인공지능(AI) 통합은 고성능 컴퓨팅(HPC) 시뮬레이션 분야에 혁신을 가져오며, AI 결합 HPC 워크플로우의 중요성, 활용성 및 성능을 증대시키고 있습니다. 본 논문은 빠르게 진화하는 AI 기반 HPC 분야를 포괄적으로 조사하고, 이러한 워크플로우를 이해하기 위한 공통 개념적 기반을 제시합니다.
특히, AI를 HPC 워크플로우에 결합하는 다양한 방식에 대한 통찰을 활용하여, 과학 응용 분야에서 가장 흔히 발견되는 여섯 가지 실행 모티프를 제안합니다. 이 실행 모티프 집합은 불완전하며 계속 진화하고 있지만, AI 통합 시뮬레이션 환경 전반에서 발생하는 주요 성능 문제를 분석하는 데 유용합니다.
본 연구는 AI 결합 HPC 워크플로우의 실행을 평가하고 개선하는 데 필요한 특정 벤치마크의 필요성을 포함하여, 미해결 과제, 연구 문제 및 향후 연구 영역을 제시합니다. 이는 해당 분야의 발전을 위한 중요한 방향을 제시할 것입니다.
원격 직접 메모리 접근(RDMA)은 CPU와 운영체제를 우회하여 원격 장치 간 직접 메모리 접근을 가능하게 하는 기술로, 현대 데이터 센터, 고성능 컴퓨팅(HPC) 및 AI/ML 워크로드에 필수적인 저지연 고처리량 네트워킹을 제공합니다. 그러나 RDMA의 기본 모델은 다루기 어려운 약한 메모리 모델을 가지며, 최근에야 정형화되었습니다.
본 연구에서는 RDMA 기반 다중 노드 객체 구축을 위한 정형 검증 라이브러리인 LOCO(Library of Composable Objects)를 소개합니다. LOCO는 공유 메모리와 분산 시스템 프로그래밍 간의 격차를 해소하며, RDMA의 강력한 지역성과 약한 일관성 특성을 활용하여 잘 캡슐화된 객체를 제공합니다.
LOCO 객체는 맞춤형 RDMA 시스템(예: 분산 맵)과 유사한 성능을 보이면서도, 정형 증명에 적합한 훨씬 간단한 프로그래밍 모델을 제공합니다. 검증을 위해 다중 노드 객체 모델링에 유연하며 메모리 일관성 모델에 독립적인 새로운 모듈형 선언적 검증 프레임워크인 Mowgli를 개발했습니다.
Mowgli를 RDMA 메모리 모델에 적용하여 LOCO 라이브러리의 정확성을 검증했습니다. 이 연구는 RDMA 기반 시스템의 개발 복잡성을 줄이고 신뢰성을 높이는 데 기여하며, 고성능 분산 시스템의 프로그래밍 패러다임을 개선할 잠재력을 가집니다.