
우리 학부 김창익 교수 연구팀이 미국 MIT 및 마이크로소프트 연구진과의 공동 연구로 범용 기술인 ‘업샘플 애니띵(Upsample Anything)’을 개발했다. 이 기술은 제한된 GPU 메모리만으로도 AI의 시각 성능을 크게 높일 수 있는 것이 특징이다.
해당 연구는 세계 최고 권위의 AI 학회인 ‘CVPR 2026’에 발표된 4,089편의 논문 중 단 18편에만 주어지는 ‘CVPR 컴퓨트 골드 스타(CVPR Compute Gold Star)’ 상을 전체 1위로 수상하는 쾌거를 이뤘다. 아울러 연구 과정의 투명성과 재현 가능성을 높이 평가받아 ‘트랜스패런시 챔피언(Transparency Champion)’에도 동시에 선정됐다.
이는 연구 성능은 물론 사용된 계산 자원, 코드 공개, 실험 재현 가능성 등 책임 있는 인공지능 연구의 핵심 요소를 두루 인정받은 성과다.

최근 휴머노이드 로봇과 자율주행 시스템, 세계모델(World Model·현실 세계의 물리적 환경과 변화를 학습·예측하는 AI 모델) 기반 인공지능은 연산 속도를 높이고 메모리 사용량을 줄이기 위해 입력 영상을 저해상도 특징 정보(Feature·AI가 이미지에서 추출한 핵심 정보)로 압축해 활용하고 있다.
그러나 압축 과정에서 작은 물체나 얇은 구조물, 미세한 결함과 같은 중요한 시각 정보가 손실되는 문제가 발생한다. 반대로 모든 영상을 처음부터 고해상도로 처리하면 막대한 GPU 메모리와 연산 자원이 필요해 실시간 처리가 어려워진다. 이는 스마트폰과 같은 소형 기기나 기동성이 중요한 로봇이 주변 환경을 정밀하게 인식해야 하는 상황에서 오랫동안 해결되지 않은 과제로 남아 있었다.
연구팀은 이러한 한계를 극복하기 위해 입력 이미지의 경계와 구조 정보를 활용해 저해상도 특징 정보를 고해상도로 복원하는 학습 없는(Training-free·추가 데이터 학습이 필요 없는) 업샘플링 기술을 개발했다.
기존 기술은 새로운 환경이나 데이터에 적용하기 위해 별도의 재학습이나 복잡한 최적화 과정을 거쳐야 했다. 반면 연구팀이 개발한 ‘업샘플 애니띵’은 입력 이미지 한 장만으로 최적의 복원 방식을 찾아낼 수 있어 다양한 환경에 즉시 적용할 수 있다.
또한 모든 시각 정보를 고해상도로 저장·처리하지 않고 핵심 정보만 압축해 활용함으로써 GPU 메모리 사용량을 크게 줄였다. 연구팀은 AI 연구에서 널리 활용되는 224×224 크기 이미지(약 5만 개 픽셀) 기준 약 0.4초의 짧은 계산만으로 원본에 가까운 시각 정보를 복원했으며, GPU 메모리 효율을 최대 16배까지 향상시키는 성과를 거뒀다.
이는 제한된 연산 자원만으로도 인공지능이 주변 환경을 더욱 정밀하게 인식할 수 있음을 의미한다. 따라서 이번 기술은 스마트폰과 같은 소형 기기는 물론, 작은 물체를 정확하게 식별하고 조작해야 하는 휴머노이드 로봇, 자율주행 시스템, 온디바이스 AI 등 다양한 차세대 인공지능 분야에 폭넓게 활용될 것으로 기대된다.

김창익 교수는 “이번 기술은 적은 자원으로도 인공지능의 시각 정밀도를 크게 높일 수 있는 알고리즘으로, 휴머노이드 로봇과 온디바이스 AI의 실용화를 앞당길 것으로 기대한다”며 “CVPR에서 성능뿐 아니라 계산 효율성과 연구 투명성까지 인정받았다는 점에서 더욱 의미가 크다”고 말했다.
이번 연구는 서민석 박사과정 학생이 제1 저자로 참여했으며, 이번 성과는 인공지능 및 컴퓨터 비전 분야 세계 최고 권위 학회인 ‘CVPR 2026’에서 6월 7일 발표됐다.
- 논문명: Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling,
- DOI:10.48550/arXiv.2511.16301
- 저자 정보: 서민석 (KAIST, 제1 저자), 마크 헤밀턴 (MIT, 마이크로소프트, 제2 저자), 김창익(KAIST, 교신저자)
- 관련 데모 동영상: https://drive.google.com/file/d/17f9j4tcD0JJfA4xeN4b5qvaOjUxFVS_U/view?usp=sharing