
김은찬 한양대 교수 연구팀은 인공지능(AI) 모델의 실제 배포 환경을 고려한 추론 효율화 연구가 AI·머신러닝 학술대회인 'NeurIPS 2026'에 최종 채택됐다고 30일 밝혔다.
연구에는 김은찬 교수와 엄빛찬 박사과정 연구원이 참여했다. 논문은 전체 모델을 학습한 뒤 실제 운용 단계에서는 필요한 부분만 선택적으로 배포하는 조기 종료형 AI 추론 기술을 제안했다.
연구팀은 AI 모델 효율성을 FLOPs(초당 부동소수점 연산)와 같은 이론적 연산량만으로 평가하기 어렵다는 점에 주목했다. 실제 장비와 서비스에서는 메모리 사용량과 추론 지연시간은 물론, 어떤 연산 구조를 장비에 탑재할지도 효율성을 좌우하기 때문이다.
연구팀은 입력 데이터에 따라 네트워크 중간 단계에서도 결과를 낼 수 있는 조기 종료 구조를 활용했다. 단순한 입력은 앞단에서 추론을 마치고, 추가 처리가 필요한 입력만 후속 연산을 수행해 불필요한 계산을 줄이는 방식이다.
특히 학습 단계에서는 전체 네트워크와 여러 중간 분류기를 함께 활용하되, 실제 배포 단계에서는 필요한 경량 중간 분류기만 선택해 남기도록 설계했다. 학습 과정에서 확보한 정보를 충분히 활용하면서 실제 운용 환경에서는 모델 구조를 가볍게 구성할 수 있도록 학습과 배포 구조를 분리한 것이 핵심이다.
이번 연구는 이론적인 연산량 절감에 그치지 않고 실제 시스템에 어떤 구조를 남겨 운용할 것인지까지 고려했다. 자원이 제한된 엣지 장비와 모바일·임베디드 환경을 비롯해 빠른 응답과 효율적인 모델 운용이 요구되는 산업용 AI 시스템 등에 활용할 수 있을 것으로 기대된다.
김은찬 교수는 “AI 모델의 효율성은 이론적인 연산량만으로 설명하기 어렵고 실제 장비에 어떤 구조를 남겨 배포하느냐도 중요하다”며 “이번 연구는 학습과 배포 구조를 분리해 현실적인 문제를 다루고자 했다. 향후 실제 산업 환경에서도 활용할 수 있는 효율적 AI 추론 기술로 확장해 나가겠다”고 말했다.
조호현 기자 hohyun@etnews.com