트웰브랩스, 피지컬 AI 학습 최적화 '페가수스 1.6' 출시

트웰브랩스, 피지컬 AI 학습 최적화 '페가수스 1.6' 출시

트웰브랩스가 비전언어모델(VLM) '페가수스 1.6'을 출시했다. 영상을 인공지능(AI) 기반 로봇과 휴머노이드가 학습할 수 있는 데이터로 전환해준다.

사람의 시선에서 촬영한 1인칭 영상 데이터인 에고센트릭 데이터를 이해하도록 개발된 게 특징이다. 주로 작업자들이 액션캠, 스마트 글래스 등을 착용한 채로 특정 동작을 수행하는 모습을 촬영해 데이터를 수집한다.

학습에 적합한 장면을 선별하고 영상 속 사람의 행동을 구간별로 나눈 뒤 손이 어떤 도구나 물체와 상호작용했으며 그 결과는 어땠는지 세부적인 파악도 필요하다.

페가수스 1.6은 이러한 과정 인식에 최적화된 에고센트릭 영상 이해 능력을 강화했다. 모델이 영상 속 사람 행동과 주변 사물, 전후 맥락을 함께 이해해 작업을 구간별로 나눠 설명할 수 있다. 작업자가 특정 부품을 집고 도구를 이용해 작업한 뒤 완성된 물체를 옮기는 장면을 구조화할 수 있는 것이다.

기존에는 원본 영상 1시간당 155시간에 달하는 수작업이 필요했지만 이를 최소화할 수 있다. 행동 분할 및 라벨링, 상세 캡션 라벨링, 품질 평가, 검색 및 큐레이션, 개인정보 및 컴플라이언스 탐지 등 핵심 기능 5개 역할이 주효했다.

트웰브랩스는 페가수스의 시간 기반 메타데이터(TBM) 기능은 피지컬 AI 분야에서 활용도가 높다고 설명했다. 사용자가 원하는 메타데이터 항목과 구조를 정의, 영상 속 내용을 시간 정보와 함께 구조화해 어떤 행동이 언제 일어났는지 정확하게 파악하고 이해하기 용이하다.

또 손·물체·도구 등 영상 전반에 걸쳐 일관되게 식별할 수 있는 고도화된 개체 인식 성능도 탑재했다. 대규모 영상을 처리하는 속도·비용 효율성도 높였다. 미국 로보틱스 학습 데이터 기업 등 고객사도 확보하기 시작했다. 정량 데이터에 학습 캡션을 추가하는 형태로 활용되고 있다.

이재성 트웰브랩스 대표는 “물건이 미끄러졌을 때 바로잡는 것 같이 사람들이 현실 세계에서 체득한 경험 대부분은 기계가 학습할 수 있는 형태로 기록되지 않았다”며 “페가수스 1.6은 영상을 구조화된 지식으로 바꿔 피지컬 AI와 로보틱스 기업이 인간 경험을 학습에 활용할 수 있게 할 것”이라고 말했다.

앞서 트웰브랩스는 자사 영상 임베딩·검색 모델 '마렝고'를 아마존웹서비스(AWS) 관리형 AI 서비스 '베드록'에 등재, 별도 인프라 없이도 영상 검색할 수 있는 환경을 조성했다.

박종진 기자 truth@etnews.com

  • ET Events