"3초만 보여주면 척척"…보고 바로 익히는 로봇 나왔다

美 스타트업 제너럴리스트AI, 로봇 파운데이션 모델 GEN-1.5 공개

IT 일반입력 :2026/08/22 14:46    수정: 2026/08/22 14:47

10초 가량 짧은 시연만으로 새 물리적 동작을 학습하고, 별도 수정이나 미세 조정 없이 바로 작업을 수행할 수 있는 로봇 모델이 탄생했다. 

미국 피지컬 AI·로봇 스타트업 제너럴리스트AI(Generalist AI)가 개발한 로봇 파운데이션 모델 ‘GEN-1.5’는 단 한 번만 시연해주면 물리적 작업을 학습할 수 있다고 과학매체 인터레스팅엔지니어링이 20일(현지시간) 보도했다.

GEN-1.5는 엔지니어가 물리적 시연을 통해 로봇이 새로운 작업을 학습하도록 설계됐다. 회사 측에 따르면 로봇은 짧은 센서리모터(sensorimotor) 시연만으로 수행해야 할 작업을 추론한 뒤 즉시 작업을 시도할 수 있다.

제너럴리스트AI의 GEN-1.5는 몇 초간의 시연을 통해 물리적 과제를 배운다. (출처=제너럴리스트AI)

10가지 물리적 과제를 대상으로 진행한 테스트에서 GEN-1.5는 단 한 번의 시연만으로 평균 59% 성공률을 기록했다. 여기에 작업 별 데이터를 5분간 추가하고 10회의 학습 단계를 거치자 성공률은 83%까지 상승했다.

테스트에는 유리병 뚜껑 돌리기, 지갑에서 돈 꺼내기, 컵 쌓기, 쓰레기 쓸기, 책 펼치기, 연필 주머니 지퍼 내리기, 진공청소기 제거 등 비교적 간단한 작업이 포함됐다.

물리적 신호 따라 학습

GEN-1.5는 영상을 센서 데이터, 언어 정보, 고유수용감각 데이터와 함께 처리하는 대규모 멀티모달 모델이다. 최대 30초 분량 정보를 컨텍스트 메모리에 저장하고, 초당 100회(100Hz) 속도로 로봇의 동작 궤적을 생성한다.

3~12초 분량 짧은 시연 영상을 메모리에 입력하는 방식은 제너럴리스트AI가 ‘피지컬 프롬프트’라고 부르는 기술이다. 로봇은 이 과정을 거친 뒤 추가 학습 없이 곧바로 해당 작업을 수행한다.

회사 측은 상황 인식 학습을 강화하기 위한 별도의 아키텍처 변경이나 메타학습 루프, 즉흥적인 실행을 유도하는 보조 목표 등을 추가하지 않았다고 설명했다.

여러 물리적 프롬프트를 결합하는 것도 가능하다. 한 시연에서는 연필 주머니의 지퍼를 여는 동작과 돈을 꺼내는 동작을 각각 보여주자 로봇이 두 행동을 연속적인 작업 순서로 연결해 수행하는 모습을 보였다.

단순한 동작 모방을 넘어 예상하지 못한 상황에 대응하는 능력도 확인됐다. 연구진이 블록을 붓으로 그릇에 쓸어 담는 5분간의 사람 시연 영상을 바탕으로 GEN-1.5를 미세조정한 뒤 로봇에게 바나나를 건네자, 로봇은 바나나를 붓 대신 사용하는 방식으로 작업을 수행했다.

관련기사

또 레고 블록이 손가락에 끼거나 종이로 그릇이 덮이는 등 예상치 못한 상황에서도 스스로 문제를 해결하는 능력을 보였다. 시뮬레이션에서 학습한 내용을 실제 환경에 적용하거나, 카메라로 사람의 동작을 관찰한 뒤 즉각적으로 재현하는 것도 가능했다.

제너럴리스트AI는 GEN-1.5가 로봇 프로그래밍에 새로운 접근법을 제시할 수 있다고 강조했다. 새로운 작업을 수행할 때마다 복잡한 지침을 일일이 작성하는 대신 사용자가 원하는 동작을 직접 시연하면 로봇이 물리적 세부 사항을 스스로 계산해 작업을 수행할 수 있다는 설명이다.