본문 바로가기

IT & AI

10만 시간의 궤적으로 배운 Xiaomi 로봇 모델

728x90

10만 시간의 궤적으로 배운 Xiaomi 로봇 모델

AI 뉴스 썸네일
AI 뉴스 썸네일

Xiaomi가 실제 조작 궤적 10만 시간 이상을 학습한 비전·언어·행동 모델 Xiaomi-Robotics-1을 공개했어요. 사람 손에 든 UMI 장치로 모은 대규모 데이터를 먼저 익힌 뒤, 실제 로봇 데이터로 몸체와 자연어 명령을 맞추는 방식이에요.

728x90

핵심 요약

구분핵심왜 볼 만한가요
학습 데이터1,700개가 넘는 환경에서 모은 UMI 궤적 10만 시간 이상을 사전 학습했어요특정 로봇 몸체에 묶이지 않은 조작 데이터를 대규모로 활용했어요
실제 로봇가정에서 수집한 실제 로봇 작업 데이터 7,200시간 이상을 후속 학습에 썼어요사전 학습한 행동을 실제 로봇과 자연어 명령에 연결했어요
새 작업 적응작업당 평균 10시간 미만의 시연으로 4개 작업에서 종합 성공률 75%를 기록했어요새 작업마다 필요한 로봇 시연 시간을 줄일 가능성을 보여줬어요
공개 범위논문과 코드 저장소, 모델 배포 페이지를 함께 열었어요연구 결과와 구현물을 직접 확인할 경로가 마련됐어요

1. 로봇의 데이터 부족을 UMI 궤적으로 풀었어요

언어 모델은 웹 문서처럼 대량의 학습 자료를 구하기 쉬워요. 로봇은 사정이 달라요. 실제 기계를 움직여 작업을 시연해야 하고, 로봇 몸체가 달라지면 같은 동작 데이터도 그대로 쓰기 어려워요. Xiaomi-Robotics-1은 이 병목을 줄이려고 특정 로봇에 종속되지 않는 UMI 조작 궤적을 먼저 학습했어요. 1

사전 학습 데이터는 10만 시간이 넘어요. 가정과 상업 시설, 산업 현장, 야외 공간을 포함한 1,700개 이상의 시나리오에서 모았어요. 긴 궤적을 일정한 길이로 나눈 뒤 비전·언어 모델이 그리퍼와 물체의 상태 변화를 문장으로 붙였어요. 사람이 모든 구간에 설명을 다는 대신 자동 주석으로 학습 쌍을 만든 거예요. 2

학습은 두 단계로 나뉘어요. 첫 단계에서는 다양한 환경에서 물체를 어떻게 움직여야 하는지 익혀요. 두 번째 단계에서는 자체 수집 데이터와 공개 로봇 데이터, 선별한 UMI 데이터를 섞어 실제 로봇의 몸체에 행동을 맞춰요. 사용자가 말한 자연어 지시를 바로 동작으로 바꾸는 능력도 이때 조정해요. Xiaomi는 실제 가정에서 소파 정리, 신발장 분류, 주방용품 수납 등을 수행한 로봇 데이터 7,200시간 이상을 모았다고 밝혔어요. 1

연구팀은 사전 학습 데이터와 모델 크기를 늘릴수록 검증 단계의 행동 오차가 줄었다고 설명했어요. 더 큰 사전 학습 모델을 후속 학습했을 때 처음 보는 환경과 물체에서도 실제 로봇 성공률이 함께 올랐어요. 공개된 실험 범위에서는 증가세가 뚜렷하게 둔화하지 않았어요. 다만 이 결과만으로 다른 로봇이나 더 긴 작업에서도 같은 증가 폭이 이어진다고 단정할 수는 없어요. 2

새 작업에 필요한 시연량도 따로 측정했어요. 전화기 포장, 프린터 보충, 세탁물 투입, 상자 포장에 작업당 평균 10시간 미만의 시연을 추가하자 종합 성공률이 75%에 도달했어요. 평균 40시간 미만으로 늘리면 85%를 기록했어요. 로봇마다 처음부터 방대한 데이터를 다시 모으는 대신, 큰 기반 모델에 적은 작업별 데이터를 더하는 접근이에요. 1

시뮬레이션에서도 RoboCasa, RoboCasa365, VLABench, RoboDojo를 평가했어요. 프로젝트 페이지와 논문 초록에 적힌 일부 세부 수치는 서로 달라서 버전별 결과를 구분해 볼 필요가 있어요. 공통으로 확인되는 내용은 네 평가군에서 기존 비교 모델보다 높은 결과를 보고했다는 점이에요. 실제 재현 여부는 공개될 체크포인트와 평가 코드로 더 확인해야 해요. 2

왜 중요한가요

로봇 모델을 키우려면 카메라 영상만 많아서는 부족해요. 영상 속 장면과 실제 조작 궤적, 수행할 명령이 연결돼야 해요. Xiaomi의 자동 주석 방식은 10만 시간 규모의 조작 기록에 상태 변화 설명을 붙여 이 연결을 만들었어요. 데이터 제작 비용과 사람이 직접 주석을 다는 시간을 얼마나 줄였는지가 후속 연구의 중요한 확인 항목이에요. 1

특정 몸체에 묶이지 않은 사전 학습도 눈여겨볼 만해요. 공통 행동 표현을 먼저 익히고 실제 로봇 데이터로 몸체를 맞출 수 있다면, 새 기종이나 새 작업을 준비할 때 필요한 시연량이 줄 수 있어요. 이번 실험의 작업당 10시간 미만이라는 수치는 그 가능성을 보여주지만, 전화기 포장과 세탁물 투입 같은 정해진 과제에서 나온 결과예요. 낯선 집에서 장시간 이어지는 작업이나 실패 후 복구 능력은 별도 검증이 필요해요. 2

공개 범위도 실제 활용 속도에 영향을 줘요. 프로젝트 페이지는 논문과 GitHub 코드 저장소, Hugging Face 모델 페이지를 연결하고 있어요. 모델 체크포인트와 실행 코드가 충분히 제공되면 연구팀이 같은 벤치마크를 다시 돌리고, 다른 로봇 몸체에 옮겼을 때 성능이 얼마나 유지되는지 비교할 수 있어요. 지금은 연구팀이 보고한 성공률과 데모를 확인한 단계이므로, 독립 재현 결과까지 함께 봐야 해요. 3

참고 자료

  1. Xiaomi-Robotics-1 프로젝트 페이지 — Xiaomi Robotics
  2. Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories — arXiv
  3. Xiaomi-Robotics-1 - 10만 시간의 실제 데이터로 학습한 로봇 파운데이션 모델 — GeekNews
728x90