Index
2026-08-18 — Research

τ₀ vs X-WAM — Pretrain Embodiment 전략 조사

tau-0-wm | naive VAM 63.0% vs released 75.3% 갭의 원인 규명 (1차 소스 대조)

TL;DR

1 두 시스템의 전략 비교

τ₀-WM (표준화형)X-WAM (흡수형)
pretrain 코퍼스27.3K h: 실로봇 17.8K (AGIBOT-G01·ARX·dual-arm Franka) + UMI 6.5K + ego 인간영상 3.0K5,800 h: AgiBot-World·DROID(단일암)·RoboTwin 2.0(sim)·InternData-A1·MimicGen(sim)
단일암 처리해당 없음 (전 플랫폼 양팔)"treat the single arm as the left arm and do not supervise the right-arm output"
action 통일rel-eef6d 20ch 공통 인터페이스 (플랫폼 표준화로 달성)고정 14ch superset + action_valid_mask
카메라전 플랫폼 head + wrist 통일learnable view embedding + static/dynamic 유형
이질성 처리 레벨supervision 티어: 실로봇(full) / UMI(약한 action) / ego(video loss만)embodiment 슬롯 + 데이터 다양성
sim 노출없음MimicGen·RoboTwin (robosuite 계열 = RoboCasa와 동일 가족)
τ₀ 원문: "collected on AGIBOT-G01, ARX, and dual-arm Franka platforms ... typically with a head-view camera and wrist-mounted cameras" τ₀ Table I (pretrain 구성 ablation): Robot-only vs Robot+UMI+Ego — zero-shot 0.14→0.55, SFT 0.70→0.83 τ₀ 레시피: pretrain global batch 12,288 / posttrain 384, chunk 30 receding-horizon

2 Takeaway

의미

naive VAM 63.0%가 X-WAM base-init 밴드에 머문 이유가 구조적으로 설명된다: τ₀ pretrain 분포에는 single-arm도, exocentric 카메라도, sim 렌더링도 없어서 RoboCasa가 3중 OOD다. "dual-arm만 써서"라는 가설은 "표준화형 pretrain이라 embodiment 다양성이 없었고, 우리 posttrain이 action space까지 갈아끼우며 전이 경로를 추가로 끊었다"로 정제된다. τ₀-native(왼팔 슬롯) 실험은 여전히 유효하나, 오른팔 zero-delta가 τ₀ pretrain에 없던 패턴 + exo 뷰 갭이 남아 부분 효과만 기대해야 한다.

3 Next

후보 실험 3종 (사용자 선택 대기): ① τ₀-native rel-eef6d 왼팔-슬롯 posttrain — action 정합 효과 분리, ② base-Wan init 대조군 — pretrain 총 기여 분리, ③ TTC — τ₀ 본 주장 검증 (baseline 63.0% 확보됨).