| 축 | τ₀-WM (표준화형) | X-WAM (흡수형) |
|---|---|---|
| pretrain 코퍼스 | 27.3K h: 실로봇 17.8K (AGIBOT-G01·ARX·dual-arm Franka) + UMI 6.5K + ego 인간영상 3.0K | 5,800 h: AgiBot-World·DROID(단일암)·RoboTwin 2.0(sim)·InternData-A1·MimicGen(sim) 등 |
| 단일암 처리 | 해당 없음 (전 플랫폼 양팔) | "treat the single arm as the left arm and do not supervise the right-arm output" |
| action 통일 | rel-eef6d 20ch 공통 인터페이스 (플랫폼 표준화로 달성) | 고정 14ch superset + action_valid_mask |
| 카메라 | 전 플랫폼 head + wrist 통일 | learnable view embedding + static/dynamic 유형 |
| 이질성 처리 레벨 | supervision 티어: 실로봇(full) / UMI(약한 action) / ego(video loss만) | embodiment 슬롯 + 데이터 다양성 |
| sim 노출 | 없음 | MimicGen·RoboTwin (robosuite 계열 = RoboCasa와 동일 가족) |
naive VAM 63.0%가 X-WAM base-init 밴드에 머문 이유가 구조적으로 설명된다: τ₀ pretrain 분포에는 single-arm도, exocentric 카메라도, sim 렌더링도 없어서 RoboCasa가 3중 OOD다. "dual-arm만 써서"라는 가설은 "표준화형 pretrain이라 embodiment 다양성이 없었고, 우리 posttrain이 action space까지 갈아끼우며 전이 경로를 추가로 끊었다"로 정제된다. τ₀-native(왼팔 슬롯) 실험은 여전히 유효하나, 오른팔 zero-delta가 τ₀ pretrain에 없던 패턴 + exo 뷰 갭이 남아 부분 효과만 기대해야 한다.
후보 실험 3종 (사용자 선택 대기): ① τ₀-native rel-eef6d 왼팔-슬롯 posttrain — action 정합 효과 분리, ② base-Wan init 대조군 — pretrain 총 기여 분리, ③ TTC — τ₀ 본 주장 검증 (baseline 63.0% 확보됨).