| step (예산) | overall | PnP-8 | non-PnP-16 |
|---|---|---|---|
| 3,000 (11%) | 11.75% | 4.2% | 15.5% |
| 9,000 (33%) | 37.67% | 24.5% | 44.2% |
| 18,000 (67%) | 58.50% | 44.8% | 65.4% |
| 24,000 (89%) | 57.25% | 42.8% | 64.5% |
| 27,000 (100%) | 63.00% | 49.0% | 70.0% |
18k 이후 58~63% 밴드 진동 (상수 LR 하 ckpt 간 요동, 24k→27k +5.75pp는 z≈2.9). per-task: 구조 조작은 CloseDrawer·OpenDoubleDoor·TurnOffMicrowave 100% 등 최상위, 저조는 TurnOffStove 12%·CoffeeSetupMug 24%(X-WAM 재현에서도 19%로 공통 난제)·PnPMicrowaveToCounter 20%.
| 모델 | init | SR | vs naive VAM |
|---|---|---|---|
| naive τ₀-VAM (ours) | τ₀ pretrain | 63.00% | — |
| X-WAM arm A (no depth) | base Wan | 61.08% | z≈0.96 — 동급 |
| X-WAM arm B (+depth) | base Wan | 66.00% | z≈1.5 — 미유의 |
| X-WAM released | X-WAM pretrain | 75.33% | z≈6+ — −12.3pp |
① 아키텍처 축(action expert + 1-pass feature vs in-sequence token + joint denoise)만으로는 두 접근이 같은 밴드(61~66%)다. ② 갭은 pretrain에서 발생 — τ₀의 실로봇 dual-arm pretrain은 RoboCasa sim 단일암으로 X-WAM pretrain만큼 이전되지 않았다 (action space 갭으로 action proj 재초기화가 필요했던 것도 한 요인). ③ τ₀의 본 제안은 TTC이므로, 이 baseline 위에서 TTC 이득을 재는 것이 다음 실험이다.
같은 step_27000 ckpt로 TTC 경로(RCS + 옵션 simulator re-rank)를 zmq 브릿지에 이식 → 63.0% 대비 이득 측정.
base-Wan init 대조군(τ₀ pretrain 기여 분리) · 100 rollout 재평가(vs arm B 판별) · 인프라 로그: cu128 hang 분석(260813-worker_nccl_hang.html) 참조.