Index
2026-08-13 — Experiment

naive τ₀-VAM — RoboCasa 24-task 최종 결과

tau-0-wm | pretrained init · 27k step (2.59M 샘플) · TTC off · 5-step euler

TL;DR

63.0%
naive VAM (ours)
61.1%
X-WAM arm A
66.0%
X-WAM arm B
75.3%
X-WAM released

1 설정

데이터 : X-WAM 릴리스 RoboCasa 1,235 ep (arm A와 동일) · raw_actions 7ch 무변환 학습 : τ₀ pretrained init (action proj 3텐서만 재초기화) · eff 96 × 27k = 2.59M 샘플 (X-WAM 2.56M 매칭) lr 5e-5 constant · 192×256 3뷰 · chunk 9 / action 33 · torch 2.8.0+cu129 · 8 GPU own 8h09m 평가 : X-WAM zmq 하네스 + τ₀ 브릿지 · 24 task × 50 rollout · 시드 동일 규약 · cfg 0 · 5-step euler

2 학습 곡선

step (예산)overallPnP-8non-PnP-16
3,000 (11%)11.75%4.2%15.5%
9,000 (33%)37.67%24.5%44.2%
18,000 (67%)58.50%44.8%65.4%
24,000 (89%)57.25%42.8%64.5%
27,000 (100%)63.00%49.0%70.0%

18k 이후 58~63% 밴드 진동 (상수 LR 하 ckpt 간 요동, 24k→27k +5.75pp는 z≈2.9). per-task: 구조 조작은 CloseDrawer·OpenDoubleDoor·TurnOffMicrowave 100% 등 최상위, 저조는 TurnOffStove 12%·CoffeeSetupMug 24%(X-WAM 재현에서도 19%로 공통 난제)·PnPMicrowaveToCounter 20%.

3 앵커 비교

모델initSRvs naive VAM
naive τ₀-VAM (ours)τ₀ pretrain63.00%
X-WAM arm A (no depth)base Wan61.08%z≈0.96 — 동급
X-WAM arm B (+depth)base Wan66.00%z≈1.5 — 미유의
X-WAM releasedX-WAM pretrain75.33%z≈6+ — −12.3pp
교란 요인 (정직 고지): 해상도 192×256 vs 256×320, chunk 33 vs 32, eff 96 vs 128(샘플수로 보정), 5-step vs 10-step 추론 — "naive = τ₀ 기본값 유지" 원칙에 따른 차이.

4 Takeaway

의미

① 아키텍처 축(action expert + 1-pass feature vs in-sequence token + joint denoise)만으로는 두 접근이 같은 밴드(61~66%)다. ② 갭은 pretrain에서 발생 — τ₀의 실로봇 dual-arm pretrain은 RoboCasa sim 단일암으로 X-WAM pretrain만큼 이전되지 않았다 (action space 갭으로 action proj 재초기화가 필요했던 것도 한 요인). ③ τ₀의 본 제안은 TTC이므로, 이 baseline 위에서 TTC 이득을 재는 것이 다음 실험이다.

5 Next Steps

TTC 실험 (τ₀ 핵심 주장 검증)

같은 step_27000 ckpt로 TTC 경로(RCS + 옵션 simulator re-rank)를 zmq 브릿지에 이식 → 63.0% 대비 이득 측정.

선택적 후속

base-Wan init 대조군(τ₀ pretrain 기여 분리) · 100 rollout 재평가(vs arm B 판별) · 인프라 로그: cu128 hang 분석(260813-worker_nccl_hang.html) 참조.