두 가지 혼재된 문제를 동시에 해결하기 위한 평가:
이번 실험으로 동일 조건(MG-30 720 ep, batch 1024, 60K step)에서 Pixel IDM v2_8gpu를 직접 평가하여 두 문제를 해소.
스크립트: scripts/run_idm_train_robocasa_mg30_v2_8gpu.sh. 8 GPU, per_device_batch=16, grad_accum=8 → effective batch 1024. 60K steps (297 epoch over 206K frames). cosine LR 1e-4, warmup 0.05. core-extra QOS로 PREEMPT 후 auto-resume.
scripts/dump_idm_actions_for_eval.py → checkpoint-60000, heldout dataset, ep {0,30,60,90,120} (Latent-A·HF eval과 동일 set). fresh env per replay 패치 적용 (260428): GT/IDM replay마다 새 env 인스턴스 생성 → 픽셀 L2=0 일치, 시각 비교 의미 있음.
| Episode | Task | Pos Error (mm) | Gripper Acc | 비고 |
|---|---|---|---|---|
| 0 | CloseDoubleDoor | 256.7 | 100.0% | step 4에서 diverge ⚠️ |
| 30 | CloseDrawer | 128.3 | 99.5% | step 5에서 diverge |
| 60 | CloseSingleDoor | 178.0 | 100.0% | step 4에서 diverge |
| 90 | CoffeePressButton | 31.6 | 99.0% | ✨ best |
| 120 | CoffeeServeMug | 79.6 | 97.7% | |
| 평균 | 134.8 mm (std 78.1) | 99.2% | leakage 없음 ✅ | |
| 모델 | 학습 데이터 | Eff. Batch | Eval Avg | Leakage |
|---|---|---|---|---|
| Pixel B0 (MG-30) | MG-30 720 ep | 64 | 332 mm | 없음 |
| Pixel v2_8gpu ← 이번 | MG-30 720 ep | 1024 | 134.8 mm | 없음 ✅ |
| Latent-A sliced 60K | MG-30 720 ep latent | 1024 | 131.8 mm | 없음 ✅ |
| HF 공식 | MG-3000 70K ep | 1024 | 113 mm | 알 수 없음 |
| MG-3000 v2_8gpu (260426) | MG-3000 70K ep | 1024 | 41.5 mm | 있음 ❌ |
같은 batch에서 pixel ≈ latent (134.8 vs 131.8 mm). Latent-IDM의 추가 비용(Cosmos forward, 556 GB hidden cache, NVMe staging, 별도 데이터로더)에 비해 성능 이득이 없음. 같은 데이터·같은 batch에서 Cosmos hidden은 action 예측에 추가 신호를 거의 주지 못한다.
단, 현재 평가는 in-distribution(MG-30)에서만 수행됨. OOD task, domain transfer(synthetic → real), unseen embodiment 시나리오에서는 Cosmos의 world model representation이 우위일 가능성 있음 — 이를 검증해야 Latent-B 학습의 정당성이 생김.
batch 효과가 지배적이라는 사실은 앞으로의 IDM 설계에 중요한 기준: 소규모 데이터(MG-30 720 ep)에서도 batch=1024이면 MG-3000 수준(113 mm)에 근접. 데이터 확장보다 batch tuning이 먼저.
Pixel v2_8gpu + Latent-A 둘 다 24-ep 전체로 재평가. std 78 mm로 5-ep 통계 불안정. CloseDoubleDoor(256 mm) outlier 정성 분석 (comparison.mp4 직접 확인).
HF heldout split이 학습 세트와 disjoint인지 확인. 같은 leakage면 우리 41.5 mm도 정당화 가능. 반대로 HF가 clean하면 데이터 효과(21 mm) 추정치가 유효.
Job 2352 (Latent-B 60K, worker-4 RUNNING) 완료 시 Latent-A와 동일 5-ep eval 먼저 → 이후 합성 비디오·unseen task로 OOD 평가. H2(아키텍처 정렬) + H3(OOD 우위) 검증.