Index
2026-04-30 — Analysis

IDM Pixel vs Latent-A 동등성 — batch 효과 오해석 정정

GR00T-Dreams | IDM 평가 비교 / leakage 검증

TL;DR

134.8
Pixel mm
131.8
Latent-A mm
332
Pixel B0 mm
2.46×
batch 효과

1 배경 / 목적

두 가지 혼재된 문제를 동시에 해결하기 위한 평가:

문제 1 — Leakage 의심: MG-3000 v2_8gpu 평가(41.5 mm)에서 heldout 720 ep이 MG-3000 학습 세트에 포함됨. 진짜 일반화 성능이 아닐 수 있음.
문제 2 — 잘못된 비교: Latent-A가 보고한 "2.5× 개선(131.8 mm)"은 Pixel B0(batch=64, 332 mm)와 비교한 수치. batch 64 vs batch 1024의 차이를 latent 표현의 우위로 해석한 오류.

이번 실험으로 동일 조건(MG-30 720 ep, batch 1024, 60K step)에서 Pixel IDM v2_8gpu를 직접 평가하여 두 문제를 해소.

2 작업 내용

학습 설정

스크립트: scripts/run_idm_train_robocasa_mg30_v2_8gpu.sh. 8 GPU, per_device_batch=16, grad_accum=8 → effective batch 1024. 60K steps (297 epoch over 206K frames). cosine LR 1e-4, warmup 0.05. core-extra QOS로 PREEMPT 후 auto-resume.

평가 설정 (Latent-A 동일 조건)

scripts/dump_idm_actions_for_eval.py → checkpoint-60000, heldout dataset, ep {0,30,60,90,120} (Latent-A·HF eval과 동일 set). fresh env per replay 패치 적용 (260428): GT/IDM replay마다 새 env 인스턴스 생성 → 픽셀 L2=0 일치, 시각 비교 의미 있음.

3 결과

Per-episode (Pixel v2_8gpu, MG-30)

EpisodeTaskPos Error (mm)Gripper Acc비고
0CloseDoubleDoor256.7100.0%step 4에서 diverge ⚠️
30CloseDrawer128.399.5%step 5에서 diverge
60CloseSingleDoor178.0100.0%step 4에서 diverge
90CoffeePressButton31.699.0%✨ best
120CoffeeServeMug79.697.7%
평균134.8 mm (std 78.1)99.2%leakage 없음 ✅

전체 비교 (동일 5-ep, fresh env)

모델학습 데이터Eff. BatchEval AvgLeakage
Pixel B0 (MG-30)MG-30 720 ep64332 mm없음
Pixel v2_8gpu ← 이번MG-30 720 ep1024134.8 mm없음 ✅
Latent-A sliced 60KMG-30 720 ep latent1024131.8 mm없음 ✅
HF 공식MG-3000 70K ep1024113 mm알 수 없음
MG-3000 v2_8gpu (260426)MG-3000 70K ep102441.5 mm있음 ❌
Pixel ≈ Latent (3 mm 차이): 동일 조건(MG-30, batch 1024, 60K, 동일 5-ep)에서 Pixel 134.8 mm vs Latent-A 131.8 mm. Cosmos hidden 추가 비용의 효과가 사실상 없음.
batch가 결정적: batch 64→1024만으로 332→134.8 mm (2.46×). 데이터 97.5× 확장(MG-30→MG-3000)은 134.8→113 mm = 21 mm 개선뿐 — 거의 10× 차이.
CloseDoubleDoor outlier (256 mm): MG-3000 v2_8gpu에서도 131 mm로 outlier. 양손 도어 닫기 task가 데이터 분포·action 모호성으로 일관되게 어려움.

4 Takeaway

Latent-IDM 트랙 의의 재검토 필요

같은 batch에서 pixel ≈ latent (134.8 vs 131.8 mm). Latent-IDM의 추가 비용(Cosmos forward, 556 GB hidden cache, NVMe staging, 별도 데이터로더)에 비해 성능 이득이 없음. 같은 데이터·같은 batch에서 Cosmos hidden은 action 예측에 추가 신호를 거의 주지 못한다.

단, 현재 평가는 in-distribution(MG-30)에서만 수행됨. OOD task, domain transfer(synthetic → real), unseen embodiment 시나리오에서는 Cosmos의 world model representation이 우위일 가능성 있음 — 이를 검증해야 Latent-B 학습의 정당성이 생김.

batch 효과가 지배적이라는 사실은 앞으로의 IDM 설계에 중요한 기준: 소규모 데이터(MG-30 720 ep)에서도 batch=1024이면 MG-3000 수준(113 mm)에 근접. 데이터 확장보다 batch tuning이 먼저.

5 Next Steps

즉시: 24-ep 공동 재평가

Pixel v2_8gpu + Latent-A 둘 다 24-ep 전체로 재평가. std 78 mm로 5-ep 통계 불안정. CloseDoubleDoor(256 mm) outlier 정성 분석 (comparison.mp4 직접 확인).

HF 공식 113 mm leakage 검증

HF heldout split이 학습 세트와 disjoint인지 확인. 같은 leakage면 우리 41.5 mm도 정당화 가능. 반대로 HF가 clean하면 데이터 효과(21 mm) 추정치가 유효.

Latent-B OOD 평가 (본 학습 완료 후)

Job 2352 (Latent-B 60K, worker-4 RUNNING) 완료 시 Latent-A와 동일 5-ep eval 먼저 → 이후 합성 비디오·unseen task로 OOD 평가. H2(아키텍처 정렬) + H3(OOD 우위) 검증.