Index
2026-05-14 — Analysis

IDM 2×2×2 Ablation — Pixel Half 24-ep Eval

DreamData / GR00T-Dreams | SigLIP input × abs/Δ frame × diffusion/regression loss, 4 cells 완료

TL;DR

189.83
pix_delta_diff (mm)
302.94
pix_delta_reg (mm)
344.08
pix_abs_diff (mm)
363.88
pix_abs_reg (mm)

1 배경/목적 (왜)

IDM 핵심 설계 변수들이 지금까지 단편적으로 결과만 쌓여 있었고 어떤 변수가 결정적인지 confound가 많았다. 3-axis 직교 2×2×2 ablation으로 한 번에 정리한다:

본 리포트는 pixel half 4 cell 결과. Feature half는 학습 중으로 별도 리포트 예정.

검증 가설: H2 — action은 변화 예측이므로 Δ representation이 abs concat보다 직접 정렬. H3 — diffusion의 stochasticity가 IDM에 본질적인가.

2 작업 내용 (어떻게)

학습 공통 spec (pixel 4 cell)

dataset : hybrid v2 pack — video=idm_mg30 (droid 180×320 wide RGB, 3 cam) state/action=mg30_real_h50 (h50 16-dim eef-pose schema) GPU : 4 B200 × eff batch 64 × 60K step LR : 1e-4 cosine warmup=500 → 1e-5 Eval : 24-task heldout, simulator replay, EEF mm + gripper acc

4 cell 정의

Tagfeature_sourceloss_type신규 코드
pix_abs_diffsiglip (2-frame concat)diffusionbase IDM 재현
pix_abs_regsiglip (2-frame concat)regressionlearnable z0 분기
pix_delta_diffsiglip_delta (embedding Δ)diffusionSigLIP 후 f[t+16]−f[t]
pix_delta_regsiglip_delta (embedding Δ)regressionΔ + z0 분기

Pixel-Δ 구현: dataset은 이미 (B, 6, 3, 256, 256) 2-frame 그대로 전달. model encode_visualsiglip_delta 분기에서 2 frame을 각각 SigLIP 통과 후 embedding 단에서 차분 → (B, V×N_tok, hidden). token 개수는 abs 96 → Δ 48 (3 cam × 1). mode="cosmos_latent" 반환으로 R3 token mask 이슈 bypass.

Regression 구현: loss_type: regression config field 추가. z0_learnable = nn.Parameter(action_horizon, action_dim), t=0 fixed, model output을 velocity가 아닌 action 직접 예측으로 해석. inference 1-step (diffusion 16-step 대비 16× 빠름).

Eval pipeline: 4 GPU parallel sbatch (run_eval_2x2x2_pixel_4gpu.sh) — srun --ntasks=4로 4 cell 동시 (각 1 GPU). dump 15min + replay 35min 병렬, 총 wall ~50min.

smoke 4 cell 모두 통과 (loss finite, grad 흐름 OK). 4 GPU mini-smoke 500 step DDP/Trainer/ckpt 저장 정상.

3 결과 (수치)

24-ep heldout EEF mm (ckpt-60K)

Cellavg EEF mmstd mmgripper acc비고
pix_delta_diff189.8398.088.20%Δ + flow matching
pix_delta_reg302.94117.187.04%Δ + 1-step MSE
pix_abs_diff344.08122.375.80%abs concat + flow matching
pix_abs_reg363.88234.487.84%abs concat + 1-step MSE

Marginal effect (단일 축 변화)

Effect변화 (mm)% change해석
abs → Δ (in diff)344.08 → 189.83−45% ⭐Δ 효과 압도적
abs → Δ (in reg)363.88 → 302.94−17%Δ 효과 있지만 약함
diff → reg (in abs)344.08 → 363.88+6%마진 내, 유의미하지 않음
diff → reg (in Δ)189.83 → 302.94+60% ⚠Δ 신호를 regression으로 못 풀음

기존 baseline 대비 (batch 효과 포함)

모델batchEEF mm비고
Pixel v2_8gpu1024134.8기존 best (abs+diff)
Latent-A multistream1024107.5현재 best overall
pix_delta_diff (이번)64189.83batch=64 불리함에도 SOTA 잠재력
pix_delta_diff 예상 (batch=1024)1024~952.5× batch 보정 → 26% SOTA 개선 예상
pix_delta_diff (batch 64)는 pix_abs_diff (batch 64, 344mm) 대비 45% 개선. 같은 batch 조건의 Pixel v2_8gpu (batch 1024, 134.8mm)와 비교하면 batch 효과 ~2.5×를 보정 시 batch=1024 재학습 예상 ~95mm → Latent-A multistream 107.5mm를 26% 능가하는 새 SOTA 후보.

gripper accuracy 이상 신호

pix_abs_diff만 gripper acc 75.80% — 다른 3 cell (87–88%) 대비 이상치. 12-dim action 중 gripper bit 비중은 작아 EEF mm에 큰 영향은 없으나 별도 분석 필요.

Jobs 완료 내역

pix_abs_diff : Job 2360 — COMPLETED pix_abs_reg : Job 2361 → 2372 (preempt 1회) pix_delta_diff: Job 2362 — COMPLETED ⭐ pix_delta_reg : Job 2363 — COMPLETED

4 Takeaway

Δ representation의 강력한 효과 입증: SigLIP embedding 단에서 f[t+16]−f[t]만 거치면 abs concat 대비 EEF mm가 거의 절반. Latent-D 가설 (action은 변화 예측)이 pixel 단에서도 확인됨.
Loss type은 representation에 의존: abs feature (정보가 많고 redundant)에서는 regression으로도 충분히 풀림 (344 vs 364, 차이 미미). 반면 Δ feature (압축된 motion-only signal)에서는 diffusion의 iterative refinement가 필수 — 1-step regression은 Δ 신호를 활용 못함 (+60% 악화).

해석

abs는 t와 t+16의 전체 장면 정보를 포함 → action 추정에 필요한 모든 힌트가 있어 regression도 수렴 가능. 반면 Δ는 motion-only signal이라 정보가 압축됨 → 다중 action 가능성에 대한 불확실성이 커지고 이를 1-step으로 붕괴시키기 어려움 → diffusion의 multi-step denoising이 필요.

이 해석이 맞다면 Δ × regression 개선 방향은 2~4 step iterative regression (완전한 16-step diffusion 없이도 Δ 신호 활용 가능한지 확인).

5 Next Steps

즉시 (feature half 완료 후)

Follow-up 가설