Index
2026-05-13–14 — Plan

IDM 2×2×2 Ablation — 3-axis 직교 실험 설계

DreamData / GR00T-Dreams | input(pixel/feature) × frame(abs/Δ) × loss(diff/reg) = 8 cell, pixel half 완료 → feature half 진행 중

TL;DR

8
Total cells
4
Pixel half 완료
4
Feature half 진행 중
32 GPU
동시 학습

1 배경/목적 (왜)

IDM 핵심 설계 선택지들이 단편적으로만 결과가 쌓여 어떤 변수가 결정적인지 confound가 많았다:

3-axis 직교 2×2×2 ablation으로 각 변수의 단일 효과(marginal effect)교호작용(interaction)을 정량화한다.

3개 검증 가설

가설질문기대
H1 (modality)Cosmos hidden이 SigLIP RGB보다 IDM 정합도 높은가?지금까지 pixel≈feature. 다른 축과 결합 시 차이 드러나는지 확인.
H2 (frame Δ)action은 변화 예측 → Δ representation이 abs concat보다 직접 정렬되는가?Latent-D 단독 검증 불가했던 부분.
H3 (regression)flow matching stochasticity가 IDM에 본질적인가, 1-step regression으로 충분한가?IDM은 fully-observed input → regression 충분 가능성. 맞으면 inference 16× 빠름.

2 작업 내용 — 8 Cell 정의 및 구현

8 cell 매트릭스

TagInputFrameLossKV tokens상태
pix_abs_diffPixelabsdiffSigLIP(p0)⊕SigLIP(p16) → 96tok✅ 완료
pix_abs_regPixelabsreg96tok✅ 완료
pix_delta_diffPixelΔdiffSigLIP(p16)−SigLIP(p0) → 48tok✅ 완료 (189.83mm)
pix_delta_regPixelΔreg48tok✅ 완료
feat_abs_diffFeatureabsdiffpool(h[0])⊕pool(h[4]) → 32tok🔄 학습 중 (3회 preempt)
feat_abs_regFeatureabsreg32tok🔄 학습 중 (minhopark own)
feat_delta_diffFeatureΔdiffpool(h[4])−pool(h[0]) → 16tok🔄 학습 중 (own, ~27%)
feat_delta_regFeatureΔreg16tok🔄 학습 중 (minhopark own)

공통 학습 spec

Dataset : hybrid v2 pack video = idm_mg30 (droid 180×320 wide RGB, 3 cam) state/action = mg30_real_h50 (h50 16-dim eef-pose, v3.0) action = [0:12] eef + state [12:28] h50 + zero [28:32], mask [0:28]=True GPU : 4 B200 × eff batch 64 × 60K step LR : 1e-4 cosine warmup=500 → 1e-5 Cosmos cache : mg30_l27_s30_T24_44_K2 (K=2, T=24, pH=4, pW=4, D=5120, fp16) Eval : 24-task heldout, simulator replay, EEF mm + gripper acc

신규 코드 — feature_source 분기 (flow_matching_action_head_idm.py)

siglip_delta : 2 frame 각각 SigLIP → embedding 단 Δ (f[t+16]-f[t]) → (B, V×N_tok, hidden), 48 tokens per 3-view cosmos_2frame_abs : pooled cache latent[0] ⊕ latent[4] → (B, 32, latent_in) cosmos_2frame_delta: pooled cache latent[4] - latent[0] → (B, 16, latent_in)

신규 코드 — regression loss 분기

loss_type: regression z0_learnable = nn.Parameter(action_horizon=16, action_dim=32) # nn.init.normal_(std=0.02) t_disc = torch.zeros(B) # fixed t=0 forward: MSE(pred_action, action_target) # velocity 아닌 action 직접 inference: 1-step (no loop) # diffusion 16-step 대비 16× 빠름

신규 코드 — dataset_latent_idm_2frame.py

Feature half용 신규 dataset class:

제출 패턴

conda activate gr00t-idm for tag in pix_abs_diff pix_abs_reg pix_delta_diff pix_delta_reg \ feat_abs_diff feat_abs_reg feat_delta_diff feat_delta_reg; do sbmr 5 "bash scripts/run_idm_2x2x2_${tag}.sh" \ --gres=gpu:4 -c 32 --mem 800GB --qos=extra sleep 5 done # 8 jobs × 4 GPU = 32 GPU 동시 (cluster cap 120 안에 들어감)

3 결과 (현황)

Pixel half — 완료

CellEEF mmgripper acc
pix_delta_diff ⭐189.8388.20%
pix_delta_reg302.9487.04%
pix_abs_diff344.0875.80%
pix_abs_reg363.8887.84%
Δ 효과: abs→Δ (diff) = −45%. Regression 효과: diff→reg (Δ) = +60% 악화 (Δ 신호를 1-step으로 못 풀음).

Feature half — 학습 중 (상세 미기재)

feat_delta_diff (own, ~27% done), feat_abs_diff (extra, 3회 preempt sbmr retry 중), feat_abs_reg/feat_delta_reg (minhopark own). 12–20h 후 eval 예정.

8 cell 통합 main table — 미완성

TagInputFrameLossEEF mmgripper
pix_delta_diffpixelΔdiff189.8388.20%
pix_delta_regpixelΔreg302.9487.04%
pix_abs_diffpixelabsdiff344.0875.80%
pix_abs_regpixelabsreg363.8887.84%
feat_delta_difffeatureΔdiffTBDTBD
feat_delta_regfeatureΔregTBDTBD
feat_abs_difffeatureabsdiffTBDTBD
feat_abs_regfeatureabsregTBDTBD

4 Takeaway (중간)

H2(Δ frame) 픽셀에서 강하게 입증 (−45%). Pixel half만으로도 Δ representation이 IDM에서 결정적임 확인.
H3(regression) — Δ 환경에서는 regression이 크게 열위 (+60%). abs 환경에서는 regression ≈ diffusion. regression 채택 조건: abs feature일 때만.

Feature half 예측

pixel과 동일한 패턴이 나온다면: feat_delta_diff가 pixel_delta_diff보다 좋거나 비슷할 것. Cosmos hidden은 pixel보다 풍부한 사전학습 표현을 제공하므로 Δ feature의 motion signal이 더 잘 압축된다는 가설(H1+H2 상호작용)을 검증. feat_abs_diff 가 pix_abs_diff (344mm)보다 좋다면 H1(modality) 단독 효과 확인.

5 Next Steps

Kill criteria

smoke 200 step에서 loss > 5 또는 NaN → 해당 tag kill. pix_abs_diff 재현 fail (134.8mm 대비 60mm 이상 차이) → spec 자체 버그 의심, batch=64 정당성 재검토. (pix_abs_diff 실측 344mm — batch 64 효과 ~2.5× 고려 시 정합.)