Index
2026-05-15 — Analysis

IDM 2×2×2 Full 8-Cell Ablation — feat_delta_reg 104.79mm SOTA

DreamData | GR00T-Dreams | input × frame × loss 직교 실험 전수 결과

TL;DR

104.79
Best EEF mm
8
Cells
−62%
Feature vs Pixel
60K
Steps each
24
Eval episodes

1 배경 / 목적

IDM(Inverse Dynamics Model)의 설계 선택지가 3개의 binary axis로 정의된다: 입력 표현(pixel/feature), 프레임 인코딩(abs/Δ), 학습 손실(diffusion/regression). 이전까지는 pixel-half(4 cell)만 평가했고, feature side(Cosmos hidden 사용)의 직접 비교가 없었다.

기존 한계: Latent-A multistream(107.5mm)이 최선이었으나, 3-axis 전체 직교 실험 없이 단편적 비교만 존재했음. pixel vs feature의 정량적 격차 미확인.

8 cell을 동시 학습(4 GPU × eff batch 64 × 60K step)하고 24-ep heldout open-loop simulator replay로 EEF mm + gripper accuracy를 측정했다.

2 작업 내용

3-Axis 정의

AxisOption A (0)Option B (1)
inputpixel — SigLIP RGB 직접 인코딩feature — Cosmos hidden cache (layer27_sigma30)
frameabs — (t, t+16) 2-frame concatΔ — f(t+16) − f(t) frame difference
lossdiffusion — flow matchingregression — learnable z₀ + 1-step MSE
공통 spec (8 cell 동일): dataset : v2 pack — video=idm_mg30 (droid 180×320), state/action=mg30_real_h50 (h50 16-dim) action : [0:12] + state[12:28] + zero[28:32], mask [0:28]=True 두 frame : (t, t+16) = action_horizon boundary 4 GPU × per_device 16 × grad_accum 1 = eff batch 64 60K step, sbmr 20 retry feature latent index: 0 + 4 (16 video frame ≈ 16×24/93)

주요 코드 변경

Eval 파이프라인 (open-loop)

Dump(gr00t-idm env, GPU): GT video → IDM forward → 16-step action chunk, 슬라이딩 윈도우 평균 → per-frame action sequence. Replay(robocasa env, CPU): env.reset(initial_state)env.step(pred_action[t]) × T. Sim state를 모델에 피드백하지 않음(open-loop).

환경 이슈: mujoco 3.3.1이 mesh volume validation 강화로 13/24 task fail. pip install mujoco==3.2.6 다운그레이드로 해결. kitchen_object_utils.py None-check(robot-data-gen ver) 적용.

3 결과

8 Cell 전수 (24-ep heldout open-loop EEF mm)

RankCellEEF mm ↓Gripper acc ↑
1 ⭐feat_delta_reg104.7984.06%
2feat_abs_reg108.5886.69%
3feat_delta_diff114.4284.47%
4feat_abs_diff122.9185.70%
5pix_delta_diff181.6388.34%
6pix_delta_reg302.9487.04%
7pix_abs_diff339.0275.77%
8pix_abs_reg363.8887.84%

Marginal Effects (단일 axis 변경 효과)

변경Before → After (mm)Δ%
pixel → feature (avg 전체)297 → 113−62% ⭐
abs → Δ (pix_diff)339 → 182−46%
diff → reg (feat_abs)123 → 109−12%
abs → Δ (feat_diff/reg)avg −5%−4~−7%
diff → reg (pix_delta)182 → 303+67% ⚠

Action L2 vs Sim EEF 불일치 (중요)

MetricBest cell
Action L2 (per-frame instantaneous)pix_delta_diff0.48
Sim EEF mm (open-loop 적분)feat_delta_reg104.79mm

기존 baseline 대비

BaselineEEF mmfeat_delta_reg 대비
Pixel v2_8gpu (batch 1024)134.8−30mm
Latent-A multistream107.46−3mm
Latent-A v3110.88−6mm
Latent-A v1114.23−9mm
주목: feat_delta_reg는 batch 64(Pixel v2_8gpu는 batch 1024)인데도 모든 baseline 능가. batch 스케일업 시 추가 개선 예상.
Action L2 ≠ Sim EEF: per-frame L2 최솟값(pix_delta_diff, 0.48)이 Sim EEF 최솟값이 아님. feature의 temporal coherence가 적분 시 drift를 줄이는 핵심.

4 Takeaway

Feature representation의 절대 우위 확립

Cosmos hidden (layer27_sigma30) 기반 feature가 SigLIP RGB pixel 대비 평균 −62%. 4 feat cell(104-123mm) 전부 4 pixel cell(182-364mm) 전부보다 좋다. Cosmos pretraining의 temporal/spatial 압축이 IDM에서도 결정적으로 작용.

설계 안전성: Feature side 4 cell이 18mm 좁은 범위에 cluster. Pixel side는 182mm spread(182-364). Feature 쪽을 선택하면 세부 axis 결정 실수에 robust함.

Δ representation의 비대칭 효과: Pixel-Δ-diff에서 −46%(motion signal 압축 효율), Feature-Δ에서 −5%(이미 Cosmos hidden이 trajectory 압축). Regression × Pixel-Δ는 +67% 대참사 — 1-step MSE가 Δ의 motion signal 활용 부족. Feature에서는 regression이 slightly 유리(−10%).

Action L2가 진짜 metric이 아님: per-frame prediction L2 ≠ sim 적분 EEF. IDM의 실질 metric은 sequence coherence(temporal drift 합산).

5 Next Steps

qnorm 8 cell 재학습 (진행 중)

현재 norm: absolute min/max, no clamp. 표준(q01/q99+clamp) 적용 시 state dim outlier 안정화 → EEF 추가 개선 기대. feat_delta_diff/feat_delta_reg Jobs 3052/3053 RUNNING. 8 cell 병렬 제출, ~6h total wall.

Closed-loop eval

현재 open-loop(action sequence 미리 계산 후 replay)에서 closed-loop(매 16 step마다 sim 현재 state/image 재예측)으로 전환. Pixel 4 cell CL 이미 완료(별도 카드). Feature 4 cell CL은 Cosmos encoder forward ~5s × 24ep × 4cell ≈ 3.5h — 후속 구현 예정.

feat_delta_reg × batch 1024 SOTA 도전

현재 best인 feat_delta_reg(104.79mm, batch 64)를 batch 1024로 재학습. Pixel v2_8gpu(134.8mm)가 batch 1024였고도 −30mm 격차. batch 스케일업 시 ~90mm 예상.

미해결: robocasa 환경 불안정

mujoco 버전이 누군가 업그레이드하면 같은 버그 재발. pip freeze로 robocasa env 잠금 필요. mujoco==3.2.6 + kitchen_object_utils.py None-check 필수 유지.