Index
2026-05-18 — Analysis

IDM 2×2×2 — Action Head vs State Prediction Head 4-Metric 분리 분석

DreamData / GR00T-Dreams  |  sim EEF(action) + state-pred(pos/quat)  |  8-cell × 24-ep, base + qnorm

TL;DR

2.4×
feat 셀 ratio (state/sim pos)
1.07
pix_delta_diff ratio
117°
pix_abs_diff state quat
−43%
pix_delta_reg state pos (qnorm)

1 배경 / 목적

IDM 2×2×2 ablation의 기존 평가 지표는 sim EEF pos mm (action을 sim에 넣어 replay → GT action replay와 EEF 궤적 L2). 이는 action head의 품질만 측정한다. IDM 모델은 action 외에 state head(predicted_base_to_eef_pos/quat)도 동시에 예측하는데, state head 품질은 sim 없이 별도로 측정 가능하다.

문제: sim EEF만 보면 feature 셀이 pixel 셀을 압도(104 vs 182~364mm)한다. 그런데 이게 action head만의 우위인가, 아니면 전반적인 representation 품질 때문인가? state head까지 같이 보면 더 정확한 그림이 나온다.
IDM(2 frames) → joint output: ├─ action_12 → env.step → sim eef_pos/quat trajectory → "sim metric" └─ state_16 → 직접 비교(GT state vs pred state) → "state pred metric" 두 head는 같은 encoder(SigLIP / Cosmos hidden)를 공유하지만 각각 별도 MLP로 학습. 한 head가 잘해도 다른 head는 다를 수 있다.

목표: 8-cell × 4-metric (sim pos, sim quat, state pos, state quat) 행렬을 완성해 어떤 셀의 두 head가 coupled인지, decoupled인지, 그리고 collapse 패턴이 무엇인지 파악.

2 작업 내용

메트릭 정의

# Sim EEF (action quality) IDM action → robocasa sim replay → eef_pos/quat trajectory (mujoco 3.2.6) eef_pos: L2(mm), 24-ep heldout open-loop eef_quat: geodesic θ = 2·arccos|⟨qa, qb⟩| (degree) # State pred (state head quality, NO sim) model predicted_base_to_eef_pos vs GT base_to_eef_pos (heldout idm_state cache) model predicted_base_to_eef_quat vs GT quat — geodesic # ratio = state_pos / sim_pos ~1.0 → 두 head 비슷한 quality (coupled) >> 1.0 → state head가 훨씬 약함 (decoupled)

추가 코드 및 스크립트

scripts/analyze_2x2x2_pose_quat_diff.py — state pred 분석 scripts/eval_idm_simulator_replay.py — quat geodesic 메트릭 추가 (260514) scripts/run_eval_2x2x2_quat_replay_4cell.sh — 4-cell 병렬 replay # Base norm (260514): 8-cell state pred + sim quat 완성 # qnorm (260515): 8-cell qnorm 재학습 후 동일 4-metric 재측정

검증

sim pos mm는 이전 open-loop eval videos/summary.json과 byte-identical 확인 (replay 결정론적 재확인 ✅). quat geodesic은 θ = 2·arccos|⟨qa,qb⟩| — symmetric, 0~180°, 90°=직교, 180°=anti-aligned.

3 결과

4-Metric Matrix — Base norm (8-cell, 24-ep)

Cellsim pos↓sim quat°↓state pos↓state quat°↓ratio posr(sim,state_pos)
feat_delta_reg ⭐104.820.1°257.862.2°2.460.29
feat_abs_reg108.619.5°247.460.5°2.280.36
feat_delta_diff114.421.9°262.161.7°2.290.24
feat_abs_diff122.923.5°251.360.7°2.040.26
pix_delta_diff ⭐coupled181.632.1°194.430.4°1.070.41
pix_delta_reg302.938.4°261.046.8°0.860.71
pix_abs_reg363.953.2°244.831.6°0.670.93
pix_abs_diff ⚠339.059.6°336.5117.1° ⚠0.990.88

4-Metric Matrix — qnorm (q01/q99+clamp, 8-cell)

Cellsim posqnorm sim posstate posqnorm state posΔstate posqnorm state quat°
pix_abs_diff339.0344.1336.5341.2+4.7116.9° ⚠
pix_abs_reg ⚠363.9336.6 (−27)244.8333.3+88.5120.8° ⚠
pix_delta_diff181.6157.8 (−24)194.4126.6−67.828.0°
pix_delta_reg302.9168.6 (−134)261.0149.3−111.7 ⭐28.8°
feat_abs_diff122.9111.3 (−12)251.3244.6−6.759.5°
feat_abs_reg108.6109.6247.4248.6+1.260.3°
feat_delta_diff114.4114.7262.1259.0−3.162.2°
feat_delta_reg104.8106.0257.8259.0+1.262.9°
발견 1 — Feature 셀: action head 압도적 / state head 모두 약함: sim pos 104~123mm (best), state pos 247~262mm (2.0~2.5×). sim quat 19~24° (best), state quat 59~63° (모두 ~60°로 균일하게 약함). Cosmos hidden이 velocity-like motion signal에 정렬 → action 예측에 탁월. 하지만 absolute pose (base_to_eef_pos/quat) 인코딩은 약함.
발견 2 — pix_delta_diff: 유일한 "coupled" 셀: sim pos 182mm vs state pos 194mm (ratio 1.07), sim quat 32° vs state quat 30° (ratio 0.95). 두 head가 같은 quality. 모델 representation이 action과 state 양쪽을 균형 있게 학습한 유일한 케이스.
발견 3 — pix_abs_diff: state head 학습 실패: state quat 117.1° (median도 117°) — 거의 모든 frame에서 anti-aligned에 가까운 collapse. sim quat 59.6°는 다른 pixel 셀과 비슷 → action head는 부분적으로 살아있음. gripper acc 75.8%로 8-cell 단독 이상치. abs+diff 조합이 quat state 학습에 근본적으로 unstable.
발견 4 — pix_abs_reg qnorm paradox: qnorm으로 sim pos는 −27mm 개선 (364→337)됐지만 state pos +88.5mm 붕괴 (245→333), state quat 31°→121° 완전 붕괴. qnorm이 이 셀 학습을 shift — action head는 살짝 구원, state head는 collapse. sim EEF 단독으로는 이 붕괴를 놓침.
발견 5 — qnorm이 pix_delta state-pred도 개선: pix_delta_diff state pos 194→127 (−35%), pix_delta_reg state pos 261→149 (−43%). sim 개선폭보다 state-pred 개선폭이 더 큼. qnorm이 state target의 outlier를 압축 → state head 학습 직접 수혜.

패턴 정리 — sim vs state-pred 일치/불일치

셀 그룹sim 메트릭state-pred 메트릭qnorm 효과해석
pix_delta (diff/reg)중간중간둘 다 크게 개선Coupled, norm이 genuine quality ↑
pix_abs (diff/reg)나쁨나쁨/collapsetrade-off만 이동Decoupled, qnorm이 구조 문제 못 고침
feature 4종최강mediocre (60°)무변화완전 Decoupled, norm 무관

4 Takeaway

Cosmos hidden은 motion 인코딩 우위, absolute state는 약함

Cosmos hidden layer27_sigma30이 action 예측에서 SigLIP pixel보다 압도적인 이유: action은 velocity-like signal (t+16 target의 delta), Cosmos hidden의 Δ 표현이 이것에 정렬. 반면 absolute pose (base_to_eef_pos/quat in global frame)는 Cosmos가 인코딩하는 것과 다른 정보 — feature 셀 state quat 60°가 4종 모두 균일하게 약한 것이 증거.

sim EEF 단독 평가의 한계: pix_abs_reg가 qnorm으로 sim −27mm 개선됐지만 state head는 quat 31°→121° 완전 붕괴. 이걸 sim EEF만 보면 "개선"으로 잘못 판단. deploy 시에는 state head도 사용하는 downstream이 있으므로 두 메트릭을 함께 봐야 정확한 판단이 가능.

pix_delta_diff "coupled" 의 의미: pixel 입력 + frame 차분 + diffusion 조합에서 모델이 action과 state를 균형 있게 학습. 이는 pixel 입력이 RGB raw spatial 정보를 보존해 absolute pose 추정에도 유리하기 때문으로 해석. Cosmos hidden은 high-level motion 표현으로 추상화돼 절대 위치 정보가 상실.

pix_abs_diff state quat 117° 의 의미: anti-aligned에 가깝다는 것은 학습 자체가 수렴에 실패했다는 신호. abs+diffusion+pixel 조합의 quat state 학습에 근본적 불안정이 있음. gripper acc 75.8% (8-cell 중 단독 이상치)도 같은 학습 문제의 반영.

5 Next Steps

pix_abs_diff 재학습 + 진단

state quat 117° collapse는 normalization으로 해결 불가 (qnorm 후 116.9° 유지). 원인 후보: (1) abs+diffusion 조합의 quat space 학습 불안정, (2) lr 너무 큼, (3) action/state loss weight 불균형. 단일 변수 ablation: lr 절반 / warmup 2× / state_loss_weight 0.1→0.01.

Feature 셀 state head 보강 실험

Feature 4-cell state quat 60° 균일 약함 — Cosmos hidden이 absolute pose 정보를 인코딩하지 못하는 구조적 한계. 가설: auxiliary absolute pose supervision을 추가하면 action head 손상 없이 state head 개선 가능한가? feat_delta_reg 기반으로 state_loss_weight 스윕 (0.0 → 0.1 → 1.0).

Feature CL (closed-loop) eval

현재 feature 셀은 sim render → Cosmos encoder 경로 미구현 (~3.5h 추가). Feature CL 결과가 있으면 실제 deploy 시나리오 완성. pix 셀 CL 결과 (327~577mm)와 비교해 modality mismatch 정도 정량화.

산출물 위치

state-pred 분석: outputs/idm_2x2x2_eval/pose_quat_summary.json sim + state-pred 비교: scripts/analyze_2x2x2_pose_quat_diff.py base 8-cell eval: outputs/idm_2x2x2_eval/<cell>/ckpt-60k/videos_quat/ qnorm 8-cell eval: outputs/idm_2x2x2_qnorm_eval/<cell>/ckpt-60k/videos/