IDM 핵심 설계 변수들이 지금까지 단편적으로 결과만 쌓여 있었고 어떤 변수가 결정적인지 confound가 많았다. 3-axis 직교 2×2×2 ablation으로 한 번에 정리한다:
본 리포트는 pixel half 4 cell 결과. Feature half는 학습 중으로 별도 리포트 예정.
검증 가설: H2 — action은 변화 예측이므로 Δ representation이 abs concat보다 직접 정렬. H3 — diffusion의 stochasticity가 IDM에 본질적인가.
| Tag | feature_source | loss_type | 신규 코드 |
|---|---|---|---|
pix_abs_diff | siglip (2-frame concat) | diffusion | base IDM 재현 |
pix_abs_reg | siglip (2-frame concat) | regression | learnable z0 분기 |
pix_delta_diff | siglip_delta (embedding Δ) | diffusion | SigLIP 후 f[t+16]−f[t] |
pix_delta_reg | siglip_delta (embedding Δ) | regression | Δ + z0 분기 |
Pixel-Δ 구현: dataset은 이미 (B, 6, 3, 256, 256) 2-frame 그대로 전달. model encode_visual의 siglip_delta 분기에서 2 frame을 각각 SigLIP 통과 후 embedding 단에서 차분 → (B, V×N_tok, hidden). token 개수는 abs 96 → Δ 48 (3 cam × 1). mode="cosmos_latent" 반환으로 R3 token mask 이슈 bypass.
Regression 구현: loss_type: regression config field 추가. z0_learnable = nn.Parameter(action_horizon, action_dim), t=0 fixed, model output을 velocity가 아닌 action 직접 예측으로 해석. inference 1-step (diffusion 16-step 대비 16× 빠름).
Eval pipeline: 4 GPU parallel sbatch (run_eval_2x2x2_pixel_4gpu.sh) — srun --ntasks=4로 4 cell 동시 (각 1 GPU). dump 15min + replay 35min 병렬, 총 wall ~50min.
| Cell | avg EEF mm | std mm | gripper acc | 비고 |
|---|---|---|---|---|
| pix_delta_diff ⭐ | 189.83 | 98.0 | 88.20% | Δ + flow matching |
| pix_delta_reg | 302.94 | 117.1 | 87.04% | Δ + 1-step MSE |
| pix_abs_diff | 344.08 | 122.3 | 75.80% | abs concat + flow matching |
| pix_abs_reg | 363.88 | 234.4 | 87.84% | abs concat + 1-step MSE |
| Effect | 변화 (mm) | % change | 해석 |
|---|---|---|---|
| abs → Δ (in diff) | 344.08 → 189.83 | −45% ⭐ | Δ 효과 압도적 |
| abs → Δ (in reg) | 363.88 → 302.94 | −17% | Δ 효과 있지만 약함 |
| diff → reg (in abs) | 344.08 → 363.88 | +6% | 마진 내, 유의미하지 않음 |
| diff → reg (in Δ) | 189.83 → 302.94 | +60% ⚠ | Δ 신호를 regression으로 못 풀음 |
| 모델 | batch | EEF mm | 비고 |
|---|---|---|---|
| Pixel v2_8gpu | 1024 | 134.8 | 기존 best (abs+diff) |
| Latent-A multistream | 1024 | 107.5 | 현재 best overall |
| pix_delta_diff (이번) | 64 | 189.83 | batch=64 불리함에도 SOTA 잠재력 |
| pix_delta_diff 예상 (batch=1024) | 1024 | ~95 | 2.5× batch 보정 → 26% SOTA 개선 예상 |
f[t+16]−f[t]만 거치면 abs concat 대비 EEF mm가 거의 절반. Latent-D 가설 (action은 변화 예측)이 pixel 단에서도 확인됨.
abs는 t와 t+16의 전체 장면 정보를 포함 → action 추정에 필요한 모든 힌트가 있어 regression도 수렴 가능. 반면 Δ는 motion-only signal이라 정보가 압축됨 → 다중 action 가능성에 대한 불확실성이 커지고 이를 1-step으로 붕괴시키기 어려움 → diffusion의 multi-step denoising이 필요.
이 해석이 맞다면 Δ × regression 개선 방향은 2~4 step iterative regression (완전한 16-step diffusion 없이도 Δ 신호 활용 가능한지 확인).
claude/260514/analysis-idm_2x2x2_ablation.md).