siglip_delta / cosmos_2frame_abs / cosmos_2frame_delta feature_source 분기, regression loss_type (learnable z0 + 1-step MSE), dataset_latent_idm_2frame.py.IDM 핵심 설계 선택지들이 단편적으로만 결과가 쌓여 어떤 변수가 결정적인지 confound가 많았다:
3-axis 직교 2×2×2 ablation으로 각 변수의 단일 효과(marginal effect)와 교호작용(interaction)을 정량화한다.
| 가설 | 질문 | 기대 |
|---|---|---|
| H1 (modality) | Cosmos hidden이 SigLIP RGB보다 IDM 정합도 높은가? | 지금까지 pixel≈feature. 다른 축과 결합 시 차이 드러나는지 확인. |
| H2 (frame Δ) | action은 변화 예측 → Δ representation이 abs concat보다 직접 정렬되는가? | Latent-D 단독 검증 불가했던 부분. |
| H3 (regression) | flow matching stochasticity가 IDM에 본질적인가, 1-step regression으로 충분한가? | IDM은 fully-observed input → regression 충분 가능성. 맞으면 inference 16× 빠름. |
| Tag | Input | Frame | Loss | KV tokens | 상태 |
|---|---|---|---|---|---|
pix_abs_diff | Pixel | abs | diff | SigLIP(p0)⊕SigLIP(p16) → 96tok | ✅ 완료 |
pix_abs_reg | Pixel | abs | reg | 96tok | ✅ 완료 |
pix_delta_diff ⭐ | Pixel | Δ | diff | SigLIP(p16)−SigLIP(p0) → 48tok | ✅ 완료 (189.83mm) |
pix_delta_reg | Pixel | Δ | reg | 48tok | ✅ 완료 |
feat_abs_diff | Feature | abs | diff | pool(h[0])⊕pool(h[4]) → 32tok | 🔄 학습 중 (3회 preempt) |
feat_abs_reg | Feature | abs | reg | 32tok | 🔄 학습 중 (minhopark own) |
feat_delta_diff | Feature | Δ | diff | pool(h[4])−pool(h[0]) → 16tok | 🔄 학습 중 (own, ~27%) |
feat_delta_reg | Feature | Δ | reg | 16tok | 🔄 학습 중 (minhopark own) |
Feature half용 신규 dataset class:
RobocasaLatent2FrameAbs: pooled_2frame = stack(latent[0], latent[4]), shape (2, 16, 5120).RobocasaLatent2FrameDelta: pooled_2frame_delta = latent[4] − latent[0], shape (16, 5120).| Cell | EEF mm | gripper acc |
|---|---|---|
| pix_delta_diff ⭐ | 189.83 | 88.20% |
| pix_delta_reg | 302.94 | 87.04% |
| pix_abs_diff | 344.08 | 75.80% |
| pix_abs_reg | 363.88 | 87.84% |
feat_delta_diff (own, ~27% done), feat_abs_diff (extra, 3회 preempt sbmr retry 중), feat_abs_reg/feat_delta_reg (minhopark own). 12–20h 후 eval 예정.
| Tag | Input | Frame | Loss | EEF mm | gripper |
|---|---|---|---|---|---|
| pix_delta_diff | pixel | Δ | diff | 189.83 | 88.20% |
| pix_delta_reg | pixel | Δ | reg | 302.94 | 87.04% |
| pix_abs_diff | pixel | abs | diff | 344.08 | 75.80% |
| pix_abs_reg | pixel | abs | reg | 363.88 | 87.84% |
| feat_delta_diff | feature | Δ | diff | TBD | TBD |
| feat_delta_reg | feature | Δ | reg | TBD | TBD |
| feat_abs_diff | feature | abs | diff | TBD | TBD |
| feat_abs_reg | feature | abs | reg | TBD | TBD |
pixel과 동일한 패턴이 나온다면: feat_delta_diff가 pixel_delta_diff보다 좋거나 비슷할 것. Cosmos hidden은 pixel보다 풍부한 사전학습 표현을 제공하므로 Δ feature의 motion signal이 더 잘 압축된다는 가설(H1+H2 상호작용)을 검증. feat_abs_diff 가 pix_abs_diff (344mm)보다 좋다면 H1(modality) 단독 효과 확인.
claude/260514/analysis-idm_2x2x2_ablation.md): marginal effect × 3축, interaction term, per-task heatmap (24 task × 8 cell).