feat_delta_reg sim EEF 106mm vs state-pred 259mm (ratio 2.4×). Cosmos hidden이 motion 인코딩(velocity-like)에 정렬 → action excellent. absolute pose 인코딩은 약함.pix_delta_reg state pos 261→149mm (−43%), qnorm이 action만큼 state head도 구원.IDM 2×2×2 ablation의 기존 평가 지표는 sim EEF pos mm (action을 sim에 넣어 replay → GT action replay와 EEF 궤적 L2). 이는 action head의 품질만 측정한다. IDM 모델은 action 외에 state head(predicted_base_to_eef_pos/quat)도 동시에 예측하는데, state head 품질은 sim 없이 별도로 측정 가능하다.
목표: 8-cell × 4-metric (sim pos, sim quat, state pos, state quat) 행렬을 완성해 어떤 셀의 두 head가 coupled인지, decoupled인지, 그리고 collapse 패턴이 무엇인지 파악.
sim pos mm는 이전 open-loop eval videos/summary.json과 byte-identical 확인 (replay 결정론적 재확인 ✅). quat geodesic은 θ = 2·arccos|⟨qa,qb⟩| — symmetric, 0~180°, 90°=직교, 180°=anti-aligned.
| Cell | sim pos↓ | sim quat°↓ | state pos↓ | state quat°↓ | ratio pos | r(sim,state_pos) |
|---|---|---|---|---|---|---|
| feat_delta_reg ⭐ | 104.8 | 20.1° | 257.8 | 62.2° | 2.46 | 0.29 |
| feat_abs_reg | 108.6 | 19.5° | 247.4 | 60.5° | 2.28 | 0.36 |
| feat_delta_diff | 114.4 | 21.9° | 262.1 | 61.7° | 2.29 | 0.24 |
| feat_abs_diff | 122.9 | 23.5° | 251.3 | 60.7° | 2.04 | 0.26 |
| pix_delta_diff ⭐coupled | 181.6 | 32.1° | 194.4 | 30.4° | 1.07 | 0.41 |
| pix_delta_reg | 302.9 | 38.4° | 261.0 | 46.8° | 0.86 | 0.71 |
| pix_abs_reg | 363.9 | 53.2° | 244.8 | 31.6° | 0.67 | 0.93 |
| pix_abs_diff ⚠ | 339.0 | 59.6° | 336.5 | 117.1° ⚠ | 0.99 | 0.88 |
| Cell | sim pos | qnorm sim pos | state pos | qnorm state pos | Δstate pos | qnorm state quat° |
|---|---|---|---|---|---|---|
| pix_abs_diff | 339.0 | 344.1 | 336.5 | 341.2 | +4.7 | 116.9° ⚠ |
| pix_abs_reg ⚠ | 363.9 | 336.6 (−27) | 244.8 | 333.3 | +88.5 ⚠ | 120.8° ⚠ |
| pix_delta_diff | 181.6 | 157.8 (−24) | 194.4 | 126.6 | −67.8 | 28.0° |
| pix_delta_reg | 302.9 | 168.6 (−134) | 261.0 | 149.3 | −111.7 ⭐ | 28.8° |
| feat_abs_diff | 122.9 | 111.3 (−12) | 251.3 | 244.6 | −6.7 | 59.5° |
| feat_abs_reg | 108.6 | 109.6 | 247.4 | 248.6 | +1.2 | 60.3° |
| feat_delta_diff | 114.4 | 114.7 | 262.1 | 259.0 | −3.1 | 62.2° |
| feat_delta_reg | 104.8 | 106.0 | 257.8 | 259.0 | +1.2 | 62.9° |
| 셀 그룹 | sim 메트릭 | state-pred 메트릭 | qnorm 효과 | 해석 |
|---|---|---|---|---|
| pix_delta (diff/reg) | 중간 | 중간 | 둘 다 크게 개선 | Coupled, norm이 genuine quality ↑ |
| pix_abs (diff/reg) | 나쁨 | 나쁨/collapse | trade-off만 이동 | Decoupled, qnorm이 구조 문제 못 고침 |
| feature 4종 | 최강 | mediocre (60°) | 무변화 | 완전 Decoupled, norm 무관 |
Cosmos hidden layer27_sigma30이 action 예측에서 SigLIP pixel보다 압도적인 이유: action은 velocity-like signal (t+16 target의 delta), Cosmos hidden의 Δ 표현이 이것에 정렬. 반면 absolute pose (base_to_eef_pos/quat in global frame)는 Cosmos가 인코딩하는 것과 다른 정보 — feature 셀 state quat 60°가 4종 모두 균일하게 약한 것이 증거.
sim EEF 단독 평가의 한계: pix_abs_reg가 qnorm으로 sim −27mm 개선됐지만 state head는 quat 31°→121° 완전 붕괴. 이걸 sim EEF만 보면 "개선"으로 잘못 판단. deploy 시에는 state head도 사용하는 downstream이 있으므로 두 메트릭을 함께 봐야 정확한 판단이 가능.
pix_delta_diff "coupled" 의 의미: pixel 입력 + frame 차분 + diffusion 조합에서 모델이 action과 state를 균형 있게 학습. 이는 pixel 입력이 RGB raw spatial 정보를 보존해 absolute pose 추정에도 유리하기 때문으로 해석. Cosmos hidden은 high-level motion 표현으로 추상화돼 절대 위치 정보가 상실.
pix_abs_diff state quat 117° 의 의미: anti-aligned에 가깝다는 것은 학습 자체가 수렴에 실패했다는 신호. abs+diffusion+pixel 조합의 quat state 학습에 근본적 불안정이 있음. gripper acc 75.8% (8-cell 중 단독 이상치)도 같은 학습 문제의 반영.
state quat 117° collapse는 normalization으로 해결 불가 (qnorm 후 116.9° 유지). 원인 후보: (1) abs+diffusion 조합의 quat space 학습 불안정, (2) lr 너무 큼, (3) action/state loss weight 불균형. 단일 변수 ablation: lr 절반 / warmup 2× / state_loss_weight 0.1→0.01.
Feature 4-cell state quat 60° 균일 약함 — Cosmos hidden이 absolute pose 정보를 인코딩하지 못하는 구조적 한계. 가설: auxiliary absolute pose supervision을 추가하면 action head 손상 없이 state head 개선 가능한가? feat_delta_reg 기반으로 state_loss_weight 스윕 (0.0 → 0.1 → 1.0).
현재 feature 셀은 sim render → Cosmos encoder 경로 미구현 (~3.5h 추가). Feature CL 결과가 있으면 실제 deploy 시나리오 완성. pix 셀 CL 결과 (327~577mm)와 비교해 modality mismatch 정도 정량화.