pix_delta_reg 303→169mm (−44%), base에서 "대참사"였던 셀이 정상화feat_delta_reg 106mm, feat_abs_reg 110mm (quat best 15.9°)feat_delta ±1mm 불변. 단 feat_abs_diff는 −12mm 개선 (abs frame이 outlier clamp 효과 수용)IDM 2×2×2 3-axis 직교 ablation (input × frame × loss, 8 cell)의 base 학습은 min_max normalization (stats min/max → [−1,1], clamp 없음)을 사용했다. VLA·Pi0.5 표준 norm은 q01/q99 + clamp — action/state target의 하위 1%·상위 99% quantile로 [−1,1] 정규화 후 경계에서 clamp. outlier에 robust한 방식이다.
pix_delta_reg가 303mm로 "대참사"였다 (diff→reg 전환 시 +67% 폭발). q01/q99 clamp가 이 셀을 구할 수 있는가?두 가지 가설: (A) regression은 raw target에 직접 MSE fit → long-tail outlier에 민감 → q01/q99 clamp가 outlier를 압축해 학습 안정화. (B) Cosmos hidden (feature)은 이미 압축/정규화된 표현 → norm 효과 없음.
검증 방법: 동일 architecture + 동일 data, --norm_method q01_q99_clamp만 바꿔 8-cell 재학습 후 24-ep open-loop sim EEF mm 비교.
8-cell 전체 재학습 (outputs/idm_2x2x2_qnorm/<tag>/), 분산 제출 (own 2 + minhopark 6 GPU). 60K steps, batch 1024, 동일 hybrid v2 pack (video=idm_mg30, state=mg30_real_h50).
6-cell (4 pixel + feat_delta×2) 먼저 완료 → dump + sim replay. feat_abs×2는 후속 (Job 3404, 28:11 완료). SLURM 3334 (dump 성공, replay 버그 fail) → 3374 (replay-only, mkdir VIDEO_DIR fix + dump-skip idempotent).
부가 픽스: ulimit -n fd 증가 (torchcodec EMFILE), LRU decoder cache 적용.
| Cell | base pos | qnorm pos | Δpos | base quat° | qnorm quat° | Δquat | grip(qnorm) |
|---|---|---|---|---|---|---|---|
| feat_delta_reg ⭐ | 104.8 | 106.0 | +1.2 | 20.1° | 19.6° | −0.5 | 83.6% |
| feat_abs_reg | 108.6 | 109.6 | +1.0 | 19.5° | 15.9° ⭐ | −3.6 | 85.6% |
| feat_abs_diff | 122.9 | 111.3 | −11.6 | 23.5° | 19.6° | −3.9 | 84.5% |
| feat_delta_diff | 114.4 | 114.7 | +0.3 | 21.9° | 19.6° | −2.2 | 83.3% |
| pix_delta_diff | 181.6 | 157.8 | −23.8 | 32.1° | 27.4° | −4.7 | 88.3% |
| pix_delta_reg | 302.9 | 168.6 | −134.3 ⭐ | 38.4° | 24.0° | −14.4 | 88.0% |
| pix_abs_reg | 363.9 | 336.6 | −27.3 | 53.2° | 59.2° | +5.9 | 76.6% |
| pix_abs_diff | 339.0 | 344.1 | +5.0 | 59.6° | 59.3° | −0.2 | 75.8% |
| Axis | base | qnorm | 해석 |
|---|---|---|---|
| input: pixel → feature | 297mm | 252mm → 110mm (−56%) | Feature 압도, 두 norm 무관 |
| frame: abs → delta | 234→176 (−25%) | 225→137 (−39%) | Δ 우위가 qnorm에서 더 커짐 |
| loss: diffusion → regression | 190→220 (+16%) | 182→180 (−1%) | qnorm이 regression을 구원 ⭐ |
pix_delta_reg 303mm). qnorm에서는 regression ≈ diffusion (−1% 차이). pix_delta_reg 303→169mm (−44%), quat 38°→24°(−38%). norm method 하나가 이 셀 학습 안정성의 결정적 변수였음.feat_delta 셀 ±1mm 불변 (action stat 이미 [−1,1] identity라 q01/q99≈min/max). 단 feat_abs_diff는 qnorm으로 −12mm (123→111) 개선 — abs frame은 절대값이라 state outlier clamp 효과를 받음.| Rank | Cell | qnorm pos | qnorm quat° | grip |
|---|---|---|---|---|
| 1 ⭐ | feat_delta_reg | 106.0mm | 19.6° | 83.6% |
| 2 | feat_abs_reg | 109.6mm | 15.9° ⭐ | 85.6% |
| 3 | feat_abs_diff | 111.3mm | 19.6° | 84.5% |
| 4 | feat_delta_diff | 114.7mm | 19.6° | 83.3% |
| 5 | pix_delta_diff | 157.8mm | 27.4° | 88.3% |
| 6 | pix_delta_reg | 168.6mm | 24.0° | 88.0% |
| 7 | pix_abs_reg | 336.6mm | 59.2° | 76.6% |
| 8 | pix_abs_diff | 344.1mm | 59.3° | 75.8% |
손해 보는 셀 없음 (pix_abs_diff collapse는 norm 무관 별개 문제). regression 셀 평균 +16%→−1% 정상화, pix_delta_reg −44% 구원, feat_abs_diff −12mm, quat 6/8 cell 개선. 잃는 것 없이 얻는 것만 있음.
왜 regression이 min_max에서 취약했는가: regression은 raw target에 직접 MSE fit → state target의 long-tail outlier 하나가 gradient를 지배. q01/q99 clamp가 outlier를 [−1,1] 경계로 압축 → 학습 안정화. diffusion(flow matching)은 stochastic sampling이라 outlier 영향이 분산되어 norm 효과가 작다.
feat_delta vs feat_abs의 차이: feat_delta는 frame 차분이라 outlier가 상쇄됨 → norm 무관. feat_abs는 두 frame의 절대값을 보므로 state outlier clamp 효과가 있음. 같은 "feature 무변화" 결론이라도 frame axis에 따라 달라짐.
pix_abs_diff 재학습 필요: 이 셀의 state quat 117° (anti-aligned에 가까움)는 normalization으로 해결 불가. abs+diffusion+pixel 조합의 구조적 학습 불안정. lr/warmup/loss-weight 실험 또는 구조 점검 별도 필요.
state quat 117° collapse (sim 59°, state-pred 117°) — norm 무관 확인. 원인 후보: lr 너무 큼, warmup 부족, action/state loss weight 불균형, abs+diff 조합의 feature 불안정. lr 절반 / warmup 2× / loss_weight 조정으로 각각 1개씩 ablation.
base CL에서 pix_delta_reg가 OL 303 → CL 327mm (+8%)였음. qnorm OL이 169mm로 크게 좋아졌으니 CL에서도 개선됐는지 확인 가치 있음. Feature CL eval은 sim render → Cosmos encoder 경로 필요 (~3.5h), 우선 pixel CL만.
pos는 2위 (109.6mm)지만 orientation 정확도는 8-cell 최강. rotation-critical task (예: pour, insert)에서 feat_abs_reg가 feat_delta_reg보다 유리할 수 있음. task 특성에 따라 최종 모델 선택 기준 마련.