disable_proprioceptive_obs=True가 Pi0.5의 pretrained state↔action 분포 파괴Pi0.5(PaliGemma + action_expert, pretrained lerobot/pi05_base)을 IDM 입력 형태(view당 1장의 forward 차분 x_{t+16} − x_t)로 fine-tune해 IDM 트랙(107mm)과 비교하는 실험이다. Pi0.5의 PaliGemma backbone이 SigLIP2(IDM 사용)보다 더 풍부한 representation을 가져 IDM 정확도가 개선될 것이라는 가설이었다.
| 항목 | v1 (no state) | v2 (state on) | IDM baseline ref |
|---|---|---|---|
| recipe | 4 GPU eff 64 20K | 동일 | 8 GPU eff 1024 60K |
| state input | OFF | ON | OFF |
| input image | x_{t+16}−x_t (차분) | x_{t+16}−x_t (차분) | (x_t, x_{t+16}) raw |
| eval | IDM-EEF + SR | IDM-EEF + SR | IDM-EEF |
v1과 v2의 유일한 차이는 state input. v2와 Pi0.5 b0_ref의 비교가 가장 fair (recipe+state 동일, input만 차분 vs raw).
@PreTrainedConfig.register_subclass가 argparse 시점에 등록 안 됨 → side-effect import 추가pi05_delta type 인식 실패 → modeling 모듈에서 config side-effect import~/slurm_commands.shfind_elements(...).get() AttributeError on resume → None-check fix24-task heldout(ep당 30ep × 24 task = 720 demos). IDM-style offline labeling: IDM으로 action 라벨 생성 후 open-loop sim replay → EEF mm + SR. Rollout eval 불가(forward delta inference 시 미래 frame 모름).
| Checkpoint | EEF mm ↓ | SR ↑ | n eval |
|---|---|---|---|
| 5K | 610.7 ± 274.6 | 1.4% | 720 |
| 10K | 574.1 ± 249.8 | 2.6% | 720 |
| 20K (최종) | 562.1 ± 241.6 | 2.2% | 720 |
| 모델 | EEF mm | 비고 |
|---|---|---|
| IDM feat_delta_reg (best) | 104.79 | 8 GPU eff 1024 60K, feature input |
| IDM Latent-A multistream | 107.46 | 이전 SOTA |
| IDM Pixel v2_8gpu | 134.8 | batch 1024 pixel |
| Pi0.5 Delta-IDM v1 (20K) | 562.1 | 4 GPU eff 64, state=OFF |
Job 2650 PENDING (extra QOS). Step 3000부터 resume. 20K step 완료 후 동일 eval pipeline으로 측정 예정. 결과 해석 기준:
| v2 결과 범위 | 해석 | 다음 액션 |
|---|---|---|
| v2 ≈ v1 (500-650mm) | state input 무의미 → delta image OOD가 진짜 원인 | 다른 input scheme 또는 종료 |
| v2 ≪ v1 (200-300mm) | state input 결정적 | recipe 정렬 + 60K/eff 1024 scale |
State input 제거(disable_proprioceptive_obs=True)가 pretrained 분포 파괴. Pi0.5는 state(proprioception) input으로 pretrain됨. v1에서 state를 끄면 action_expert가 state↔action joint distribution을 학습할 수 없어 IDM 예측이 붕괴할 가능성. 실제 loss 수렴(0.46→0.10)은 됐지만 open-loop simulator에서 EEF가 5× 나쁨.
Delta image 자체가 OOD일 수 있음. 학습 데이터가 Cosmos 생성 droid-style video 차분 → Pi0.5의 pretrained visual encoder가 차분 이미지를 처리하도록 설계되지 않음. 차분 이미지가 natural image distribution과 근본적으로 다름.
v2(STATE=on)가 결정 실험. state만 켰을 때 개선 폭이 state input 효과를 직접 측정. 개선이 없으면 delta image OOD가 true bottleneck → 다른 input scheme(raw concat 유지, dual-view, channel concat 등) 검토.
Job 2650 완료 확인 후 즉시 24-task eval 실행. CKPT_DIR=outputs/pi05_delta_idm_4gpu_state_on/checkpoints_preserved로 5K/10K/20K 병렬 평가.
v2 ≪ v1 → state input 복구 효과 확인 → 60K step / eff 1024로 scale-up, IDM eval pipeline 동일 적용. v2 ≈ v1 → delta image OOD 근본 해결 필요 → (a) raw 2-frame input으로 Pi0.5 IDM-style 재설계, (b) 실험 종료 후 IDM 트랙(feat_delta_reg) 집중.
Pi0.5의 pretrained action_expert는 50-token attention pattern. 16-token으로 truncate 시 pattern이 제대로 작동하는지 불확실. v2가 잘 됐을 경우 chunk=50 + IDM eval 변경 실험 가능.
IDM 트랙은 EEF mm만, Pi0.5 b0_ref는 rollout SR만. Apple-to-apple 비교가 어려움. b0_ref ckpt에 eval_pi05_delta_idm.py 적용(delta_lookahead 비활성화)으로 b0_ref EEF mm 측정 가능. 장기 TODO.