Index
2026-05-15 — Analysis

Pi0.5 Delta-IDM v1 Eval 결과 — 562mm 실패 + v2 STATE=on 가설 분기

DreamData | GR00T-Dreams | PaliGemma backbone × forward delta input IDM 비교

TL;DR

562
v1 EEF mm
2.2%
v1 SR
107
IDM baseline mm
v1 / IDM 비율
TBD
v2 EEF mm

1 배경 / 목적

Pi0.5(PaliGemma + action_expert, pretrained lerobot/pi05_base)을 IDM 입력 형태(view당 1장의 forward 차분 x_{t+16} − x_t)로 fine-tune해 IDM 트랙(107mm)과 비교하는 실험이다. Pi0.5의 PaliGemma backbone이 SigLIP2(IDM 사용)보다 더 풍부한 representation을 가져 IDM 정확도가 개선될 것이라는 가설이었다.

원가설: PaliGemma backbone의 풍부한 representation → EEF 정확도 개선 (IDM 107mm → 추정 80mm 수준)

설계 결정 요약

항목v1 (no state)v2 (state on)IDM baseline ref
recipe4 GPU eff 64 20K동일8 GPU eff 1024 60K
state inputOFFONOFF
input imagex_{t+16}−x_t (차분)x_{t+16}−x_t (차분)(x_t, x_{t+16}) raw
evalIDM-EEF + SRIDM-EEF + SRIDM-EEF

v1과 v2의 유일한 차이는 state input. v2와 Pi0.5 b0_ref의 비교가 가장 fair (recipe+state 동일, input만 차분 vs raw).

2 작업 내용

구현 (smoke 카드에서 완료 — 이 카드는 eval 결과 분석)

주요 신규 파일: configuration_pi05_delta.py — PI05DeltaConfig, delta_lookahead=16, observation_delta_indices=[0,16] modeling_pi05_delta.py — compute_delta 헬퍼 + _preprocess_images_with_delta (5D→4D delta) eval_pi05_delta_idm.py — 24-task heldout open-loop replay + EEF mm + SR v1 학습: 4 GPU × eff batch 64 × 20K step (b0_ref recipe 동일) 학습 데이터: Keh0t0/robocasa_mg30_real_v2 (720 ep mg30 H50 schema)

발견된 버그 5건 (v1 eval 과정)

Eval 방법

24-task heldout(ep당 30ep × 24 task = 720 demos). IDM-style offline labeling: IDM으로 action 라벨 생성 후 open-loop sim replay → EEF mm + SR. Rollout eval 불가(forward delta inference 시 미래 frame 모름).

3 결과

v1 (state=OFF) 20K step까지 learning curve

CheckpointEEF mm ↓SR ↑n eval
5K610.7 ± 274.61.4%720
10K574.1 ± 249.82.6%720
20K (최종)562.1 ± 241.62.2%720
가설 기각: IDM baseline(feat_delta_reg 104.79mm)의 5× 이상. 학습 loss는 0.46→0.10으로 정상 하강, 17/24 task이 5K→20K 사이 개선. 모델 수렴 실패가 아니라 아키텍처 수준의 문제.

IDM baseline 대비

모델EEF mm비고
IDM feat_delta_reg (best)104.798 GPU eff 1024 60K, feature input
IDM Latent-A multistream107.46이전 SOTA
IDM Pixel v2_8gpu134.8batch 1024 pixel
Pi0.5 Delta-IDM v1 (20K)562.14 GPU eff 64, state=OFF

v2 (STATE=on) 현황

Job 2650 PENDING (extra QOS). Step 3000부터 resume. 20K step 완료 후 동일 eval pipeline으로 측정 예정. 결과 해석 기준:

v2 결과 범위해석다음 액션
v2 ≈ v1 (500-650mm)state input 무의미 → delta image OOD가 진짜 원인다른 input scheme 또는 종료
v2 ≪ v1 (200-300mm)state input 결정적recipe 정렬 + 60K/eff 1024 scale

4 Takeaway

PaliGemma backbone 우위 가설 기각 — 단 원인은 미확정

State input 제거(disable_proprioceptive_obs=True)가 pretrained 분포 파괴. Pi0.5는 state(proprioception) input으로 pretrain됨. v1에서 state를 끄면 action_expert가 state↔action joint distribution을 학습할 수 없어 IDM 예측이 붕괴할 가능성. 실제 loss 수렴(0.46→0.10)은 됐지만 open-loop simulator에서 EEF가 5× 나쁨.

Delta image 자체가 OOD일 수 있음. 학습 데이터가 Cosmos 생성 droid-style video 차분 → Pi0.5의 pretrained visual encoder가 차분 이미지를 처리하도록 설계되지 않음. 차분 이미지가 natural image distribution과 근본적으로 다름.

v2(STATE=on)가 결정 실험. state만 켰을 때 개선 폭이 state input 효과를 직접 측정. 개선이 없으면 delta image OOD가 true bottleneck → 다른 input scheme(raw concat 유지, dual-view, channel concat 등) 검토.

5 Next Steps

v2 학습 모니터링 → eval (우선순위 1)

Job 2650 완료 확인 후 즉시 24-task eval 실행. CKPT_DIR=outputs/pi05_delta_idm_4gpu_state_on/checkpoints_preserved로 5K/10K/20K 병렬 평가.

v2 결과에 따른 분기

v2 ≪ v1 → state input 복구 효과 확인 → 60K step / eff 1024로 scale-up, IDM eval pipeline 동일 적용. v2 ≈ v1 → delta image OOD 근본 해결 필요 → (a) raw 2-frame input으로 Pi0.5 IDM-style 재설계, (b) 실험 종료 후 IDM 트랙(feat_delta_reg) 집중.

미해결: chunk_size 50→16 truncate 영향

Pi0.5의 pretrained action_expert는 50-token attention pattern. 16-token으로 truncate 시 pattern이 제대로 작동하는지 불확실. v2가 잘 됐을 경우 chunk=50 + IDM eval 변경 실험 가능.

미해결: EEF mm vs SR 차원 불일치

IDM 트랙은 EEF mm만, Pi0.5 b0_ref는 rollout SR만. Apple-to-apple 비교가 어려움. b0_ref ckpt에 eval_pi05_delta_idm.py 적용(delta_lookahead 비활성화)으로 b0_ref EEF mm 측정 가능. 장기 TODO.