Index
2026-05-18 — Experiment

Pi0.5-Delta IDM — teacher-forced closed-loop eval + control 최종 판정

DreamData | delta-입력 효능: 버그수정+control+동일척도+충분budget 공정 측정

TL;DR

0.812
control SR
0.312
delta@10K SR
0.250
delta@20K SR
~0.31x
delta / known-good
2/4
delta 완전실패 task

1 배경 / 목적

delta-IDM 기존 open-loop replay eval은 오차 누적으로 SR 구조적 ≈0(eef_mm만 신호) → 이전 VLA/plain-pi05 closed-loop SR과 비교 불가. 사용자가 "9K offline eef 떨어져도 SR=0, 그냥 모델 실패 아니냐"고 정당하게 압박.

요청: 추측 말고 control 쌍으로 "모델이냐 / 하니스냐 / 미학습이냐 / budget이냐"를 통제 실험으로 가른다.

2 작업 내용

eval_pi05_delta_idm.py--mode closed_loop 신설(현재 3캠 프레임/16-d proprio = live env, 미래 xt+16만 GT teacher-forcing; 기존 open-loop=검증된 in-train 경로 무수정). idm_intrain_eval.py가 delta/2frame in-train eval을 이 closed-loop로 교체(first/plain=_run_rollouts 유지).

통제 반복 (각 16 demo = 4task×4eps, sbm 1 GPU): ms300: 5208 delta_sf@10K / 5209 control first_sf@17K ms600: 5239 delta_sf@10K / 5244 control first_sf@20K (native SR=1.0) per-mode 라우팅 검증: ckpt config.json delta_mode 5031=first → _preprocess_images_first_only (x_t만) 5114=delta → _preprocess_images_with_delta (차분+normfix) 운영 트랩: 5240(control@017000) HFValidationError — 5031 20K완주 rotation이 017000 삭제. 학습중 잡 특정-step ckpt pin = rotation race. fix: 완료잡 최종 ckpt(5031@020000) 사용 = 5244.

3 결과 (ms600 최종 — 동일 하니스·라우팅검증·control이 하니스 검증)

taskcontrol first_sf@20K (native 1.0)delta_sf @10Kdelta_sf @20K
CloseDoubleDoor0.750.000.00
CloseDrawer1.000.500.50
CloseSingleDoor1.000.750.50
CoffeePressButton0.500.000.00
GLOBAL SR0.8120.3120.250 (~0.31x)
GLOBAL eef (mm)128183192
caveat 닫힘 (절대 최종): delta@20K 0.250 ≈ delta@10K 0.312 (16-demo 노이즈 내, 오히려 약간↓ — SingleDoor 0.75→0.50). 10K→20K가 격차를 못 메움 → 유일 잔여 caveat("더 학습하면 나아질 것") 소진. delta-입력 약함은 미학습 아님(20K 동일)·하니스 아님(control 검증)·버그 아님(state-fix+라우팅)·측정 아님(offline구조적 배제) — 모든 교란 제거 후 결론.
CloseDoubleDoor 정체 최종 규명 (2회 통제 반복으로 수렴): ms300=budget artifact(시연 ~440 > cap 300 → control도 0.00). ms600서 control 0.75 회복(succ_step 371~394) → 하니스 정상·이 task 측정 가능. delta는 ms600에서도 0.00 → 하니스 아닌 진짜 delta 약점(control이 동일조건 0.75 푸니까). 진단 수렴: "dead-zone"(오류)→budget(불완전)→T_demo-bound 우려→control 0.75로 반증 → delta 본질 약점 확정.
하니스/라우팅 검증: control GLOBAL 0.812, native-1.0 ckpt에서 정상 높은 SR + CloseDoubleDoor 회복 → 하니스 functional·discriminative. ckpt config.json delta_mode가 모델별 입력 표현 정확 라우팅(first=x_t만 / delta=차분).
delta 완전 실패 2 task: CloseDoubleDoor 0.00(control 0.75), CoffeePressButton 0.00(control 0.50). 나머지도 0.50/0.75x. eef는 delta가 control과 유사권(거친 도달 비슷)이나 정밀 task 완수에서 일관 열세.

4 Takeaway

의미 (이 실험 arc의 결론)

① "완전 모델 실패(SR=0)" 확정 기각 — bug-free·잘 학습 delta가 GLOBAL 31.2%, CloseSingleDoor 0.75/CloseDrawer 0.50 실제 성공. 그간 본 "SR=0"의 정체 = ms300 budget 부족(시연 길이 초과) + offline SR 구조적 0. 모델 실패 신호가 아니었음.

② delta-입력은 comparable non-delta보다 본질적·지속적·명백히 약함 — 가장 깨끗한 공정 조건(ms600·라우팅 검증·control이 하니스 정상성 입증, CloseDoubleDoor 0.75 회복)에서 delta = known-good의 ~0.31x(10K&20K 일관), 4 task 중 2개 완전 실패(control은 0.75/0.50). 하니스 artifact 아닌 진짜 표현 약점.

③ 원 "delta-IDM 약함/가설 기각" 방향을 최선 토대서 확정 — 철회된 562/540/396은 state-2-timestep 버그 오염; 0.312/0.250 vs 0.812는 버그수정+control+동일척도+충분budget+10K&20K 일관의 정당한 측정. delta@20K가 caveat를 닫음(미학습 아님). 사용자의 반복된 회의가 이 rigor를 끌어냄("dead-zone" 오진도 사용자 지적으로 정정). delta-입력 backbone-swap 트랙 종료 = 확정(caveat 없음).

5 Next Steps

delta@20K 확정점 — 완료 (caveat 닫힘)

5114가 20K 도달(020000 안정) → jobid 5306로 동일 ms600 closed-loop 측정. delta@20K GLOBAL 0.250 ≈ delta@10K 0.312(약간↓). 10K→20K가 격차를 못 메움 → "더 학습하면" caveat 소진. 절대최종 확정: delta-입력 약함은 미학습 아님.

트랙 판단

delta-입력 backbone-swap은 closed-loop 정책으로서 comparable non-delta 대비 명백히 열등 — 공정 근거 확보. 트랙 종료 권고, 자원을 SigLIP2 IDM 계열·다른 방향으로.

방법론 교훈

학습 중 잡의 특정 step ckpt를 eval에 pin하면 checkpoint rotation race(HFValidationError) — 완료 잡의 최종 ckpt를 쓰거나 eval 전 snapshot 복사. control 통제 실험이 "모델/하니스/budget" 교란을 가른 핵심.