delta-IDM 기존 open-loop replay eval은 오차 누적으로 SR 구조적 ≈0(eef_mm만 신호) → 이전 VLA/plain-pi05 closed-loop SR과 비교 불가. 사용자가 "9K offline eef 떨어져도 SR=0, 그냥 모델 실패 아니냐"고 정당하게 압박.
eval_pi05_delta_idm.py에 --mode closed_loop 신설(현재 3캠 프레임/16-d proprio = live env, 미래 xt+16만 GT teacher-forcing; 기존 open-loop=검증된 in-train 경로 무수정). idm_intrain_eval.py가 delta/2frame in-train eval을 이 closed-loop로 교체(first/plain=_run_rollouts 유지).
| task | control first_sf@20K (native 1.0) | delta_sf @10K | delta_sf @20K |
|---|---|---|---|
| CloseDoubleDoor | 0.75 | 0.00 | 0.00 |
| CloseDrawer | 1.00 | 0.50 | 0.50 |
| CloseSingleDoor | 1.00 | 0.75 | 0.50 |
| CoffeePressButton | 0.50 | 0.00 | 0.00 |
| GLOBAL SR | 0.812 | 0.312 | 0.250 (~0.31x) |
| GLOBAL eef (mm) | 128 | 183 | 192 |
① "완전 모델 실패(SR=0)" 확정 기각 — bug-free·잘 학습 delta가 GLOBAL 31.2%, CloseSingleDoor 0.75/CloseDrawer 0.50 실제 성공. 그간 본 "SR=0"의 정체 = ms300 budget 부족(시연 길이 초과) + offline SR 구조적 0. 모델 실패 신호가 아니었음.
② delta-입력은 comparable non-delta보다 본질적·지속적·명백히 약함 — 가장 깨끗한 공정 조건(ms600·라우팅 검증·control이 하니스 정상성 입증, CloseDoubleDoor 0.75 회복)에서 delta = known-good의 ~0.31x(10K&20K 일관), 4 task 중 2개 완전 실패(control은 0.75/0.50). 하니스 artifact 아닌 진짜 표현 약점.
③ 원 "delta-IDM 약함/가설 기각" 방향을 최선 토대서 확정 — 철회된 562/540/396은 state-2-timestep 버그 오염; 0.312/0.250 vs 0.812는 버그수정+control+동일척도+충분budget+10K&20K 일관의 정당한 측정. delta@20K가 caveat를 닫음(미학습 아님). 사용자의 반복된 회의가 이 rigor를 끌어냄("dead-zone" 오진도 사용자 지적으로 정정). delta-입력 backbone-swap 트랙 종료 = 확정(caveat 없음).
5114가 20K 도달(020000 안정) → jobid 5306로 동일 ms600 closed-loop 측정. delta@20K GLOBAL 0.250 ≈ delta@10K 0.312(약간↓). 10K→20K가 격차를 못 메움 → "더 학습하면" caveat 소진. 절대최종 확정: delta-입력 약함은 미학습 아님.
delta-입력 backbone-swap은 closed-loop 정책으로서 comparable non-delta 대비 명백히 열등 — 공정 근거 확보. 트랙 종료 권고, 자원을 SigLIP2 IDM 계열·다른 방향으로.
학습 중 잡의 특정 step ckpt를 eval에 pin하면 checkpoint rotation race(HFValidationError) — 완료 잡의 최종 ckpt를 쓰거나 eval 전 snapshot 복사. control 통제 실험이 "모델/하니스/budget" 교란을 가른 핵심.