Index
2026-05-07 — Analysis

Eval All — IDM 7-track + Pi0.5 종합 평가

GR00T-Dreams | 24-task heldout, 동일 protocol, 보고용 통합 결과 (260508 update: Latent-C 추가)

TL;DR

109.6
multistr mm ⭐
110.0
v3 multi mm
116.1
C n12 mm (NEW)
172.0
Pixel MG-30 mm
17.2%
B0 Real SR
4.7%
B1 Synth SR
3.7×
B0/B1 ratio

1배경/목적

학습 완료된 IDM 변종(Latent-A v1/v2/v3/multistream + Pixel MG-30/MG-3000) + Pi0.5 VLA(Real B0 / Synth B1)를 동일 protocol로 일괄 평가. 보고용으로 정확하게 비교 가능한 표 + 시각 자료 확보가 목적.

이전 결과들은 다른 ep 수, 다른 protocol로 산발적으로 측정되어 있어 공정한 head-to-head가 어려웠음. 이번엔 24-task × {3 ep (IDM) / 8 ep (Pi0.5)} fixed protocol + fresh-env-per-replay + EnvUtils-based init으로 재측정.

Pi0.5 이전 0% SR은 학습 부족이 아니라 eval pipeline bug였음. DexMG wrapper의 success = reward == 1.0 잘못, v0.1 assets 누락, close-task threshold 0.05 too strict, state mismatch 등 chain bug. 상세: claude/260506/analysis-pi05_eval_zero_sr_root_cause.md.

2작업 내용

IDM 4 latent track (이미 학습 완료, 24-ep 재실행으로 재현성 확인)

Pixel-IDM 2 track (24-ep 신규 평가)

Pi0.5 VLA 2 track (24-task × 8 ep)

Latent-C n12 layer-routed (260508 추가) 🆕

Per-task 통합 영상

각 task 1 ep을 GT + 7 IDM 트랙 prediction을 4×2 grid로 합성. ffmpeg filter_complex + drawtext로 라벨링. 이전 6트랙 → 7트랙으로 갱신, padding cell 없이 perfect fit.

scripts/build_per_task_comparison_videos.py → outputs/per_task_comparison/<heldout_idx>_<task>.mp4 × 24개 (총 ~45 MB) 레이아웃 (4×2 perfect fit): | GT | Pixel-MG30 | Pixel-MG3000 | Latent-A v1 | | v2 | v3 (multi) | multistream | Latent-C n12 | + 하단 task 이름 + heldout_idx 오버레이

Submission

Cluster: 8개 sbm 1-GPU 동시 제출 (4 IDM latent + 2 IDM pixel + 2 pi05). QOS: core-extra. Wall-clock: IDM ~30 min, Pi05 ~4h.

3결과 — IDM 6-track

Overall (24-ep heldout EEF mm)

트랙dataleakageparamsEEF avgstdgripper acc
Pixel MG-30 v2_8gpu720 ep없음315M172.085.388.97%
Pixel MG-3000 v2_8gpu *70.5K ep있음315M42.856.197.54%
Latent-A v1 single L27720 ep (latent)없음315M115.365.983.51%
Latent-A v2 action+state720 ep (latent)없음315M128.670.783.19%
Latent-A v3 multi concat720 ep (latent)없음315M110.071.086.14%
Latent-A multistream ⭐720 ep (latent)없음401M109.677.683.72%
Latent-C n12 layer-routed 🆕720 ep (latent)없음~243M116.147.484.10%

* Pixel MG-3000은 heldout 720 ep ⊂ training 70.5K ep 이라 unfair. 단순 참고용.
🆕 Latent-C: π0.5 KI 영감, dense N=12 layer routing on pooled cache (4×4 spatial). 전체 7트랙 중 std 가장 작음 (가장 일관된 품질).

Same-data clean 비교 (720 ep, no leakage): Pixel MG-30 172.0 mm vs Latent-A multistream 109.6 mm = Cosmos hidden feature가 SigLIP visual보다 37% 개선. Cosmos가 large-scale video pretrain에서 학습한 motion-aware feature가 IDM action 예측에 더 정합한 representation 제공.
v2 trade-off: action+state 동시 예측은 +13 mm 비용 (115 → 129). state quality는 gripper만 13.9 mm로 좋고 base_pos는 1.4 m 글로벌 mean collapse — visual resolution 4×4 spatial이 부족.

Per-task EEF mm (전체 24-task × 7-track)

taskPixMG30PixMG3K *v1v2v3multistrC n12 🆕
CloseDoubleDoor260.248.6335.0236.5243.3330.4247.9
CloseDrawer129.828.467.4133.891.5103.3116.8
CloseSingleDoor158.715.3124.094.692.2103.3121.3
CoffeePressButton31.88.738.533.331.535.140.0
CoffeeServeMug80.119.890.990.974.983.080.0
CoffeeSetupMug108.452.494.080.756.453.163.1
OpenDoubleDoor209.0147.6211.7158.3150.9237.3153.3
OpenDrawer256.97.7190.9218.9123.0114.5164.5
OpenSingleDoor116.314.1118.7146.881.368.3103.0
PnPCabToCounter292.827.7131.5125.589.6112.4112.4
PnPCounterToCab191.310.166.968.068.462.091.8
PnPCounterToMicrowave304.961.1159.8286.2159.291.8155.5
PnPCounterToSink232.146.0106.3170.492.9112.4201.8
PnPCounterToStove150.863.893.598.961.485.8109.4
PnPMicrowaveToCounter240.5230.0212.2274.7344.0327.8169.2
PnPSinkToCounter370.520.399.0139.0226.9120.2146.1
PnPStoveToCounter216.040.798.481.9117.1102.273.5
TurnOffMicrowave62.22.7102.7109.7107.8117.1119.3
TurnOffSinkFaucet111.5157.991.2209.095.488.3112.0
TurnOffStove132.65.746.234.233.940.067.5
TurnOnMicrowave95.57.1102.2114.5104.294.5101.7
TurnOnSinkFaucet174.83.197.354.193.656.2100.5
TurnOnStove151.26.226.755.138.331.260.6
TurnSinkSpout50.43.163.470.761.659.375.1
AVG172.042.8115.3128.6110.0109.6116.1
STD85.356.165.970.771.077.647.4
Latent-C 특징: avg 116.1 mm로 v3/multistream에 살짝 못 미치지만, per-task std 47.4 mm로 7트랙 중 최저 — 즉 task 간 변동성이 가장 적고 일관됨. PnPMicrowaveToCounter 169 mm로 v3 (344) / multistream (328)에서의 outlier를 −175 mm 큰 폭으로 개선 (★). 안정성 우선이라면 C가 매력적, peak 성능이 우선이라면 multistream.
multistream 큰 win (vs v3): PnPCounterToMicrowave (−67), PnPSinkToCounter (−107 vs v3), OpenDrawer (−9 vs v3, −76 vs v1), OpenSingleDoor (−13), CoffeeSetupMug (−3), TurnOnSinkFaucet (−37). PnP grasp/place 정밀도가 핵심인 task에서 layer-wise per-stream attention 효과적.
multistream 큰 loss (vs v3): CloseDoubleDoor (+87), OpenDoubleDoor (+86). Articulated double-door spatial trajectory에서 inferior — token concat이 fine-grained spatial reasoning에 약함.

4결과 — Pi0.5 Real vs Synth

Overall

Expdatackptstate_modeoverall SR비고
B0 Realheldout 720 ep017500real (joint+grip)33/192 (17.2%)Real state ✓
B1 Synthdreamgen P2 1440 ep016000zero9/192 (4.7%)Synth-only
B0 Real이 B1 Synth 대비 3.7× SR. Real proprio state로 학습된 policy가 시뮬레이터 분포와 매칭되어 closed-loop drift 적은 단순 motion에서 동작. Pi0.5 학습 자체는 정상이고, 이전 0% SR은 100% eval pipeline bug였음 — 진단 → 수정 chain 검증.

Per-task SR (24 task × 8 ep, success-by-task 정렬)

taskB0 RealB1 Synth
TurnOnMicrowave5/8 (62.5%)1/8 (12.5%)
TurnSinkSpout5/8 (62.5%)2/8 (25.0%)
CloseDrawer3/8 (37.5%)1/8 (12.5%)
PnPSinkToCounter3/8 (37.5%)0/8
TurnOffMicrowave3/8 (37.5%)1/8 (12.5%)
TurnOffSinkFaucet3/8 (37.5%)2/8 (25.0%)
CoffeePressButton2/8 (25.0%)0/8
PnPCounterToSink2/8 (25.0%)0/8
PnPCounterToStove2/8 (25.0%)0/8
PnPCabToCounter1/8 (12.5%)0/8
PnPMicrowaveToCounter1/8 (12.5%)0/8
PnPStoveToCounter1/8 (12.5%)0/8
TurnOffStove1/8 (12.5%)0/8
TurnOnSinkFaucet1/8 (12.5%)1/8 (12.5%)
OpenSingleDoor0/81/8 (12.5%)
CloseDoubleDoor0/80/8
CloseSingleDoor0/80/8
CoffeeServeMug0/80/8
CoffeeSetupMug0/80/8
OpenDoubleDoor0/80/8
OpenDrawer0/80/8
PnPCounterToCab0/80/8
PnPCounterToMicrowave0/80/8
TurnOnStove0/80/8
TOTAL33/192 (17.2%)9/192 (4.7%)

관찰 및 의의

  • Best (B0): TurnOn/Off* (faucet, microwave, spout), CloseDrawer, CoffeePressButton, PnPSinkToCounter — simple stable motion 카테고리. 로봇이 자세 잡고 한 번 누르거나 한 방향으로 움직이는 단순 task에서 잘함.
  • Worst (B0=0%): Door open/close, Microwave/Cab PnP, multi-step coffee, Stove on — articulated joint, multi-step manipulation, fine-tuned timing이 필요한 task. 정확한 grasp + 일정한 force + 단계 순서가 모두 맞아야 success.
  • B1 Synth 한계: dreamgen P2 데이터는 16-frame chunk로 만들어진 짧은 sequence + state field 0. Long-horizon task는 학습 신호 자체가 부족. 한계 단서: B1 best가 TurnOff*Faucet (25%) — 이건 partial close motion 만으로 success threshold 통과 가능한 task.
  • OpenSingleDoor outlier: B1=1/8 (B0=0). Synth가 일부 articulated에서 predictable trajectory 학습 가능성 (16-frame이 우연히 success motion 단편 cover). Statistical noise일 수도 있음.
B0의 0% task 진단: CloseDoubleDoor 같은 articulated 강한 task는 v0.1 controller drift + threshold strict 조합으로 GT replay조차 strict 70%/relaxed 100%만 달성. Pi0.5 closed-loop는 GT보다 drift 더 많아 0% 자연스러움. 추가 fix 후보: open-task / PnP 별 success threshold 재calibration.

5산출물

분석 로그

claude/260507/analysis-eval_all_results.md (per-task tables, takeaway, next) claude/260507/plan-eval_all_idm_and_pi05.md (실행 계획)

스크립트 (commit accdef2 + 4131777)

결과 / 영상

6Takeaway

  1. Cosmos hidden > SigLIP visual (clean same-data 720 ep): Latent multistream 109.6 vs Pixel MG-30 172.0 = −37%. Cosmos large-scale video pretrain feature가 IDM 단계에서도 효과적.
  2. multistream 아키텍처 우위 견고: PnP-종 task에서 v3 (dim concat)보다 일관 win (per-layer Linear+SelfAttn(2L)+token concat). 그러나 articulated double door에서는 inferior — 두 방식 상보적.
  3. Latent-C n12 routing의 가치는 안정성: avg 116.1 mm로 multistream에 못 미치지만, per-task std 47.4 mm로 가장 일관. PnPMicrowaveToCounter outlier (다른 트랙 200~344) 를 169로 개선 — π0.5 KI 1:1 routing이 일부 task에선 진짜 효과.
  4. Pi0.5 학습 정상, eval bug였음: B0 Real 17.2% / B1 Synth 4.7% — 4배 격차로 학습 quality 차이 분명. Pi0.5 학습 재실행 불필요 (eval pipeline 수정만으로 측정 가능했음).
  5. DreamGen synth의 핵심 한계: 16-frame chunk + zero state로 long-horizon multi-step manipulation을 못 학습. Real heldout 720 ep로도 17.2%이므로 single-step task에선 충분, 복잡 task엔 long-horizon synth + IDM-state 도입 필요 (Step 5/6 plan).
  6. v2 (action+state) trade-off: state supervision 비용 +13 mm (action). gripper_qpos만 13.9 mm로 좋고 base_pos 1.4 m global mean — 4×4 spatial pool 부족.

7다음 (Next)