Pi0.5 + FRAPPE (Feature-aligned post-training) 의 mid-train alignment 효과를 검증하기 위해 3-way 비교 실험을 진행했다. 기존 pi05 baseline(b0/b1/b2)은 real/synthetic 데이터 믹스 비율 실험이었고, FRAPPE 트랙은 visual feature alignment를 mid-train 단계에 추가해 pi05의 시각 표현력을 보강하는 접근이다.
전날(260528) frappe_base eval(63.5%) 완료 후, midA/midB eval이 병렬로 제출되었고 오늘 오전 양쪽 모두 완료되어 3-way 비교가 가능해졌다. 평가 조건: 24-task heldout, 20 episode/task = 480 total, step=20K, state_mode=real.
학습은 각각 4 GPU(B200) × ~4시간. 평가는 단일 GPU × ~7시간(24 task 순차). 모두 robocasa-MG_3000 데이터셋 기반.
평가 스크립트는 eval_pi05_envutils_poc.py 기반으로 task별 episode를 순차 실행하고 AGGREGATE_summary.json에 per-task 성공률을 저장한다. wandb 업로드는 TLS 인증 오류로 실패했으나 로컬 JSON은 정상 저장됨.
| Variant | 성공/전체 | SR | vs base | SLURM Job |
|---|---|---|---|---|
| frappe_midA | 322/480 | 67.1% | +3.6pp (+17 ep) | 10302 |
| frappe_midB | 316/480 | 65.8% | +2.3pp (+11 ep) | 10303 |
| frappe_base | 305/480 | 63.5% | — | 10238 |
| Task | base (%) | midA (%) | midB (%) | midA Δ |
|---|---|---|---|---|
| PnPSinkToCounter | 30% | 55% | 20% | +25pp |
| PnPCabToCounter | 45% | 60% | 55% | +15pp |
| CoffeeServeMug | 50% | 65% | 55% | +15pp |
| PnPCounterToMicrowave | 40% | 50% | 50% | +10pp |
| PnPMicrowaveToCounter | 40% | 60% | 45% | +20pp |
| TurnOnSinkFaucet | 65% | 70% | 75% | +5pp |
| TurnOffStove | 40% | 30% | 30% | −10pp |
| CloseDoubleDoor | 70% | 85% | 70% | +15pp |
| CoffeeSetupMug | 15% | 20% | 15% | +5pp |
| OpenDrawer | 80% | 65% | 80% | −15pp |
| CloseDrawer | 100% | 100% | 100% | 0pp |
| CloseSingleDoor | 95% | 100% | 95% | +5pp |
FRAPPE mid-train alignment(midA/midB)는 base(plain pi05) 대비 전체 SR을 +2~4pp 개선한다. 특히 PnP 계열(물건 집어 이동) task에서 효과가 크고, 단순 개폐/버튼 task는 이미 포화(CloseDrawer 100%)라 개선 여지가 없다.
midA > midB인 이유는 명확하지 않으나, PnPSinkToCounter에서 midB가 붕괴(20%)하는 현상이 결정적. variant A가 더 안정적인 alignment 경로로 보인다. 다음 단계(frappe_moe)의 base는 midA로 확정되어 있으며, 이 실험 결과가 그 선택을 정당화한다.
전체적으로 보면 FRAPPE는 방향성은 맞지만 개선 폭이 크지 않다(+3.6pp). MoE 확장(teacher별 LoRA + gate router)이 이를 더 끌어올릴 수 있는지가 다음 핵심 질문이다.
midA frozen base + 3 LoRA (dinov2/clip/vit) + gate router 조합. 20K step 학습 완료. 24-task eval 현재 실행 중 (RUNNING). 결과가 나오면 base(63.5%)/midA(67.1%)와 비교해 MoE의 추가 gain을 측정.
3개 variant 모두 CoffeeSetupMug 15~20%, TurnOffStove 30~40%. 데이터 분포(MG-3000에서 해당 task 비중)와 task 난이도를 별도로 분석할 필요 있음. 단순히 더 학습시키거나 task-specific augmentation을 고려해야 한다.
midA 55% vs midB 20%의 35pp 차이는 비정상적. midA와 midB의 alignment 차이(학습률, alignment layer, teacher 선택 등)를 확인해야 한다. midB의 특정 hyperparameter가 일부 task에 악영향을 미치는 것으로 추정.