Index
2026-05-29 — Analysis

FRAPPE 3-way 비교 완료 — midA 67.1% > midB 65.8% > base 63.5%

GR00T-Dreams | Pi0.5 + FRAPPE mid-train alignment | 24 tasks × 20 ep × 3 variants

TL;DR

67.1%
midA SR (best)
65.8%
midB SR
63.5%
base SR
+3.6pp
midA vs base
24
Tasks
20K
Steps

1 배경 / 목적

Pi0.5 + FRAPPE (Feature-aligned post-training) 의 mid-train alignment 효과를 검증하기 위해 3-way 비교 실험을 진행했다. 기존 pi05 baseline(b0/b1/b2)은 real/synthetic 데이터 믹스 비율 실험이었고, FRAPPE 트랙은 visual feature alignment를 mid-train 단계에 추가해 pi05의 시각 표현력을 보강하는 접근이다.

비교 목적: FRAPPE mid-train alignment(variant A vs B)가 standard fine-tuning(base)에 비해 얼마나 성능을 높이는지, 그리고 두 variant 중 어느 쪽이 우위인지 확인.

전날(260528) frappe_base eval(63.5%) 완료 후, midA/midB eval이 병렬로 제출되었고 오늘 오전 양쪽 모두 완료되어 3-way 비교가 가능해졌다. 평가 조건: 24-task heldout, 20 episode/task = 480 total, step=20K, state_mode=real.

2 작업 내용

학습은 각각 4 GPU(B200) × ~4시간. 평가는 단일 GPU × ~7시간(24 task 순차). 모두 robocasa-MG_3000 데이터셋 기반.

frappe_base : pi05 standard fine-tuning (FRAPPE alignment 없음) frappe_midA : pi05 + FRAPPE mid-train variant A (theia-base-vit alignment) frappe_midB : pi05 + FRAPPE mid-train variant B (theia-base-vit, different hyperparams) eval script : GR00T-Dreams/scripts/run_frappe_eval_24tasks.sh EXP={frappe_base|frappe_midA|frappe_midB} CKPT_STEP=020000 N_EPISODES=20 eval jobs : 10238 (base, COMPLETED 6h50m), 10302 (midA, COMPLETED 7h23m), 10303 (midB, COMPLETED 7h02m) eval output : GR00T-Dreams/outputs/pi05_eval_24tasks/{EXP}_020000_real/AGGREGATE_summary.json

평가 스크립트는 eval_pi05_envutils_poc.py 기반으로 task별 episode를 순차 실행하고 AGGREGATE_summary.json에 per-task 성공률을 저장한다. wandb 업로드는 TLS 인증 오류로 실패했으나 로컬 JSON은 정상 저장됨.

3 결과

전체 SR (overall success rate)

Variant성공/전체SRvs baseSLURM Job
frappe_midA322/48067.1%+3.6pp (+17 ep)10302
frappe_midB316/48065.8%+2.3pp (+11 ep)10303
frappe_base305/48063.5%10238

Task별 성공률 (midA vs base 상위 개선 / 주요 회귀)

Taskbase (%)midA (%)midB (%)midA Δ
PnPSinkToCounter30%55%20%+25pp
PnPCabToCounter45%60%55%+15pp
CoffeeServeMug50%65%55%+15pp
PnPCounterToMicrowave40%50%50%+10pp
PnPMicrowaveToCounter40%60%45%+20pp
TurnOnSinkFaucet65%70%75%+5pp
TurnOffStove40%30%30%−10pp
CloseDoubleDoor70%85%70%+15pp
CoffeeSetupMug15%20%15%+5pp
OpenDrawer80%65%80%−15pp
CloseDrawer100%100%100%0pp
CloseSingleDoor95%100%95%+5pp
PnP 계열 전반적 개선: midA에서 PnP 7개 task 평균 base 대비 ~+9pp 개선. 특히 PnPSinkToCounter(+25pp), PnPMicrowaveToCounter(+20pp)가 두드러짐. FRAPPE mid-train이 fine-grained manipulation 표현력을 키운 것으로 해석.
회귀 주의: TurnOffStove(base 40%→midA 30%, −10pp), OpenDrawer(base 80%→midA 65%, −15pp). midA가 midB보다 일부 task에서 불안정. PnPSinkToCounter는 midB에서 오히려 20%로 붕괴(midA 55%와 35pp 차이) — midB가 특정 task에서 불안정.
공통 취약 task: CoffeeSetupMug (15~20%), TurnOffStove (30~40%) — 3 variant 전부 낮음. 데이터 부족 혹은 task 자체 난이도 문제.

4 Takeaway

FRAPPE mid-train alignment 효과 확인, 그러나 task-선택적

FRAPPE mid-train alignment(midA/midB)는 base(plain pi05) 대비 전체 SR을 +2~4pp 개선한다. 특히 PnP 계열(물건 집어 이동) task에서 효과가 크고, 단순 개폐/버튼 task는 이미 포화(CloseDrawer 100%)라 개선 여지가 없다.

midA > midB인 이유는 명확하지 않으나, PnPSinkToCounter에서 midB가 붕괴(20%)하는 현상이 결정적. variant A가 더 안정적인 alignment 경로로 보인다. 다음 단계(frappe_moe)의 base는 midA로 확정되어 있으며, 이 실험 결과가 그 선택을 정당화한다.

전체적으로 보면 FRAPPE는 방향성은 맞지만 개선 폭이 크지 않다(+3.6pp). MoE 확장(teacher별 LoRA + gate router)이 이를 더 끌어올릴 수 있는지가 다음 핵심 질문이다.

5 Next Steps

진행 중: frappe_moe eval (job 10541)

midA frozen base + 3 LoRA (dinov2/clip/vit) + gate router 조합. 20K step 학습 완료. 24-task eval 현재 실행 중 (RUNNING). 결과가 나오면 base(63.5%)/midA(67.1%)와 비교해 MoE의 추가 gain을 측정.

미해결: CoffeeSetupMug & TurnOffStove 취약

3개 variant 모두 CoffeeSetupMug 15~20%, TurnOffStove 30~40%. 데이터 분포(MG-3000에서 해당 task 비중)와 task 난이도를 별도로 분석할 필요 있음. 단순히 더 학습시키거나 task-specific augmentation을 고려해야 한다.

midB PnPSinkToCounter 붕괴 원인 미파악

midA 55% vs midB 20%의 35pp 차이는 비정상적. midA와 midB의 alignment 차이(학습률, alignment layer, teacher 선택 등)를 확인해야 한다. midB의 특정 hyperparameter가 일부 task에 악영향을 미치는 것으로 추정.