← 목록으로
2026-05-28 · DreamData · Experiment

Pi0.5 + FRAPPE Alignment 3-way 비교 실험

frappe_base / frappe_midA / frappe_midB — DAVIAN MG-3000, 20K steps | frappe_base 평가 완료 SR 63.5%

TL;DR

63.5%
frappe_base SR
305/480
성공/에피소드
24
평가 Tasks
20K
학습 Steps
4 GPU
학습 리소스

1 배경 / 목적

FRAPPE(arXiv:2602.17259, "Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment")는 VLA 정책 backbone에 world model의 미래 예측 representation을 alignment 손실로 주입하는 방법론이다. 원 논문은 RDT-1B + RoboTwin 환경 기준이며, 이번 실험은 Pi0.5 + robocasa MG-3000 환경으로 이식한다.

목적: DreamData의 핵심 질문 중 하나인 "world model representation을 policy에 직접 alignment하면 성능이 오르는가?" 를 검증. DreamGen 비디오 생성 품질과 무관하게, world model representation 자체의 alignment 효과를 먼저 측정한다.

실험 설계 포인트: 3 트랙 모두 DAVIAN MG-3000(실 데이터만, 합성 없음)으로 학습 → FRAPPE alignment 효과만 순수 분리. 합성 데이터는 추후 실험에서 추가.

2 작업 내용

3-track 정의

TrackPolicy Type특징SLURM
frappe_basepi05plain Pi0.5 baseline (alignment 없음)10238 (COMPLETED)
frappe_midApi05_frappe variant=Atap_layer=13, theia-base-vit alignment, num_learnable=196, proj_coeff=0.0510302 (RUNNING)
frappe_midBpi05_frappe variant=B동일 HP, variant B 구조10303 (RUNNING)

공통 학습 설정

Dataset : DAVIAN-Robotics/robocasa-MG_3000 (70,492 ep, 19.6M frames, 340 tasks) Base ckpt : lerobot/pi05_base Steps : 20,000 Batch : 16 × 4 GPU (eff. 64, grad_accum=1) LR : 1e-4 → cosine → 2.5e-6 (warmup 1K, decay 20K) Tune targets : visual + llm + action_expert (full fine-tune) chunk_size : 50, n_action_steps: 25 Mixed prec. : bf16 Hardware : 4 GPU × 32 CPU × 800 GB, ~4시간 소요 (jobs 10223/10224)

평가 설정

Script : scripts/run_frappe_eval_24tasks.sh (from GR00T-Dreams) Eval : 24 heldout robocasa tasks × 20 ep = 480 ep State : real (heldout demo 초기 상태 reset_to) CKPT : 020000 (step 20K) Hardware : 1 GPU × 18 CPU × 200 GB, ~6h 50m (frappe_base 기준)

3 결과

frappe_base 20K: SR 63.5%(305/480). 이는 이 eval pipeline(24 task, reset_to 기준) 상의 Pi0.5 baseline 수치.

frappe_base per-task 결과 (20K step, n=20 ep)

TaskSR성공/ep
CloseDrawer100%20/20최고
CloseSingleDoor95%19/20
TurnOffMicrowave90%18/20
OpenSingleDoor85%17/20
OpenDrawer80%16/20
TurnOnStove80%16/20
TurnSinkSpout80%16/20
CoffeePressButton80%16/20
CloseDoubleDoor70%14/20
OpenDoubleDoor70%14/20
PnPStoveToCounter70%14/20
TurnOffSinkFaucet70%14/20
TurnOnMicrowave65%13/20
TurnOnSinkFaucet65%13/20
PnPCounterToCab60%12/20
PnPCounterToSink55%11/20
CoffeeServeMug50%10/20
PnPCounterToStove50%10/20
PnPCounterToMicrowave40%8/20
PnPMicrowaveToCounter40%8/20
TurnOffStove40%8/20
PnPCabToCounter45%9/20
PnPSinkToCounter30%6/20최저
CoffeeSetupMug15%3/20최저

midA / midB 상태

Track학습평가 잡상태예상 결과
frappe_baseCOMPLETED (job 10238)10238완료SR 63.5%
frappe_midACOMPLETED (job 10223)10302RUNNING미집계
frappe_midBCOMPLETED (job 10224)10303RUNNING미집계
frappe_midA/midB 평가 잡(10302/10303)은 오늘 오전부터 실행 중(각 ~7시간 경과). 24 task × 20 ep eval은 frappe_base 기준 약 6:50 소요이므로 완료 임박.

4 Takeaway

frappe_base 63.5% — FRAPPE 효과 측정의 기준선

frappe_base 63.5%는 Pi0.5를 DAVIAN MG-3000으로 20K step fine-tune한 plain 성능이다. 이 수치를 기준으로 midA/midB의 FRAPPE alignment 효과를 판단한다.

task별 패턴: 1DoF 조작(문 열기/닫기, 서랍, 노브) 계열 70-100%로 안정적. PnP + Coffee 복합 task 계열 15-50%로 취약. 이는 policy 자체의 task 난이도 반응이며, FRAPPE alignment 효과는 midA/midB 결과가 나와야 평가 가능.

CoffeeSetupMug(15%)가 최저인 것은 주목할 만하다 — "컵을 올바른 위치에 셋업"하는 복합 조작 + 정밀 위치 요구. 향후 DreamGen 합성 데이터로 이 계열 task를 보강할 가치가 있음.

5 Next Steps