← 목록으로
TL;DR
- FRAPPE(Future Representation Alignment, arXiv:2602.17259) 방법론을 Pi0.5에 적용하는 3-way 비교 실험 착수. base(plain pi05) / midA(variant A, theia alignment) / midB(variant B) 각 4 GPU × 20K step 학습 완료.
- frappe_base 평가 완료: SR 63.5%(305/480, 24 task × 20 ep). 이 수치가 FRAPPE alignment 효과를 판단하는 baseline.
- frappe_midA(job 10302) / frappe_midB(job 10303) 평가 진행 중 — 각 ~6:44 경과, 결과 대기 중.
1 배경 / 목적
FRAPPE(arXiv:2602.17259, "Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment")는 VLA 정책 backbone에 world model의 미래 예측 representation을 alignment 손실로 주입하는 방법론이다. 원 논문은 RDT-1B + RoboTwin 환경 기준이며, 이번 실험은 Pi0.5 + robocasa MG-3000 환경으로 이식한다.
목적: DreamData의 핵심 질문 중 하나인 "world model representation을 policy에 직접 alignment하면 성능이 오르는가?" 를 검증. DreamGen 비디오 생성 품질과 무관하게, world model representation 자체의 alignment 효과를 먼저 측정한다.
실험 설계 포인트: 3 트랙 모두 DAVIAN MG-3000(실 데이터만, 합성 없음)으로 학습 → FRAPPE alignment 효과만 순수 분리. 합성 데이터는 추후 실험에서 추가.
2 작업 내용
3-track 정의
| Track | Policy Type | 특징 | SLURM |
| frappe_base | pi05 | plain Pi0.5 baseline (alignment 없음) | 10238 (COMPLETED) |
| frappe_midA | pi05_frappe variant=A | tap_layer=13, theia-base-vit alignment, num_learnable=196, proj_coeff=0.05 | 10302 (RUNNING) |
| frappe_midB | pi05_frappe variant=B | 동일 HP, variant B 구조 | 10303 (RUNNING) |
공통 학습 설정
Dataset : DAVIAN-Robotics/robocasa-MG_3000 (70,492 ep, 19.6M frames, 340 tasks)
Base ckpt : lerobot/pi05_base
Steps : 20,000
Batch : 16 × 4 GPU (eff. 64, grad_accum=1)
LR : 1e-4 → cosine → 2.5e-6 (warmup 1K, decay 20K)
Tune targets : visual + llm + action_expert (full fine-tune)
chunk_size : 50, n_action_steps: 25
Mixed prec. : bf16
Hardware : 4 GPU × 32 CPU × 800 GB, ~4시간 소요 (jobs 10223/10224)
평가 설정
Script : scripts/run_frappe_eval_24tasks.sh (from GR00T-Dreams)
Eval : 24 heldout robocasa tasks × 20 ep = 480 ep
State : real (heldout demo 초기 상태 reset_to)
CKPT : 020000 (step 20K)
Hardware : 1 GPU × 18 CPU × 200 GB, ~6h 50m (frappe_base 기준)
3 결과
frappe_base 20K: SR 63.5%(305/480). 이는 이 eval pipeline(24 task, reset_to 기준) 상의 Pi0.5 baseline 수치.
frappe_base per-task 결과 (20K step, n=20 ep)
| Task | SR | 성공/ep | |
| CloseDrawer | 100% | 20/20 | 최고 |
| CloseSingleDoor | 95% | 19/20 | |
| TurnOffMicrowave | 90% | 18/20 | |
| OpenSingleDoor | 85% | 17/20 | |
| OpenDrawer | 80% | 16/20 | |
| TurnOnStove | 80% | 16/20 | |
| TurnSinkSpout | 80% | 16/20 | |
| CoffeePressButton | 80% | 16/20 | |
| CloseDoubleDoor | 70% | 14/20 | |
| OpenDoubleDoor | 70% | 14/20 | |
| PnPStoveToCounter | 70% | 14/20 | |
| TurnOffSinkFaucet | 70% | 14/20 | |
| TurnOnMicrowave | 65% | 13/20 | |
| TurnOnSinkFaucet | 65% | 13/20 | |
| PnPCounterToCab | 60% | 12/20 | |
| PnPCounterToSink | 55% | 11/20 | |
| CoffeeServeMug | 50% | 10/20 | |
| PnPCounterToStove | 50% | 10/20 | |
| PnPCounterToMicrowave | 40% | 8/20 | |
| PnPMicrowaveToCounter | 40% | 8/20 | |
| TurnOffStove | 40% | 8/20 | |
| PnPCabToCounter | 45% | 9/20 | |
| PnPSinkToCounter | 30% | 6/20 | 최저 |
| CoffeeSetupMug | 15% | 3/20 | 최저 |
midA / midB 상태
| Track | 학습 | 평가 잡 | 상태 | 예상 결과 |
| frappe_base | COMPLETED (job 10238) | 10238 | 완료 | SR 63.5% |
| frappe_midA | COMPLETED (job 10223) | 10302 | RUNNING | 미집계 |
| frappe_midB | COMPLETED (job 10224) | 10303 | RUNNING | 미집계 |
frappe_midA/midB 평가 잡(10302/10303)은 오늘 오전부터 실행 중(각 ~7시간 경과). 24 task × 20 ep eval은 frappe_base 기준 약 6:50 소요이므로 완료 임박.
4 Takeaway
frappe_base 63.5% — FRAPPE 효과 측정의 기준선
frappe_base 63.5%는 Pi0.5를 DAVIAN MG-3000으로 20K step fine-tune한 plain 성능이다. 이 수치를 기준으로 midA/midB의 FRAPPE alignment 효과를 판단한다.
task별 패턴: 1DoF 조작(문 열기/닫기, 서랍, 노브) 계열 70-100%로 안정적. PnP + Coffee 복합 task 계열 15-50%로 취약. 이는 policy 자체의 task 난이도 반응이며, FRAPPE alignment 효과는 midA/midB 결과가 나와야 평가 가능.
CoffeeSetupMug(15%)가 최저인 것은 주목할 만하다 — "컵을 올바른 위치에 셋업"하는 복합 조작 + 정밀 위치 요구. 향후 DreamGen 합성 데이터로 이 계열 task를 보강할 가치가 있음.
5 Next Steps
- frappe_midA/midB 결과 집계 — jobs 10302/10303 완료 직후 AGGREGATE_summary.json 읽어 3-way 비교표 완성. midA/B가 base 63.5% 대비 향상되면 FRAPPE alignment 유효, 동등하거나 하락하면 robocasa 세팅에서 alignment 효과 미미 판정.
- 합성 데이터 혼합 실험 — FRAPPE alignment 효과가 확인되면, DreamGen 합성 비디오로 pseudo-labeled data를 혼합해 b2_mix 계열로 실험. alignment + 합성 데이터의 시너지 확인.
- 더 많은 학습 step 검토 — 20K step이 DAVIAN MG-3000(70K ep) 대비 매우 적음. 40K~100K step 추가 학습 시 base 수렴 특성 파악.
- CoffeeSetupMug / PnPSinkToCounter 집중 분석 — 최저 task 2개에 대한 failure mode 영상 확인 후 policy 개선 방향 도출.