Index
2026-06-04 — Analysis

FRAPPE MoE v3 Ablation — frappe_base init: theia 기여도 검증

DreamData / FRAPPE-pi0.5 | Job 11885(학습) + 11890(eval) | 24-task × 20 ep

TL;DR

62.7%
v3 Overall SR
63.5%
base SR
67.1%
midA SR (최고)
301/480
v3 Raw
−4.4%p
vs midA

1 배경 / 목적

MoE v1(66.7%)과 v2(66.2%)가 모두 midA(67.1%)를 넘지 못한 후, 남은 가설이 하나 있었다: "midA 초기화가 문제인 것 아닌가?"

midA는 theia teacher로 VLM representation을 정렬한 상태. MoE post-train에서 새 teacher 3개(dinov2/clip/vit)를 추가하면 theia-aligned 표현과 충돌이 생겨 학습을 방해한다는 가설이었다.

검증 질문: "theia 없는 frappe_base(DAVIAN 20K full-FT, 미정렬)에서 MoE를 init하면 v1/v2보다 높고 midA를 넘을 수 있는가?"

이것이 MoE 방향의 마지막 ablation이었다. v1→v2에서 4가지 RDT 정합 수정을 적용했음에도 개선이 없었기 때문에, init 자체를 바꾸는 것이 남은 변수였다.

2 작업 내용

v3 = v2의 4 RDT 정합 수정 유지 + init만 교체:

v2 구성 (유지): - proj_loss 정규화: Σ/num_branches (원본 정합, 실효 0.05) - trainable residual fusion head (zero-init, warm-start) - gate z-loss (load balance, weight=1e-6) - gate label smoothing (ε=0.1) v3 변경 사항: - init 변경: midA checkpoint → frappe_base checkpoint (frappe_base = pi0.5 + DAVIAN MG-3000 20K full-FT, theia 미정렬) 실패한 첫 시도: - lerobot/pi05_base (DAVIAN 미학습) → in-loop SR 0%, 즉시 폐기 - 재설계: DAVIAN 학습된 frappe_base ckpt 사용 학습: job 11885, own QOS, 4 GPU, elapsed 09:54:14 평가: job 11890, own QOS, 1 GPU, elapsed 08:54:44 script: GR00T-Dreams/scripts/run_frappe_eval_24tasks.sh (EXP=frappe_moe_v3, N_EPISODES=20)
wandb push 실패 (non-fatal): worker pod TLS 인증서 오류. AGGREGATE_summary.json은 디스크에 정상 저장.

3 결과

6-way 최종 비교 (MoE 시리즈 완결)

Track24-task SRRawvs midA비고
midA (VLM tap, theia)67.1%322/480최고, sweet spot
moe-v1 (midA init, 3× align)66.7%320/480−0.4%p노이즈 수준
moe-v2 (midA init + RDT 4수정)66.2%318/480−0.9%p정합 수정 효과無
midB (expert tap, theia)65.8%316/480−1.3%p
base (pi0.5 + DAVIAN FT)63.5%305/480−3.6%ptheia 없음
moe-v3 (frappe_base init + RDT 4수정)62.7%301/480−4.4%pbase보다도 낮음

v3 per-task 결과 (24 tasks, 각 20ep)

Taskv3 SRv3 Raw카테고리
CloseDrawer100.0%20/20Close
CloseSingleDoor95.0%19/20Close
TurnSinkSpout85.0%17/20Turn
CoffeePressButton85.0%17/20Coffee
TurnOffSinkFaucet85.0%17/20Turn
OpenSingleDoor85.0%17/20Open
TurnOnMicrowave85.0%17/20Turn
PnPStoveToCounter80.0%16/20PnP
OpenDoubleDoor75.0%15/20Open
OpenDrawer90.0%18/20Open
TurnOnSinkFaucet70.0%14/20Turn
CloseDoubleDoor65.0%13/20Close ⚠
TurnOffMicrowave65.0%13/20Turn ⚠
TurnOnStove60.0%12/20Turn ⚠
CoffeeServeMug60.0%12/20Coffee
PnPCounterToStove60.0%12/20PnP
PnPCabToCounter45.0%9/20PnP ⚠
PnPCounterToSink45.0%9/20PnP ⚠
PnPCounterToCab40.0%8/20PnP ⚠
CoffeeSetupMug35.0%7/20Coffee
PnPMicrowaveToCounter30.0%6/20PnP ⚠
TurnOffStove25.0%5/20Turn ⚠
PnPSinkToCounter25.0%5/20PnP ⚠
PnPCounterToMicrowave15.0%3/20PnP ⚠

카테고리별 패턴

카테고리v3 합계v3 평균분석
Open (3 tasks)50/6083.3%v3 강세
Close (3 tasks)52/6086.7%CloseDoor 65% 제외하면 강세
Turn (7 tasks)95/14067.9%Stove계열 약점(TurnOff/OnStove 25/60%)
Coffee (3 tasks)36/6060.0%CoffeeSetupMug 35% 발목
PnP (8 tasks)68/16042.5%정밀 pick-place 전반 약점. Counter→Microwave 15% 최저
핵심 관찰: v3는 base init임에도 PnP 카테고리에서 midA 대비 −15~−30%p. "frappe_base가 theia 없이 LoRA로 시작한 MoE는 오히려 base보다 PnP에서 더 나쁨".
역설적 패턴: Open/Close에서 강세(83-87%)지만 PnP(42.5%)에서 무너짐 → 7 win, 8 loss 패턴. 평균 −4.4%p.

4 Takeaway

가설 판정: REJECTED

v3 < base < midA. theia alignment가 MoE를 막은 것이 아님이 명확히 확인됐다. theia alignment는 base→midA +3.6%p를 실제로 기여하며, LoRA 기반 MoE post-train으로는 이 기여를 따라잡지 못하고 오히려 소폭 손실.

v1(midA init) → v2(midA init + RDT 4수정) → v3(frappe_base init + RDT 4수정) 모두 midA를 못 넘음. init이 midA든 frappe_base든, 정규화 방식이 어떻든 결론이 동일 → MoE post-train 아키텍처(frozen base + LoRA + gate + multi-teacher) 자체가 이 robocasa 셋업의 구조적 한계.

RDT-1B 원본에서도 "robocasa선 MoE post < mid"라는 전례가 있었는데, pi0.5 + 다양한 변형(init/fusion/normalization)에서도 robust하게 재현됨.

가장 큰 발견(재확인): base 교체(RDT-1B ~5% → pi0.5 65%) >>> mid alignment (+2-4%p) >>> MoE post (±0, 구조적 한계). 개선 우선순위가 명확해짐.
부차적 발견: v3의 PnP −15~−30%p는 "destination이 좁은 pick-place에서 LoRA 기반 MoE가 표현을 오히려 망가뜨린다"는 신호. 향후 post-train 설계 시 참고할 failure mode.

5 Next Steps

MoE post-train 방향 공식 종결

v1/v2/v3 ablation으로 MoE post-train의 구조적 한계가 충분히 확인됐다. ckpt 6종(base/midA/midB/moe-v1/moe-v2/moe-v3) 보존, 추가 MoE 학습 없음.

다음 방향: midA를 baseline으로 다른 개선축 탐색

(a) alignment teacher 변경: theia 대신 DINOv2-ViT-B / CLIP-ViT-H / ViT-huge — mid_dinov2/mid_clip/mid_vit 실험 오늘 제출(jobs 12051/12052/12053, RUNNING). 결과로 "어떤 teacher가 robocasa manipulation에 더 유효한가" 비교.

(b) RTC(Representation Transfer for Control) 적용 — alignment 위치/방식 자체 변경.

(c) 데이터셋 변경 / 데이터 augmentation 강화.

(d) v3의 task-specific 패턴(Turn류 강세, PnP 무너짐) 별도 분석 가능성.