Index
2026-06-01 — Analysis

FRAPPE MoE 완전 평가 — 5-way 최종 비교

GR00T-Dreams | DAVIAN MG-3000 24-task, 20 ep × 24 task = 480 ep

TL;DR

66.7%
moe SR
66.2%
moe_v2 SR
67.1%
midA SR (best)
480
eval episodes
20K
steps

1 배경 / 목적

260529 카드(frappe_moe_training)에서 FRAPPE MoE 학습이 완료됐으나 24-task eval(job 10541)이 진행 중이었다. 이후 v1 eval 결과 수신 직후 v2 설계 변경을 적용한 후속 실험(job 10559, 10577)도 같은 날 완료됐다.

배경 가설: FRAPPE 단일-teacher(midA = dinov2-base-vit alignment) 이후, 3개의 이질적 teacher(dinov2/clip/vit)를 gate-weighted MoE로 fusion하면 각 teacher의 강점을 태스크별로 조합하여 midA를 초과할 수 있다.

frappe_moe_v2 동기: v1에서 gate router의 teacher 출력 3개를 합산(×3 스케일)하는 구조적 불균형이 의심됐다. v2는 이를 수정하여 align 평균(÷3), trainable residual fusion head, gate z-loss + label smoothing을 추가했다.

2 작업 내용

frappe_moe 24-task eval (job 10541)

EXP=frappe_moe N_EPISODES=20 scripts/run_frappe_eval_24tasks.sh @ GR00T-Dreams ckpt: outputs/pi05_frappe_moe/checkpoints/020000 wall-clock: 8h 40m | started: 2026-05-29 08:44 → 완료: 17:24

frappe_moe_v2 설계 변경 (v1 → v2 diff)

v1 (frappe_moe): - teacher 출력 3개 단순 합산 (align scale ×3 effect) - gate router: softmax gate weights - no gate regularization v2 (frappe_moe_v2): - align 평균 (÷3) → teacher 표현 스케일 정규화 - trainable residual fusion head (단순 gate 대신 residual path) - gate z-loss + label smoothing → gate entropy 유도, 분산 방지 - 나머지 동일: midA frozen base, LoRA r=16 α=32, 3 teacher(dinov2/clip/vit), 20K steps, lr=1e-4

frappe_moe_v2 학습 + eval (jobs 10558→10559, 10577)

10558: frappe_moe_v2 첫 시도 → 5분 만에 종료 (초기 checkpoint 없어 OUT dir 재생성) 10559: frappe_moe_v2 정상 학습 4 GPU × 9h56m 2026-05-29 12:25 → 22:21 10577: frappe_moe_v2 eval 1 GPU × 8h13m 2026-05-29 22:15 → 05-30 06:28

3 결과

5-way 최종 비교 (DAVIAN MG-3000, 24 task × 20 ep = 480 ep, 20K steps)

모델SR (전체)성공/전체구조비고
frappe_midA 67.1% 322/480 단일 teacher (dinov2-base-vit) 기준 (최고)
frappe_moe 66.7% 320/480 MoE: midA frozen + 3 LoRA + gate (합산) midA 대비 −0.4pp
frappe_moe_v2 66.2% 318/480 MoE v2: align÷3, residual head, z-loss v1 대비 −0.5pp
frappe_midB 65.8% 316/480 단일 teacher variant B (theia-base-vit)
frappe_base 63.5% 305/480 plain Pi0.5 (FRAPPE 없음) 기저선
MoE 가설 기각: 3-teacher MoE (v1, v2 모두) 단일-teacher midA(67.1%)를 초과하지 못했다. 두 버전 모두 midA와 2~4 episode 차이 — 통계적 노이즈 수준이나 일관된 패턴.

frappe_moe (v1) vs moe_v2 태스크별 주요 차이

Taskmoe v1moe v2Δ비고
CloseDoubleDoor 80.0% 60.0% −20pp v2 최대 퇴보
PnPStoveToCounter 70.0% 85.0% +15pp v2 최대 개선
TurnOffSinkFaucet 85.0% 95.0% +10pp
PnPCabToCounter 40.0% 50.0% +10pp
PnPCounterToMicrowave 30.0% 40.0% +10pp
PnPCounterToSink 65.0% 55.0% −10pp
PnPCounterToStove 65.0% 55.0% −10pp
TurnOffStove 50.0% 40.0% −10pp
TurnSinkSpout 90.0% 95.0% +5pp
CoffeeSetupMug 25.0% 20.0% −5pp 양쪽 모두 약점
CloseDrawer 100.0% 100.0% 0pp 양쪽 완벽
v2 태스크 분포 변화: v2의 gate regularization(z-loss)이 gate 분포를 균등화하면서 특정 teacher에 집중하던 패턴이 흩어진 것으로 보인다. CloseDoubleDoor −20pp / PnPStoveToCounter +15pp처럼 개별 태스크 승패가 교차되지만, 전체 합산은 v1보다 낮다.

frappe_moe 전체 per-task 결과 (480 ep)

Taskmoe v1moe v2
CloseDoubleDoor80.0% (16/20)60.0% (12/20)
CloseDrawer100.0% (20/20)100.0% (20/20)
CloseSingleDoor95.0% (19/20)85.0% (17/20)
CoffeePressButton70.0% (14/20)75.0% (15/20)
CoffeeServeMug65.0% (13/20)65.0% (13/20)
CoffeeSetupMug25.0% (5/20)20.0% (4/20)
OpenDoubleDoor65.0% (13/20)70.0% (14/20)
OpenDrawer75.0% (15/20)80.0% (16/20)
OpenSingleDoor90.0% (18/20)85.0% (17/20)
PnPCabToCounter40.0% (8/20)50.0% (10/20)
PnPCounterToCab40.0% (8/20)45.0% (9/20)
PnPCounterToMicrowave30.0% (6/20)40.0% (8/20)
PnPCounterToSink65.0% (13/20)55.0% (11/20)
PnPCounterToStove65.0% (13/20)55.0% (11/20)
PnPMicrowaveToCounter60.0% (12/20)40.0% (8/20)
PnPSinkToCounter45.0% (9/20)45.0% (9/20)
PnPStoveToCounter70.0% (14/20)85.0% (17/20)
TurnOffMicrowave80.0% (16/20)80.0% (16/20)
TurnOffSinkFaucet85.0% (17/20)95.0% (19/20)
TurnOffStove50.0% (10/20)40.0% (8/20)
TurnOnMicrowave70.0% (14/20)75.0% (15/20)
TurnOnSinkFaucet60.0% (12/20)70.0% (14/20)
TurnOnStove85.0% (17/20)80.0% (16/20)
TurnSinkSpout90.0% (18/20)95.0% (19/20)
TOTAL66.7% (320/480)66.2% (318/480)

4 Takeaway

MoE 복잡도가 단일 최적 teacher를 이기지 못한다

FRAPPE 프레임워크에서 "최적 teacher 하나"(midA, dinov2-base-vit)는 "3 teacher의 gate-weighted fusion"(moe, moe_v2)보다 일관되게 높거나 동등한 성능을 보인다. 두 버전(v1 66.7%, v2 66.2%)이 모두 midA(67.1%)를 초과하지 못했으며, 차이는 2~4 episode(0.4~0.8pp)로 노이즈 범위에 있지만 방향이 일관적이다.

특히 v2에서 gate regularization을 추가해 teacher 전문화를 유도했음에도 전체 SR이 v1보다 오히려 낮아진 점이 시사적이다. gate z-loss가 gate entropy를 높여 특정 태스크에서 이득을 봤으나(PnPStoveToCounter +15pp), 기존에 강했던 태스크(CloseDoubleDoor −20pp)에서 역효과가 났다. 즉, MoE gate가 태스크별 teacher 전문화를 학습하지 못하고 있다는 것을 시사한다.

더 근본적으로는, 동일 데이터(MG-3000)로 학습된 midA 위에 추가 teacher를 쌓는 구조 자체가 한계일 수 있다. midA가 이미 MG-3000 분포를 잘 포착했다면, 추가 teacher는 중복 정보를 제공할 뿐이다.

FRAPPE baseline 확립: 5-way 비교를 통해 FRAPPE의 상단이 midA ≈ 67%임이 확인됐다. base(63.5%) 대비 +3.6pp는 여전히 유의미한 alignment 효과다.
CoffeeSetupMug 구조적 약점: v1(25%), v2(20%) 모두 전체 최하위. 이 태스크는 multi-step setup 시퀀스를 요구하며, 20K steps 단일 policy로는 커버하기 어려운 task horizon일 가능성이 있다.

5 Next Steps

MoE 트랙 종료 판단

v1, v2 모두 midA를 초과하지 못했으므로 MoE teacher-fusion 방향의 추가 실험은 수익률이 낮다. 현재 FRAPPE 최종 상태 = midA(67.1%) as best FRAPPE policy로 확정하고, 다음 단계로 이동하는 것이 합리적이다.

DreamGen 합성 데이터 통합 (핵심 다음 단계)

현재 Cosmos AR 생성 → droid-IDM action → sim open-loop 11.1% SR 파이프라인이 구축됐다. 다음 실험 방향: 합성 비디오에서 추출한 pseudo action을 real demo와 혼합하여 policy fine-tune. midA(67.1%)를 base로 사용하고, 합성 데이터 비율(mix ratio)을 변수로 조정하는 ablation이 필요하다. 가설: PnP 계열(현재 약 40~65%)이 합성 비디오에서 유의미하게 개선될 수 있다 — Cosmos AR이 이 계열 task를 생성할 수 있다면.

CoffeeSetupMug 별도 분석

전 모델에서 20~25%로 최하위. 재학습 step 수 부족인지, task 자체의 복잡도 문제인지 확인 필요. 간단한 검증: midA 40K steps extended training에서 CoffeeSetupMug SR 변화 추적.