260529 카드(frappe_moe_training)에서 FRAPPE MoE 학습이 완료됐으나 24-task eval(job 10541)이 진행 중이었다. 이후 v1 eval 결과 수신 직후 v2 설계 변경을 적용한 후속 실험(job 10559, 10577)도 같은 날 완료됐다.
frappe_moe_v2 동기: v1에서 gate router의 teacher 출력 3개를 합산(×3 스케일)하는 구조적 불균형이 의심됐다. v2는 이를 수정하여 align 평균(÷3), trainable residual fusion head, gate z-loss + label smoothing을 추가했다.
| 모델 | SR (전체) | 성공/전체 | 구조 | 비고 |
|---|---|---|---|---|
| frappe_midA | 67.1% | 322/480 | 단일 teacher (dinov2-base-vit) | 기준 (최고) |
| frappe_moe | 66.7% | 320/480 | MoE: midA frozen + 3 LoRA + gate (합산) | midA 대비 −0.4pp |
| frappe_moe_v2 | 66.2% | 318/480 | MoE v2: align÷3, residual head, z-loss | v1 대비 −0.5pp |
| frappe_midB | 65.8% | 316/480 | 단일 teacher variant B (theia-base-vit) | — |
| frappe_base | 63.5% | 305/480 | plain Pi0.5 (FRAPPE 없음) | 기저선 |
| Task | moe v1 | moe v2 | Δ | 비고 |
|---|---|---|---|---|
| CloseDoubleDoor | 80.0% | 60.0% | −20pp | v2 최대 퇴보 |
| PnPStoveToCounter | 70.0% | 85.0% | +15pp | v2 최대 개선 |
| TurnOffSinkFaucet | 85.0% | 95.0% | +10pp | — |
| PnPCabToCounter | 40.0% | 50.0% | +10pp | — |
| PnPCounterToMicrowave | 30.0% | 40.0% | +10pp | — |
| PnPCounterToSink | 65.0% | 55.0% | −10pp | — |
| PnPCounterToStove | 65.0% | 55.0% | −10pp | — |
| TurnOffStove | 50.0% | 40.0% | −10pp | — |
| TurnSinkSpout | 90.0% | 95.0% | +5pp | — |
| CoffeeSetupMug | 25.0% | 20.0% | −5pp | 양쪽 모두 약점 |
| CloseDrawer | 100.0% | 100.0% | 0pp | 양쪽 완벽 |
| Task | moe v1 | moe v2 |
|---|---|---|
| CloseDoubleDoor | 80.0% (16/20) | 60.0% (12/20) |
| CloseDrawer | 100.0% (20/20) | 100.0% (20/20) |
| CloseSingleDoor | 95.0% (19/20) | 85.0% (17/20) |
| CoffeePressButton | 70.0% (14/20) | 75.0% (15/20) |
| CoffeeServeMug | 65.0% (13/20) | 65.0% (13/20) |
| CoffeeSetupMug | 25.0% (5/20) | 20.0% (4/20) |
| OpenDoubleDoor | 65.0% (13/20) | 70.0% (14/20) |
| OpenDrawer | 75.0% (15/20) | 80.0% (16/20) |
| OpenSingleDoor | 90.0% (18/20) | 85.0% (17/20) |
| PnPCabToCounter | 40.0% (8/20) | 50.0% (10/20) |
| PnPCounterToCab | 40.0% (8/20) | 45.0% (9/20) |
| PnPCounterToMicrowave | 30.0% (6/20) | 40.0% (8/20) |
| PnPCounterToSink | 65.0% (13/20) | 55.0% (11/20) |
| PnPCounterToStove | 65.0% (13/20) | 55.0% (11/20) |
| PnPMicrowaveToCounter | 60.0% (12/20) | 40.0% (8/20) |
| PnPSinkToCounter | 45.0% (9/20) | 45.0% (9/20) |
| PnPStoveToCounter | 70.0% (14/20) | 85.0% (17/20) |
| TurnOffMicrowave | 80.0% (16/20) | 80.0% (16/20) |
| TurnOffSinkFaucet | 85.0% (17/20) | 95.0% (19/20) |
| TurnOffStove | 50.0% (10/20) | 40.0% (8/20) |
| TurnOnMicrowave | 70.0% (14/20) | 75.0% (15/20) |
| TurnOnSinkFaucet | 60.0% (12/20) | 70.0% (14/20) |
| TurnOnStove | 85.0% (17/20) | 80.0% (16/20) |
| TurnSinkSpout | 90.0% (18/20) | 95.0% (19/20) |
| TOTAL | 66.7% (320/480) | 66.2% (318/480) |
FRAPPE 프레임워크에서 "최적 teacher 하나"(midA, dinov2-base-vit)는 "3 teacher의 gate-weighted fusion"(moe, moe_v2)보다 일관되게 높거나 동등한 성능을 보인다. 두 버전(v1 66.7%, v2 66.2%)이 모두 midA(67.1%)를 초과하지 못했으며, 차이는 2~4 episode(0.4~0.8pp)로 노이즈 범위에 있지만 방향이 일관적이다.
특히 v2에서 gate regularization을 추가해 teacher 전문화를 유도했음에도 전체 SR이 v1보다 오히려 낮아진 점이 시사적이다. gate z-loss가 gate entropy를 높여 특정 태스크에서 이득을 봤으나(PnPStoveToCounter +15pp), 기존에 강했던 태스크(CloseDoubleDoor −20pp)에서 역효과가 났다. 즉, MoE gate가 태스크별 teacher 전문화를 학습하지 못하고 있다는 것을 시사한다.
더 근본적으로는, 동일 데이터(MG-3000)로 학습된 midA 위에 추가 teacher를 쌓는 구조 자체가 한계일 수 있다. midA가 이미 MG-3000 분포를 잘 포착했다면, 추가 teacher는 중복 정보를 제공할 뿐이다.
v1, v2 모두 midA를 초과하지 못했으므로 MoE teacher-fusion 방향의 추가 실험은 수익률이 낮다. 현재 FRAPPE 최종 상태 = midA(67.1%) as best FRAPPE policy로 확정하고, 다음 단계로 이동하는 것이 합리적이다.
현재 Cosmos AR 생성 → droid-IDM action → sim open-loop 11.1% SR 파이프라인이 구축됐다. 다음 실험 방향: 합성 비디오에서 추출한 pseudo action을 real demo와 혼합하여 policy fine-tune. midA(67.1%)를 base로 사용하고, 합성 데이터 비율(mix ratio)을 변수로 조정하는 ablation이 필요하다. 가설: PnP 계열(현재 약 40~65%)이 합성 비디오에서 유의미하게 개선될 수 있다 — Cosmos AR이 이 계열 task를 생성할 수 있다면.
전 모델에서 20~25%로 최하위. 재학습 step 수 부족인지, task 자체의 복잡도 문제인지 확인 필요. 간단한 검증: midA 40K steps extended training에서 CoffeeSetupMug SR 변화 추적.