frappe_base init: theia 기여도 검증MoE v1(66.7%)과 v2(66.2%)가 모두 midA(67.1%)를 넘지 못한 후, 남은 가설이 하나 있었다: "midA 초기화가 문제인 것 아닌가?"
midA는 theia teacher로 VLM representation을 정렬한 상태. MoE post-train에서 새 teacher 3개(dinov2/clip/vit)를 추가하면 theia-aligned 표현과 충돌이 생겨 학습을 방해한다는 가설이었다.
이것이 MoE 방향의 마지막 ablation이었다. v1→v2에서 4가지 RDT 정합 수정을 적용했음에도 개선이 없었기 때문에, init 자체를 바꾸는 것이 남은 변수였다.
v3 = v2의 4 RDT 정합 수정 유지 + init만 교체:
| Track | 24-task SR | Raw | vs midA | 비고 |
|---|---|---|---|---|
| midA (VLM tap, theia) | 67.1% | 322/480 | — | 최고, sweet spot |
| moe-v1 (midA init, 3× align) | 66.7% | 320/480 | −0.4%p | 노이즈 수준 |
| moe-v2 (midA init + RDT 4수정) | 66.2% | 318/480 | −0.9%p | 정합 수정 효과無 |
| midB (expert tap, theia) | 65.8% | 316/480 | −1.3%p | |
| base (pi0.5 + DAVIAN FT) | 63.5% | 305/480 | −3.6%p | theia 없음 |
| moe-v3 (frappe_base init + RDT 4수정) | 62.7% | 301/480 | −4.4%p | base보다도 낮음 |
| Task | v3 SR | v3 Raw | 카테고리 |
|---|---|---|---|
| CloseDrawer | 100.0% | 20/20 | Close |
| CloseSingleDoor | 95.0% | 19/20 | Close |
| TurnSinkSpout | 85.0% | 17/20 | Turn |
| CoffeePressButton | 85.0% | 17/20 | Coffee |
| TurnOffSinkFaucet | 85.0% | 17/20 | Turn |
| OpenSingleDoor | 85.0% | 17/20 | Open |
| TurnOnMicrowave | 85.0% | 17/20 | Turn |
| PnPStoveToCounter | 80.0% | 16/20 | PnP |
| OpenDoubleDoor | 75.0% | 15/20 | Open |
| OpenDrawer | 90.0% | 18/20 | Open |
| TurnOnSinkFaucet | 70.0% | 14/20 | Turn |
| CloseDoubleDoor | 65.0% | 13/20 | Close ⚠ |
| TurnOffMicrowave | 65.0% | 13/20 | Turn ⚠ |
| TurnOnStove | 60.0% | 12/20 | Turn ⚠ |
| CoffeeServeMug | 60.0% | 12/20 | Coffee |
| PnPCounterToStove | 60.0% | 12/20 | PnP |
| PnPCabToCounter | 45.0% | 9/20 | PnP ⚠ |
| PnPCounterToSink | 45.0% | 9/20 | PnP ⚠ |
| PnPCounterToCab | 40.0% | 8/20 | PnP ⚠ |
| CoffeeSetupMug | 35.0% | 7/20 | Coffee |
| PnPMicrowaveToCounter | 30.0% | 6/20 | PnP ⚠ |
| TurnOffStove | 25.0% | 5/20 | Turn ⚠ |
| PnPSinkToCounter | 25.0% | 5/20 | PnP ⚠ |
| PnPCounterToMicrowave | 15.0% | 3/20 | PnP ⚠ |
| 카테고리 | v3 합계 | v3 평균 | 분석 |
|---|---|---|---|
| Open (3 tasks) | 50/60 | 83.3% | v3 강세 |
| Close (3 tasks) | 52/60 | 86.7% | CloseDoor 65% 제외하면 강세 |
| Turn (7 tasks) | 95/140 | 67.9% | Stove계열 약점(TurnOff/OnStove 25/60%) |
| Coffee (3 tasks) | 36/60 | 60.0% | CoffeeSetupMug 35% 발목 |
| PnP (8 tasks) | 68/160 | 42.5% | 정밀 pick-place 전반 약점. Counter→Microwave 15% 최저 |
v3 < base < midA. theia alignment가 MoE를 막은 것이 아님이 명확히 확인됐다. theia alignment는 base→midA +3.6%p를 실제로 기여하며, LoRA 기반 MoE post-train으로는 이 기여를 따라잡지 못하고 오히려 소폭 손실.
v1(midA init) → v2(midA init + RDT 4수정) → v3(frappe_base init + RDT 4수정) 모두 midA를 못 넘음. init이 midA든 frappe_base든, 정규화 방식이 어떻든 결론이 동일 → MoE post-train 아키텍처(frozen base + LoRA + gate + multi-teacher) 자체가 이 robocasa 셋업의 구조적 한계.
RDT-1B 원본에서도 "robocasa선 MoE post < mid"라는 전례가 있었는데, pi0.5 + 다양한 변형(init/fusion/normalization)에서도 robust하게 재현됨.
v1/v2/v3 ablation으로 MoE post-train의 구조적 한계가 충분히 확인됐다. ckpt 6종(base/midA/midB/moe-v1/moe-v2/moe-v3) 보존, 추가 MoE 학습 없음.
(a) alignment teacher 변경: theia 대신 DINOv2-ViT-B / CLIP-ViT-H / ViT-huge — mid_dinov2/mid_clip/mid_vit 실험 오늘 제출(jobs 12051/12052/12053, RUNNING). 결과로 "어떤 teacher가 robocasa manipulation에 더 유효한가" 비교.
(b) RTC(Representation Transfer for Control) 적용 — alignment 위치/방식 자체 변경.
(c) 데이터셋 변경 / 데이터 augmentation 강화.
(d) v3의 task-specific 패턴(Turn류 강세, PnP 무너짐) 별도 분석 가능성.