dinov2-vit-b / clip-vit-h / vit-huge-patchmid_dinov2) / 12052(mid_clip) / 12053(mid_vit), 각 own QOS / 4 GPU / 20K stepFRAPPE MoE v3 ablation으로 MoE post-train 방향이 종결됐다 (v1/v2/v3 모두 midA 못 넘음, 구조적 한계 확인). 다음 개선축으로 alignment teacher 자체를 바꿔보는 것이 자연스러운 첫 번째 탐색이다.
기존 midA는 theia-base-patch16-224-cdiv를 teacher로 사용했다. Theia는 여러 teacher를 distill한 compound 표현이지만, manipulation에 특화된 teacher가 아니다. 세 가지 대안을 동시에 실험한다:
기존 finetune_pi05_frappe.sh에 3개 track을 추가했다. midA와 동일한 조건(variant A, tap_layer=13, proj_coeff=0.05, delta_lookahead=16)에서 teacher만 교체.
| Track | Teacher | num_learnable | 특성 | SLURM Job | Status |
|---|---|---|---|---|---|
| midA (baseline) | theia-base-patch16 | 196 | compound distill (여러 teacher 합성) | — | COMPLETED |
| mid_dinov2 | DINOv2-ViT-B | 256 | self-supervised, 강한 local patch 특징 | 12051 | RUNNING |
| mid_clip | CLIP-ViT-H | 256 | 언어-비전 contrastive, 의미 정렬 강함 | 12052 | RUNNING |
| mid_vit | ViT-huge-patch14 | 256 | ImageNet supervised, 고용량 pure vision | 12053 | RUNNING |
num_learnable 차이 주의: midA는 theia의 output token 수에 맞게 196을 사용했으나, dinov2/clip/vit는 256px 입력에서 모두 256 patch token을 생성 → num_learnable=256. 완전히 공정한 비교는 아니나 token 수를 teacher에 맞추는 것이 표준적.
conda activate pi05 && sbm "bash scripts/finetune_pi05_frappe.sh mid_dinov2" --qos=own --gres=gpu:4 -c 32 --mem 800GB 동일 패턴으로 3개 제출.| Track | Teacher | Overall SR | 비고 |
|---|---|---|---|
| midA | theia-base-vit | 67.1% (322/480) | 현재 최고, 기준점 |
| midB | theia-base-vit (expert tap) | 65.8% (316/480) | tap 위치만 다름 |
| base | — (alignment 없음) | 63.5% (305/480) | FRAPPE 없는 순수 pi0.5 |
| 시나리오 | 의미 |
|---|---|
| any alt teacher > 67.1% | theia가 최적 teacher가 아님. 해당 teacher 특성이 robocasa에 더 적합 |
| alt teacher ≈ 67.1% (±1%p) | teacher 종류보다 alignment 여부 자체가 중요. theia가 충분히 좋음 |
| all alt teachers < 67.1% | theia compound distill이 manipulation에 최적. single-source teacher는 부족 |
이 실험은 "FRAPPE에서 teacher의 종류가 얼마나 중요한가"라는 근본적인 질문에 답한다. midA가 +3.6%p를 달성한 것이 theia라는 특정 teacher 덕분인지, 아니면 어떤 strong visual teacher든 비슷한 효과를 내는지 구분할 수 있다.
특히 CLIP-ViT-H는 언어-비전 공동 표현이라 robocasa의 언어 조건부 task에 유리할 수 있고, DINOv2는 manipulation에 중요한 object-centric local feature가 강하다. 결과에 따라 "어떤 inductive bias의 teacher가 robot manipulation policy alignment에 맞는가"에 대한 답을 얻을 수 있다.
학습 완료 후 run_frappe_eval_24tasks.sh(EXP=frappe_mid_dinov2/mid_clip/mid_vit)로 24-task × 20ep eval. midA(67.1%) 대비 비교.
단순 overall SR 외에 카테고리별(PnP/Open/Close/Turn/Coffee) 패턴을 확인. 특정 teacher가 PnP 약점을 개선하는지, 또는 어떤 카테고리에서 갈리는지 분석.
teacher ablation과 별개로: (a) alignment 주입 위치 변경(tap_layer != 13), (b) RTC 적용, (c) 더 큰 DAVIAN 데이터셋(robocasa-MG_3000 대신 full MG). 우선 teacher ablation 결과 먼저 확인 후 방향 결정.