Index
2026-06-04 — Experiment Kickoff

FRAPPE alt teacher mid-train — DINOv2 / CLIP / ViT ablation

DreamData / FRAPPE-pi0.5 | Jobs 12051 / 12052 / 12053 | RUNNING

TL;DR

67.1%
midA baseline
3
새 실험
RUNNING
현재 상태
20K
Steps each
4 GPU
per job

1 배경 / 목적

FRAPPE MoE v3 ablation으로 MoE post-train 방향이 종결됐다 (v1/v2/v3 모두 midA 못 넘음, 구조적 한계 확인). 다음 개선축으로 alignment teacher 자체를 바꿔보는 것이 자연스러운 첫 번째 탐색이다.

기존 midA는 theia-base-patch16-224-cdiv를 teacher로 사용했다. Theia는 여러 teacher를 distill한 compound 표현이지만, manipulation에 특화된 teacher가 아니다. 세 가지 대안을 동시에 실험한다:

mid_dinov2
DINOv2-ViT-B
mid_clip
CLIP-ViT-H
mid_vit
ViT-huge-patch
baseline (midA)
theia-base-vit
연구 질문: "manipulation task에서 어떤 visual teacher representation이 policy alignment에 더 유효한가? — 로컬 특징 강화(DINOv2), 언어-비전 정렬(CLIP), 고용량 pure vision(ViT-huge) 중 어느 것이 theia를 넘는가?"

2 작업 내용

기존 finetune_pi05_frappe.sh에 3개 track을 추가했다. midA와 동일한 조건(variant A, tap_layer=13, proj_coeff=0.05, delta_lookahead=16)에서 teacher만 교체.

scripts/finetune_pi05_frappe.sh 추가 트랙: mid_dinov2: --policy.align_enc_type=dinov2-vit-b --policy.num_learnable=256 mid_clip: --policy.align_enc_type=clip-vit-h --policy.num_learnable=256 mid_vit: --policy.align_enc_type=vit-huge-patch --policy.num_learnable=256 midA (기준): --policy.align_enc_type=theia-base-vit --policy.num_learnable=196

Teacher 비교 설계

TrackTeachernum_learnable특성SLURM JobStatus
midA (baseline)theia-base-patch16196compound distill (여러 teacher 합성)COMPLETED
mid_dinov2DINOv2-ViT-B256self-supervised, 강한 local patch 특징12051RUNNING
mid_clipCLIP-ViT-H256언어-비전 contrastive, 의미 정렬 강함12052RUNNING
mid_vitViT-huge-patch14256ImageNet supervised, 고용량 pure vision12053RUNNING

num_learnable 차이 주의: midA는 theia의 output token 수에 맞게 196을 사용했으나, dinov2/clip/vit는 256px 입력에서 모두 256 patch token을 생성 → num_learnable=256. 완전히 공정한 비교는 아니나 token 수를 teacher에 맞추는 것이 표준적.

공통 설정 (midA와 동일)

base model: lerobot/pi05_base dataset: DAVIAN-Robotics/robocasa-MG_3000 root: /home/nas_main/minhopark/datasets/robot/lerobot_v30/... frappe_variant: A (VLM tap, SigLIP layer 13) tap_layer: 13 proj_coeff: 0.05 delta_lookahead: 16 steps: 20000 batch_size: 16 (grad_accum=1) optimizer: AdamW lr=1e-4, wd=0.01, clip=1.0 scheduler: cosine warmup 1K → decay 20K → 2.5e-6 4 GPU, bf16, gradient_checkpointing=true in-loop eval: CloseDoubleDoor, 20ep per 1000 steps
제출 방법: conda activate pi05 && sbm "bash scripts/finetune_pi05_frappe.sh mid_dinov2" --qos=own --gres=gpu:4 -c 32 --mem 800GB 동일 패턴으로 3개 제출.

3 결과

현재 상태: 3개 job 모두 RUNNING. 학습 진행 중(2026-06-04 오전 제출). 20K step + 24-task eval 후 결과 확보 예정.

비교 기준점 (기존 결과)

TrackTeacherOverall SR비고
midAtheia-base-vit67.1% (322/480)현재 최고, 기준점
midBtheia-base-vit (expert tap)65.8% (316/480)tap 위치만 다름
base— (alignment 없음)63.5% (305/480)FRAPPE 없는 순수 pi0.5

예상 결과 범위

시나리오의미
any alt teacher > 67.1%theia가 최적 teacher가 아님. 해당 teacher 특성이 robocasa에 더 적합
alt teacher ≈ 67.1% (±1%p)teacher 종류보다 alignment 여부 자체가 중요. theia가 충분히 좋음
all alt teachers < 67.1%theia compound distill이 manipulation에 최적. single-source teacher는 부족

4 Takeaway

실험 설계 의미

이 실험은 "FRAPPE에서 teacher의 종류가 얼마나 중요한가"라는 근본적인 질문에 답한다. midA가 +3.6%p를 달성한 것이 theia라는 특정 teacher 덕분인지, 아니면 어떤 strong visual teacher든 비슷한 효과를 내는지 구분할 수 있다.

특히 CLIP-ViT-H는 언어-비전 공동 표현이라 robocasa의 언어 조건부 task에 유리할 수 있고, DINOv2는 manipulation에 중요한 object-centric local feature가 강하다. 결과에 따라 "어떤 inductive bias의 teacher가 robot manipulation policy alignment에 맞는가"에 대한 답을 얻을 수 있다.

기대 효과: 3개 중 하나라도 midA를 +1%p 이상 넘으면, teacher 선택이 유효한 improvement axis임이 확인됨. 넘지 못하면 "teacher보다 alignment 방법론 자체를 바꿔야" 한다는 signal.

5 Next Steps

24-task eval 대기

학습 완료 후 run_frappe_eval_24tasks.sh(EXP=frappe_mid_dinov2/mid_clip/mid_vit)로 24-task × 20ep eval. midA(67.1%) 대비 비교.

결과 분석 포인트

단순 overall SR 외에 카테고리별(PnP/Open/Close/Turn/Coffee) 패턴을 확인. 특정 teacher가 PnP 약점을 개선하는지, 또는 어떤 카테고리에서 갈리는지 분석.

병행 탐색 후보

teacher ablation과 별개로: (a) alignment 주입 위치 변경(tap_layer != 13), (b) RTC 적용, (c) 더 큰 DAVIAN 데이터셋(robocasa-MG_3000 대신 full MG). 우선 teacher ablation 결과 먼저 확인 후 방향 결정.