Index
2026-06-05 — Experiment

FRAPPE Alt Teacher 결과 — DINOv2/CLIP 75%, ViT-huge 60%

DreamData / FRAPPE-pi0.5 | CloseDoubleDoor in-loop eval (20ep) | jobs 12051/12052/12053

TL;DR

75%
DINOv2 최종 SR
75%
CLIP 최종 SR
60%
ViT-huge 최종 SR
95%
DINOv2 피크 SR
20K
Steps

1 배경 / 목적

MoE post-train 계열 실험이 6-way 비교에서 전부 midA(theia teacher, 67.1% 24-task)를 넘지 못하고 종결됨(260603). post-train 방향을 포기하고 mid-train teacher 자체를 바꾸는 것이 다음 레버로 설정됐다. theia-base-patch16-224-cdiv는 현재 midA의 teacher이나, DINOv2 / CLIP / ViT-huge-patch14 같은 대형 범용 vision encoder가 더 풍부한 semantic을 제공할 수 있는지 ablation이 필요했다.

한계: 기존 midA vs MoE 비교는 24-task full eval(480ep) 기준이었으나, alt teacher 실험의 in-loop eval은 CloseDoubleDoor 단일 태스크(20ep)만 사용. 직접 비교 불가. 최종 판단은 24-task full eval 후에만 가능.

2 작업 내용

260604에 3개 jobs 동시 제출 (kickoff 카드: 260604-frappe_alt_teacher_kickoff.html). 동일한 FRAPPE mid-train 설정에서 teacher만 교체, 나머지(학습 데이터·step·LR)는 midA와 동일.

Job 12051 — DINOv2-ViT-B (teacher: dinov2-base) script: scripts/finetune_pi05_frappe.sh mid_dinov2 output: GR00T-Dreams/outputs/pi05_frappe_mid_dinov2/ 4 GPU / 20K steps / DAVIAN MG-3000 완료: 2026-06-04T14:51:21 (elapsed 5h42m) Job 12052 — CLIP-ViT-H (teacher: CLIP-ViT-H-14-laion2B) script: scripts/finetune_pi05_frappe.sh mid_clip output: GR00T-Dreams/outputs/pi05_frappe_mid_clip/ 4 GPU / 20K steps / DAVIAN MG-3000 완료: 2026-06-04T14:48:45 (elapsed 5h39m) Job 12053 — ViT-huge-patch14 (teacher: vit-huge-patch14-224-in21k) script: scripts/finetune_pi05_frappe.sh mid_vit output: GR00T-Dreams/outputs/pi05_frappe_mid_vit/ 4 GPU / 20K steps / DAVIAN MG-3000 완료: 2026-06-04T20:27:16 (elapsed 5h33m)

In-loop eval 설정: eval_env_name=CloseDoubleDoor, 20 episodes parallel, eval_freq=1000 (매 1K step마다 평가). 총 20회 평가 포인트.

3 결과

최종 결과 (step 20K)

TeacherJob최종 SR (20K)피크 SR피크 Step상태
DINOv2-ViT-B12051 75.0% (15/20) 95.0% (19/20) 11K COMPLETED
CLIP-ViT-H12052 75.0% (15/20) 85.0% (17/20) 8K COMPLETED
ViT-huge-patch1412053 60.0% (12/20) 85.0% (17/20) 12K, 13K, 18K COMPLETED
비교 기준 주의: 위 SR은 CloseDoubleDoor 단일 태스크 in-loop (20ep). theia midA는 24-task full eval 67.1% (480ep). 동일 metric이 아니므로 직접 대소 비교 불가. CloseDoubleDoor 단일 태스크에서의 midA 기준치를 별도로 측정해야 의미 있는 비교 가능.

수렴 곡선 — CloseDoubleDoor SR per 1K steps

Teacher 1K2K3K4K5K 6K7K8K9K10K 11K12K13K14K15K 16K17K18K19K20K
DINOv2 00202020 5050655575 9565657565 6580657075
CLIP 05304060 4070856075 7555557560 7570756575
ViT-huge 05305035 5560306065 5585856075 6575856560
DINOv2 step 11K 피크 95%: 19/20 episodes 성공. 이후 65~80%로 하락. Overfitting 또는 높은 분산(20ep stochastic eval) 때문일 수 있음. 체크포인트 11K에서 별도 24-task eval 해볼 가치 있음.
높은 분산: 20-episode eval은 stochastic — 동일 모델도 ±15~25%p 요동. ViT-huge는 피크 85%를 3회 찍었지만 최종 60%로 마감. 단일 포인트보다 최후 5K 평균이 더 신뢰적: DINOv2 ~71%, CLIP ~72%, ViT ~68%.

최후 5K 구간 평균 (step 16~20K)

Teacher16K17K18K19K20K평균
DINOv2658065707571.0%
CLIP757075657572.0%
ViT-huge657585656070.0%

5K 평균으로 보면 CLIP(72%) ≈ DINOv2(71%) ≈ ViT-huge(70%) — 사실상 3종 모두 유사한 수준.

4 Takeaway

Alt Teacher 종류가 in-loop proxy 성능에 미치는 영향은 제한적

DINOv2 / CLIP / ViT-huge 세 teacher 모두 CloseDoubleDoor in-loop에서 최종 60~75% 범위에 몰려 있고, 5K 평균으로는 70~72%로 사실상 동률이다. 20-episode stochastic eval의 분산(±20%p)을 고려하면 세 teacher 간 통계적 차이가 있다고 보기 어렵다.

theia(midA)가 왜 24-task full eval에서 67.1%를 달성했는지는 이 in-loop 결과만으로 설명되지 않는다. theia의 강점은 특정 태스크(CloseDoubleDoor)에서의 단일 수행보다 24 태스크 전반에 걸친 범용성일 수 있다. 진짜 비교는 24-task full eval(480ep) 이후에만 가능.

DINOv2의 step 11K 피크(95%)는 흥미롭다 — early stopping + 체크포인트 선택이 이 실험에서 유효한 전략임을 시사한다. ViT-huge처럼 여러 번 피크가 나타났다가 빠지는 패턴은 학습이 불안정하거나 20ep eval 자체의 분산 때문일 가능성 모두 있다.

결론 보류: 현재 in-loop 결과로는 "DINOv2/CLIP이 theia보다 낫다"고 말할 수 없다. midA에 비해 나쁘다고도 말할 수 없다. 24-task full eval 결과가 verdict.

5 Next Steps

미해결 한계

  • In-loop eval = CloseDoubleDoor 단일 태스크 → 24-task 전반에서 어떻게 다를지 미지수
  • 20-episode eval은 분산이 너무 커 단일 체크포인트 SR로 rank 결정 불안정
  • DINOv2 step 11K 피크(95%)가 실제 모델 품질 향상인지, eval 운(stochastic 20ep)인지 불명확

즉시 실행: DINOv2 (또는 CLIP) 24-task full eval 제출

DINOv2와 CLIP이 proxy에서 동률이므로, 둘 중 하나(또는 둘 다)를 24-task full eval로 확인. midA(theia) 67.1% (480ep)와 동일 조건으로 비교. 결과에 따라 teacher 교체 여부 결정.

# DINOv2 step 20K 체크포인트 24-task full eval 예시 sbm "bash scripts/eval_frappe_24tasks.sh pi05_frappe_mid_dinov2 020000" \ --gres=gpu:1 -c 8 --mem 200GB --qos=extra # DINOv2 step 11K 체크포인트도 별도 평가 (피크 체크포인트 검증) sbm "bash scripts/eval_frappe_24tasks.sh pi05_frappe_mid_dinov2 011000" \ --gres=gpu:1 -c 8 --mem 200GB --qos=extra

검토: 24-task 결과에 따른 다음 방향

  • DINOv2/CLIP > midA(theia): teacher 교체 확정, 더 긴 학습(50K+) 실험
  • DINOv2/CLIP ≈ midA(theia): teacher 종류보다 다른 요소(데이터·step·LR)가 bottleneck. 방향 재검토
  • DINOv2/CLIP < midA(theia): theia의 범용성 재확인. alignment target(위치·레이어) 변경 실험으로 전환