TL;DR
- DINOv2-ViT-B / CLIP-ViT-H 동률 75% (CloseDoubleDoor 20ep in-loop, step 20K 최종)
- ViT-huge-patch14 60% — 피크 85%×3회 있었으나 최종 drop
- theia(midA) 직접 비교 불가 — midA는 24-task full eval(67.1%); 단일 태스크 in-loop와 다른 metric
- DINOv2 step 11K 피크 95% — 이후 65~75%로 drop, early stopping 가치 검토 필요
- 전체 24-task eval 미제출 → DINOv2/CLIP 중 하나로 제출 예정
1 배경 / 목적
MoE post-train 계열 실험이 6-way 비교에서 전부 midA(theia teacher, 67.1% 24-task)를 넘지 못하고 종결됨(260603).
post-train 방향을 포기하고 mid-train teacher 자체를 바꾸는 것이 다음 레버로 설정됐다.
theia-base-patch16-224-cdiv는 현재 midA의 teacher이나, DINOv2 / CLIP / ViT-huge-patch14 같은
대형 범용 vision encoder가 더 풍부한 semantic을 제공할 수 있는지 ablation이 필요했다.
한계: 기존 midA vs MoE 비교는 24-task full eval(480ep) 기준이었으나,
alt teacher 실험의 in-loop eval은 CloseDoubleDoor 단일 태스크(20ep)만 사용. 직접 비교 불가.
최종 판단은 24-task full eval 후에만 가능.
2 작업 내용
260604에 3개 jobs 동시 제출 (kickoff 카드: 260604-frappe_alt_teacher_kickoff.html).
동일한 FRAPPE mid-train 설정에서 teacher만 교체, 나머지(학습 데이터·step·LR)는 midA와 동일.
Job 12051 — DINOv2-ViT-B (teacher: dinov2-base)
script: scripts/finetune_pi05_frappe.sh mid_dinov2
output: GR00T-Dreams/outputs/pi05_frappe_mid_dinov2/
4 GPU / 20K steps / DAVIAN MG-3000
완료: 2026-06-04T14:51:21 (elapsed 5h42m)
Job 12052 — CLIP-ViT-H (teacher: CLIP-ViT-H-14-laion2B)
script: scripts/finetune_pi05_frappe.sh mid_clip
output: GR00T-Dreams/outputs/pi05_frappe_mid_clip/
4 GPU / 20K steps / DAVIAN MG-3000
완료: 2026-06-04T14:48:45 (elapsed 5h39m)
Job 12053 — ViT-huge-patch14 (teacher: vit-huge-patch14-224-in21k)
script: scripts/finetune_pi05_frappe.sh mid_vit
output: GR00T-Dreams/outputs/pi05_frappe_mid_vit/
4 GPU / 20K steps / DAVIAN MG-3000
완료: 2026-06-04T20:27:16 (elapsed 5h33m)
In-loop eval 설정: eval_env_name=CloseDoubleDoor, 20 episodes parallel, eval_freq=1000 (매 1K step마다 평가). 총 20회 평가 포인트.
3 결과
최종 결과 (step 20K)
| Teacher | Job | 최종 SR (20K) | 피크 SR | 피크 Step | 상태 |
| DINOv2-ViT-B | 12051 |
75.0% (15/20) |
95.0% (19/20) |
11K |
COMPLETED |
| CLIP-ViT-H | 12052 |
75.0% (15/20) |
85.0% (17/20) |
8K |
COMPLETED |
| ViT-huge-patch14 | 12053 |
60.0% (12/20) |
85.0% (17/20) |
12K, 13K, 18K |
COMPLETED |
비교 기준 주의: 위 SR은 CloseDoubleDoor 단일 태스크 in-loop (20ep).
theia midA는 24-task full eval 67.1% (480ep). 동일 metric이 아니므로 직접 대소 비교 불가.
CloseDoubleDoor 단일 태스크에서의 midA 기준치를 별도로 측정해야 의미 있는 비교 가능.
수렴 곡선 — CloseDoubleDoor SR per 1K steps
| Teacher |
1K | 2K | 3K | 4K | 5K |
6K | 7K | 8K | 9K | 10K |
11K | 12K | 13K | 14K | 15K |
16K | 17K | 18K | 19K | 20K |
| DINOv2 |
0 | 0 | 20 | 20 | 20 |
50 | 50 | 65 | 55 | 75 |
95 | 65 | 65 | 75 | 65 |
65 | 80 | 65 | 70 | 75 |
| CLIP |
0 | 5 | 30 | 40 | 60 |
40 | 70 | 85 | 60 | 75 |
75 | 55 | 55 | 75 | 60 |
75 | 70 | 75 | 65 | 75 |
| ViT-huge |
0 | 5 | 30 | 50 | 35 |
55 | 60 | 30 | 60 | 65 |
55 | 85 | 85 | 60 | 75 |
65 | 75 | 85 | 65 | 60 |
DINOv2 step 11K 피크 95%: 19/20 episodes 성공. 이후 65~80%로 하락.
Overfitting 또는 높은 분산(20ep stochastic eval) 때문일 수 있음.
체크포인트 11K에서 별도 24-task eval 해볼 가치 있음.
높은 분산: 20-episode eval은 stochastic — 동일 모델도 ±15~25%p 요동.
ViT-huge는 피크 85%를 3회 찍었지만 최종 60%로 마감.
단일 포인트보다 최후 5K 평균이 더 신뢰적: DINOv2 ~71%, CLIP ~72%, ViT ~68%.
최후 5K 구간 평균 (step 16~20K)
| Teacher | 16K | 17K | 18K | 19K | 20K | 평균 |
| DINOv2 | 65 | 80 | 65 | 70 | 75 | 71.0% |
| CLIP | 75 | 70 | 75 | 65 | 75 | 72.0% |
| ViT-huge | 65 | 75 | 85 | 65 | 60 | 70.0% |
5K 평균으로 보면 CLIP(72%) ≈ DINOv2(71%) ≈ ViT-huge(70%) — 사실상 3종 모두 유사한 수준.
4 Takeaway
Alt Teacher 종류가 in-loop proxy 성능에 미치는 영향은 제한적
DINOv2 / CLIP / ViT-huge 세 teacher 모두 CloseDoubleDoor in-loop에서 최종 60~75% 범위에 몰려 있고,
5K 평균으로는 70~72%로 사실상 동률이다. 20-episode stochastic eval의 분산(±20%p)을 고려하면 세 teacher 간
통계적 차이가 있다고 보기 어렵다.
theia(midA)가 왜 24-task full eval에서 67.1%를 달성했는지는 이 in-loop 결과만으로 설명되지 않는다.
theia의 강점은 특정 태스크(CloseDoubleDoor)에서의 단일 수행보다 24 태스크 전반에 걸친 범용성일 수 있다.
진짜 비교는 24-task full eval(480ep) 이후에만 가능.
DINOv2의 step 11K 피크(95%)는 흥미롭다 — early stopping + 체크포인트 선택이 이 실험에서
유효한 전략임을 시사한다. ViT-huge처럼 여러 번 피크가 나타났다가 빠지는 패턴은 학습이 불안정하거나
20ep eval 자체의 분산 때문일 가능성 모두 있다.
결론 보류: 현재 in-loop 결과로는 "DINOv2/CLIP이 theia보다 낫다"고 말할 수 없다.
midA에 비해 나쁘다고도 말할 수 없다. 24-task full eval 결과가 verdict.
5 Next Steps
미해결 한계
- In-loop eval = CloseDoubleDoor 단일 태스크 → 24-task 전반에서 어떻게 다를지 미지수
- 20-episode eval은 분산이 너무 커 단일 체크포인트 SR로 rank 결정 불안정
- DINOv2 step 11K 피크(95%)가 실제 모델 품질 향상인지, eval 운(stochastic 20ep)인지 불명확
즉시 실행: DINOv2 (또는 CLIP) 24-task full eval 제출
DINOv2와 CLIP이 proxy에서 동률이므로, 둘 중 하나(또는 둘 다)를 24-task full eval로 확인.
midA(theia) 67.1% (480ep)와 동일 조건으로 비교. 결과에 따라 teacher 교체 여부 결정.
# DINOv2 step 20K 체크포인트 24-task full eval 예시
sbm "bash scripts/eval_frappe_24tasks.sh pi05_frappe_mid_dinov2 020000" \
--gres=gpu:1 -c 8 --mem 200GB --qos=extra
# DINOv2 step 11K 체크포인트도 별도 평가 (피크 체크포인트 검증)
sbm "bash scripts/eval_frappe_24tasks.sh pi05_frappe_mid_dinov2 011000" \
--gres=gpu:1 -c 8 --mem 200GB --qos=extra
검토: 24-task 결과에 따른 다음 방향
- DINOv2/CLIP > midA(theia): teacher 교체 확정, 더 긴 학습(50K+) 실험
- DINOv2/CLIP ≈ midA(theia): teacher 종류보다 다른 요소(데이터·step·LR)가 bottleneck. 방향 재검토
- DINOv2/CLIP < midA(theia): theia의 범용성 재확인. alignment target(위치·레이어) 변경 실험으로 전환