기존 stitch layer 탐색(find_stitch_layer_vggt.py, find_stitch_layer_vggt_dinov2.py)은 Conv3d connector가 맞춰야 할 회귀 타깃으로 Wan VAE latent를 사용했다 (Phase 2~3 파이프라인 기준). 그러나 Phase 4(=paper Phase 2, RL fine-tuning) base 모델은 260512에 Cosmos-Predict2-2B로 확정됐고, 이 모델은 Wan과 다른 VAE(Cosmos VAE)로 latent를 인코딩한다. 만약 stitch layer의 최적값이 VAE 종류에 따라 달라진다면, Phase 4로 전환할 때 LGM connector를 처음부터 다시 탐색해야 한다 — 이 리스크를 사전에 확인하기 위해 동일한 24-task RoboCasa 데이터로 --vae_type cosmos 옵션을 켜고 stitch layer 탐색을 재실행했다.
기존 closed-form ridge regression 스크립트에 이미 있던 --vae_type {wan,cosmos} 옵션(default=wan)을 cosmos로 지정해 동일 24-task HDF5, 동일 클립 샘플링(max_clips=3, eval_clips=10, num_frames=32, ridge=1e-4)으로 재실행. aggregator/DINOv2 두 stitch 방식 각각에 대해 실행했다.
왜 이 방식을 택했는가: 새 스크립트를 짜지 않고 기존 탐색 파이프라인의 VAE 스위치만 바꿔 실행 → Wan/Cosmos 결과를 같은 데이터·같은 회귀 방법으로 1:1 비교 가능.
| Stitch 방식 | VAE 타깃 | Best layer | MSE @ best | MSE 저하율 |
|---|---|---|---|---|
| Aggregator | Wan (기존, 260630) | 2 | 0.00761 | — |
| Aggregator | Cosmos (신규) | 2 | 0.00822 | +8.0% |
| DINOv2 | Wan (기존) | 4 | 0.08006 | — |
| DINOv2 | Cosmos (신규) | 4 | 0.12246 | +53.0% |
aggregator는 두 VAE 모두 layer 2에서 20까지 완만한 단조 증가(0.0076~0.0082 → 1.12~1.18)를 보인 반면, DINOv2는 layer 6 이후 기하급수적으로 폭증한다 — Cosmos 기준 layer 6=0.208, layer 14=4.61, layer 22=140.1 (초기 대비 1000배 이상). DINOv2 경로는 얕은 layer(2~6) 구간을 벗어나는 순간 Conv3d connector가 latent를 전혀 못 맞추는 것으로 보인다.
Phase 2→Phase 4 전환 시 LGM connector의 stitch layer를 처음부터 다시 찾을 필요는 없다는 것이 확인됐다 — 이는 Phase 4 착수 일정에서 불확실성 하나를 제거한다. 다만 같은 날 진행 중인 agg2 vs dino4 실전 학습 ablation(260702-vggt_omega_agg_vs_dino_ablation_progress.html)에서는 DINOv2가 Phase-B loss 기준 더 우세하게 나오고 있어, "closed-form MSE로는 aggregator가 안전하지만 실제 학습 loss로는 DINOv2가 더 잘 수렴한다"는 상충하는 신호가 동시에 존재한다. 이 모순은 두 지표(latent 재구성 오차 vs downstream geometry loss)가 서로 다른 것을 측정하기 때문일 가능성이 크며, Phase 4용 최종 stitch 방식 결정 전에 반드시 풀어야 할 질문이다.
이 카드의 실험은 어디까지나 1시간짜리 closed-form ridge regression(회귀 오차)이고, 실제 diffusion latent 위에서의 학습 안정성/수렴 속도를 대변하지 않는다. DINOv2가 Cosmos VAE에서 MSE가 훨씬 나쁘다는 결과와, 현재 Wan VAE 기반 Phase-B 학습에서 DINOv2가 더 낮은 loss를 보이는 결과가 상충 — 어느 지표가 Phase 4 reward 품질과 더 상관관계가 높은지 아직 모른다.
(1) agg2/dino4 Phase-B 학습이 완주되면, 두 최종 체크포인트로 실제 RoboCasa held-out depth AbsRel을 측정해 closed-form MSE 순위와 학습 loss 순위 중 어느 쪽이 최종 geometry 품질과 더 잘 맞는지 확인. (2) Phase 4 착수 시점에 소규모(5K step) Cosmos VAE 파이프라인 파일럿으로 aggregator vs DINOv2를 다시 학습 비교 — VAE_TYPE 전환이 closed-form에서는 견고했지만 실제 diffusion 학습에서도 같은 결론인지 별도 검증 필요.