Index
2026-07-01 ~ 07-02 — Experiment

Cosmos VAE 타깃 stitch layer 재탐색 — VAE 전환 견고성 검증

VGGRPO | find_stitch_layer_vggt{,_dinov2}.py --vae_type cosmos, job 31896/31897, 31941/31942

TL;DR

2
agg best layer
4
dino best layer
+8% / +53%
MSE 저하(agg/dino)

1 배경 / 목적

기존 stitch layer 탐색(find_stitch_layer_vggt.py, find_stitch_layer_vggt_dinov2.py)은 Conv3d connector가 맞춰야 할 회귀 타깃으로 Wan VAE latent를 사용했다 (Phase 2~3 파이프라인 기준). 그러나 Phase 4(=paper Phase 2, RL fine-tuning) base 모델은 260512에 Cosmos-Predict2-2B로 확정됐고, 이 모델은 Wan과 다른 VAE(Cosmos VAE)로 latent를 인코딩한다. 만약 stitch layer의 최적값이 VAE 종류에 따라 달라진다면, Phase 4로 전환할 때 LGM connector를 처음부터 다시 탐색해야 한다 — 이 리스크를 사전에 확인하기 위해 동일한 24-task RoboCasa 데이터로 --vae_type cosmos 옵션을 켜고 stitch layer 탐색을 재실행했다.

기존 한계: Wan VAE 기준 결정(ℓ̂=2 aggregator, 260630)이 Cosmos VAE에서도 유효한지 검증된 바 없어, Phase 4 전환 시 connector 재설계 리스크가 잠재해 있었다.

2 작업 내용

기존 closed-form ridge regression 스크립트에 이미 있던 --vae_type {wan,cosmos} 옵션(default=wan)을 cosmos로 지정해 동일 24-task HDF5, 동일 클립 샘플링(max_clips=3, eval_clips=10, num_frames=32, ridge=1e-4)으로 재실행. aggregator/DINOv2 두 stitch 방식 각각에 대해 실행했다.

VAE_TYPE=cosmos bash scripts/find_stitch_layer_vggt.sh → experiments/stitch_search_vggt_cosmos/ VAE_TYPE=cosmos bash scripts/find_stitch_layer_vggt_dinov2.sh → experiments/stitch_search_vggt_dinov2_cosmos/ backbone: VGGT-Ω 1B 512 (facebook/VGGT-Omega, depth=24, embed_dim=1024) layers 탐색 범위: aggregator [2,4,...,20], DINOv2 [2,4,...,22] job: 31896/31897 (첫 실행, Jul1 08:0x KST) → 31941/31942 (재확인 실행, Jul1 09:4x KST)

왜 이 방식을 택했는가: 새 스크립트를 짜지 않고 기존 탐색 파이프라인의 VAE 스위치만 바꿔 실행 → Wan/Cosmos 결과를 같은 데이터·같은 회귀 방법으로 1:1 비교 가능.

3 결과 (수치)

Stitch 방식VAE 타깃Best layerMSE @ bestMSE 저하율
AggregatorWan (기존, 260630)20.00761
AggregatorCosmos (신규)20.00822+8.0%
DINOv2Wan (기존)40.08006
DINOv2Cosmos (신규)40.12246+53.0%

Layer별 MSE 곡선 형태

aggregator는 두 VAE 모두 layer 2에서 20까지 완만한 단조 증가(0.0076~0.0082 → 1.12~1.18)를 보인 반면, DINOv2는 layer 6 이후 기하급수적으로 폭증한다 — Cosmos 기준 layer 6=0.208, layer 14=4.61, layer 22=140.1 (초기 대비 1000배 이상). DINOv2 경로는 얕은 layer(2~6) 구간을 벗어나는 순간 Conv3d connector가 latent를 전혀 못 맞추는 것으로 보인다.

핵심 발견: stitch layer 선택(2/4) 자체는 VAE 종류에 무관하게 동일하게 나와, connector 아키텍처 재설계 없이 Phase 4로 넘어갈 수 있다는 근거가 확보됐다.
경고: DINOv2 stitch는 Wan→Cosmos 전환 시 회귀 오차가 aggregator보다 6배 더 크게 나빠졌고(+53% vs +8%), 절대값도 이미 10배 이상 나쁘다. closed-form MSE만 보면 Phase 4용으로는 aggregator가 명백히 안전한 선택이다.

4 Takeaway

의미

Phase 2→Phase 4 전환 시 LGM connector의 stitch layer를 처음부터 다시 찾을 필요는 없다는 것이 확인됐다 — 이는 Phase 4 착수 일정에서 불확실성 하나를 제거한다. 다만 같은 날 진행 중인 agg2 vs dino4 실전 학습 ablation(260702-vggt_omega_agg_vs_dino_ablation_progress.html)에서는 DINOv2가 Phase-B loss 기준 더 우세하게 나오고 있어, "closed-form MSE로는 aggregator가 안전하지만 실제 학습 loss로는 DINOv2가 더 잘 수렴한다"는 상충하는 신호가 동시에 존재한다. 이 모순은 두 지표(latent 재구성 오차 vs downstream geometry loss)가 서로 다른 것을 측정하기 때문일 가능성이 크며, Phase 4용 최종 stitch 방식 결정 전에 반드시 풀어야 할 질문이다.

5 Next Steps

미해결 한계

이 카드의 실험은 어디까지나 1시간짜리 closed-form ridge regression(회귀 오차)이고, 실제 diffusion latent 위에서의 학습 안정성/수렴 속도를 대변하지 않는다. DINOv2가 Cosmos VAE에서 MSE가 훨씬 나쁘다는 결과와, 현재 Wan VAE 기반 Phase-B 학습에서 DINOv2가 더 낮은 loss를 보이는 결과가 상충 — 어느 지표가 Phase 4 reward 품질과 더 상관관계가 높은지 아직 모른다.

다음 실험

(1) agg2/dino4 Phase-B 학습이 완주되면, 두 최종 체크포인트로 실제 RoboCasa held-out depth AbsRel을 측정해 closed-form MSE 순위와 학습 loss 순위 중 어느 쪽이 최종 geometry 품질과 더 잘 맞는지 확인. (2) Phase 4 착수 시점에 소규모(5K step) Cosmos VAE 파이프라인 파일럿으로 aggregator vs DINOv2를 다시 학습 비교 — VAE_TYPE 전환이 closed-form에서는 견고했지만 실제 diffusion 학습에서도 같은 결론인지 별도 검증 필요.