260702 카드(260702-vggt_omega_agg_vs_dino_ablation_progress.html)에서 VGGT-Ω LGM Phase-B 50K-step 학습을 aggregator(ℓ̂=2) vs DINOv2(ℓ̂=4) 두 stitch 경로로 ablation 중이었다. 당시 agg2 step 18.8K / dino4 step 14.5K로 서로 다른 step에 있어 "dino4가 더 빠르고 낮게 수렴한다"는 관찰이 있었지만, 두 run이 같은 step에 도달했을 때 재비교해야 진짜 우열이 확정된다는 한계를 그 카드의 Next Steps에 명시했다. 이번 관찰 시점에 agg2가 step 43,488까지 진행하면서 dino4의 현재 step(33,963)을 이미 지나쳤으므로, agg2 로그에서 같은 step 구간(33,800~34,100)을 추출해 dino4의 최근 200-step 평균과 실제 matched-step 비교가 처음으로 가능해졌다.
새로운 코드 변경 없음 — job 31943(agg2, node n10)/31944(dino4, node n67)를 extra QOS로 계속 RUNNING 상태 유지하며 train_log.csv·slurms/*.out을 관찰. 260702 보고 이후 선점(preempt) 이벤트가 한 번도 발생하지 않아 두 잡 모두 2026-07-01 18:42:25/18:42:55에 시작한 이후 지금(2026-07-03 09:40 기준)까지 1일 14시간 58분 연속 RUNNING이다 — 이전까지 관측된 4회 이상 preempt-resume 체인(31199/31200 → 31768/31769 → 31796/31797 → 31943/31944)과 달리 이번엔 안정적으로 지속됨.
matched-step 비교는 agg2 로그에서 dino4가 현재 위치한 step 구간만 슬라이스해 두 run의 loss/L_depth/L_cam을 나란히 놓는 방식으로, 별도 실험 실행 없이 기존 로그만으로 계산했다.
| Config | 현재 Step | Loss (최근 200 avg) | L_depth | L_cam | Steps/h (실측) | ETA (50K까지) |
|---|---|---|---|---|---|---|
| agg2 (aggregator ℓ=2) | 43,488 / 50,000 (87.0%) | 1.32 | 0.032 | 0.0052 | ≈1035 | ≈6.3h |
| dino4 (DINOv2 ℓ=4) | 33,963 / 50,000 (67.9%) | 1.00 | 0.039 | 0.0029 | ≈816 | ≈19.7h |
| Config | Step 구간 | Loss (구간 평균) | L_depth | L_cam | dino4 대비 |
|---|---|---|---|---|---|
| dino4 (DINOv2 ℓ=4) | 33,764–33,963 (최종) | 1.00 | 0.039 | 0.0029 | baseline |
| agg2 (aggregator ℓ=2) | 33,800–34,100 | 1.56 | 0.031 | 0.0062 | +56% (36%↓ if dino4 wins) |
260702 보고 시점엔 두 run이 서로 다른 step에 있어 "dino4가 더 낫다"는 관찰에 apples-to-apples 캐비어트가 붙어 있었다. 이번 matched-step(~34K) 재계산으로 그 캐비어트가 해소됐고, DINOv2 stitch 경로가 aggregator 경로보다 downstream Phase-B loss(특히 loss·L_cam)에서 실제로 우세하다는 것이 step 통제 하에 재확인됐다. 이는 260630 closed-form stitch search에서 aggregator(MSE 0.0076)가 DINOv2(MSE 0.080)보다 latent 재구성 오차가 10배 낮았던 것과는 여전히 정반대 방향 — "재구성 오차가 낮다"와 "실제 geometry loss가 잘 학습된다"가 다른 지표라는 260702의 결론이 한 번 더 뒷받침됐다. 동시에 260702-cosmos_vae_stitch_search 카드에서 Cosmos VAE 타깃 기준 DINOv2가 aggregator보다 훨씬 취약(+53% vs +8% MSE 저하)하다고 나온 것과는 여전히 상충 — Wan VAE 기반 이 실험의 결론을 Cosmos VAE 기반 Phase 4로 그대로 이전할 수 없다는 근거가 강화됐다.
50K 완주 시점의 최종 비교가 아직 없다 — agg2는 ~6.3h, dino4는 ~19.7h 후 완주 예정이라 최종 확정까지는 dino4 완주를 기다려야 한다. 또한 L_depth 단독으로는 agg2가 근소 우세라 "dino4가 전 지표 우세"는 과장이며, 종합 loss·L_cam 기준의 우세로 한정해야 한다.
(1) agg2 완주(~6.3h 후, step 50K) 후 즉시 job 스케줄 확인 — extra QOS로 GPU 반납되면 다음 실험(Cosmos VAE pilot 등) 우선 배정 검토. (2) dino4 완주(~19.7h 후)까지 대기 후 두 run의 최종 50K 지점 loss·L_depth·L_cam·L_grad 종합 비교로 stitch 경로 최종 결정. (3) 최종 결정과 무관하게, Cosmos VAE stitch 재탐색 결과(DINOv2 취약)와 상충하므로 Phase 4 Cosmos-Predict2 파일럿에서는 두 stitch 경로 모두 소규모 재검증 필요 — Wan VAE 결론을 그대로 채택하지 말 것.