Index
2026-07-03 — Experiment

VGGT-Ω LGM Phase-B 학습: aggregator(ℓ=2) vs DINOv2(ℓ=4) — 동일 step matched 비교로 우열 확정

VGGRPO | RoboCasa 24-task, 4-GPU DDP, job 31943/31944 (39h 연속 RUNNING, preempt 없음)

TL;DR

43,488
agg2 step (87%)
33,963
dino4 step (68%)
1.56 / 1.00
matched-step loss (agg/dino @34K)
39h
무선점 연속 실행

1 배경 / 목적

260702 카드(260702-vggt_omega_agg_vs_dino_ablation_progress.html)에서 VGGT-Ω LGM Phase-B 50K-step 학습을 aggregator(ℓ̂=2) vs DINOv2(ℓ̂=4) 두 stitch 경로로 ablation 중이었다. 당시 agg2 step 18.8K / dino4 step 14.5K로 서로 다른 step에 있어 "dino4가 더 빠르고 낮게 수렴한다"는 관찰이 있었지만, 두 run이 같은 step에 도달했을 때 재비교해야 진짜 우열이 확정된다는 한계를 그 카드의 Next Steps에 명시했다. 이번 관찰 시점에 agg2가 step 43,488까지 진행하면서 dino4의 현재 step(33,963)을 이미 지나쳤으므로, agg2 로그에서 같은 step 구간(33,800~34,100)을 추출해 dino4의 최근 200-step 평균과 실제 matched-step 비교가 처음으로 가능해졌다.

기존 한계: 260702 시점엔 "다른 step 수라 완전한 apples-to-apples 비교는 아니다"라는 caveat이 있었음.

2 작업 내용

새로운 코드 변경 없음 — job 31943(agg2, node n10)/31944(dino4, node n67)를 extra QOS로 계속 RUNNING 상태 유지하며 train_log.csv·slurms/*.out을 관찰. 260702 보고 이후 선점(preempt) 이벤트가 한 번도 발생하지 않아 두 잡 모두 2026-07-01 18:42:25/18:42:55에 시작한 이후 지금(2026-07-03 09:40 기준)까지 1일 14시간 58분 연속 RUNNING이다 — 이전까지 관측된 4회 이상 preempt-resume 체인(31199/31200 → 31768/31769 → 31796/31797 → 31943/31944)과 달리 이번엔 안정적으로 지속됨.

# 260702 09:50 스냅샷 → 260703 09:40 스냅샷, 실측 처리량 agg2: step 18,823 → 43,488 (Δ24,665 / 23.83h ≈ 1035 step/h) dino4: step 14,516 → 33,963 (Δ19,447 / 23.83h ≈ 816 step/h) # matched-step 비교용 window 추출 agg2 step [33800,34100] (n=301) 평균 ← dino4 최종 step(33963)과 동일 구간 dino4 최근 200-step 평균 (step ~33,764-33,963)

matched-step 비교는 agg2 로그에서 dino4가 현재 위치한 step 구간만 슬라이스해 두 run의 loss/L_depth/L_cam을 나란히 놓는 방식으로, 별도 실험 실행 없이 기존 로그만으로 계산했다.

3 결과 (수치)

Config현재 StepLoss (최근 200 avg)L_depthL_camSteps/h (실측)ETA (50K까지)
agg2 (aggregator ℓ=2)43,488 / 50,000 (87.0%)1.320.0320.0052≈1035≈6.3h
dino4 (DINOv2 ℓ=4)33,963 / 50,000 (67.9%)1.000.0390.0029≈816≈19.7h

Matched-step 비교 (~step 34K, 260702 미해결 항목 해소)

ConfigStep 구간Loss (구간 평균)L_depthL_camdino4 대비
dino4 (DINOv2 ℓ=4)33,764–33,963 (최종)1.000.0390.0029baseline
agg2 (aggregator ℓ=2)33,800–34,1001.560.0310.0062+56% (36%↓ if dino4 wins)
핵심 발견: 같은 step 구간(~34K)에서 직접 비교한 결과 dino4 loss 1.00이 agg2 1.56보다 36% 낮다 — L_cam도 dino4가 절반 이하(0.0029 vs 0.0062)로 낮아, 260702에 관찰됐던 dino4 우위가 step 수 차이에 의한 착시가 아니라 실제 격차임을 확인했다. 다만 L_depth는 agg2가 근소하게 낮아(0.031 vs 0.039) 완전히 모든 지표에서 dino4가 이긴 것은 아니다.
주의: agg2는 이미 50K의 87%까지 진행해 목표 완주(~6.3h 후)에 훨씬 가깝고, dino4는 처리량이 21% 낮아 완주까지 ~19.7h 더 필요하다. 최종 50K 완주 시점의 절대 비교는 아직 확정 아님 — 지금까지의 추세(dino4가 step당 손실 하락 더 가파름)가 후반부까지 유지되는지는 별도 확인 필요.

4 Takeaway

의미

260702 보고 시점엔 두 run이 서로 다른 step에 있어 "dino4가 더 낫다"는 관찰에 apples-to-apples 캐비어트가 붙어 있었다. 이번 matched-step(~34K) 재계산으로 그 캐비어트가 해소됐고, DINOv2 stitch 경로가 aggregator 경로보다 downstream Phase-B loss(특히 loss·L_cam)에서 실제로 우세하다는 것이 step 통제 하에 재확인됐다. 이는 260630 closed-form stitch search에서 aggregator(MSE 0.0076)가 DINOv2(MSE 0.080)보다 latent 재구성 오차가 10배 낮았던 것과는 여전히 정반대 방향 — "재구성 오차가 낮다"와 "실제 geometry loss가 잘 학습된다"가 다른 지표라는 260702의 결론이 한 번 더 뒷받침됐다. 동시에 260702-cosmos_vae_stitch_search 카드에서 Cosmos VAE 타깃 기준 DINOv2가 aggregator보다 훨씬 취약(+53% vs +8% MSE 저하)하다고 나온 것과는 여전히 상충 — Wan VAE 기반 이 실험의 결론을 Cosmos VAE 기반 Phase 4로 그대로 이전할 수 없다는 근거가 강화됐다.

5 Next Steps

미해결 한계

50K 완주 시점의 최종 비교가 아직 없다 — agg2는 ~6.3h, dino4는 ~19.7h 후 완주 예정이라 최종 확정까지는 dino4 완주를 기다려야 한다. 또한 L_depth 단독으로는 agg2가 근소 우세라 "dino4가 전 지표 우세"는 과장이며, 종합 loss·L_cam 기준의 우세로 한정해야 한다.

다음 실험

(1) agg2 완주(~6.3h 후, step 50K) 후 즉시 job 스케줄 확인 — extra QOS로 GPU 반납되면 다음 실험(Cosmos VAE pilot 등) 우선 배정 검토. (2) dino4 완주(~19.7h 후)까지 대기 후 두 run의 최종 50K 지점 loss·L_depth·L_cam·L_grad 종합 비교로 stitch 경로 최종 결정. (3) 최종 결정과 무관하게, Cosmos VAE stitch 재탐색 결과(DINOv2 취약)와 상충하므로 Phase 4 Cosmos-Predict2 파일럿에서는 두 stitch 경로 모두 소규모 재검증 필요 — Wan VAE 결론을 그대로 채택하지 말 것.