Index
2026-07-10 — Analysis

VGGT-Ω LGM 4-way Ablation 결과 정리 — dino4 stitch 우세 확정

VGGRPO | Phase 2 LGM 구축 — VGGT-Ω backbone × {Wan, Cosmos} VAE × {aggregator, DINOv2} stitch

TL;DR

1.03
Wan dino4 loss
0.92
Cosmos-nonorm dino4
4
Runs 비교
2
신규 job 착수

1 배경 / 목적

260624 off-the-shelf backbone eval에서 VGGT-Ω가 4-way 중 전 metric 1위(AbsRel 0.296)를 기록해 LGM backbone으로 채택된 이후(260629~), aggregator stitch(layer 2) vs DINOv2 stitch(layer 4) 두 축과 Wan VAE vs Cosmos-Predict2 VAE 두 축을 곱한 2×2 = 4-way ablation을 진행해왔다. 260703 카드에서 Wan 축의 matched-step(~34K) 중간 비교로 dino4 우세를 잠정 확인했고, 260706 카드에서 Cosmos VAE 축 학습(aggregator step 35.9K, DINOv2 step 28.2K)이 진행 중이라고 보고했었다.

이번 세션(260709)에서 그 Cosmos 축 학습이 완주/근접 완주되어 4개 run 전체의 최종 수치를 취합했고, 동시에 Cosmos 결과의 신뢰도를 깎는 두 가지 기존 버그(fp16 depth quantization, latent 미정규화)가 재확인되어 재학습을 새로 시작했다.

기존 한계: 260706 시점까지 Cosmos 축은 "진행 중" 상태로만 보고됐고, Wan과의 정량 비교(final loss, depth reg)가 없었다. 또한 depth HDF5가 float16으로 저장되어 OpenGL z-buffer 0.99 근방에서 계단식 오차(~0.4m)가 발생하는 버그와, Cosmos latent 채널10 std가 나머지 대비 30~60배 큰 미정규화 문제(260708-260709 카드에서 진단)가 이 Cosmos-nonorm 결과에 그대로 반영돼 있어 결과 해석에 주의가 필요했다.

2 작업 내용

4개 run(Wan agg2, Wan dino4, Cosmos-nonorm agg2, Cosmos-nonorm dino4)의 train_log.csv 최근 500 step 평균(Wan) 및 각 run 종료 시점 값(Cosmos-nonorm)을 취합해 하나의 표로 정리했다. Cosmos-nonorm agg2는 사용자 fp32 재전처리 결정에 따라 91%(step 45500/50000)에서 조기 종료, dino4는 정상 완주.

비교 대상 exp dir: - lgm_robocasa_vggt_v0_agg2_0630_0839/ (Wan agg2, 완주) - lgm_robocasa_vggt_v0_dino4_0630_0843/ (Wan dino4, 완주) - lgm_robocasa_vggt_v0_cosmos_agg2_0704_1346_nonorm_fp16depth/ (91% 완료, step 45500) - lgm_robocasa_vggt_v0_cosmos_dino4_0704_1346_nonorm_fp16depth/ (완주)

취합 직후, 결과가 fp16 depth quantization + latent 미정규화 두 confound를 안고 있다는 점(260708-260709 진단)을 근거로 Cosmos-nonorm 4개 run 전체를 _nonorm_fp16depth suffix로 백업 처리하고, fp32 재전처리 + latent normalization + 정규화된 입력 분포 기준 재산출된 Conv3d init을 적용한 새 학습을 착수했다 (job 37233 dino4, job 37399 agg2).

3 결과

RunVAEStitch최종 LossDepth reg (L_reg)상태
Wan agg2Wan 2.1aggregator L21.7012.9cm완주(50K)
Wan dino4Wan 2.1DINOv2 L41.039.3cm완주(50K)
Cosmos-nonorm agg2Cosmos-Predict2aggregator L2~1.75~15.8cm91%(45.5K/50K)
Cosmos-nonorm dino4Cosmos-Predict2DINOv2 L40.929.7cm완주(50K)
핵심 발견: DINOv2 stitch(dino4)가 VAE 종류와 무관하게 aggregator stitch(agg2) 대비 depth/pose 모든 metric에서 일관 우세 — Wan에서 loss 39% 낮음(1.03 vs 1.70), Cosmos-nonorm에서도 47% 낮음(0.92 vs ~1.75). 260703 matched-step 중간 비교(dino4 1.00 < agg2 1.56, ~34K step)와 방향이 동일해 최종 완주 시점에도 재확인됨.
주의: Cosmos-nonorm dino4(0.92)가 Wan dino4(1.03)보다 수치상 낮지만, 이 비교는 신뢰할 수 없다 — Cosmos-nonorm은 fp16 depth 계단식 오차와 latent 채널10 압도(std 60.7×) 두 버그를 그대로 안고 학습됐고, 두 버그 모두 loss를 어느 방향으로 왜곡하는지 사전에 알 수 없다. VAE 자체의 우열은 fp32+norm 재학습(37233/37399) 완주 전까지 판단 보류.

4 Takeaway

의미

Stitch 선택(dino4 vs agg2)은 VAE choice와 독립적으로 결정 가능한 축임이 확정됐다 — 4개 run 전부에서 dino4가 이겼으므로, LGM connector 아키텍처 결정으로 DINOv2 stitch를 확정하고 향후 ablation은 VAE 축(Wan vs Cosmos-norm)에만 집중하면 된다. 이는 실험 설계를 2×2에서 사실상 1×2로 줄여, 남은 GPU 예산을 VAE 비교의 신뢰도(fp32+norm 재현성)에 집중할 수 있게 한다.

동시에 이번 취합은 "완주된 숫자가 곧 신뢰 가능한 숫자는 아니다"라는 교훈을 남겼다 — Cosmos-nonorm 4개 run은 모두 정상 종료됐지만 알려진 두 버그 때문에 폐기 대상이 됐다. 향후 ablation 결과를 보고할 때는 known confound 목록을 항상 명시해야 한다.

5 Next Steps

미해결 한계

fp32+norm 재학습(37233/37399)은 아직 step 3300~3500(50K 중 ~7%)로 초기 단계 — 현재 시점에서 Cosmos VAE의 진짜 성능은 알 수 없다. 또한 Wan 축은 여전히 fp16 depth로 학습된 결과라, Cosmos-norm과 apples-to-apples 비교하려면 Wan도 fp32로 재학습할지 결정이 필요하다(현재 미결).

다음 실험

~2일 후 job 37233/37399 완주 예상. 완주 시 {Wan(fp16), Cosmos-norm(fp32)} × {agg2, dino4} 최종 비교표 재작성, Cosmos-nonorm 축은 참고용으로만 유지. Wan fp32 재학습 여부는 이 비교 결과를 보고 결정 (Cosmos-norm이 Wan 대비 명확히 우세하면 재학습 없이 Cosmos-norm dino4로 LGM Phase 2 확정, 애매하면 Wan fp32 재학습으로 confound 제거 후 재비교).