260624 off-the-shelf backbone eval에서 VGGT-Ω가 4-way 중 전 metric 1위(AbsRel 0.296)를 기록해 LGM backbone으로 채택된 이후(260629~), aggregator stitch(layer 2) vs DINOv2 stitch(layer 4) 두 축과 Wan VAE vs Cosmos-Predict2 VAE 두 축을 곱한 2×2 = 4-way ablation을 진행해왔다. 260703 카드에서 Wan 축의 matched-step(~34K) 중간 비교로 dino4 우세를 잠정 확인했고, 260706 카드에서 Cosmos VAE 축 학습(aggregator step 35.9K, DINOv2 step 28.2K)이 진행 중이라고 보고했었다.
이번 세션(260709)에서 그 Cosmos 축 학습이 완주/근접 완주되어 4개 run 전체의 최종 수치를 취합했고, 동시에 Cosmos 결과의 신뢰도를 깎는 두 가지 기존 버그(fp16 depth quantization, latent 미정규화)가 재확인되어 재학습을 새로 시작했다.
4개 run(Wan agg2, Wan dino4, Cosmos-nonorm agg2, Cosmos-nonorm dino4)의 train_log.csv 최근 500 step 평균(Wan) 및 각 run 종료 시점 값(Cosmos-nonorm)을 취합해 하나의 표로 정리했다. Cosmos-nonorm agg2는 사용자 fp32 재전처리 결정에 따라 91%(step 45500/50000)에서 조기 종료, dino4는 정상 완주.
취합 직후, 결과가 fp16 depth quantization + latent 미정규화 두 confound를 안고 있다는 점(260708-260709 진단)을 근거로 Cosmos-nonorm 4개 run 전체를 _nonorm_fp16depth suffix로 백업 처리하고, fp32 재전처리 + latent normalization + 정규화된 입력 분포 기준 재산출된 Conv3d init을 적용한 새 학습을 착수했다 (job 37233 dino4, job 37399 agg2).
| Run | VAE | Stitch | 최종 Loss | Depth reg (L_reg) | 상태 |
|---|---|---|---|---|---|
| Wan agg2 | Wan 2.1 | aggregator L2 | 1.70 | 12.9cm | 완주(50K) |
| Wan dino4 | Wan 2.1 | DINOv2 L4 | 1.03 | 9.3cm | 완주(50K) |
| Cosmos-nonorm agg2 | Cosmos-Predict2 | aggregator L2 | ~1.75 | ~15.8cm | 91%(45.5K/50K) |
| Cosmos-nonorm dino4 | Cosmos-Predict2 | DINOv2 L4 | 0.92 | 9.7cm | 완주(50K) |
Stitch 선택(dino4 vs agg2)은 VAE choice와 독립적으로 결정 가능한 축임이 확정됐다 — 4개 run 전부에서 dino4가 이겼으므로, LGM connector 아키텍처 결정으로 DINOv2 stitch를 확정하고 향후 ablation은 VAE 축(Wan vs Cosmos-norm)에만 집중하면 된다. 이는 실험 설계를 2×2에서 사실상 1×2로 줄여, 남은 GPU 예산을 VAE 비교의 신뢰도(fp32+norm 재현성)에 집중할 수 있게 한다.
동시에 이번 취합은 "완주된 숫자가 곧 신뢰 가능한 숫자는 아니다"라는 교훈을 남겼다 — Cosmos-nonorm 4개 run은 모두 정상 종료됐지만 알려진 두 버그 때문에 폐기 대상이 됐다. 향후 ablation 결과를 보고할 때는 known confound 목록을 항상 명시해야 한다.
fp32+norm 재학습(37233/37399)은 아직 step 3300~3500(50K 중 ~7%)로 초기 단계 — 현재 시점에서 Cosmos VAE의 진짜 성능은 알 수 없다. 또한 Wan 축은 여전히 fp16 depth로 학습된 결과라, Cosmos-norm과 apples-to-apples 비교하려면 Wan도 fp32로 재학습할지 결정이 필요하다(현재 미결).
~2일 후 job 37233/37399 완주 예상. 완주 시 {Wan(fp16), Cosmos-norm(fp32)} × {agg2, dino4} 최종 비교표 재작성, Cosmos-nonorm 축은 참고용으로만 유지. Wan fp32 재학습 여부는 이 비교 결과를 보고 결정 (Cosmos-norm이 Wan 대비 명확히 우세하면 재학습 없이 Cosmos-norm dino4로 LGM Phase 2 확정, 애매하면 Wan fp32 재학습으로 confound 제거 후 재비교).