Index
2026-07-06 — Experiment

VGGT-Ω LGM Cosmos VAE 타깃 재학습 — aggregator vs DINOv2 stitch ablation 진행

VGGRPO | Phase 4 reward path 준비 — Wan VAE → Cosmos VAE 타깃 전환

TL;DR

35.9K
agg2 step /50K
28.2K
dino4 step /50K
3
preempt 취소
~40h
현재 run 경과

1 배경 / 목적

260701 design spec에서 Phase 4(paper Phase 2 = RL fine-tuning) 베이스 모델이 Wan2.2가 아니라 Cosmos-Predict2-2B robocasa-MG30 iter 73.2K로 최종 확정됐다. 이어서 260702 stitch layer 재탐색(cosmos_vae_stitch_search)에서 best layer는 Wan VAE와 동일 (aggregator=2, DINOv2=4)로 나왔지만, closed-form MSE degradation 폭이 aggregator +8% (0.0076→0.0082) vs DINOv2 +53%(0.080→0.122)로 DINOv2 stitch가 Cosmos VAE 타깃에서 훨씬 취약할 가능성이 제기됐다. 이 우려가 실제 Phase-B 50K step 학습 곡선에서도 재현되는지 확인하기 위해, 260629~703에서 진행했던 aggregator vs DINOv2 ablation(Wan VAE 타깃, DINOv2가 36% 낮은 loss로 우세 확정)을 Cosmos VAE 타깃으로 그대로 반복한다.

기존 한계: 260702 stitch layer 탐색은 closed-form ridge regression 기반 MSE 비교였고, 실제 gradient descent 학습 곡선에서 동일한 우열 관계가 나타나는지는 별도 검증이 필요했다. 또한 own QOS 큐 경쟁이 심해 학습이 자주 중단되는 문제가 이번 주 반복적으로 발생했다.

2 작업 내용

scripts/train_lgm_robocasa_vggt_v0.shVAE_TYPE=cosmos 플래그를 추가해 Wan VAE 대신 Cosmos VAE latent를 supervision target으로 사용하도록 전환. 나머지 설정(STITCH_TYPE={aggregator,dino}, NUM_FRAMES=8, MAX_STEPS=50000, 4-GPU DDP)은 기존 Wan-VAE ablation과 동일하게 유지해 VAE 타깃만 통제된 변수로 비교한다.

MAX_STEPS=50000 STITCH_TYPE=aggregator NUM_FRAMES=8 VAE_TYPE=cosmos \ bash scripts/train_lgm_robocasa_vggt_v0.sh # TAG=agg2 MAX_STEPS=50000 STITCH_TYPE=dino NUM_FRAMES=8 VAE_TYPE=cosmos \ bash scripts/train_lgm_robocasa_vggt_v0.sh # TAG=dino4 sbatch --gres=gpu:4 -c 32 --mem 800GB --qos=own|extra ...

제출/재시작 타임라인 (own QOS 경쟁으로 반복 preemption):

JobStitch제출(UTC)결과비고
33086aggregator07/03 16:33COMPLETED (36min)step 49500→50000 완주 (이전 run 마무리)
33088dino07/03CANCELLED (0s)즉시 취소
33097dino07/03 16:26CANCELLED (2h44m)SIGTERM, step ~41.6K에서 중단
33146dino07/03 19:13CANCELLED (1d3h31m)재시작 후 재차 preemption
33147aggregator07/03 19:14CANCELLED (1d3h30m)재시작 후 재차 preemption
33528dino07/04 22:45(KST)RUNNINGcosmos_dino4_0704_1346, step 0부터 새 run
33529aggregator07/04 22:45(KST)RUNNINGcosmos_agg2_0704_1346, step 0부터 새 run

33146/33147 취소 이후에는 체크포인트에서 이어받지 않고 step 0부터 새 run 태그로 재시작했다 — 자동 self-requeue/checkpoint-resume 로직이 아직 없어 preemption마다 진행분이 소실되고 있다.

3 결과

확인 시점(2026-07-06 09:39 KST, 현재 run 기준 경과 약 1d 10h53m) 기준 진행 상황:

StitchStep진행률최근 loss 범위Notes
aggregator (ℓ=2)35,950 / 50,00071.9%0.65 ~ 2.40동일 자원에서 처리량 우위 지속
DINOv2 (ℓ=4)28,250 / 50,00056.5%0.35 ~ 3.08step-to-step 진동 폭 더 큼
패턴 재현: Cosmos VAE 타깃에서도 aggregator가 동일 시간(둘 다 07/04 13:45 UTC 시작, 동일 GPU) 대비 더 많은 step을 처리 — 260702/703 카드에서 확인된 "DINOv2가 처리량 22% 느림" 패턴이 Cosmos VAE 타깃에서도 재현된다.
아직 결론 불가: 두 run이 서로 다른 step(35.9K vs 28.2K)에 있어 matched-step loss 비교는 아직 불가능하다. 260702 stitch search에서 우려했던 "Cosmos VAE에서 DINOv2가 더 취약(MSE degradation +53% vs aggregator +8%)"이 실제 학습 loss 곡선에서 재현되는지는 두 run 모두 50K에 도달해야 matched-step 비교로 확정 가능.
Preemption 손실: 07/03 최초 제출분(33097 dino: step ~41.6K까지 진행, 33146/33147: 1일 3시간 이상 학습)이 own QOS 경쟁으로 3회 CANCELLED되며 전부 소실 — 체크포인트 재사용 없이 07/04 처음부터 재시작. 실질 wall-clock 낭비가 최소 2GPU-day 이상 추정된다.

4 Takeaway

의미

Phase4 reward backbone(VGGT-Ω, 260629 확정)과 base 모델(Cosmos-Predict2, 260701 확정) 결정 이후, LGM Phase-B 학습 자체도 supervision target을 Cosmos VAE로 맞추는 작업이 반드시 필요함이 재확인됐다. 동시에 own QOS 큐에서의 잦은 preemption이 이번 실험의 실질적 병목으로 드러났다 — 3일치 학습 로그 중 SLURM 인프라 이슈(preemption 3회)가 실험 진행 자체보다 더 큰 시간 손실을 유발했다.

5 Next Steps

미해결 한계

두 run 모두 50K step 미완료 상태라 Cosmos VAE 타깃에서 aggregator vs DINOv2의 최종 우열이 아직 확정되지 않았다. 또한 preemption마다 체크포인트 없이 재시작하는 구조라 향후에도 동일한 손실이 반복될 위험이 있다.

다음 실험

(1) 두 run이 50K에 도달하면 matched-step(예: 28K 시점) loss 비교로 260702의 우려(DINOv2가 Cosmos VAE에서 더 취약)가 실제 학습에서도 재현되는지 검증. (2) SIGTERM trap + sbatch self-resubmit 패턴 도입해 preemption 시 진행분 보존 (§ preemption 5분 grace 활용). (3) 최종 stitch 방식 확정 후 Phase 4 direct-RGB reward path(VGGT-Ω 3-cam → geometry → 4D reward) 구현에 반영.