Index
2026-06-13 (KST) — Analysis

DA3-v2 50K 완주 확정 — 3-track 최종 비교 및 Phase 4 착수 준비

VGGRPO | LGM Phase 2 종료 · job 11869 · 4 GPU · 2h 36m

TL;DR

50K
DA3-v2 Steps
0.12
Avg Final Loss
24
RoboCasa Tasks
2
Tracks Failed

1 배경 / 목적

LGM Phase 2의 3-track ablation이 진행 중이었다. 세 트랙은 backbone 선택지와 loss 설계의 두 축을 동시에 비교했다:

Jun 12 (KST 기준)에 DA3-v1/Any4D가 각각 발산/크래시로 종료됐고, DA3-v2만 step 49.9K에서 수렴 상태로 남아있었다. job 11869은 Jun 13 KST 새벽에 마지막 500 steps(49500→50000)를 완주시켜 DA3-v2 학습을 공식 종료했다.

목적: DA3-v2 최종 수렴 확인 + 3-track 전체 ablation 결론 도출 → Phase 4 RL reward path 확정

2 작업 내용

Job 11869 — DA3-v2 마지막 500 steps

SLURM Job
11869
Start (KST)
Jun 13 05:28
End (KST)
Jun 13 08:04
Elapsed
2h 35m 58s
GPUs
4 × B200
Resume from
step 49500

DA3-v2 학습 설정

backbone : DA3-LARGE (Depth-Anything-3, vitl) stitch_layer: 6 (find_stitch_layer_da3.py 결과, MSE 0.0252) conv3d_init : experiments/stitch_search_da3/conv3d_init_layer6.pt LoRA : r=64, α=32 (DA3 backbone에 적용) loss (v2) : L_D (depth, conf-weighted) + L_M (matching) + L_P (3D point consistency) + L_C (9-DoF camera) + L_grad (gradient regularization) dataset : 24 sealed single-stage RoboCasa tasks 3000 demos × 24 = 72K clips, 216×384, depth GT lr : 2e-4 | max_steps_b : 50000 | num_frames : 32 script : scripts/train_lgm_robocasa_da3_v0.sh (auto-resume)

3-track 비교 설정

TrackBackboneLossExp dir
Any4DAny4D monocularpseudo-labellgm_robocasa_v0_0511_0254
DA3-v1DA3-LARGE자체 설계 (depth+ray+pose)lgm_robocasa_da3_v0_lossv1_0511_0254
DA3-v2DA3-LARGEpaper § 3.2 풀 구현lgm_robocasa_da3_v0_lossv2_0511_0254

3 결과

3-track 최종 결과 비교

Track최종 상태Final StepFinal Loss판정
DA3-v2 정상 완주 50,000 0.07–0.20 (avg 0.12) ✅ 수렴
DA3-v1 발산 완주 50,000 35–49 (total) ❌ 발산
Any4D 크래시 중단 47,500 N/A 💥 크래시

DA3-v2 최종 500 steps 손실 추이 (job 11869)

StepTotal LossL_D (depth)L_M (match)L_P (3D pt)L_C (cam)L_grad
49,5000.14750.0410.0420.0420.0180.005
49,6000.11340.0320.0350.0270.0150.004
49,7000.14100.0330.0530.0310.0210.003
49,8000.08200.0250.0220.0210.0090.004
49,9500.07370.0170.0290.0150.0100.003
50,000Done (checkpoint saved)
DA3-v2 수렴 확정: total loss 0.07–0.20 범위에서 안정 수렴. 최저 0.0737(step 49950), 전 컴포넌트 L_D≈0.017–0.074, L_P≈0.015–0.057로 정상 범위.
DA3-v1 발산 원인: rollout angle (ro) ≈ 60–130° 지속. 자체 설계 loss에 conf-weighted depth normalization이 없어 GT-side scale drift가 누적된 것으로 추정. v2에서 per-clip scale norm + L_C 9-DoF 보정이 이를 잡아줬다.
Any4D 크래시 원인: step 47,500에서 DINOv2 pretrain hub download race condition (OSError). 근본 원인은 multi-worker dataloader + hub lock 경합. 복구 미시도 (DA3-v2 수렴 이후 Any4D 우선순위 하락).

4 Takeaway

3-track ablation 결론

DA3 backbone + paper-aligned loss(v2)의 조합만 수렴했다. 이는 두 가지 설계 결정을 동시에 검증한다:

  • cross-view attention 필수: Any4D(monocular)은 frame-level scale ambiguity를 해결하지 못해 pseudo-label 품질이 불안정했다. DA3의 cross-view attention encoder가 per-cam depth scale을 공통 기준으로 묶어준다.
  • paper loss v2 설계의 유효성: L_D conf-weighting + L_C 9-DoF camera loss + GT-side scale norm이 없으면(DA3-v1 방식) rollout angle이 발산한다. 논문 §3.2의 전체 loss 조합이 필수.
Phase 4 의미: DA3-v2 체크포인트(phaseB_50000.pt 등)가 RL reward path의 backbone으로 확정됐다. LGM 단계를 우회하고 DA3-v2를 직접 decoded RGB 3-cam 입력 reward로 쓰는 경로가 plan에서 이미 선택됐으므로, Phase 2 완료 = Phase 4 즉시 착수 가능.

5 Next Steps

Phase 4 착수 — Flow-GRPO + DA3 reward 통합

Phase 4 계획서(claude/260510/plan-vggrpo_phase2_rl.md) 기준 Sub-plan #1부터 순서대로:

  • Task 1: FF (FeedForward) submodule 구현 — flow-GRPO reward 브릿지
  • Task 2: Cosmos-Predict2-2B base model 로드 및 LoRA r=32 세팅 확인 (ckpt: robocasa-MG30 iter 73.2K)
  • Task 3: DA3-v2 reward function 래핑 — decoded RGB 3-cam (2×2 grid TL/TR/BL) 입력, geometry score 출력
  • Task 4: flow-GRPO 학습 루프 통합 + xview reward weight ablation (0 / 0.5 / 1.0) × 알고리즘 (grpo / diffusionNFT) = 6 run

미해결 한계

  • DA3-v2 depth 정량 평가 미수행: 50K 완주했지만 test split에서 depth RMSE / ABS-rel 미측정. RoboCasa validation set 구성 후 평가 필요.
  • Any4D 복구 미시도: DINOv2 hub lock 수정 + step 47.5K resume 가능하나, DA3-v2 수렴으로 ablation 목적은 달성. RL reward path 비교 필요 시에만 재시도.
  • Phase 4 reward path LGM 미포함: DA3-v2 직접 reward는 plan에서 이미 채택. LGM-based reward (paper 원본 경로)는 Phase 4 완료 후 bonus 실험으로 남아있음.