TL;DR
- DA3-v2 50K 완주: job 11869이 step 49500→50000 마무리 (Jun 13 05:28-08:04 KST). loss 0.07–0.20 (avg ≈ 0.12), 전 컴포넌트 안정.
- 3-track 최종: DA3-v2만 수렴. DA3-v1 발산(total_loss 35–49), Any4D DINOv2 race condition 크래시(47.8K에서 중단).
- Phase 4 ready: LGM Phase 2 사실상 종료. Cosmos-Predict2-2B base + DA3-v2 직접 reward path로 RL fine-tuning 즉시 착수 가능.
1 배경 / 목적
LGM Phase 2의 3-track ablation이 진행 중이었다. 세 트랙은 backbone 선택지와 loss 설계의 두 축을 동시에 비교했다:
- Any4D track: monocular 기반 backbone, pseudo-label 학습
- DA3-v1 track: Depth-Anything-3 LARGE backbone, 자체 설계 loss (depth + ray + pose)
- DA3-v2 track: DA3 backbone + paper § 3.2 loss 풀 구현 (L_D + L_M + L_P + L_C + L_grad)
Jun 12 (KST 기준)에 DA3-v1/Any4D가 각각 발산/크래시로 종료됐고, DA3-v2만 step 49.9K에서 수렴 상태로 남아있었다. job 11869은 Jun 13 KST 새벽에 마지막 500 steps(49500→50000)를 완주시켜 DA3-v2 학습을 공식 종료했다.
목적: DA3-v2 최종 수렴 확인 + 3-track 전체 ablation 결론 도출 → Phase 4 RL reward path 확정
2 작업 내용
Job 11869 — DA3-v2 마지막 500 steps
DA3-v2 학습 설정
backbone : DA3-LARGE (Depth-Anything-3, vitl)
stitch_layer: 6 (find_stitch_layer_da3.py 결과, MSE 0.0252)
conv3d_init : experiments/stitch_search_da3/conv3d_init_layer6.pt
LoRA : r=64, α=32 (DA3 backbone에 적용)
loss (v2) : L_D (depth, conf-weighted) + L_M (matching)
+ L_P (3D point consistency) + L_C (9-DoF camera)
+ L_grad (gradient regularization)
dataset : 24 sealed single-stage RoboCasa tasks
3000 demos × 24 = 72K clips, 216×384, depth GT
lr : 2e-4 | max_steps_b : 50000 | num_frames : 32
script : scripts/train_lgm_robocasa_da3_v0.sh (auto-resume)
3-track 비교 설정
| Track | Backbone | Loss | Exp dir |
| Any4D | Any4D monocular | pseudo-label | lgm_robocasa_v0_0511_0254 |
| DA3-v1 | DA3-LARGE | 자체 설계 (depth+ray+pose) | lgm_robocasa_da3_v0_lossv1_0511_0254 |
| DA3-v2 | DA3-LARGE | paper § 3.2 풀 구현 | lgm_robocasa_da3_v0_lossv2_0511_0254 |
3 결과
3-track 최종 결과 비교
| Track | 최종 상태 | Final Step | Final Loss | 판정 |
| DA3-v2 |
정상 완주 |
50,000 |
0.07–0.20 (avg 0.12) |
✅ 수렴 |
| DA3-v1 |
발산 완주 |
50,000 |
35–49 (total) |
❌ 발산 |
| Any4D |
크래시 중단 |
47,500 |
N/A |
💥 크래시 |
DA3-v2 최종 500 steps 손실 추이 (job 11869)
| Step | Total Loss | L_D (depth) | L_M (match) | L_P (3D pt) | L_C (cam) | L_grad |
| 49,500 | 0.1475 | 0.041 | 0.042 | 0.042 | 0.018 | 0.005 |
| 49,600 | 0.1134 | 0.032 | 0.035 | 0.027 | 0.015 | 0.004 |
| 49,700 | 0.1410 | 0.033 | 0.053 | 0.031 | 0.021 | 0.003 |
| 49,800 | 0.0820 | 0.025 | 0.022 | 0.021 | 0.009 | 0.004 |
| 49,950 | 0.0737 | 0.017 | 0.029 | 0.015 | 0.010 | 0.003 |
| 50,000 | Done (checkpoint saved) |
DA3-v2 수렴 확정: total loss 0.07–0.20 범위에서 안정 수렴. 최저 0.0737(step 49950), 전 컴포넌트 L_D≈0.017–0.074, L_P≈0.015–0.057로 정상 범위.
DA3-v1 발산 원인: rollout angle (ro) ≈ 60–130° 지속. 자체 설계 loss에 conf-weighted depth normalization이 없어 GT-side scale drift가 누적된 것으로 추정. v2에서 per-clip scale norm + L_C 9-DoF 보정이 이를 잡아줬다.
Any4D 크래시 원인: step 47,500에서 DINOv2 pretrain hub download race condition (OSError). 근본 원인은 multi-worker dataloader + hub lock 경합. 복구 미시도 (DA3-v2 수렴 이후 Any4D 우선순위 하락).
4 Takeaway
3-track ablation 결론
DA3 backbone + paper-aligned loss(v2)의 조합만 수렴했다. 이는 두 가지 설계 결정을 동시에 검증한다:
- cross-view attention 필수: Any4D(monocular)은 frame-level scale ambiguity를 해결하지 못해 pseudo-label 품질이 불안정했다. DA3의 cross-view attention encoder가 per-cam depth scale을 공통 기준으로 묶어준다.
- paper loss v2 설계의 유효성: L_D conf-weighting + L_C 9-DoF camera loss + GT-side scale norm이 없으면(DA3-v1 방식) rollout angle이 발산한다. 논문 §3.2의 전체 loss 조합이 필수.
Phase 4 의미: DA3-v2 체크포인트(phaseB_50000.pt 등)가 RL reward path의 backbone으로 확정됐다. LGM 단계를 우회하고 DA3-v2를 직접 decoded RGB 3-cam 입력 reward로 쓰는 경로가 plan에서 이미 선택됐으므로, Phase 2 완료 = Phase 4 즉시 착수 가능.
5 Next Steps
Phase 4 착수 — Flow-GRPO + DA3 reward 통합
Phase 4 계획서(claude/260510/plan-vggrpo_phase2_rl.md) 기준 Sub-plan #1부터 순서대로:
- Task 1: FF (FeedForward) submodule 구현 — flow-GRPO reward 브릿지
- Task 2: Cosmos-Predict2-2B base model 로드 및 LoRA r=32 세팅 확인 (ckpt: robocasa-MG30 iter 73.2K)
- Task 3: DA3-v2 reward function 래핑 — decoded RGB 3-cam (2×2 grid TL/TR/BL) 입력, geometry score 출력
- Task 4: flow-GRPO 학습 루프 통합 + xview reward weight ablation (0 / 0.5 / 1.0) × 알고리즘 (grpo / diffusionNFT) = 6 run
미해결 한계
- DA3-v2 depth 정량 평가 미수행: 50K 완주했지만 test split에서 depth RMSE / ABS-rel 미측정. RoboCasa validation set 구성 후 평가 필요.
- Any4D 복구 미시도: DINOv2 hub lock 수정 + step 47.5K resume 가능하나, DA3-v2 수렴으로 ablation 목적은 달성. RL reward path 비교 필요 시에만 재시도.
- Phase 4 reward path LGM 미포함: DA3-v2 직접 reward는 plan에서 이미 채택. LGM-based reward (paper 원본 경로)는 Phase 4 완료 후 bonus 실험으로 남아있음.