전날(260507) 카드에서 3-track 중간 수렴을 분석한 결과: DA3-v2 sigmoid loss 0.135 최저, Any4D 0.250으로 plateau 진입 의심, DA3-v1 1.156(ray_origin 2.19 지배)이었다. 이후 추가 학습이 진행되어 오늘(260508) 09:42 기준 현황을 업데이트한다.
세 트랙은 동일한 sealed RoboCasa 3000 demos (∞ depth 제거 전처리 완료)로 학습 중이며, 모두 4 GPU DDP / core-on-sub 파티션에서 preemption 자동 재시작으로 운영 중이다.
이번 분석의 목적은 ① Any4D plateau 확정 여부, ② DA3-v2 지속 개선 여부, ③ DA3-v1 ray_origin 문제 완화 여부를 확인하는 것이다.
이전 기준점 (260507 카드): Any4D step 8605 loss 0.250 / DA3-v1 step 6389 loss 1.156 / DA3-v2 step 5750 loss 0.135
SLURM 실시간 로그(slurms/taewoongkang_13352.out, 15218.out, 15219.out)를 읽어 각 트랙의 현재 step 및 loss 분포를 추출했다.
DA3 두 트랙(15218, 15219)은 이전 preemption 이후 재시작 시 각각 step 6000, step 8000에서 체크포인트 resume했다. Any4D(13352)는 preemption 없이 18시간 이상 연속 실행 중 — 가장 오랜 단일 실행 구간.
Any4D는 depth(d), photometric(p), scene-flow(sf) 3항 합산.
DA3-v1은 depth(d), ray_origin(ro), ray_dir(rd), rotation(R), translation(t) 5항.
DA3-v2는 paper §3.2 기반 L_D(D), L_M(M), L_P(P), L_C(C), L_grad(g) 5항.
| Track | 이전 Step | 이전 Loss | 현재 Step | 현재 Loss | Δ Step | 추세 |
|---|---|---|---|---|---|---|
| DA3-v2 (sigmoid) | 5,750 | 0.135 | 9,750 | ~0.085 | +4,000 | ↓ 지속 개선 |
| Any4D | 8,605 | 0.250 | 12,600 | ~0.21 | +3,995 | → 완만 개선, plateau |
| DA3-v1 | 6,389 | 1.156 | 7,800 | ~1.05 | +1,411 | ↓ 매우 느린 감소, 고분산 |
| Step | total | D (depth) | M (mono) | P (point) | C (pose 9-DoF) | g (grad) |
|---|---|---|---|---|---|---|
| 8,000 | 0.0914 | 0.019 | 0.036 | 0.018 | 0.015 | 0.003 |
| 8,500 | 0.0894 | 0.021 | 0.031 | 0.018 | 0.016 | 0.003 |
| 9,000 | 0.0982 | 0.022 | 0.028 | 0.022 | 0.023 | 0.004 |
| 9,750 | 0.0849 | 0.018 | 0.032 | 0.017 | 0.016 | 0.003 |
최저 관측값: step 8850에서 0.0710 (D=0.018, M=0.023, P=0.016, C=0.011, g=0.004)
| Step (최근 샘플) | total | d (depth) | p (photo) | sf (scene flow) |
|---|---|---|---|---|
| 12,200 | 0.1918 | 0.1133 | 0.0675 | 0.0220 |
| 12,300 | 0.2514 | 0.1690 | 0.0638 | 0.0371 |
| 12,450 | 0.1562 | 0.0834 | 0.0689 | 0.0078 |
| 12,500 | 0.1770 | 0.1098 | 0.0628 | 0.0089 |
| 12,600 | 0.1575 | 0.0851 | 0.0673 | 0.0103 |
최저 관측값: step 12600 부근 0.1562. depth 항이 total의 ~55%, photo ~35%, scene-flow ~10%. 3항 비율은 안정적.
| Step | total | d | ro (ray_origin) | rd | R | t |
|---|---|---|---|---|---|---|
| 6,000 | 1.2679 | 0.031 | 2.402 | 0.021 | 0.010 | 0.015 |
| 6,500 | 1.1286 | 0.036 | 2.107 | 0.025 | 0.014 | 0.013 |
| 7,000 | 1.0709 | 0.036 | 1.975 | 0.032 | 0.019 | 0.013 |
| 7,500 | 1.1981 | 0.024 | 2.301 | 0.018 | 0.009 | 0.007 |
| 7,800 | 1.2452 | 0.037 | 2.333 | 0.030 | 0.010 | 0.016 |
최저 관측값: step 7150에서 0.4887 (ro=0.819 — 간헐적 spike 하강). 그러나 다음 step에서 즉시 반등. 구조적 문제로 판단.
DA3-v2의 sub-loss 분해(D/M/P/C/g)에서 각 항이 0.015~0.032 수준으로 균형 잡힌 반면, DA3-v1의 ray_origin(ro)은 2.0~2.8로 타 항의 50~100배. v1의 ray_origin은 3D 공간에서의 카메라 원점 매칭 손실로, monocular scale ambiguity 없이 GT 깊이가 있는 RoboCasa 환경에서도 수렴하지 못하는 것은 v1 설계 시 per-clip 1-scale fit 가정이 3-cam 교차 시점 간 기하 정합을 충분히 제약하지 못한 결과로 해석된다. DA3-v2는 9-DoF pose 감독(L_C)이 명시적 교차 시점 정합을 강제하여 ray_origin 문제를 우회한다.
세 트랙을 통해 얻은 핵심 결론: GT depth + multi-view explicit supervision(DA3-v2)이 pseudo-label monocular(Any4D)를 명확히 이김. VGGRPO Phase 2 LGM 경로로 DA3-v2를 채택하는 근거 확보.
DA3-v2가 step 15K에서 loss < 0.07 또는 수렴(Δloss < 0.005 / 1000 steps)이면 LGM 체크포인트를 Phase 3(GRPO reward 통합)의 초기화로 사용하는 실험을 개시한다. 현재 0.085 @ 9750 → 15K 예상치: 0.07~0.075 (선형 외삽 기준, 실제는 log 감소 예상).