Index
2026-05-08 — Analysis

3-track 수렴 분석 (Step 9.7K–12.6K) — DA3-v2 0.085 유지, Any4D plateau 확인

VGGRPO | sealed RoboCasa 3000 demos | Any4D vs DA3-v1 vs DA3-v2-sigmoid

TL;DR

0.085
DA3-v2 @ 9750
0.21
Any4D @ 12600
1.05
DA3-v1 @ 7800
+4K
Any4D steps added
+4K
DA3-v2 steps added

1 배경 / 목적

전날(260507) 카드에서 3-track 중간 수렴을 분석한 결과: DA3-v2 sigmoid loss 0.135 최저, Any4D 0.250으로 plateau 진입 의심, DA3-v1 1.156(ray_origin 2.19 지배)이었다. 이후 추가 학습이 진행되어 오늘(260508) 09:42 기준 현황을 업데이트한다.

세 트랙은 동일한 sealed RoboCasa 3000 demos (∞ depth 제거 전처리 완료)로 학습 중이며, 모두 4 GPU DDP / core-on-sub 파티션에서 preemption 자동 재시작으로 운영 중이다. 이번 분석의 목적은 ① Any4D plateau 확정 여부, ② DA3-v2 지속 개선 여부, ③ DA3-v1 ray_origin 문제 완화 여부를 확인하는 것이다.

이전 기준점 (260507 카드): Any4D step 8605 loss 0.250 / DA3-v1 step 6389 loss 1.156 / DA3-v2 step 5750 loss 0.135

2 작업 내용

SLURM 실시간 로그(slurms/taewoongkang_13352.out, 15218.out, 15219.out)를 읽어 각 트랙의 현재 step 및 loss 분포를 추출했다.

실행 중인 SLURM 작업

job 13352 | Any4D | train_lgm_robocasa_v0.sh | RUNNING 18h 42m | 13352.out job 15218 | DA3-v1 | train_lgm_robocasa_da3_v0_lossv1.sh | RUNNING 9h 9m | 15218.out job 15219 | DA3-v2 | train_lgm_robocasa_da3_v0.sh | RUNNING 9h 1m | 15219.out

DA3 두 트랙(15218, 15219)은 이전 preemption 이후 재시작 시 각각 step 6000, step 8000에서 체크포인트 resume했다. Any4D(13352)는 preemption 없이 18시간 이상 연속 실행 중 — 가장 오랜 단일 실행 구간.

로그 형식 (트랙별)

Any4D : [B step/50000] loss=X (d=X p=X sf=X) lr=X DA3-v1 : step N | loss X | d X ro X rd X R X t X | s X DA3-v2 : step N | loss X | D X M X P X C X g X | s X

Any4D는 depth(d), photometric(p), scene-flow(sf) 3항 합산.
DA3-v1은 depth(d), ray_origin(ro), ray_dir(rd), rotation(R), translation(t) 5항.
DA3-v2는 paper §3.2 기반 L_D(D), L_M(M), L_P(P), L_C(C), L_grad(g) 5항.

3 결과 (수치)

3-track 현황 비교 — 이전 vs 현재

Track이전 Step이전 Loss현재 Step현재 LossΔ Step추세
DA3-v2 (sigmoid)5,7500.1359,750~0.085+4,000↓ 지속 개선
Any4D8,6050.25012,600~0.21+3,995→ 완만 개선, plateau
DA3-v16,3891.1567,800~1.05+1,411↓ 매우 느린 감소, 고분산

DA3-v2 — step 8000→9750 세부 분해

모든 sub-loss가 균형 잡힌 분포 유지. 단일 항이 지배하는 구조 없음. step 9750 기준: D=0.018, M=0.032, P=0.017, C=0.016, g=0.003.
SteptotalD (depth)M (mono)P (point)C (pose 9-DoF)g (grad)
8,0000.09140.0190.0360.0180.0150.003
8,5000.08940.0210.0310.0180.0160.003
9,0000.09820.0220.0280.0220.0230.004
9,7500.08490.0180.0320.0170.0160.003

최저 관측값: step 8850에서 0.0710 (D=0.018, M=0.023, P=0.016, C=0.011, g=0.004)

Any4D — step 8605→12600 세부

4K steps 추가 학습에도 평균 loss는 0.250→0.21로 소폭 개선. 단 분산이 크고(0.157~0.430) 뚜렷한 하강 트렌드 없음. Plateau 진입 확인.
Step (최근 샘플)totald (depth)p (photo)sf (scene flow)
12,2000.19180.11330.06750.0220
12,3000.25140.16900.06380.0371
12,4500.15620.08340.06890.0078
12,5000.17700.10980.06280.0089
12,6000.15750.08510.06730.0103

최저 관측값: step 12600 부근 0.1562. depth 항이 total의 ~55%, photo ~35%, scene-flow ~10%. 3항 비율은 안정적.

DA3-v1 — step 6000→7800 세부

ray_origin(ro)이 total loss의 ~90% 지배 구조 지속. step 7800에서 ro=2.333으로 여전히 2+ 수준. 전체 분산 크고(0.49~1.44), 방향성 없는 oscillation.
Steptotaldro (ray_origin)rdRt
6,0001.26790.0312.4020.0210.0100.015
6,5001.12860.0362.1070.0250.0140.013
7,0001.07090.0361.9750.0320.0190.013
7,5001.19810.0242.3010.0180.0090.007
7,8001.24520.0372.3330.0300.0100.016

최저 관측값: step 7150에서 0.4887 (ro=0.819 — 간헐적 spike 하강). 그러나 다음 step에서 즉시 반등. 구조적 문제로 판단.

손실 구조 비교 분석

DA3-v2의 sub-loss 분해(D/M/P/C/g)에서 각 항이 0.015~0.032 수준으로 균형 잡힌 반면, DA3-v1의 ray_origin(ro)은 2.0~2.8로 타 항의 50~100배. v1의 ray_origin은 3D 공간에서의 카메라 원점 매칭 손실로, monocular scale ambiguity 없이 GT 깊이가 있는 RoboCasa 환경에서도 수렴하지 못하는 것은 v1 설계 시 per-clip 1-scale fit 가정이 3-cam 교차 시점 간 기하 정합을 충분히 제약하지 못한 결과로 해석된다. DA3-v2는 9-DoF pose 감독(L_C)이 명시적 교차 시점 정합을 강제하여 ray_origin 문제를 우회한다.

4 Takeaway

DA3-v2가 3-track 최종 승자로 거의 확정. 0.085는 Any4D 대비 2.5배 낮은 loss이며, paper §3.2의 명시적 multi-view supervision (L_D + L_M + L_P + L_C + L_grad)이 RoboCasa GT 환경에서 유효함을 입증.
Any4D plateau는 pseudo-label의 구조적 한계. monocular scale ambiguity로 인한 frame-level scale 변동이 per-view (s, b) LS fit을 흔드는 문제가 여전히 미해결. GT depth가 있는 환경에서 Any4D의 이점이 사라지는 지점.
DA3-v1은 ray_origin 항 자체를 재설계하거나 포기해야 함. 7800 step 동안 ro 항이 2.0+ 수준을 유지하는 것은 loss 구조의 설계 결함. ablation 참조용으로 유지하되, 추가 개선 투자 불필요.

세 트랙을 통해 얻은 핵심 결론: GT depth + multi-view explicit supervision(DA3-v2)이 pseudo-label monocular(Any4D)를 명확히 이김. VGGRPO Phase 2 LGM 경로로 DA3-v2를 채택하는 근거 확보.

5 Next Steps

현재 미해결 사항

다음 실험 가설

DA3-v2 15K 이후 Phase 3 전환 조건

DA3-v2가 step 15K에서 loss < 0.07 또는 수렴(Δloss < 0.005 / 1000 steps)이면 LGM 체크포인트를 Phase 3(GRPO reward 통합)의 초기화로 사용하는 실험을 개시한다. 현재 0.085 @ 9750 → 15K 예상치: 0.07~0.075 (선형 외삽 기준, 실제는 log 감소 예상).