Index
2026-05-07 — Analysis

3-track 수렴 분석 (Step 6K–8.6K) — DA3-v2 리드, Any4D plateau 진입

VGGRPO | sealed RoboCasa 3-track ablation 중간 점검 #2

TL;DR

0.135
DA3-v2 loss
0.250
Any4D loss
1.156
DA3-v1 loss
8605
Any4D steps
5750
DA3-v2 steps

1 배경 / 목적

260506 카드에서 sealed RoboCasa 데이터로 fresh start한 3-track ablation(Any4D / DA3-v1 / DA3-v2 sigmoid)의 step 2700~4195 구간 초기 수렴을 확인했다. 이번 카드는 그 이후 구간(step ~5750~8605)의 추가 진행을 기록한다.

비교 기준점 (260506 카드): Any4D ~0.224 (step ~4k), DA3-v2 0.182 (step ~4k), DA3-v1 1.47 ray_origin 2.76 (step ~4k). 이번 카드 시점: Any4D step 8605, DA3-v1 step 6389, DA3-v2 step 5750.

3 job (SLURM 11344 / 11358 / 11798)은 sub/core-on-sub + core-extra 파티션에서 각각 7시간+ 연속 RUNNING 중. preempt 없이 안정적으로 진행 중.

2 트랙 구성

Track 1 (Any4D): job 11344 scripts/train_lgm_robocasa_v0.sh backbone: Any4D (monocular depth), stitch layer 7 loss: depth (per-clip scale fit) + pose + scene-flow log: experiments/lgm_robocasa_v0_0504_0352/train_log.csv Track 2 (DA3-v1): job 11358 scripts/train_lgm_robocasa_da3_v0_lossv1.sh backbone: DA3 vitl, stitch layer 6 loss: depth + ray_origin + ray_dir + rot + trans (자체 설계, per-clip scale) log: experiments/lgm_robocasa_da3_v0_lossv1_0504_0353/train_log.csv Track 3 (DA3-v2): job 11798 scripts/train_lgm_robocasa_da3_v0.sh backbone: DA3 vitl, stitch layer 6 loss: paper §3.2 (L_D conf-weighted + L_M + L_P 3D + L_C 9-DoF + L_grad) D_c = sigmoid(conf) ∈ (0,1), GT-side scale = mean(‖P‖₂) per clip log: experiments/lgm_robocasa_da3_v0_lossv2_0504_0354/train_log.csv

3 결과

3-track 현재 상태 요약

TrackStepTotal Loss주요 성분SLURM Job상태
DA3-v2 sigmoid 5,750 0.135 L_D 0.026, L_M 0.048, L_P 0.029, L_C 0.028 11798 RUNNING
Any4D 8,605 0.250 depth 0.170, pose 0.066, sf 0.028 11344 RUNNING
DA3-v1 6,389 1.156 ray_origin 2.19, depth 0.035, rot 0.008 11358 RUNNING

Any4D 학습 궤적

StepTotalDepthPoseSF
2,0300.2770.1920.0740.024
4,1550.3450.2470.0880.021
6,6550.2610.1930.0570.022
8,3800.2570.1400.1070.019
8,605 (최신)0.2510.1700.0660.028
Plateau 진입 판단: step 4155에서 0.345까지 튀었다가 6655에서 0.261, 8605에서 0.251. improvement rate가 크게 둔화됨. Depth는 0.247→0.140으로 개선됐으나 pose 성분(0.066~0.107)이 노이즈 수준으로 fluctuate — 수렴 후반부 noise-dominated 구간.

DA3-v2 sigmoid 학습 궤적

StepTotalL_DL_ML_PL_CL_gradScale
4,5830.1030.0200.0400.0200.0200.0035.15
4,6170.1220.0310.0420.0270.0180.0043.90
5,1170.1390.0300.0500.0330.0220.0043.92
5,6170.1830.0560.0450.0470.0270.0082.14
5,750 (최신)0.1350.0260.0480.0290.0280.0044.37
DA3-v2 best loss: 0.103 (step 4583) — 3-track 전체에서 가장 낮은 수치. step 5617에서 0.183으로 일시 상승했다가 5750에서 0.135로 회복. Scale norm(GT-side mean ‖P‖₂)이 2.14~5.15로 fluctuate하며 loss를 흔들고 있지만 전체 수렴 방향은 유지.
Scale instability: per-clip scale norm이 2.1→5.2→3.9→2.1→4.4로 크게 변동. 이는 clip마다 카메라 절대 거리 분포가 다른 데서 오는 정상 분산. Loss 자체는 scale 보정 후이므로 최종 수렴에는 영향 없을 것으로 판단 (v1 비교: scale 1.54~1.66, 훨씬 안정적이지만 loss 자체는 10x 큼).

DA3-v1 학습 궤적

StepTotalray_origindepthray_dirrottrans
4,7731.2342.2940.0420.0240.0130.020
5,2730.9671.7340.0500.0480.0120.014
5,4011.0481.9400.0330.0270.0110.019
5,9011.4352.7470.0310.0220.0060.013
6,389 (최신)1.1562.1900.0350.0180.0080.010
ray_origin 지배 지속: ray_origin 성분이 2.19로 total loss(1.156)보다 큰 값을 유지. depth(0.035), rot(0.008), trans(0.010)은 수렴 중이나 ray_origin이 loss 전체를 왜곡. step 5901에서 2.747로 급등한 후 6389에서 2.19로 부분 회복 — spike 패턴 반복. v1 loss의 per-clip 1-scale-fit이 multi-view ray origin을 충분히 정규화하지 못하는 구조적 한계.

4 Takeaway

DA3-v2 sigmoid가 loss 기준 우위 확정 단계

step 5750에서 0.135로 Any4D(0.250)의 절반 수준. 이는 DA3 multi-view cross-attention이 monocular Any4D 대비 실질적인 이점을 제공하고 있음을 시사. 특히 L_P(3D point consistency) 0.029와 L_C(9-DoF pose) 0.028이 함께 낮아지고 있어 depth-ray-pose joint 수렴 중.

Any4D plateau — 절대 loss 수준 자체가 낮은 것인지 확인 필요

Any4D는 0.250에서 정체. 두 가지 가능성: (1) 실제 수렴 한계 — monocular pseudo-depth의 scale ambiguity가 per-view LS fit으로 완전히 해결이 안 되는 구조적 바닥. (2) 학습률 스케줄 plateau — 10K step 이후 추가 decay 필요. Depth 0.170이 DA3-v2 L_D(0.026) 대비 6x 높다는 점이 구조적 한계 쪽에 무게를 둠.

DA3-v1은 ray_origin 정규화 설계 실패 확인

ray_origin이 6k step이 지나도 total loss를 초과하는 수치를 유지. per-clip 1-scale-fit이 3D ray origin의 절대 좌표 크기를 해결하지 못함. v2의 GT-side scale norm + L_M(raw ray L1) 방식이 이를 해결한 근거가 됨.

5 Next Steps

viz 정성 비교 (r 값)

260506 카드에서 언급된 step별 r(Pearson correlation) 비교가 아직 수행되지 않음. DA3-v2 step ~5000 체크포인트로 viz PNG 생성 후 Any4D와 r 비교:

awk -F, 'NR==1||/,r=/' experiments/lgm_robocasa_da3_v0_lossv2_0504_0354/train_log.csv | head

DA3-v2 scale instability 모니터링

per-clip scale norm이 2.1~5.2로 크게 변동. step 8k+ 시점에서 scale 분산이 줄어드는지 확인. 줄어들지 않으면 batch-level scale 통계 (running mean) 도입 검토.

DA3-v2 ~10K step 도달 시 최종 ablation 비교

Any4D가 이미 8.6K step이므로 DA3-v2도 10K 전후가 되면 동일 step 구간 ablation 가능. 현재 DA3-v2가 5.75K step인 것은 preempt로 인한 effective runtime 차이. job 11798이 core-extra(preemptible)임에 주의 — 필요 시 own QOS 빈 슬롯 확인 후 이동.

Phase 2 마무리 기준 설정

DA3-v2 loss < 0.10 안정 유지 OR Any4D 대비 r 기준 명확한 우위 확인 시 Phase 2(LGM 구축) 완료 판단. 이후 Phase 3(GRPO reward signal 통합) 진입. VGGRPO 본 목적인 diffusion fine-tuning 단계.