260506 카드에서 sealed RoboCasa 데이터로 fresh start한 3-track ablation(Any4D / DA3-v1 / DA3-v2 sigmoid)의 step 2700~4195 구간 초기 수렴을 확인했다. 이번 카드는 그 이후 구간(step ~5750~8605)의 추가 진행을 기록한다.
3 job (SLURM 11344 / 11358 / 11798)은 sub/core-on-sub + core-extra 파티션에서 각각 7시간+ 연속 RUNNING 중. preempt 없이 안정적으로 진행 중.
| Track | Step | Total Loss | 주요 성분 | SLURM Job | 상태 |
|---|---|---|---|---|---|
| DA3-v2 sigmoid | 5,750 | 0.135 | L_D 0.026, L_M 0.048, L_P 0.029, L_C 0.028 | 11798 | RUNNING |
| Any4D | 8,605 | 0.250 | depth 0.170, pose 0.066, sf 0.028 | 11344 | RUNNING |
| DA3-v1 | 6,389 | 1.156 | ray_origin 2.19, depth 0.035, rot 0.008 | 11358 | RUNNING |
| Step | Total | Depth | Pose | SF |
|---|---|---|---|---|
| 2,030 | 0.277 | 0.192 | 0.074 | 0.024 |
| 4,155 | 0.345 | 0.247 | 0.088 | 0.021 |
| 6,655 | 0.261 | 0.193 | 0.057 | 0.022 |
| 8,380 | 0.257 | 0.140 | 0.107 | 0.019 |
| 8,605 (최신) | 0.251 | 0.170 | 0.066 | 0.028 |
| Step | Total | L_D | L_M | L_P | L_C | L_grad | Scale |
|---|---|---|---|---|---|---|---|
| 4,583 | 0.103 | 0.020 | 0.040 | 0.020 | 0.020 | 0.003 | 5.15 |
| 4,617 | 0.122 | 0.031 | 0.042 | 0.027 | 0.018 | 0.004 | 3.90 |
| 5,117 | 0.139 | 0.030 | 0.050 | 0.033 | 0.022 | 0.004 | 3.92 |
| 5,617 | 0.183 | 0.056 | 0.045 | 0.047 | 0.027 | 0.008 | 2.14 |
| 5,750 (최신) | 0.135 | 0.026 | 0.048 | 0.029 | 0.028 | 0.004 | 4.37 |
| Step | Total | ray_origin | depth | ray_dir | rot | trans |
|---|---|---|---|---|---|---|
| 4,773 | 1.234 | 2.294 | 0.042 | 0.024 | 0.013 | 0.020 |
| 5,273 | 0.967 | 1.734 | 0.050 | 0.048 | 0.012 | 0.014 |
| 5,401 | 1.048 | 1.940 | 0.033 | 0.027 | 0.011 | 0.019 |
| 5,901 | 1.435 | 2.747 | 0.031 | 0.022 | 0.006 | 0.013 |
| 6,389 (최신) | 1.156 | 2.190 | 0.035 | 0.018 | 0.008 | 0.010 |
step 5750에서 0.135로 Any4D(0.250)의 절반 수준. 이는 DA3 multi-view cross-attention이 monocular Any4D 대비 실질적인 이점을 제공하고 있음을 시사. 특히 L_P(3D point consistency) 0.029와 L_C(9-DoF pose) 0.028이 함께 낮아지고 있어 depth-ray-pose joint 수렴 중.
Any4D는 0.250에서 정체. 두 가지 가능성: (1) 실제 수렴 한계 — monocular pseudo-depth의 scale ambiguity가 per-view LS fit으로 완전히 해결이 안 되는 구조적 바닥. (2) 학습률 스케줄 plateau — 10K step 이후 추가 decay 필요. Depth 0.170이 DA3-v2 L_D(0.026) 대비 6x 높다는 점이 구조적 한계 쪽에 무게를 둠.
ray_origin이 6k step이 지나도 total loss를 초과하는 수치를 유지. per-clip 1-scale-fit이 3D ray origin의 절대 좌표 크기를 해결하지 못함. v2의 GT-side scale norm + L_M(raw ray L1) 방식이 이를 해결한 근거가 됨.
260506 카드에서 언급된 step별 r(Pearson correlation) 비교가 아직 수행되지 않음. DA3-v2 step ~5000 체크포인트로 viz PNG 생성 후 Any4D와 r 비교:
awk -F, 'NR==1||/,r=/' experiments/lgm_robocasa_da3_v0_lossv2_0504_0354/train_log.csv | head
per-clip scale norm이 2.1~5.2로 크게 변동. step 8k+ 시점에서 scale 분산이 줄어드는지 확인. 줄어들지 않으면 batch-level scale 통계 (running mean) 도입 검토.
Any4D가 이미 8.6K step이므로 DA3-v2도 10K 전후가 되면 동일 step 구간 ablation 가능. 현재 DA3-v2가 5.75K step인 것은 preempt로 인한 effective runtime 차이. job 11798이 core-extra(preemptible)임에 주의 — 필요 시 own QOS 빈 슬롯 확인 후 이동.
DA3-v2 loss < 0.10 안정 유지 OR Any4D 대비 r 기준 명확한 우위 확인 시 Phase 2(LGM 구축) 완료 판단. 이후 Phase 3(GRPO reward signal 통합) 진입. VGGRPO 본 목적인 diffusion fine-tuning 단계.