Index
2026-06-03 — Experiment

3-track 학습 진행 현황 (260603)

VGGRPO | Any4D 14.7K · DA3-v2 9.8K · DA3-v1 12.4K | Jobs 11851 / 11853 / 11869

TL;DR

14,670
Any4D step
9,800
DA3-v2 step
12,400
DA3-v1 step
0.35
Any4D loss
0.18
DA3-v2 loss
~40
DA3-v1 loss

1 배경 / 목적

지난 카드 (260522)에서 3-track 학습을 step 12.7K / 8K / 10.9K 시점에 스냅샷했다. Jobs 6695/6696/6881이 user cancel·PREEMPT으로 종료된 이후, Jun 2 23:48 UTC에 새 job 세트를 재제출. 이번 카드는 Jun 3 오전까지의 약 9.5~10시간 추가 학습 결과를 기록한다.

세 트랙의 목적:

공통 설정: 24 task HDF5 (RoboCasa v0.1 216×384 depth sealed, 72k demo), lr 2e-4, max 50K steps, 4 GPU DDP (B200), num_frames=32.

2 작업 내용

Job 재제출 상황

Jun 2 23:47~48 UTC에 동시 제출. DA3-v2 첫 시도(job 11852)는 16분 만에 PREEMPTED되어 즉시 job 11869로 재제출.

Job 11851 | Any4D | start 2026-06-02T23:47:57 | RUNNING ~9h47m Job 11852 | DA3-v2 | start 2026-06-02T23:47:58 | PREEMPTED 00:16:29 Job 11853 | DA3-v1 | start 2026-06-02T23:47:58 | RUNNING ~9h47m Job 11869 | DA3-v2 | start 2026-06-03T00:14:27 | RUNNING ~9h21m (11852 재제출)

Any4D (job 11851)

scripts/train_lgm_robocasa_v0.shtrain_lgm_robocasa_v0.py. step 12500 (phaseB_12500.pt)에서 재개. Loss = depth + pose + scene_flow 항. LR cosine decay 진행 중 (2e-4 → 현재 4.96e-5, step 14670 기준).

DA3-v2 (job 11869)

scripts/train_lgm_robocasa_da3_v0.shtrain_lgm_robocasa_da3_v0.py. 11852 PREEMPT로 step 8000 (phaseB_8000.pt)에서 재개. Loss = L_D (conf-weighted depth) + L_M (mask) + L_P (3D point) + L_C (9-DoF camera) + L_grad. LoRA r=64, α=32. PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True (OOM 방지).

DA3-v1 (job 11853)

scripts/train_lgm_robocasa_da3_v0_lossv1.shtrain_lgm_robocasa_da3_v0_lossv1.py. v1 baseline dir (lgm_robocasa_da3_v0_lossv1_0511_0254)에서 재개. Loss 구성: depth + rotation(ro) + relative_depth(rd) + scale(R) + translation(t).

3 결과 (수치)

3-track step 비교표

트랙 이전 step
(260522)
현재 step 최근 loss 수렴 상태
DA3-v2 8,000 ~9,800 0.176 (D:0.033 M:0.072 P:0.040 C:0.028) 수렴 양호
Any4D 12,720 ~14,670 0.31 (d:0.20 p:0.09 sf:0.03) 안정 (노이즈 있음)
DA3-v1 10,950 ~12,400 ~40 (ro≈85 peak 124) 발산 지속

Any4D — step 12500 → 14670 구간 loss

loss 범위 0.19~0.82, 중앙값 ~0.35. 깊은 이상치(0.8+)가 간헐적으로 발생하지만 전체 추세는 하향 유지. d(depth) 항이 주 기여자 (~60%), p(pose) ~27%, sf(scene_flow) ~9%.
[B 14500] loss=0.3871 (d=0.2581 p=0.1103 sf=0.0374) lr=4.97e-05 [B 14600] loss=0.2794 (d=0.1906 p=0.0821 sf=0.0133) lr=4.96e-05 [B 14620] loss=0.1940 (d=0.1523 p=0.0337 sf=0.0158) lr=4.96e-05 [B 14650] loss=0.1993 (d=0.1382 p=0.0562 sf=0.0098) lr=4.96e-05 [B 14670] loss=0.3096 (d=0.1966 p=0.0948 sf=0.0364) lr=4.96e-05

DA3-v2 — step 8000 → 9800 구간 loss

paper § 3.2 loss 기준 step 8K→9.8K 진행. 평균 loss ≈ 0.22, 최저 0.13 (step 8650). 5개 항 모두 안정적으로 수렴. scale 추정치(s)가 1.5~5.3 범위로 정상 동작.
step 8000 | loss 0.1869 | D 0.049 M 0.071 P 0.036 C 0.028 g 0.003 | s 2.97 step 8650 | loss 0.1305 | D 0.021 M 0.062 P 0.024 C 0.021 g 0.002 | s 5.23 ← 최저 step 9000 | loss 0.2224 | D 0.058 M 0.069 P 0.056 C 0.035 g 0.004 | s 2.25 step 9500 | loss 0.2448 | D 0.074 M 0.073 P 0.056 C 0.039 g 0.004 | s 2.52 step 9800 | loss 0.1758 | D 0.033 M 0.072 P 0.040 C 0.028 g 0.003 | s 2.57

DA3-v1 — step 10500 → 12400 구간 loss

rotation 항 ro (= absolute rotation error, rad 단위 추정)이 25~162로 폭발. step 11850에서 loss=123.6, ro=241.7로 최대 spike. 개선 징후 없음 — 12K step 이후에도 발산 패턴 동일.
step 10500 | loss 32.5 | d 0.145 ro 62.1 rd 0.487 R 0.056 t 0.972 step 11000 | loss 54.5 | d 0.192 ro 100.8 rd 0.476 R 0.111 t 3.589 step 11400 | loss 87.9 | d 0.276 ro 162.5 rd 0.226 R 0.183 t 6.116 ← peak step 11850 | loss 123.6 | d 0.147 ro 241.7 rd 0.514 R 0.058 t 2.339 ← 최대 step 12000 | loss 54.1 | d 0.104 ro 103.7 rd 0.533 R 0.214 t 1.675 step 12400 | loss 42.9 | d 0.174 ro 83.2 rd 0.467 R 0.124 t 0.774
DA3-v2 최저 loss
0.1305 @ 8650
Any4D 최저 loss
0.1936 @ 14505
DA3-v1 loss 범위
13 ~ 124
DA3-v2 preemption
16min (job 11852)

4 Takeaway

DA3-v2가 3-track 중 유일한 수렴 궤도. step 9800 기준 loss 0.18 — Any4D(0.35)의 절반. paper § 3.2 loss (conf-weighted depth + 3D point + 9-DoF camera)의 설계가 GT depth가 있는 RoboCasa 도메인에서 효과적으로 작동함을 확인.
DA3-v1 발산은 12K step 이후에도 개선 없음. rotation 항 ro가 v1 loss의 핵심 취약점. 별도 scale-agnostic 처리 없이 raw rotation error를 직접 최적화하는 구조적 한계로 보임. ablation 목적의 baseline으로는 의미 있으나, 실사용 가치는 없음.
Any4D는 안정하지만 수렴 속도가 느리다. step 14.7K에서 loss 0.35는 DA3-v2 step 9.8K의 0.18보다 높다. monocular pseudo-depth 의존 구조의 frame-level scale ambiguity가 학습 수렴을 늦추는 것으로 추정. 50K step 목표까지 계속 학습하면서 최종 수렴 수준을 DA3-v2와 비교할 필요 있음.

🔍 분석: 왜 DA3-v2가 수렴이 빠른가?

DA3는 multi-view cross-attention이 인코더에 내장돼 여러 카메라 뷰를 jointly처리한다. 이 덕분에 frame-level scale ambiguity 없이 일관된 깊이/포즈 추정이 가능. 반면 Any4D는 각 뷰를 독립 처리 후 connector가 geometry를 통합하는 방식으로, RoboCasa 3-cam처럼 고정된 extrinsic이 있는 GT 데이터에서는 DA3의 구조적 이점이 더 크다.

5 Next Steps

즉시

중기 (DA3-v2 수렴 후)

한계