Index
2026-06-04 — Experiment

3-track 학습 진행 현황 (260604)

VGGRPO / Any4D 20.0K · DA3-v2 14.6K · DA3-v1 17.1K

TL;DR

20.0K
Any4D step
14.6K
DA3-v2 step
17.1K
DA3-v1 step
0.12
DA3-v2 loss
~50
DA3-v1 loss

1 배경 / 목적

Jun 2 재가동 후 약 33시간 경과 시점의 3-track LGM-RoboCasa 학습 진행 상황을 기록한다. 전날(Jun 3) 스냅샷 이후 하루치 진행을 비교하여 각 track의 수렴/발산 패턴을 확인한다.

3 track의 목적:

이전 스냅샷 (Jun 3): Any4D 14,670 / DA3-v2 9,800 / DA3-v1 12,400

2 작업 내용

신규 코드 수정 없음. 실행 중인 3개 job의 slurms/taewoongkang_118{51,53,69}.out에서 최신 step 로그를 수집하여 loss 성분별 분석을 수행.

각 track의 loss 포맷

Any4D (job 11851): [B {step}/50000] loss={total} (d={depth} p={photometric} sf={scale_factor}) lr={lr} DA3-v2 (job 11869): step {step} | loss {total} | D {depth} M {match} P {photometric} C {color} g {geometry} | s {speed} DA3-v1 (job 11853): step {step} | loss {total} | d {depth} ro {rotation} rd {render_depth} R {R} t {translation} | s {speed}

DA3-v1의 ro (rotation) 항이 다른 성분과 비교해 어떤 규모인지 정량 분석. DA3-v2에서는 rotation을 explicit loss term으로 두지 않고 L_M (match) + L_P (3D point) + L_C (9-DoF) 의 기하학적 일관성으로 implicit하게 학습.

3 결과

Step 진행 요약

Track Job Jun 3 step Jun 4 step +Δ (24h) 진행률 상태
Any4D baseline 11851 14,670 20,050 +5,380 40.1% RUNNING
DA3-v2 (paper) 11869 9,800 14,600 +4,800 29.2% RUNNING
DA3-v1 (ablation) 11853 12,400 17,150 +4,750 발산

Loss 성분 분석 (최신 5 step 기준)

Track Total loss 주요 성분 문제 성분 판정
Any4D (step 20,050) ≈ 0.29 d=0.16, p=0.11, sf=0.04 없음 안정
DA3-v2 (step 14,600) 0.116 D=0.022, M=0.042, P=0.027, C=0.022, g=0.003 없음 수렴 중
DA3-v1 (step 17,150) 20 ~ 94 d=0.13, rd=0.43, R=0.06, t=1.5 ro ≈ 39–176 발산 지속
DA3-v1 rotation 항 폭발: ro (rotation loss)가 step 17,150 기준 39–176 범위로 진동. 같은 시점 depth 성분(d ≈ 0.13)의 300–1,300배 수준. total loss 전체를 rotation 항이 지배하여 depth/pose 학습 신호가 묻힘.
DA3-v2 수렴 확인: step 9,800 → 14,600 구간에서 total loss 0.18 → 0.12로 하락 추세. 모든 성분(D, M, P, C, g)이 동일한 스케일(0.002–0.10)로 균형있게 학습 중.

Any4D 40K step 도달 전망

현재 속도(+5,380 steps/24h)로는 50,000 step 완주까지 약 2.8일 추가 소요 예상 (Jun 7 이전 완료 가능). 학습률 lr = 4.53e-05 단계 — cosine decay 적용 중.

Any4D: 20,050 / 50,000 (40.1%)

4 Takeaway

DA3-v2 loss 설계의 우월성 재확인

DA3-v1의 핵심 실패 원인이 explicit rotation loss 항의 스케일 문제임이 성분 분석으로 명확해졌다. rotation을 별도 loss term(ro)으로 직접 최적화하는 v1 방식은 rotation의 비선형성(SO(3) 공간)과 translation/depth 항의 스케일 차이를 그대로 노출시킨다.

반면 DA3-v2 (paper §3.2)는 pose 감독을 L_M(feature match) + L_P(3D reprojection) + L_C(9-DoF) 로 분산시켜 각 항이 유사한 스케일(0.02–0.09)로 유지된다. rotation을 implicit하게 학습하는 이 설계가 실제 수렴에서 결정적 차이를 만든 것으로 판단.

RL Phase 전환 prerequisite 확인: DA3-v2 loss≈0.12 수렴은 LGM reward backbone으로 사용하기에 충분한 수준에 근접 중. Any4D 20K에서의 loss≈0.29는 DA3-v2 대비 2.5배 높음 — reward 신호 품질 차이가 GRPO ablation에서 나타날 것.

5 Next Steps

DA3-v1 조기 종료 검토

17,150 step에서도 발산이 지속 중이고 DA3-v2 대비 loss 스케일 차이가 구조적이다. rotation 항 수정 없이는 수렴 불가로 판단. DA3-v1을 scancel 11853하고 GPU를 회수하여 DA3-v2 또는 다른 실험에 활용하는 것이 합리적. 단, DA3-v2 checkpoint가 충분히 수렴하는 시점(~20K step, loss < 0.10)을 기다린 후 결정.

DA3-v2 checkpoint 품질 평가

step 14,600에서 loss 0.12로 수렴 중. 목표 milestone: 20K step (loss < 0.10) 도달 시 벤치마크 평가 실행. 평가 기준: RoboCasa 홀드아웃 씬에서 depth PSNR, pose error (rotation < 5°, translation < 0.05m 목표).

Any4D 완주 후 처리

Jun 7 이전 50K step 완주 예상. 완주 시 Any4D checkpoint를 DA3-v2 initialized 모델 대비 reward signal 품질 비교 실험 설계. 구체적으로: 동일 RoboCasa 시퀀스에 대해 두 모델의 depth/pose estimation quality → GRPO reward 분산(σ) 비교.