ro ≈ 98이 전체 loss 지배 — 발산 패턴 무변화Jun 2 재가동 후 약 33시간 경과 시점의 3-track LGM-RoboCasa 학습 진행 상황을 기록한다. 전날(Jun 3) 스냅샷 이후 하루치 진행을 비교하여 각 track의 수렴/발산 패턴을 확인한다.
3 track의 목적:
신규 코드 수정 없음. 실행 중인 3개 job의 slurms/taewoongkang_118{51,53,69}.out에서 최신 step 로그를 수집하여 loss 성분별 분석을 수행.
DA3-v1의 ro (rotation) 항이 다른 성분과 비교해 어떤 규모인지 정량 분석. DA3-v2에서는 rotation을 explicit loss term으로 두지 않고 L_M (match) + L_P (3D point) + L_C (9-DoF) 의 기하학적 일관성으로 implicit하게 학습.
| Track | Job | Jun 3 step | Jun 4 step | +Δ (24h) | 진행률 | 상태 |
|---|---|---|---|---|---|---|
| Any4D baseline | 11851 | 14,670 | 20,050 | +5,380 | 40.1% | RUNNING |
| DA3-v2 (paper) | 11869 | 9,800 | 14,600 | +4,800 | 29.2% | RUNNING |
| DA3-v1 (ablation) | 11853 | 12,400 | 17,150 | +4,750 | — | 발산 |
| Track | Total loss | 주요 성분 | 문제 성분 | 판정 |
|---|---|---|---|---|
| Any4D (step 20,050) | ≈ 0.29 | d=0.16, p=0.11, sf=0.04 | 없음 | 안정 |
| DA3-v2 (step 14,600) | 0.116 | D=0.022, M=0.042, P=0.027, C=0.022, g=0.003 | 없음 | 수렴 중 |
| DA3-v1 (step 17,150) | 20 ~ 94 | d=0.13, rd=0.43, R=0.06, t=1.5 | ro ≈ 39–176 | 발산 지속 |
ro (rotation loss)가 step 17,150 기준 39–176 범위로 진동. 같은 시점 depth 성분(d ≈ 0.13)의 300–1,300배 수준. total loss 전체를 rotation 항이 지배하여 depth/pose 학습 신호가 묻힘.
현재 속도(+5,380 steps/24h)로는 50,000 step 완주까지 약 2.8일 추가 소요 예상 (Jun 7 이전 완료 가능). 학습률 lr = 4.53e-05 단계 — cosine decay 적용 중.
Any4D: 20,050 / 50,000 (40.1%)
DA3-v1의 핵심 실패 원인이 explicit rotation loss 항의 스케일 문제임이 성분 분석으로 명확해졌다. rotation을 별도 loss term(ro)으로 직접 최적화하는 v1 방식은 rotation의 비선형성(SO(3) 공간)과 translation/depth 항의 스케일 차이를 그대로 노출시킨다.
반면 DA3-v2 (paper §3.2)는 pose 감독을 L_M(feature match) + L_P(3D reprojection) + L_C(9-DoF) 로 분산시켜 각 항이 유사한 스케일(0.02–0.09)로 유지된다. rotation을 implicit하게 학습하는 이 설계가 실제 수렴에서 결정적 차이를 만든 것으로 판단.
17,150 step에서도 발산이 지속 중이고 DA3-v2 대비 loss 스케일 차이가 구조적이다. rotation 항 수정 없이는 수렴 불가로 판단. DA3-v1을 scancel 11853하고 GPU를 회수하여 DA3-v2 또는 다른 실험에 활용하는 것이 합리적. 단, DA3-v2 checkpoint가 충분히 수렴하는 시점(~20K step, loss < 0.10)을 기다린 후 결정.
step 14,600에서 loss 0.12로 수렴 중. 목표 milestone: 20K step (loss < 0.10) 도달 시 벤치마크 평가 실행. 평가 기준: RoboCasa 홀드아웃 씬에서 depth PSNR, pose error (rotation < 5°, translation < 0.05m 목표).
Jun 7 이전 50K step 완주 예상. 완주 시 Any4D checkpoint를 DA3-v2 initialized 모델 대비 reward signal 품질 비교 실험 설계. 구체적으로: 동일 RoboCasa 시퀀스에 대해 두 모델의 depth/pose estimation quality → GRPO reward 분산(σ) 비교.