Index
2026-06-05 — Experiment

3-track 학습 진행 현황 (260605)

VGGRPO / Any4D 25.5K · DA3-v2 19.4K · DA3-v1 21.9K

TL;DR

25.5K
Any4D step
51%
Any4D 진행률
19.4K
DA3-v2 step
0.15
DA3-v2 loss
21.9K
DA3-v1 step
~40
DA3-v1 loss

1 배경 / 목적

Jun 2 재가동 후 약 57시간 경과 시점의 3-track LGM-RoboCasa 학습 진행 상황을 기록한다. Jun 04 스냅샷 이후 24시간 진행을 추적하며, 두 가지 마일스톤을 확인한다: (1) Any4D 50% 돌파, (2) DA3-v2 20K 평가 checkpoint 임박.

3 track 역할 요약:

이전 스냅샷 (Jun 4): Any4D 20,050 / DA3-v2 14,600 / DA3-v1 17,150

2 작업 내용

신규 코드 수정 없음. 실행 중인 3개 job의 slurms/taewoongkang_118{51,53,69}.out tail 100행에서 최신 step 로그를 수집하여 loss 성분별 분석 수행.

각 track의 loss 포맷

Any4D (job 11851): [B {step}/50000] loss={total} (d={depth} p={photometric} sf={scale_factor}) lr={lr} DA3-v2 (job 11869): step {step} | loss {total} | D {depth} M {match} P {photometric} C {cross_view} g {geometry} | s {speed} DA3-v1 (job 11853): step {step} | loss {total} | d {depth} ro {rotation} rd {render_depth} R {R_mat} t {translation} | s {speed}

DA3-v2의 step 19,350에서 spike(loss=0.536, M=0.196, C=0.128)가 관찰됨. 전후 step (19,300: 0.306, 기준값 0.11–0.17)과 비교 시 배치 이상치로 판단.

3 결과

Step 진행 요약

Track Job Jun 4 step Jun 5 step +Δ (24h) 진행률 상태
Any4D baseline 11851 20,050 25,495 +5,445 51.0% ★ RUNNING
DA3-v2 (paper) 11869 14,600 19,350 +4,750 38.7% RUNNING
DA3-v1 (ablation) 11853 17,150 21,900 +4,750 발산

Loss 성분 분석 (최신 ~10 step 평균)

Track Total loss (avg) 주요 성분 문제 성분 판정
Any4D (step 25,495) ≈ 0.33 d≈0.20, p≈0.09, sf≈0.03 없음 안정
DA3-v2 (step 19,350) ≈ 0.15 D≈0.033, M≈0.056, P≈0.038, C≈0.030, g≈0.004 없음 (spike 일회성) 수렴 중
DA3-v1 (step 21,900) 15 ~ 111 d≈0.15, rd≈0.35, R≈0.11, t≈1.0 ro ≈ 20–202° 발산 지속
Any4D 50% 돌파: step 25,495 / 50,000 — 절반 통과. lr = 3.67–3.76e-05 (cosine decay 후반부). loss 0.29 (Jun 4) → 0.33 (Jun 5)으로 소폭 상승했으나 정상 변동 범위 내. 배치 간 분산이 크고 (min 0.15, max 0.94) 이동평균은 0.30–0.35 구간에 안정.
DA3-v2 20K 체크포인트 임박: step 19,350 → 약 650 step 남음. 현재 속도(4,750 step/24h)로 ~3시간 내 20K 도달. step 19,000–19,300 구간 loss 0.11–0.31 (spike 제외 평균 0.14). Jun 04 카드에서 설정한 "loss < 0.10" 목표에는 아직 미달(≈0.15)이지만 평가 실행 시점으로 적절.
DA3-v1 5일째 발산 무변화: step 21,900에서도 ro 항이 20–202° 범위로 진동. step 21,900에서 total loss가 15.9(저점)을 기록했으나, 바로 전 step 21,850에서는 67.9, step 20,950에서는 104.1. 수렴 신호 없음. depth 성분(d ≈ 0.13–0.19)은 정상 범위지만 rotation loss에 완전히 묻혀 학습 신호로 기능하지 못함.

DA3-v1 rotation 폭발 히스토리 (최근 5 샘플)

StepTotal lossro (rotation)d (depth)비율 (ro/d)
19,650111.8211.9°0.51~416×
20,950104.1202.3°0.15~1,349×
21,45042.883.8°0.13~645×
21,85067.9133.4°0.14~953×
21,90015.929.6°0.13~228×

Any4D 완주 예상 시점 (재계산)

현재 속도(+5,445 steps/24h)로 50,000 step 완주까지 약 4.5일 추가 소요 → Jun 10 전후 완주 예상. lr cosine decay는 완주 시 최솟값에 도달.

Any4D: 25,495 / 50,000 (51.0%)

DA3-v2: 19,350 / 50,000 (38.7%)

4 Takeaway

DA3-v2 20K 도달 시 평가 즉시 실행 필요

Jun 04 카드에서 설정한 DA3-v2 20K / loss < 0.10 목표 중 step 기준은 수 시간 내 달성된다. 현재 loss ≈ 0.15는 목표보다 높지만, 배치별 0.11까지 내려가는 step이 관찰되어 평균적 수렴은 진행 중이다. 20K checkpoint에서 홀드아웃 씬 기준 depth PSNR + pose error 평가를 실행해야 reward backbone으로서의 실제 품질을 확인할 수 있다.

Any4D는 같은 기준에서 loss ≈ 0.33으로 DA3-v2 대비 2.2배 높다. 이 차이가 GRPO reward signal의 S/N ratio에 얼마나 반영되는지가 Phase 2 RL 시작 전에 확인해야 할 핵심 질문.

DA3-v1 scancel 의사결정 시점: step 21,900(5일 경과)에서도 rotation 항이 depth 성분의 228–1,349배로 폭발. 구조적 원인(SO(3) 비선형성 + loss scale 불균형)이 명확하고 수정 없이는 수렴 불가. DA3-v2 20K 평가 결과가 나오면 그 시점에 DA3-v1을 scancel 11853하고 GPU 4장 회수하는 것이 합리적.

5 Next Steps

① DA3-v2 20K checkpoint 평가 (오늘 내)

~3시간 내 step 20,000 도달 예정. 평가 항목:

  • RoboCasa 홀드아웃 씬(PnPCounterToMicrowave 외 2 씬)에서 depth PSNR 측정
  • pose estimation error: rotation < 5°, translation < 0.05m 목표
  • reward signal 품질: 동일 시퀀스에서 DA3-v2 vs Any4D baseline 보상 분산(σ) 비교

② DA3-v1 종료 및 GPU 회수

DA3-v2 20K 평가 결과 확인 후 scancel 11853 실행. 회수된 GPU 4장을 Phase 2 RL 첫 실험(FF submodule 통합, Sub-plan #1 Task 1)에 즉시 투입 가능. DA3-v1 checkpoint(step ~22K)는 NAS에 보관하여 이론적 재현 시 사용.

③ Any4D 50K 완주 후 처리 (Jun 10 전후)

완주 checkpoint로 DA3-v2 대비 reward 품질 비교 실험 설계. 구체적으로: RoboCasa 동일 씬에서 두 모델의 depth error 분포 → GRPO group reward 분산 비교. 분산이 낮으면 reward signal이 약해 GRPO gradient가 줄어들므로 어느 쪽 backbone이 RL 학습에 더 효과적인지 판단 가능.