Index
2026-06-09 — Experiment

3-track 학습 진행 현황 (260609)

VGGRPO / Any4D 47.3K · DA3-v2 38.3K · DA3-v1 40.9K

TL;DR

47.3K
Any4D step
94.6%
Any4D 진행률
38.3K
DA3-v2 step
0.10
DA3-v2 loss
40.9K
DA3-v1 step
~90°
DA3-v1 ro

1 배경 / 목적

Jun 8 스냅샷(260608 카드) 이후 1일간(Jun 8→9) 3-track LGM-RoboCasa 학습 진행 상황을 기록한다. 주요 관찰 포인트: (1) Any4D 오늘 완주 여부 확인 (260608 카드 예측 검증), (2) DA3-v2 loss 추가 하강 여부, (3) DA3-v1 발산 개선 없음 재확인 → scancel 실행 여부.

3 track 역할 요약:

직전 스냅샷 (Jun 8): Any4D 41,865 (83.7%, loss≈0.28) / DA3-v2 33,500 (loss≈0.10) / DA3-v1 36,100 (ro≈86°) — Any4D Jun 9–10 완주 예측

2 작업 내용

신규 코드 수정 없음. 실행 중인 3개 job의 slurms/taewoongkang_118{51,53,69}.out tail 80행에서 최신 step 로그를 수집하여 loss 성분별 분석 수행.

속도 측정 (Jun 8 → Jun 9, 1일)

TrackJun 8 stepJun 9 stepΔ step속도 (step/day)잔여ETA
Any4D 41,865 47,320 +5,455 5,455 2,680 Jun 9 PM
DA3-v2 33,500 38,300 +4,800 4,800 11,700 Jun 11–12
DA3-v1 36,100 40,850 +4,750 4,750 9,150 발산 중

3 결과

Step 진행 요약

Track Job Jun 8 step Jun 9 step 진행률 완주 예상 상태
Any4D baseline 11851 41,865 47,320 94.6% ★ Jun 9 PM 완주 임박
DA3-v2 (paper) 11869 33,500 38,300 76.6% Jun 11–12 수렴 중
DA3-v1 (ablation) 11853 36,100 40,850 81.7% 발산

Any4D: 47,320 / 50,000 (94.6%) — Jun 9 PM 완주

DA3-v2: 38,300 / 50,000 (76.6%) — Jun 11–12 완주

DA3-v1: 40,850 / 50,000 (81.7%) — 발산 지속, scancel 권고

Loss 성분 분석 (최신 ~10 step)

Track Total loss (최근 중앙값) Jun 8 → Jun 9 주요 성분 판정
Any4D (step 47,320) ≈ 0.24 0.28 → 0.24 (↓14%) d≈0.12–0.14, p≈0.08–0.10, sf≈0.02–0.06 수렴 완성
DA3-v2 (step 38,300) ≈ 0.11 0.10 → 0.11 (횡보, 안정) D≈0.018–0.082, M≈0.022–0.086, P≈0.013–0.074, C≈0.009–0.037, g≈0.002–0.008 안정 수렴
DA3-v1 (step 40,850) 23–65 무변화 ro ≈ 45–130° 발산 지속
Any4D 오늘 완주 예측 정확: 260608 카드의 "Jun 9–10 완주" 예측 그대로 step 47,320(94.6%)까지 진행. 잔여 2,680 step ÷ 5,455/day ≈ 0.49일 = ~12시간 → Jun 9 오후 완주. lr 6.30–7.17e-07 (cosine decay 막바지). loss 0.28→0.24(↓14%) 추가 개선. 완주 직전 일부 spike(step 47,100: 0.887)가 있으나 전체 추세는 하강.
DA3-v2 loss 안정 유지: step 35,700–38,300 구간 loss 0.062(min, step 36,500) ~ 0.272(max, step 37,000). 최근 중앙값 ≈ 0.11로 260608과 유사하게 안정. D(depth, conf-weighted), M(match), P(photometric), C(cross-view), g(gradient) 각 성분 모두 안정적인 범위 유지. lr ≈ 5.5e-06대 (Any4D와 유사 decay 단계).
DA3-v1 발산 9일차, 개선 없음: step 40,850에서도 ro 45–130° 범위 유지. 최악 관찰: step 39,250(loss=65.6, ro=128.8°), step 40,750(loss=60.4, ro=118.8°). 최솟값: step 39,600(loss=23.7, ro=45.4°) — 이후 즉시 ro 84°로 복귀. 260608 카드에서 "DA3-v2 20K 평가 후 scancel" 권고가 있었으나 미이행. 현재까지 GPU 4장 × 9일 = 36 GPU-day 낭비 중.

DA3-v1 rotation 최근 샘플 (step 38,200–40,850)

StepTotal lossro (rotation°)d (depth)ro/d 비율
38,20048.595.4°0.090~1,060×
38,50033.264.8°0.144~450×
39,00031.260.8°0.112~543×
39,25065.6128.8°0.106~1,215×
39,60023.745.4°0.167~272×
40,00037.273.1°0.087~840×
40,75060.4118.8°0.097~1,224×
40,85051.0100.0°0.139~720×

rotation 항이 depth 성분 대비 270–1,220배로 total loss를 지배. depth 성분(d ≈ 0.09–0.17)은 수렴 가능 범위이나 loss scale이 rotation에 압도됨.

4 Takeaway

Any4D 오늘 완주 — 3-track 비교 평가 준비 단계 진입

260608 카드 예측이 정확했다. Any4D는 Jun 9 PM에 50K final checkpoint를 생성하고, DA3-v2는 Jun 11–12 완주 예정. 이 시점에 동일 RoboCasa 홀드아웃 씬에서 depth PSNR / pose error 직접 비교가 가능해진다. Phase 2 RL reward backbone 선택(Any4D vs DA3)을 위한 마지막 missing piece가 채워지는 주간.

DA3-v2 loss가 안정 구간(0.062–0.18)을 유지하면서 Any4D의 0.24 대비 수치상 더 낮지만, loss 척도가 다르므(Any4D: d+p+sf vs DA3-v2: D+M+P+C+g) 직접 수치 비교보다 동일 evaluation set에서의 depth PSNR / pose RMSE가 판단 기준이 된다.

DA3-v1 scancel 지연 비용: 260608 카드(어제)에서 "즉시 scancel" 권고가 있었으나 오늘도 실행되지 않았다. job 11853은 Jun 1부터 9일째 실행 중 (elapsed 6-09:23). GPU 4장 × 9일 = 36 GPU-day 추가 소모. 현재도 수렴 신호가 없으므로 오늘 즉시 scancel 11853이 필요.

5 Next Steps

① DA3-v1 즉시 종료 (오늘, 최우선)

scancel 11853 실행. step ~40,850 checkpoint는 experiments/lgm_robocasa_da3_v0_lossv1_0511_0254/에 보존. 회수된 GPU 4장을 Phase 2 RL Sub-plan #1 Task 1(FF submodule Cosmos 통합)에 즉시 투입.

② Any4D 완주 확인 및 평가 launch (Jun 9 PM)

50K checkpoint 생성 후 RoboCasa 홀드아웃 씬 평가:

  • depth PSNR: Any4D 50K vs DA3-v2 현재 checkpoint (step 38,300)
  • pose estimation error: rotation < 5°, translation < 0.05m 목표
  • 학습 완료 후 experiments/lgm_robocasa_v0_0511_0254/에서 final ckpt 확인

③ DA3-v2 최종 수렴 확인 (Jun 11–12)

잔여 11,700 step ÷ 4,800/day ≈ 2.4일 → Jun 11–12 완주. loss < 0.08 달성 여부 확인. 완주 후 ②와 동일한 evaluation 실행. Phase 2 RL backbone 선택(Any4D vs DA3-v2) 최종 판단.

④ Phase 2 RL Sub-plan #1 착수 준비

Cosmos-Predict2-2B robocasa-MG30 iter 73.2K checkpoint 확인. FF submodule Cosmos 통합(Task 1) 구현. DA3-v1 GPU 4장 + 현재 유휴 GPU 활용. LGM reward는 DA3-v2 완주 후 swap-in — 즉시 착수 가능.