ro ≈ 20–202 — 발산 패턴 5일째 무변화Jun 2 재가동 후 약 57시간 경과 시점의 3-track LGM-RoboCasa 학습 진행 상황을 기록한다. Jun 04 스냅샷 이후 24시간 진행을 추적하며, 두 가지 마일스톤을 확인한다: (1) Any4D 50% 돌파, (2) DA3-v2 20K 평가 checkpoint 임박.
3 track 역할 요약:
신규 코드 수정 없음. 실행 중인 3개 job의 slurms/taewoongkang_118{51,53,69}.out tail 100행에서 최신 step 로그를 수집하여 loss 성분별 분석 수행.
DA3-v2의 step 19,350에서 spike(loss=0.536, M=0.196, C=0.128)가 관찰됨. 전후 step (19,300: 0.306, 기준값 0.11–0.17)과 비교 시 배치 이상치로 판단.
| Track | Job | Jun 4 step | Jun 5 step | +Δ (24h) | 진행률 | 상태 |
|---|---|---|---|---|---|---|
| Any4D baseline | 11851 | 20,050 | 25,495 | +5,445 | 51.0% ★ | RUNNING |
| DA3-v2 (paper) | 11869 | 14,600 | 19,350 | +4,750 | 38.7% | RUNNING |
| DA3-v1 (ablation) | 11853 | 17,150 | 21,900 | +4,750 | — | 발산 |
| Track | Total loss (avg) | 주요 성분 | 문제 성분 | 판정 |
|---|---|---|---|---|
| Any4D (step 25,495) | ≈ 0.33 | d≈0.20, p≈0.09, sf≈0.03 | 없음 | 안정 |
| DA3-v2 (step 19,350) | ≈ 0.15 | D≈0.033, M≈0.056, P≈0.038, C≈0.030, g≈0.004 | 없음 (spike 일회성) | 수렴 중 |
| DA3-v1 (step 21,900) | 15 ~ 111 | d≈0.15, rd≈0.35, R≈0.11, t≈1.0 | ro ≈ 20–202° | 발산 지속 |
ro 항이 20–202° 범위로 진동. step 21,900에서 total loss가 15.9(저점)을 기록했으나, 바로 전 step 21,850에서는 67.9, step 20,950에서는 104.1. 수렴 신호 없음. depth 성분(d ≈ 0.13–0.19)은 정상 범위지만 rotation loss에 완전히 묻혀 학습 신호로 기능하지 못함.
| Step | Total loss | ro (rotation) | d (depth) | 비율 (ro/d) |
|---|---|---|---|---|
| 19,650 | 111.8 | 211.9° | 0.51 | ~416× |
| 20,950 | 104.1 | 202.3° | 0.15 | ~1,349× |
| 21,450 | 42.8 | 83.8° | 0.13 | ~645× |
| 21,850 | 67.9 | 133.4° | 0.14 | ~953× |
| 21,900 | 15.9 | 29.6° | 0.13 | ~228× |
현재 속도(+5,445 steps/24h)로 50,000 step 완주까지 약 4.5일 추가 소요 → Jun 10 전후 완주 예상. lr cosine decay는 완주 시 최솟값에 도달.
Any4D: 25,495 / 50,000 (51.0%)
DA3-v2: 19,350 / 50,000 (38.7%)
Jun 04 카드에서 설정한 DA3-v2 20K / loss < 0.10 목표 중 step 기준은 수 시간 내 달성된다. 현재 loss ≈ 0.15는 목표보다 높지만, 배치별 0.11까지 내려가는 step이 관찰되어 평균적 수렴은 진행 중이다. 20K checkpoint에서 홀드아웃 씬 기준 depth PSNR + pose error 평가를 실행해야 reward backbone으로서의 실제 품질을 확인할 수 있다.
Any4D는 같은 기준에서 loss ≈ 0.33으로 DA3-v2 대비 2.2배 높다. 이 차이가 GRPO reward signal의 S/N ratio에 얼마나 반영되는지가 Phase 2 RL 시작 전에 확인해야 할 핵심 질문.
scancel 11853하고 GPU 4장 회수하는 것이 합리적.
~3시간 내 step 20,000 도달 예정. 평가 항목:
DA3-v2 20K 평가 결과 확인 후 scancel 11853 실행. 회수된 GPU 4장을 Phase 2 RL 첫 실험(FF submodule 통합, Sub-plan #1 Task 1)에 즉시 투입 가능. DA3-v1 checkpoint(step ~22K)는 NAS에 보관하여 이론적 재현 시 사용.
완주 checkpoint로 DA3-v2 대비 reward 품질 비교 실험 설계. 구체적으로: RoboCasa 동일 씬에서 두 모델의 depth error 분포 → GRPO group reward 분산 비교. 분산이 낮으면 reward signal이 약해 GRPO gradient가 줄어들므로 어느 쪽 backbone이 RL 학습에 더 효과적인지 판단 가능.