LGMv3 Phase B는 frozen Any4D의 pseudo-label(depth/pose/scene flow)로 LGM connector를 학습시키는 단계.
260413에 find_stitch_layer.py로 최적 stitch layer ℓ̂=7을 확정하고
conv3d_init_layer7.pt를 초기화 체크포인트로 사용.
이전 학습 시도(job 47040, 47133, 47662 등)는 core-extra QOS 환경에서 총 4회 선점(약 26h 소모)을 겪어 step 17,500까지만 진행된 상태였음. 4/17 00:33에 job 48060으로 재시작하여 이번 카드 기준 step 40,715까지 선점 없이 안정 학습 중.
260417-lgmv3_phaseB_training.html은 job 48060 시작 직후(15h, ~step 22K)
운영 상태만 기록. 이 카드는 step 17.5K→40.7K 구간의 실제 loss 수치를 담음.
Phase B 핵심 설계: Any4D는 frozen(gradient 없음)으로 pseudo-label 생성 전용. 학습 가능 파라미터는 LGM connector (Conv3d 2.05M params)만. scene flow는 GT가 없어 pseudo-label을 supervision으로 사용 — 이것이 scene flow loss 노이즈의 근본 원인.
| Step | Total loss | Depth (d) | Pose (p) | Scene flow (sf) | LR |
|---|---|---|---|---|---|
| 17,500 | 0.610 | 0.362 | 0.060 | 0.376 | 5.5e-07 |
| 18,000 | 0.398 | 0.208 | 0.037 | 0.304 | 5.0e-05 |
| 20,000 | 0.319 | 0.136 | 0.026 | 0.313 | 4.93e-05 |
| 22,500 | 0.258 | 0.106 | 0.020 | 0.264 | 4.72e-05 |
| 25,000 | 0.387 | 0.126 | 0.021 | 0.478 | 4.38e-05 |
| 27,500 | 0.302 | 0.083 | 0.026 | 0.387 | 3.93e-05 |
| 30,000 | 0.254 | 0.078 | 0.014 | 0.324 | 3.40e-05 |
| 32,000 | 0.297 | 0.073 | 0.024 | 0.400 | 2.93e-05 |
| 35,000 | 0.248 | 0.068 | 0.015 | 0.363 | 2.19e-05 |
| 37,500 | 0.262 | 0.063 | 0.018 | 0.378 | 1.59e-05 |
| 40,300 | 0.241 | 0.054 | 0.018 | 0.340 | 1.03e-05 |
| 40,715 (최신) | 0.352 | 0.065 | 0.017 | 0.541 | 9.46e-06 |
loss=0.15~0.36 범위로 분산이 있지만 추세선 기준으로 하강 중. step 40K 이후부터는 LR이 ~1e-5 이하로 내려가며 개선 속도 둔화 예상.
Depth와 pose의 85%/70% loss 감소는 LGM connector가 Any4D pseudo-label을 충분히 학습하고 있음을 의미. Phase B 완료 후 LGM connector를 4D reward 계산에 사용할 수 있는 품질 수준에 근접하고 있음.
Scene flow loss가 총 loss의 대부분을 점유하고 있어, 현재 수치가 높아 보이지만 실질적으로 중요한 depth/pose는 양호하게 수렴 중. Phase 3(GRPO)에서 scene flow reward 가중치를 낮추거나 제외하는 것을 검토할 필요 있음.
job 48060이 step 50K까지 완료되면 phaseB_50000.pt 체크포인트 확보.
VAL visualization (viz/step_50000.png)으로 depth/pose 예측 품질 시각 확인.
정량 평가: DROID validation set에서 depth RMSE, pose error (ATE) 측정. Any4D pseudo-label과의 비교 및 GT depth(droid_processed 156 에피소드)와 비교. scene flow 품질이 reward 계산에 충분한지 판단.
Phase B 평가 결과에 따라 plan-gt_alignment.md의 GT supervision 전환을 적용할지 결정.
depth가 충분히 수렴했다면 Phase 3로 직행; GT 품질이 부족하면 droid_processed 156 ep로
추가 파인튜닝(GT depth/pose alignment) 실시.
GT scene flow 없음 → pseudo-label 노이즈 상한이 존재. 옵션: ① scene flow loss weight를 0으로 (depth/pose만 학습), ② RAFT 등 외부 optical flow를 scene flow GT로 사용, ③ Phase 3 GRPO에서 scene flow reward를 제외. Phase B 완료 후 ablation 실험 예정.