Index
2026-04-20 — Experiment

LGMv3 Phase B 학습 loss 진행 현황 (step 17.5K→40.7K)

VGGRPO | job 48060 | 4×B200 core-extra QOS | lgmv3_0413_1229

TL;DR

81%
진행률
0.055
Depth loss
0.018
Pose loss
0.38
SF loss
40,715
현재 step
3d 9h
RUNNING
전체 진행률 (step 0 → 50K 기준)
40,715 / 50,000

1 배경 / 목적

LGMv3 Phase B는 frozen Any4D의 pseudo-label(depth/pose/scene flow)로 LGM connector를 학습시키는 단계. 260413에 find_stitch_layer.py로 최적 stitch layer ℓ̂=7을 확정하고 conv3d_init_layer7.pt를 초기화 체크포인트로 사용.

이전 학습 시도(job 47040, 47133, 47662 등)는 core-extra QOS 환경에서 총 4회 선점(약 26h 소모)을 겪어 step 17,500까지만 진행된 상태였음. 4/17 00:33에 job 48060으로 재시작하여 이번 카드 기준 step 40,715까지 선점 없이 안정 학습 중.

이번 카드의 범위: 기존 260417-lgmv3_phaseB_training.html은 job 48060 시작 직후(15h, ~step 22K) 운영 상태만 기록. 이 카드는 step 17.5K→40.7K 구간의 실제 loss 수치를 담음.

2 학습 설정

Job ID : 48060 (sbmr 5 "bash scripts/train_lgm_v3.sh" --qos=core-extra --gres=gpu:4 -c 96 --mem 800GB) 실험명 : lgmv3_0413_1229 재시작 from : experiments/lgmv3_0413_1229/checkpoints/phaseB_17500.pt GPU : 4×B200 (DDP, world_size=4) LR schedule : warmup 500 steps → peak 5e-5 → cosine decay 현재 step 40,715: lr ≈ 9.5e-6 Loss : depth (SSIM+L1) + pose (quat+trans) + scene_flow scene_flow은 frozen Any4D pseudo-label supervision VAL : 매 100 step마다 viz/step_XXXXX.png 저장 시작 시각 : 2026-04-17 00:33:32 경과 : 3일 9시간 17분 (선점 없음)

Phase B 핵심 설계: Any4D는 frozen(gradient 없음)으로 pseudo-label 생성 전용. 학습 가능 파라미터는 LGM connector (Conv3d 2.05M params)만. scene flow는 GT가 없어 pseudo-label을 supervision으로 사용 — 이것이 scene flow loss 노이즈의 근본 원인.

3 결과

Loss 추이 (샘플, 매 ~2,500 step)

StepTotal lossDepth (d)Pose (p)Scene flow (sf)LR
17,5000.6100.3620.0600.3765.5e-07
18,0000.3980.2080.0370.3045.0e-05
20,0000.3190.1360.0260.3134.93e-05
22,5000.2580.1060.0200.2644.72e-05
25,0000.3870.1260.0210.4784.38e-05
27,5000.3020.0830.0260.3873.93e-05
30,0000.2540.0780.0140.3243.40e-05
32,0000.2970.0730.0240.4002.93e-05
35,0000.2480.0680.0150.3632.19e-05
37,5000.2620.0630.0180.3781.59e-05
40,3000.2410.0540.0180.3401.03e-05
40,715 (최신)0.3520.0650.0170.5419.46e-06

Depth loss 수렴 분석

Depth: step 17,500의 0.362에서 step 40,000대의 0.05~0.07로 85% 감소. step 25,000~30,000 구간에서 가장 빠른 하강(0.126→0.078). 이후 완만한 수렴.
Pose: step 17,500의 0.060에서 0.014~0.025 수준으로 약 70% 감소. depth에 비해 상대적으로 일찍(step 22K 이전) 안정 구간 진입.
Scene flow: 0.376 → 0.34~0.55 범위로 거의 개선 없음. pseudo-label supervision이 노이즈 상한을 만들고 있으며 총 loss의 70~80%를 차지. 실질적 학습이 depth/pose 수렴에 집중됨.

학습 안정성

선점 없음: 4/17 시작 이후 3일 9시간 동안 PREEMPTED 없음. 이전 학습(4회 선점)과 달리 core-extra QOS에서 꾸준히 자원 확보.

loss=0.15~0.36 범위로 분산이 있지만 추세선 기준으로 하강 중. step 40K 이후부터는 LR이 ~1e-5 이하로 내려가며 개선 속도 둔화 예상.

4 Takeaway

Phase B 수렴 의미

Depth와 pose의 85%/70% loss 감소는 LGM connector가 Any4D pseudo-label을 충분히 학습하고 있음을 의미. Phase B 완료 후 LGM connector를 4D reward 계산에 사용할 수 있는 품질 수준에 근접하고 있음.

Scene flow loss가 총 loss의 대부분을 점유하고 있어, 현재 수치가 높아 보이지만 실질적으로 중요한 depth/pose는 양호하게 수렴 중. Phase 3(GRPO)에서 scene flow reward 가중치를 낮추거나 제외하는 것을 검토할 필요 있음.

GT supervision 전환(plan-gt_alignment.md) 미적용: 현재 학습은 pseudo-label 전용. GT depth/pose를 on-the-fly alignment로 사용하는 설계(260416)는 Phase B 완료 후 재학습 여부를 평가할 때 고려. 156 에피소드(droid_processed) vs 현재 데이터셋 규모 차이가 주요 변수.

5 Next Steps

즉시 — Phase B 완료 대기 (~4/21~4/22)

job 48060이 step 50K까지 완료되면 phaseB_50000.pt 체크포인트 확보. VAL visualization (viz/step_50000.png)으로 depth/pose 예측 품질 시각 확인.

완료 후 — Phase B 체크포인트 평가

정량 평가: DROID validation set에서 depth RMSE, pose error (ATE) 측정. Any4D pseudo-label과의 비교 및 GT depth(droid_processed 156 에피소드)와 비교. scene flow 품질이 reward 계산에 충분한지 판단.

GT supervision 전환 여부 결정

Phase B 평가 결과에 따라 plan-gt_alignment.md의 GT supervision 전환을 적용할지 결정. depth가 충분히 수렴했다면 Phase 3로 직행; GT 품질이 부족하면 droid_processed 156 ep로 추가 파인튜닝(GT depth/pose alignment) 실시.

미해결 — Scene flow 개선 경로

GT scene flow 없음 → pseudo-label 노이즈 상한이 존재. 옵션: ① scene flow loss weight를 0으로 (depth/pose만 학습), ② RAFT 등 외부 optical flow를 scene flow GT로 사용, ③ Phase 3 GRPO에서 scene flow reward를 제외. Phase B 완료 후 ablation 실험 예정.