← 목록으로
2026-04-21 · VGGRPO · LGM Phase B

LGMv3 Phase B 후반부 수렴 현황

step 40.7K → 47.5K (95%) · job 48060 · RUNNING 4일 10h+

TL;DR

95%
진행률
47.5K
현재 step
0.046
depth loss
0.018
pose loss
0.25
scene flow (avg)
~3h
잔여 추정

1 배경/목적 (왜)

이전 카드(260420)에서 step 40.7K(81%)까지의 수렴을 확인했다. 이후 추가 6.8K steps(40.7K→47.5K)가 진행되었고, cosine LR schedule이 tail 구간에 진입했다. 이 구간에서의 수렴 패턴을 확인하고, 완료 후 checkpoint 평가 준비 여부를 점검하기 위해 현황을 기록한다.

특히 LR이 1.09e-05(step 40K) → 9e-07(step 47.5K)로 12x 감소한 구간으로, gradient update 크기가 줄어들며 loss가 어떻게 안정화되는지 확인한다.

2 작업 내용 (어떻게)

Job 48060 (scripts/train_lgm_v3.sh, 4 GPU, core-extra QOS)의 SLURM output slurms/taewoongkang_48060.out에서 step 40K~47.5K 구간 loss를 추출해 분석.

sbm "scripts/train_lgm_v3.sh" --qos=core-extra --gres=gpu:4 -c 96 --mem 800GB # 학습 설정 total_steps = 50,000 lr_schedule = cosine (max lr = 1e-4, min lr → 0) loss = depth(d) + pose(p) + scene_flow(sf) # 40K 이후 lr 추이 step 40K: lr = 1.09e-05 step 43K: lr = 5.54e-06 step 45K: lr = 2.88e-06 step 47K: lr = 1.05e-06 ← cosine tail 진입 step 47.5K: lr ≈ 9e-07

3 결과 (수치)

Step별 loss 추이 (40K→47.5K)

Steptotal lossdepth (d)pose (p)scene flow (sf)lr
40K 이전 카드 끝0.1920.0510.0120.2591.09e-05
41K0.2870.0610.0140.4248.93e-06
42K0.2700.0570.0250.3767.15e-06
43K0.2470.0510.0190.3545.54e-06
44K0.3030.0560.0090.4764.11e-06
45K0.2420.0500.0150.3532.88e-06
46K0.1080.0450.0230.0791.86e-06
47K0.1590.0510.0210.1741.05e-06
47.5K 현재0.1310.0440.0140.144~9e-07

이전 카드 대비 개선

0.055→0.046
depth loss (−16%)
0.018→0.018
pose loss (plateau)
0.08~0.55
scene flow (노이즈 지속)
Depth: 0.055(40.7K) → 0.044(47.5K) — LR decay에 따른 미세 추가 수렴. per-step variance도 감소 추세.
Pose: 0.018 수준에서 plateau. step 47.5K 기준 0.014~0.024 범위로 안정. 실질 수렴 완료로 판단.
Scene Flow: 최솟값 0.079(step 46K), 최댓값 0.55(step 44K)로 배치마다 극단적 변동. 이는 pseudo-label(frozen Any4D) 노이즈가 원인이며, LR을 낮춰도 해소되지 않음.
안정성: step 17K 재시작 이후 선점 0회, 4일 10시간+ 연속 RUNNING. 학습 자체는 안정.

4 Takeaway

LR cosine tail 구간의 의미

Step 47K에서 lr ≈ 1e-6로 진입 후 실질적인 loss 개선은 미미하다. Depth/pose 모두 수렴 완료 상태이며, 이후 2,500 steps는 fine-grained weight 안정화 역할만 할 것으로 예상된다. Phase B checkpoint를 50K 완료 직후 평가해도 되고, 이미 47.5K checkpoint를 평가해도 큰 차이 없을 수 있다.

Scene flow loss의 높은 variance는 구조적 문제(pseudo-label 품질)로, loss 값 자체보다 checkpoint에서 실제 scene flow 예측 품질을 직접 검증해야 한다. Loss 수치만으로 scene flow 수렴 여부를 판단하기 어렵다.

이번 Phase B 학습은 GT supervision 없이 pseudo-label로 학습한 첫 번째 완전 사이클이다. 완료 후 GT alignment 도입(plan-gt_alignment.md, 260416 설계) 여부를 결정하는 기준 checkpoint가 된다.

5 Next Steps

즉시 (완료 후)

다음 결정

한계: 현재 log 기반 loss 수치만 있으며, 실제 geometry 품질(SSIM, EPE 등 정량 지표)은 별도 eval 스크립트 실행 필요. 완료 후 즉시 실행 권장.