scripts/train_lgm_v3.sh — Phase B LGM 학습 (4 GPU, core-extra)VGGRPO Phase 2 (LGM 구축) 의 핵심인 LGMv3 Phase B 학습을 진행 중. Phase A는 closed-form ridge regression (find_stitch_layer.py, best ℓ̂=7)으로 대체되었고, Phase B가 실질적인 depth/pose/scene-flow 예측 학습이다.
학습 설정: --init_conv3d experiments/stitch_search/conv3d_init_layer7.pt --stitch_layer 7, 4 GPU B200, core-extra QOS (quota 초과 상태 → preemption 대상).
SLURM sacct --starttime=2026-04-16 기준 train_lgm_v3.sh 관련 전체 이력:
| Job ID | 상태 | Elapsed | 비고 |
|---|---|---|---|
| 45899 | PREEMPTED | 08:47:18 | 초기 Phase B 학습 시도 |
| 47040 | PREEMPTED | 02:05:31 | 재시도 — 단기 선점 |
| 47133 | PREEMPTED | 08:06:58 | 재시도 |
| 47662 | PREEMPTED | 08:02:48 | 재시도 |
| 48005 | COMPLETED | 00:05:01 | 설정 검증용 단기 실행 |
| 48031 | COMPLETED | 00:01:19 | 설정 검증용 단기 실행 |
| 48060 | RUNNING | 15:36:21+ | 현재 진행 중 (가장 긴 연속 실행) |
Preemption 총 손실 compute time: 08:47 + 02:05 + 08:06 + 08:02 = 약 26h 50m. Job 48005, 48031은 각각 5분, 1분으로 설정 검증(디버그 run)으로 추정된다.
Job 48060이 15h 36m 이상 중단 없이 실행되고 있다. 이전 최장 실행이 8h 47m(45899)이었으므로 이번 실행이 가장 오래 지속되고 있다.
job 48005(5min), 48031(1min)의 COMPLETED 패턴은 Phase B 재시작 전 checkpoint 경로나 데이터 로딩을 검증한 단기 테스트 run으로 보인다.
45899(8h47) → 47040(2h05) → 47133(8h06) → 47662(8h02): 47040만 2시간에서 선점되고 나머지는 모두 8시간대에서 선점. 클러스터 own-quota 작업이 낮시간 대 집중적으로 들어오는 패턴으로 추정. 현재 48060은 그 시간대를 넘긴 것으로 보인다.
LGMv3 Phase B 학습이 core-extra QOS 환경에서 반복 preemption에도 불구하고 자동 requeue(sbmr)로 지속 실행되고 있다. 현재 job 48060이 가장 오래 실행 중으로, Phase B 학습의 실질적인 진행 여부는 이 job의 checkpoint loss 곡선에서 확인 가능하다.
Phase B 결과(depth/pose 예측 품질)가 나오면 GT alignment 계획(GT supervision 전환)을 실제로 구현하기 위한 기반이 마련된다.
squeue -u taewoongkang + SLURM log에서 Phase B loss 곡선 확인