Index
2026-04-17 — Experiment

LGMv3 Phase B 학습 실행 현황

VGGRPO | train_lgm_v3.sh · 4 GPU · core-extra QOS · 반복 Preemption

TL;DR

4
PREEMPT 횟수
~26h 50m
손실 compute
15h 36m+
현재 연속 실행
4
GPU (core-extra)

1 배경 / 목적

VGGRPO Phase 2 (LGM 구축) 의 핵심인 LGMv3 Phase B 학습을 진행 중. Phase A는 closed-form ridge regression (find_stitch_layer.py, best ℓ̂=7)으로 대체되었고, Phase B가 실질적인 depth/pose/scene-flow 예측 학습이다.

학습 설정: --init_conv3d experiments/stitch_search/conv3d_init_layer7.pt --stitch_layer 7, 4 GPU B200, core-extra QOS (quota 초과 상태 → preemption 대상).

core-extra QOS: own-quota 초과 상태에서 extra QOS로 실행 중. own-quota 작업이 들어오면 자동 선점(PREEMPT) 발생. 이것이 반복 중단의 원인.

2 SLURM Job 실행 이력

SLURM sacct --starttime=2026-04-16 기준 train_lgm_v3.sh 관련 전체 이력:

Job ID 상태 Elapsed 비고
45899PREEMPTED08:47:18초기 Phase B 학습 시도
47040PREEMPTED02:05:31재시도 — 단기 선점
47133PREEMPTED08:06:58재시도
47662PREEMPTED08:02:48재시도
48005COMPLETED00:05:01설정 검증용 단기 실행
48031COMPLETED00:01:19설정 검증용 단기 실행
48060RUNNING15:36:21+현재 진행 중 (가장 긴 연속 실행)

Preemption 총 손실 compute time: 08:47 + 02:05 + 08:06 + 08:02 = 약 26h 50m. Job 48005, 48031은 각각 5분, 1분으로 설정 검증(디버그 run)으로 추정된다.

# 학습 제출 명령 (sbmr — 자동 requeue 포함) sbmr 5 "bash scripts/train_lgm_v3.sh" \ --qos=core-extra --gres=gpu:4 -c 96 --mem 800GB

3 현황 분석

Job 48060이 15h 36m 이상 중단 없이 실행되고 있다. 이전 최장 실행이 8h 47m(45899)이었으므로 이번 실행이 가장 오래 지속되고 있다.

긍정적: core-extra QOS 환경에서 15h+ 연속 실행은 클러스터 상황이 완화되었음을 의미. 이 패턴이 유지되면 Phase B 학습을 완주할 가능성이 있다.
누적 손실: preemption 4회로 약 26h 50m의 compute가 소실됨. checkpoint 기반 재시작(sbmr 자동 requeue)으로 progress는 보존되지만, overhead는 실질적이다.

job 48005(5min), 48031(1min)의 COMPLETED 패턴은 Phase B 재시작 전 checkpoint 경로나 데이터 로딩을 검증한 단기 테스트 run으로 보인다.

📌 Preemption 패턴 분석

45899(8h47) → 47040(2h05) → 47133(8h06) → 47662(8h02): 47040만 2시간에서 선점되고 나머지는 모두 8시간대에서 선점. 클러스터 own-quota 작업이 낮시간 대 집중적으로 들어오는 패턴으로 추정. 현재 48060은 그 시간대를 넘긴 것으로 보인다.

4 Takeaway

LGMv3 Phase B 학습이 core-extra QOS 환경에서 반복 preemption에도 불구하고 자동 requeue(sbmr)로 지속 실행되고 있다. 현재 job 48060이 가장 오래 실행 중으로, Phase B 학습의 실질적인 진행 여부는 이 job의 checkpoint loss 곡선에서 확인 가능하다.

Phase B 결과(depth/pose 예측 품질)가 나오면 GT alignment 계획(GT supervision 전환)을 실제로 구현하기 위한 기반이 마련된다.

5 Next Steps