LGM Training · Infra Hardening

VGGRPO — Experiments

260406-260412 · ~20 SLURM jobs, ~5 GPU·d wall time

SLURM Jobs~20
GPU·d~5d
Hardware4×B200
Preempt %70%

실험 목적

이번 주 SLURM 작업은 두 가지 목적이 섞여 있다: (1) Resume / NaN guard / viz 인프라 검증, (2) LGM Phase A/B 학습 누적. 그러나 04-09에 design bug가 발견되면서 후반 작업의 결과는 baseline 무효 처리. 인프라 검증 결과는 유효.

Configuration

ParamValue
ConnectorConv3d, 2.05M params
LoRA rank32
DatasetDROID + EgoExo4D 옵션 추가
GPU4 × B200
Grad clip0.5 (강화됨, 1.0→0.5)
Loss skip threshold5.0
Depth clamp100m

SLURM 작업 (대표)

Job IDStateElapsedPeriodNote
36031PREEMPTED06:4504-05 17:35 → 04-06 00:214GPU LGM
36457PREEMPTED10:0404-06 13:59 → 04-07 00:03
36535PREEMPTED07:0904-06 17:47 → 04-07 00:57
37393PREEMPTED1d 03:4404-07 13:47 → 04-08 17:32가장 긴 단일 run
38366CANCELLED15:0304-09 01:47 → 16:51Resume LGM
38638COMPLETED04:2004-09 18:37 → 22:58
38796PREEMPTED13:5504-10 00:01 → 13:56
38815PREEMPTED22:2104-10 00:36 → 22:58
40365PREEMPTED12:3004-11 01:47 → 14:18
41053PREEMPTED06:2604-11 16:44 → 23:10
41671PREEMPTED06:5604-12 03:46 → 10:43
42101PREEMPTED06:3104-12 10:43 → 17:14
42511RUNNING~01:52+04-13 12:59 → ...현재 진행

실행 명령: scripts/train_lgm.sh · scripts/resume_lgm.sh · scripts/train_lgm_egoexo4d.sh

GPU 사용 분석

Ablation Insights