train_lgm_robocasa_vggt_v0.sh(STITCH=dino, LOSS_TAG=a5, w_depth=5.0) 21:33 시작, node n36, GPU 4장 util 96~99% / mem 97GB·178GB, sjob 진단 이상 없음. exp dir lgm_robocasa_vggt_v0_cosmos_dino4_a5_0721_1025 기준 step ~39200까지 진행, per-step loss 0.3~1.1 사이 변동(수렴 추세는 이 스냅샷만으로 판단 불가). 이전 3개 attempt(12분~12시간)보다 훨씬 안정적으로 오래 버티는 중 — preempt 여부 계속 관찰.
_0721_1025) 기준 이 a5 학습은 시작한 지 사흘째 — cluster extra QOS 특성상 own 잡 도착마다 계속 밀리는 패턴.코드 커밋·문서 작성 없음. 동일 a5 학습이 preempt→auto-resume 체인으로 3번 더 순환한 뒤, 현재(54071) 오늘 attempt 중 가장 오래 버티는 중.
NUM_FRAMES=8 VAE_TYPE=cosmos STITCH_TYPE=dino LOSS_TAG=a5, w_cam=1.0 w_depth=5.0 grad_scales=1 alpha_conf=0.0 gamma_conf=1.0 view_weights_depth=1,1,2.5)가 checkpoint auto-resume로 계속 이어짐: 53369(04:27 시작 → 16:42 PREEMPTED, 12:15:00 경과, node n8) → 53795(16:44 시작 → 19:23 PREEMPTED, 2:38:30 경과, node n28) → 54025(20:17 시작 → 20:30 PREEMPTED, 단 12:34만에 밀림, node n27) → 54071(약 1시간 PENDING 간격 후 21:33 시작, 현재 RUNNING 11:28:41+, node n36). sjob 기준 GPU 4장 모두 util 96~99%, mem 97/178GB, throttle 0%, 진단 경고 없음. 로그 tail(step 38250~39200) 기준 per-step loss는 0.3~1.1 범위에서 진동 — 수렴 여부는 더 긴 구간 확인 필요.
claude/ 디렉토리 없음(구조적 이슈, 신규 아님). 4개 서브디렉토리(exp1/exp2/exp3/rgb) 전부 무활동.
| Job ID | 프로젝트 | 실행 명령 | GPU | 상태 | 실행 시간 | 노드 |
|---|---|---|---|---|---|---|
| 53369 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, LOSS_TAG=a5, resume) | 4 | PREEMPTED | 12:15:00 | n8 |
| 53795 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, LOSS_TAG=a5, resume) | 4 | PREEMPTED | 02:38:30 | n28 |
| 54025 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, LOSS_TAG=a5, resume) | 4 | PREEMPTED | 00:12:34 | n27 |
| 54071 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, LOSS_TAG=a5, resume) | 4 | RUNNING | 11:28:41+ | n36 |
※ 나머지 5개 프로젝트(DreamData, EgoX2, EgoX_wan2.2, EgoX_wan2.2_long, Graph_VLM)의 WorkDir로는 지난 24시간 내 sacct 기록 없음. 사용자의 다른 SLURM 활동(Robotics/cosmos의 s30_full_0~3 RUNNING 4건, dreamzero 등)은 이번 6개 프로젝트 범위 밖이라 제외.