train_lgm_robocasa_vggt_v0.sh(STITCH_TYPE=dino, LOSS_TAG=a5, w_depth=5.0)가 지난 9시간 동안 PREEMPTED 3연속(50443 2:25 / 50717 3:18 / 51181 2:43, 총 ~34 GPU-h)되었고 후속 잡 51312는 현재 PENDING(AssocGrpGRES — GPU quota 대기). `own` 4-GPU 쿼터로 전환하거나 preempt 주기를 감안한 짧은 체크포인트 간격 확인 필요.
LOSS_TAG=a5, w_cam/w_depth 재조정)이다. 13일간 문서 갱신 없이 실험 설정만 바뀐 상태 — 다음 세션에서 현재 a5 실험의 배경/가설을 context.md에 기록할 것.
own/extra QOS 경계에서 3회 연속 PREEMPTED → 재제출 → 현재 PENDING. 학습 자체는 살아있지만 완주 못 하고 있는 상태.코드 커밋·문서 작성 없음. 학습 잡만 preempt-재제출 사이클로 계속 진행.
NUM_FRAMES=8 VAE_TYPE=cosmos STITCH_TYPE=dino LOSS_TAG=a5, w_cam=1.0 w_depth=5.0 grad_scales=1 alpha_conf=0.0 gamma_conf=1.0 view_weights_depth=1,1,2.5)가 checkpoint에서 auto-resume하며 3회 연속 preempt됨: 50443(19:25 시작, 2:25:06 만에 preempt) → 50717(21:58 시작, 3:18:31) → 51181(01:20 시작, 2:43:10, 04:04에 preempt) → 51312(재제출, 현재 PENDING). extra QOS라 다른 사용자의 own 잡에 매번 밀려나는 패턴 — context.md의 dino4/agg2(37233/37399, 07-09 완주분)와는 다른 loss config(a5)로, 실험이 문서화 없이 이어지고 있음.
extra QOS의 구조적 특성(다른 유저의 own 잡이 도착하면 즉시 밀림) — 체크포인트 간격이 preempt 주기(2~3h)보다 촘촘한지 확인 없이는 학습 진행률(step)이 실제로 얼마나 쌓이고 있는지 불확실.own QOS로 전환해 preempt 리스크 제거.claude/ 디렉토리 없음(구조적 이슈, 신규 아님). 4개 서브디렉토리(exp1/exp2/exp3/rgb) 전부 무활동.
| Job ID | 프로젝트 | 실행 명령 | GPU | 상태 | 실행 시간 | 노드 |
|---|---|---|---|---|---|---|
| 50443 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, LOSS_TAG=a5) | 4 | PREEMPTED | 02:25:06 | n55 |
| 50717 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, LOSS_TAG=a5, resume) | 4 | PREEMPTED | 03:18:31 | n31 |
| 51181 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, LOSS_TAG=a5, resume) | 4 | PREEMPTED | 02:43:10 | n30 |
| 51312 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, LOSS_TAG=a5, resume) | 4 | PENDING (AssocGrpGRES) | - | - |
※ 나머지 5개 프로젝트(DreamData, EgoX2, EgoX_wan2.2, EgoX_wan2.2_long, Graph_VLM)의 WorkDir로는 지난 24시간 내 sacct 기록 없음.