extra QOS). RGB-only 재시도도 11h22m 후 PREEMPTED (job 1174).--qos=own 사용 or sbmr 자동 재시도 설정 검토.Phase A(T2V smoke), Phase B(I2V A14B 마이그레이션 + smoke), Phase C(latent cache 3-way split)가 순차적으로 완료됐다. Phase D는 8-GPU DDP로 실제 LoRA fine-tuning을 진행하는 단계다. latent cache가 미리 빌드되어 있으면 학습 시작 시 eager precompute 없이 바로 학습에 들어갈 수 있다.
configs/robocasa_i2v.yaml)| Job ID | Config | QOS | 실행 시간 | State | 비고 |
|---|---|---|---|---|---|
| 1091 | robocasa_i2v.yaml --mode rgb | extra | 2h 57m | COMPLETED | RGB cache 빌드 완료 |
| 1092 | robocasa_i2v.yaml --mode pt | share | 3h 51m | COMPLETED | PT cache 빌드 완료 |
| 1164 | robocasa_i2v.yaml (HCPT) | extra | 15h 32m | PREEMPTED | 첫 본격 HCPT 학습 |
| 1170 | robocasa_i2v_rgbonly.yaml | extra | 0h 30m | CANCELLED | CONFIG env var 전달 오류 추정 |
| 1174 | robocasa_i2v_rgbonly.yaml | extra | 11h 22m | PREEMPTED | RGB-only 재시도 |
extra QOS로 제출됐고, 15h와 11h 실행 후 다른 사용자의 own job이 들어오면서 CANCELLED됐다. 5분 grace period가 있으므로 마지막 체크포인트는 preemption 직전까지 저장됐을 가능성이 있다.slurms/ 디렉토리의 output 파일을 직접 확인해야 한다.Phase A→C가 완료된 시점에서 실제 학습이 시작됐다는 것 자체가 중요한 이정표다. 15h와 11h가 정상 실행됐다는 것은 코드와 데이터 파이프라인에 치명적 버그가 없다는 간접 증거다 — latent cache 미스, OOM, NaN 발산이 있었다면 수 분~수십 분 내 crash가 났을 것이다. extra QOS 특성상 preemption은 예상된 결과이며, 문제는 resume 전략의 부재다.
jobs 1164, 1174의 output 파일(slurms/*.out)에서 마지막 저장 step과 loss 값 확인. checkpoint 디렉토리(results/robocasa_i2v/)의 최신 파일 timestamp로 저장 여부 검증.
옵션 A: sbmr 5 "bash scripts/run_robocasa_i2v.sh" --gres=gpu:8 -c 56 --mem 800GB --qos=extra — 자동 재시도(최대 5회), preemption 발생 시 마지막 checkpoint에서 resume. 코드에 --resume_from_checkpoint latest가 설정돼 있는지 확인 필요.
옵션 B: --qos=own으로 제출해 preemption 없는 환경 확보. 단, own quota(8 GPU)를 독점하므로 팀 내 조율 필요.
job 1164(HCPT)이 15h 실행됐는데 PT view2 outlier 버그(context.md 기재)가 학습에 영향 줬을 가능성 있다. RGB-only(job 1174)로 baseline 수렴을 먼저 확인한 뒤 HCPT로 전환하는 순서가 안전할 수 있다.