sbmr로 재개.
--vae_type 미전달로 Cosmos 대신 Wan이 학습되던 문제 포함), 체크포인트 2.5TB → 110GB로 정리.VGGRPO-rl-phase2(RL/Phase 4).코드 커밋 없음 — 학습 잡 2개 완주 + 핸드오프 문서 1건.
${VAE_TYPE} 누락), --vae_type이 python에 전달 안 돼 실제로는 Cosmos 대신 Wan이 학습되고 있던 문제, fp16 depth quantization(z-buffer 0.99 근처 ~0.4m 계단현상 → fp32 재전처리로 해결), num_samples overreport로 인한 IndexError(clamp로 임시 방어), 강제 최종 체크포인트 저장 누락, 체크포인트 미정리로 2.5TB 적체(자동 pruning으로 110GB까지 정리).12 commits — GRPO 학습 파이프라인을 하루 만에 신규 구축하고 첫 negative result까지 확정.
num_samples overreport)이 dataset loader clamp로만 임시 방어된 상태 — preprocess 단계 근본 수정 필요.| Job ID | 프로젝트 | 실행 명령 | GPU | 상태 | 실행 시간 | 노드 |
|---|---|---|---|---|---|---|
| 37231 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino) | 4 | CANCELLED | 00:00:05 | n10 |
| 37232 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=aggregator) | 4 | CANCELLED | 00:00:00 | - |
| 37233 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=dino, cosmos) | 4 | COMPLETED | 04:58:08 | n11 |
| 37234 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (STITCH=aggregator, cosmos) | 4 | COMPLETED | 04:00:42 | n12 |
| 37399 | VGGRPO | train_lgm_robocasa_vggt_v0.sh (agg2 resumed, IndexError fix) | 4 | COMPLETED | 02:57:41 | n27 |
| 37369 | VGGRPO-rl-phase2 | cosmos_ff/train_grpo.sh (smoke) | 1 | COMPLETED | 00:07:45 | n45 |
| 37375 | VGGRPO-rl-phase2 | cosmos_ff/train_grpo.sh (v0, sde=4/noise=0.7) | 1 | CANCELLED (user) | 00:48:20 | n73 |
| 37389 | VGGRPO-rl-phase2 | cosmos_ff/train_grpo.sh (v1, full-SDE/noise=1.0) | 1 | CANCELLED (user) | 00:10:50 | n84 |
| 37406 | VGGRPO-rl-phase2 | cosmos_ff/train_grpo.sh (v2, regime pivot) | 1 | CANCELLED (user) | 01:30:18 | n87 |
| 37509 | VGGRPO-rl-phase2 | cosmos_ff/train_grpo.sh (24-task survey, 35 epoch) | 1 | CANCELLED (user) | 03:46:44 | n86 |