TL;DR
- 현재 RUNNING: SLURM job 48079, 3일 8시간 실행 중 (2026-04-20 기준)
- iter 38,400: loss=0.2185, iter_speed=20.09초/iter, GPU 4×B200 (peak 144.4GB/GPU)
- 초기화:
Cosmos-Predict2-14B-Sample-GR00T-Dreams-DROID (DROID domain 사전 적응 체크포인트)
- 반복 preemption 극복: 동일 실험 8회 이상 preempt 후 job 48079에서 안정 실행. resume from checkpoint 정상 동작 확인.
1 배경 / 목적
DreamData 프로젝트에서 DreamGen 파이프라인을 따라 video world model을 학습한다. 이 video model은 real demonstration 비디오를 conditioning으로 받아 새로운 robot manipulation 비디오를 합성하는 역할을 한다. 합성된 비디오에 IDM으로 pseudo action을 부여하여 VLA 학습 데이터를 증강한다.
Cosmos-Predict2 선택 이유: DreamGen 논문이 Cosmos 기반 video world model을 사용. GR00T-Dreams repo에서 Cosmos-Predict2 + GR00T-DROID init 조합으로 RoboCasa domain에 파인튜닝하는 설정이 준비되어 있었음.
두 가지 실험을 병렬로 진행 중:
- real init:
14b_groot_robocasa_mg30_real_480 — GR00T-DROID ckpt에서 real MG-30 데이터로 파인튜닝 (현재 RUNNING)
- droid init:
14b_groot_robocasa_mg30_480 — 별도 DROID init 실험 (여러 차례 preempt, 현재 중단)
2 작업 내용
학습 설정
모델: Cosmos-Predict2 14B (video2world)
초기화: checkpoints/nvidia/Cosmos-Predict2-14B-Sample-GR00T-Dreams-DROID/model-480p-16fps.pt
실험명: predict2_video2world_training_14b_groot_robocasa_mg30_480
GPU: 4× B200, fsdp_shard_size=4, context_parallel_size=1
해상도: 480P 16fps
데이터: RoboCasa MG-30 real demonstrations (24 task × 30 ep = 720 ep)
출력: cosmos-predict2/checkpoints/posttraining/video2world/14b_groot_robocasa_mg30_real_480/
SLURM 실행 이력
| Job ID | 상태 | 실행 시간 | 비고 |
| 48079 | RUNNING | 3d 8h+ (진행 중) | iter 38400, 안정 실행 |
| 48025 | PREEMPTED | 1h 23m | 초기 실행 |
| 48033 | PREEMPTED | 1h 07m | — |
| 48081 | PREEMPTED | 5h 58m | — |
| 49833 | PREEMPTED | 5h 00m | — |
| 49648 | PREEMPTED | 3h 57m | — |
| 49984 | COMPLETED | 4m | checkpoint 저장 확인용 단기 실행 |
GPU 리소스 사용 현황 (iter 38400 기준)
peak GPU mem (avg)
144.4 GB
3 결과 (진행 중)
iter 38,400 안정 실행 중: 2026-04-20 00:30~00:31 기준 checkpoint 정상 저장 확인 (model/optim/scheduler/trainer 4개 파일). loss 0.2185로 수렴 추세.
학습 진행 추이
| 시점 | iter | loss | 비고 |
| 학습 시작 | 0 | — | GR00T-DROID ckpt에서 warm-start |
| 중간 (추정) | ~20,000 | — | preemption 반복 구간 |
| 현재 (2026-04-20) | 38,400 | 0.2185 | RUNNING, checkpoint 저장 확인 |
Checkpoint 저장 경로:
checkpoints/posttraining/video2world/14b_groot_robocasa_mg30_real_480/
├── checkpoints/
│ ├── model/iter_000038400.pt
│ ├── optim/iter_000038400.pt
│ ├── scheduler/iter_000038400.pt
│ └── trainer/iter_000038400.pt
├── config.pkl
├── config.yaml
└── stdout.log
GPU util 75% 평균: 최대 100%, 최소 0%로 편차 큼. data loading 또는 checkpoint 저장 시 idle 구간 존재. 병목 확인 필요.
4 Takeaway
DreamGen 파이프라인에서의 위치
이 video world model이 완성되면 synthetic 비디오 생성이 가능해진다. DreamGen 논문에서는 1,200 human demo로 video model을 학습하고 neural trajectory를 생성했다. 우리는 720 ep(MG-30)로 학습 중으로, 논문보다 데이터가 적지만 GR00T-DROID warm-start로 일부 보완.
Cosmos-Predict2 선택의 이점: NVIDIA의 공식 GR00T-Dreams 파이프라인을 그대로 활용하므로 코드 안정성이 높고, GR00T-DROID init이 robot manipulation domain에 이미 적응된 상태에서 시작.
resume from checkpoint가 정상 동작 확인: 반복 preemption에도 iter 38400까지 누적됨. job 48079가 preempt되면 다음 job에서 자동 resume 가능.
5 Next Steps
- 학습 완료 후 inference 테스트: 학습된 체크포인트로 새 RoboCasa 비디오 합성 → 품질 확인
- GPU util 병목 분석: 75% avg / 0% min → data loading 또는 checkpoint save가 idle 원인인지 profiling
- job 48079 preempt 시 즉시 재제출: resume_from_checkpoint=latest 설정되어 있어 자동 재개 가능
- synthetic 비디오 생성 파이프라인 연결: 학습 완료 후 IDM으로 pseudo action 부여 → DreamData Stage 3 진입
- loss 수렴 기준 설정: 0.2185에서 얼마나 더 학습해야 할지 — inference 품질로 판단