DreamGen 파이프라인 (옵션 A)의 핵심 가설: Cosmos 14B 비디오 생성 모델로 합성 비디오를 만들고, IDM으로 pseudo action을 역추정하여 GR00T N1 fine-tune 데이터로 활용. 데이터가 없는 새 task에도 적용 가능한 data augmentation 전략.
오늘(260429) 목표: P0 sanity (10 video) end-to-end 실행 완료 + HF DAVIAN-Robotics/robocasa-H50 v3.0 포맷 호환성 확보 → P1/P2 스케일업 기반 마련.
4×B200 GPU, Cosmos-Predict2 14B mg30_real iter_47200 체크포인트 사용. 10개 합성 비디오 생성.
run_p0_post_cosmos.sh에 --target_h 216 --target_w 384 추가 (quadrant 해상도 유지, 불필요한 upscale 회피).
idm_robocasa_mg3000_v2_8gpu/checkpoint-60000로 10 ep × 12s/ep ≈ 2분 소요. pseudo action parquet writeback (<DREAM> prefix)LeRobot 버전 확인: 0.3.3 = v2.1, 0.4.4 = v3.0. dreamgen env (py3.10)에 0.4.4 설치.
| 단계 | 소요 (P0 기준) | P2 외삽 (1000 video) | 비고 |
|---|---|---|---|
| Cosmos 14B 생성 | 37s/video | ~17h | 4 GPU sbm |
| Post-cosmos (IDM dump + build) | 14s/video | ~4h | 1 GPU |
| v3.0 변환 | ~3s/video | ~50min | CPU |
| 검증 항목 | 우리 v3 | HF v3.0 | 상태 |
|---|---|---|---|
| codebase_version | v3.0 | v3.0 | ✓ 일치 |
| chunks_size | 1000 / 100MB / 200MB | 1000 / 100MB / 200MB | ✓ 일치 |
| meta/tasks.parquet | shape (10,1), task_index col | 동일 schema | ✓ 일치 |
| episodes chunk parquet | 131 cols (stats/* + videos/* timestamp) | 동일 schema | ✓ 일치 |
| data parquet | action float32[12], state float32[16] | 동일 | ✓ 일치 |
| video codec | av1 (libsvtav1), 128×128, 16fps | av1, 128×128, 20fps | fps 차이 (16 vs 20) |
| 카메라 key | robot0_agentview_left/right, robot0_eye_in_hand | 동일 | ✓ 일치 |
| 시점 | synthetic IDM 예측 | real heldout GT |
|---|---|---|
| t=0 | xyz=[-0.008, 0.029, 0.012], gripper=-1 | xyz=[-0.053, 0.011, 0.129], gripper=-1 |
| t=40 | xyz=[-0.449, -0.011, 0.424] | xyz=[-0.656, -0.294, 0.567] |
dreamgen env torch 2.6 + torchcodec 0.10 + ffmpeg 8 ABI 미스매치로 로컬 LeRobotDataset.__getitem__ 디코딩 실패. 포맷 자체는 정상 — HF Spaces visualizer는 데이터 파일을 직접 읽으므로 영향 없음.Cosmos 14B (mg30_real 720 ep 학습본) + MG-3000 IDM (checkpoint-60000) 조합이 합성 비디오에서 의미 있는 pseudo action을 뽑아내는 것 확인. Action magnitude underestimation은 IDM 문제가 아니라 Cosmos 합성 비디오의 동작 폭 한계.
HF v3.0 포맷 gap은 완전히 해소됨: convert_to_lerobot_v3.py + run_p0_post_cosmos.sh step3으로 파이프라인 끝까지 자동화. P1/P2 대규모 datagen이 추가 인프라 작업 없이 바로 실행 가능.
P2 (1000 video) 후 GR00T N1 fine-tune: real + pseudo data mix로 SR 향상 검증이 다음 핵심 목표. real(720 ep) + 합성(1000 ep) 혼합 시 어느 ratio가 최적인지 P2 실험 설계 필요.
build_datagen_seeds.py --num_tasks 24 --eps_per_task 2 + 동일 wrapper로 자동 처리. Cosmos 37s/video → 4 GPU 약 31분. Action magnitude 분포 확인.
Cosmos sbm 제출 (~17h, 8 GPU 권장). 완료 후 real(720 ep) + synthetic(500/1000 ep) 혼합 비율별 GR00T N1 SR 측정. DreamGen 논문 Table 1 재현 여부 확인.
Cosmos mg30_real (720 ep) 학습본의 동작 폭 한계. 옵션 B: Cosmos MG-3000 추가 학습 시 동작 폭 확장 가능성. 단, P2 real+synthetic mix로 GR00T N1이 보완 가능한지 먼저 검증.
dreamgen env torchcodec ABI 미스매치: ffmpeg 7 다운그레이드 또는 torch 2.7+ 업그레이드. HF Spaces 업로드 후 visualizer 검증으로 대체 가능.