IDM MG-30(720ep) 학습 결과 시뮬레이터 EEF error 332mm, HF FullSet(72K ep) 113mm로 66% 차이 발생. 원인 분석 결과 데이터 규모 100배 차이가 핵심 요인으로 결론. loss도 0.094(ours) vs 0.013(HF)로 7배 차이 (5K step에서 plateau).
HF FullSet이 실제로 MG-3000 규모임을 global_metadata/robocasa/stats.json의 episode_index max=3010으로 확인 완료. num_trajectories=1.7M은 windows 수이지 episode 수가 아님.
prepare_idm_mg3000_dataset.py)MG-3000 LeRobot 데이터셋 (24개 task × ~3000 ep)을 IDM 학습 포맷으로 merge. 출력 경로: /home/nas_main/taewoongkang/Dataset/robocasa/idm_mg3000.
scripts/run_idm_train_robocasa_mg3000.sh)| Job ID | 상태 | 실행 시간 | 비고 |
|---|---|---|---|
| 53287 | COMPLETED | 0:01:16 | 빠른 종료 (초기화 오류 추정) |
| 53346 | COMPLETED | 0:14:03 | 단기 완료 |
| 53609 | COMPLETED | 0:00:43 | 즉시 종료 |
| 53620 | PREEMPTED | 5:56:50 | preemption |
| 54138 | PREEMPTED | 1:28:05 | preemption |
| 54326 | RUNNING | 4:35:28+ | 현재 안정 실행 중 |
qos=core-extra로 제출 — preemption 위험 있으나 현재까지 안정.| 설정 | 에피소드 수 | 규모 | 예상 결과 |
|---|---|---|---|
| Ours MG-30 | 720 ep | 1× | loss 0.094, Sim 332mm |
| Ours MG-3000 (진행 중) | 70,492 ep | 100× | 목표: loss ~0.013, Sim ~113mm |
| HF FullSet (기준) | 72,000 ep | 100× | loss 0.013, Sim 113mm |
MG-3000 학습 결과는 60K steps 완료 후 확인 가능. 4×B200에서 HF 대비 학습 속도 유사할 것으로 예상.
시뮬레이터 eval 결과로 "코드 문제 없음, 데이터 규모가 원인"을 확인했다. MG-3000 학습은 이 가설의 최종 검증이다. 성공 시 DreamGen 파이프라인의 다음 단계(IDM pseudo label 생성 → GR00T N1 policy fine-tune)로 진행 가능.
qos=core-extra 제출이므로 own job 도착 시 preemption 가능. 체크포인트가 주기적으로 저장되는지 확인 필요. preemption 발생 시 마지막 checkpoint에서 재개 가능.시뮬레이터 eval 실행: dump_idm_actions_for_eval.py → eval_idm_simulator_replay.py. HF(113mm)와 직접 비교. 동등 성능 확인 시 데이터 가설 검증 완료.
best checkpoint로 전체 비디오 데이터 IDM dump (DreamGen Section 3). gr00t_finetune.py로 GR00T N1 policy fine-tune (DreamGen Section 4). downstream success rate 측정이 최종 목표.
dreamzero scripts/train/robocasa_video_finetune.sh RUNNING. 생성된 합성 비디오를 IDM으로 labeling하면 DreamGen 전체 파이프라인 완성.