_src/predict2_multiview/(view-embedding, MultiViewDiT)가 정답 — 뷰 수를 텐서 shape에서
동적 추론해 3뷰 모델 수술 불필요, camera extrinsic/intrinsic도 불필요. AgiBot이 같은 경로로 이미 3뷰 사용 중.Cosmos Predict로 RoboCasa 3개 멀티뷰 비디오를 생성하는 world model을 파인튜닝하려면 착수 전에
(1) 어느 레포/서브시스템이 실제 학습 코드인지, (2) RoboCasa 데이터가 어디 어떤 포맷으로 있는지,
(3) 3-view가 코드상 지원되는지, (4) 학습 커맨드/체크포인트/데이터 포맷이 뭔지를 확정해야 했다.
Robotics/GR00T-Dreams/는 IDM/GR00T N1/DreamGenBench용이지 비디오 모델 학습 코드가 아니라는 점을
먼저 확인했고, 실제 본체는 Robotics/cosmos-predict2.5/임을 확인했다.
병렬 Explore agent 3개로 (A) multiview 학습 파이프라인, (B) gr00t/robocasa/action 레시피, (C) 로컬 robocasa 데이터셋 인벤토리를 조사(NAS broad-scan 금지 규칙 준수, 디렉토리별 targeted ls만 사용).
| 서브시스템 | 방식 | 카메라 파라미터 | 학습 레시피 | 채택 |
|---|---|---|---|---|
_src/predict2_multiview/ | view-embedding (MultiViewDiT) | 불필요 | 있음 (post-training_multiview.md, Waymo 5뷰) | ✅ 채택 |
_src/predict2/camera/ | camera-conditioned | extrinsic/intrinsic 필요 | inference만 문서화, 학습 레시피 없음 | ❌ |
_src/predict2/cosmos_policy/ | action+image policy (HDF5) | 불필요 | 외부 cosmos-cookbook | ❌ (비디오생성 부차적) |
경로: /home/nas_main/hyojinjang/DATA/robocasa_mg3000_droid_lerobot_20fps_v2_merged.
LeRobot v2.1, 23종 task dir, task당 3000ep, 예 PnPCounterToCab: total_frames 777,674, total_videos 9000(=3000×3뷰).
뷰: exterior_image_1_left, exterior_image_2_left, wrist_image_left — 뷰별 mp4 이미 분리 저장
(videos/chunk-{c:03d}/{video_key}/episode_{i:06d}.mp4), 180×320/h264/yuv420p/20fps, 에피소드 길이 214~323 frame(~10~16초).
캡션은 meta/episodes.jsonl의 tasks[0]에 직접 존재(짧은 단문 템플릿), task_index 조인 불필요.
make_config() 에러 없이 실행,
ConfigStore에 experiment/data_train/data_val=robocasa 등록 확인(Phase 3).checkpoint_db.download_checkpoint(uri)가
s3://bucket/... URI를 non-INTERNAL registry로 판단해 HF(nvidia/Cosmos-Predict2.5-2B
auto/multiview 524af350)로 자동 다운로드 — waymo와 동일 방식이라 robocasa.py 수정 불필요.RoboCasa가 원천적으로 3-view라 요청과 완벽히 부합하며, 별도 뷰 생성이 불필요하다는 점이 확인됐다. view-embedding 경로는 모델 수술 없이 데이터 변환 + config 2개만으로 3-view RoboCasa 파인튜닝이 가능해, 카메라 파라미터가 필요한 camera-conditioned 경로보다 압도적으로 간단하다. 이전 세션이 이미 환경/구조 이해를 확보해둔 덕에 착수 비용이 낮았다. 같은 예산(8GPU)으로 병행 중인 Path B(DROID init, 2×2 그리드, 14B)와 비교하면, Path A는 DROID init은 없지만 진짜 3-view이고 즉시 dry-run 가능한 상태(2.5, cu128, B200-native)라는 점이 대비된다.
캡션이 짧은 단문 템플릿이라 다양성이 부족할 수 있음(1차는 그대로 사용, 부족 시 VLM enrich 검토). 파일럿 5 task/300ep만 검증됐고 전체 23 task/3000ep 스케일 변환은 아직 실행 안 함.
HF 토큰 + Cosmos 라이선스 수락 확인 → 4GPU/CP=4/max_iter~20 소규모 sbatch(sbm, --qos=extra)로 데이터→VAE→텍스트→fwd/bwd→loss→ckpt 파이프라인 검증 → 통과 시 8GPU/CP=8 본학습(max_iter=4000)으로 확장. Path B(DROID grid) 본학습과 loss curve/생성 품질 비교 예정.