5-Stage Roadmap Update

DreamData — Roadmap & Plan

260406-260412 · Stage 1 표현 결정 + Stage 2 진입 조건 정의

Phases8
완료3
진행1
대기4

Overall Vision

5-Stage 로드맵으로 video world model을 통해 limited teleop → diverse rollout → pseudo action label → VLA few-shot 학습으로 변환한다. 이번 주 핵심은 Stage 1의 학습 인프라와 표현 방식 결정이었고, 다음 사이클은 데이터 스케일업과 Stage 2 진입 결정이다.

Phase Checklist (이번 주 갱신)

Phase목적/기대 효과상태실제 결과
Stage 1 — Wan multi-view LoRAMulti-view 표현 + 학습 인프라 확립🔄 진행Layout A I2V가 베스트로 확정
Stage 1.5 — I2V 인프라14B 모델 LoRA finetune 동작 확인✅ 완료commit 8533de4 · batch 2 × accum 4
Stage 1.6 — External precomputemulti-GPU SIGKILL 회피 + VRAM 절약✅ 완료precompute_embeddings.py 분리
Stage 1.7 — 데이터 스케일업wrist view 학습 데이터량 확보❌ 대기MG-100(33K clips) 후보
Stage 2 — Label decoderWan intermediate feature → perception annotation❌ 미착수설계 미확정
Stage 3 — Dataset generationDiverse rollout 생성❌ 미착수
Stage 4 — Sim 평가 (RoboCasa)VLA few-shot 성능 측정❌ 미착수
Stage 5 — Real-world 평가최종 baseline 검증❌ 미착수

이번 주 계획 변경 / 의사결정

계획 변경 1 — I2V 우선화

처음 계획은 T2V를 먼저 굳히고 I2V는 부속 실험으로 두는 것이었다. Layout A T2V 결과에서 view 분리가 약하고 GT 일관성이 낮은 게 명확해지자, T2V vs I2V 동시 진행 → I2V를 primary로 격상. Why: conditioning 효과가 모델 크기 차이를 압도할 가능성이 크고, downstream 사용처(robot 카메라 첫 프레임 → 비디오 생성)와 정합.

계획 변경 2 — Precompute 분리

원래 finetrainers 기본(in-loop precompute)을 유지하려 했으나 4 GPU DDP에서 SIGKILL 누적. 학습 코드와 인코딩 코드를 갈라내는 큰 리팩토링을 수용. Why: "학습은 매번, 인코딩은 한 번"이 정상이고, layout/conditioning만 바뀌는 우리 실험 구조에서 한 번 precompute 후 다중 실험에 재사용하는 것이 시간/전력 모두 이득.

Dependencies & Risks

Milestones

마일스톤예상실제코멘트
I2V 학습 구동04-0804-0914B VRAM 튜닝으로 1일 지연
Precompute 분리04-09계획 외 추가 작업
Layout A/B/C × T2V/I2V 6셀 완료04-124/6 완료Layout C T2V 체크포인트 손상으로 지연
Stage 2 설계 시작04-15Stage 1 데이터 스케일업이 선행