260406-260412 · Stage 1 표현 결정 + Stage 2 진입 조건 정의
5-Stage 로드맵으로 video world model을 통해 limited teleop → diverse rollout → pseudo action label → VLA few-shot 학습으로 변환한다. 이번 주 핵심은 Stage 1의 학습 인프라와 표현 방식 결정이었고, 다음 사이클은 데이터 스케일업과 Stage 2 진입 결정이다.
| Phase | 목적/기대 효과 | 상태 | 실제 결과 |
|---|---|---|---|
| Stage 1 — Wan multi-view LoRA | Multi-view 표현 + 학습 인프라 확립 | 🔄 진행 | Layout A I2V가 베스트로 확정 |
| Stage 1.5 — I2V 인프라 | 14B 모델 LoRA finetune 동작 확인 | ✅ 완료 | commit 8533de4 · batch 2 × accum 4 |
| Stage 1.6 — External precompute | multi-GPU SIGKILL 회피 + VRAM 절약 | ✅ 완료 | precompute_embeddings.py 분리 |
| Stage 1.7 — 데이터 스케일업 | wrist view 학습 데이터량 확보 | ❌ 대기 | MG-100(33K clips) 후보 |
| Stage 2 — Label decoder | Wan intermediate feature → perception annotation | ❌ 미착수 | 설계 미확정 |
| Stage 3 — Dataset generation | Diverse rollout 생성 | ❌ 미착수 | — |
| Stage 4 — Sim 평가 (RoboCasa) | VLA few-shot 성능 측정 | ❌ 미착수 | — |
| Stage 5 — Real-world 평가 | 최종 baseline 검증 | ❌ 미착수 | — |
처음 계획은 T2V를 먼저 굳히고 I2V는 부속 실험으로 두는 것이었다. Layout A T2V 결과에서 view 분리가 약하고 GT 일관성이 낮은 게 명확해지자, T2V vs I2V 동시 진행 → I2V를 primary로 격상. Why: conditioning 효과가 모델 크기 차이를 압도할 가능성이 크고, downstream 사용처(robot 카메라 첫 프레임 → 비디오 생성)와 정합.
원래 finetrainers 기본(in-loop precompute)을 유지하려 했으나 4 GPU DDP에서 SIGKILL 누적. 학습 코드와 인코딩 코드를 갈라내는 큰 리팩토링을 수용. Why: "학습은 매번, 인코딩은 한 번"이 정상이고, layout/conditioning만 바뀌는 우리 실험 구조에서 한 번 precompute 후 다중 실험에 재사용하는 것이 시간/전력 모두 이득.
| 마일스톤 | 예상 | 실제 | 코멘트 |
|---|---|---|---|
| I2V 학습 구동 | 04-08 | 04-09 | 14B VRAM 튜닝으로 1일 지연 |
| Precompute 분리 | — | 04-09 | 계획 외 추가 작업 |
| Layout A/B/C × T2V/I2V 6셀 완료 | 04-12 | 4/6 완료 | Layout C T2V 체크포인트 손상으로 지연 |
| Stage 2 설계 시작 | 04-15 | — | Stage 1 데이터 스케일업이 선행 |