DreamData

RoboCasa Multi-View Video Generation via Wan2.1 LoRA Fine-Tuning
50% Progress
5/10 Phases
6 Jobs Running
6d Elapsed
5 of 10 phases complete 50%

Vision

RoboCasa 로봇 시뮬레이션의 multi-view 비디오(left/right/wrist)로 Wan2.1 T2V/I2V LoRA fine-tuning을 수행하여 로봇 동작의 realistic multi-view 비디오를 생성한다. 궁극적으로 로봇 학습 데이터 augmentation에 활용.

Architecture

RoboCasa Sim → left / right / wrist 3-view video ↓ Horizontal concat (left|right|wrist) → single 480p video ↓ Finetrainers T2V LoRA Training (Wan2.1-T2V-14B) ↓ Text prompt → Multi-view robot video generation

Phase Checklist

Phase Status Why Needed Actual Result
Code Research done Wan fine-tuning 프레임워크 선정 4종 비교 → Finetrainers v0.2.0 선택 (LoRA+multi-res+B200)
Finetrainers Setup done 베이스 코드 구성 Full clone, Wan2.1 T2V 파이프라인 확인
RoboCasa 분석 done 학습 데이터 구조 파악 MimicGen 체계, atomic 태스크당 10K 데모, filter_key 분리
전처리 v1 done Multi-view concat 데이터 생성 left+right+wrist 가로 concat, 480p 33f
전처리 v2 done v1의 동작 압축 문제 해결 태스크별 균등 샘플링 + 동작 구간 crop
T2V LoRA 학습 running 텍스트 → multi-view 비디오 생성 6 jobs RUNNING, 장기 학습 진행 중
T2V 평가 pending 생성 품질 정량 평가 미시작 (FVD, multi-view consistency)
I2V 파이프라인 pending 첫 프레임 조건부 비디오 생성 설계 완료, WanImageToVideoPipeline 활용 예정
I2V LoRA 학습 pending I2V fine-tuning 미시작
정량 비교 pending T2V vs I2V, view consistency 비교 미시작

Milestones

Key Decisions

Finetrainers Framework
Wan2.1-14B Base Model
LoRA Fine-tune
3-view Concat

Framework Selection Rationale

4종 비교 (Finetrainers, Diffusers script, SimpleTuner, MusePose) 중 Finetrainers v0.2.0 선택. LoRA + multi-resolution 지원, B200 호환, Wan2.1 T2V/I2V 파이프라인 내장.

Data Strategy

v1: 전체 에피소드 가로 concat → 동작 구간이 희석되는 문제 발견.
v2: 태스크별 균등 샘플링 + 동작 구간만 crop하여 정보 밀도 개선.