DreamData Progress

Wan2.1 T2V LoRA Fine-tuning for Multi-view Robot Video Generation
2026.04.03 - 04.08
1 Commits
+31K Lines
~30 SLURM Jobs
80h+ GPU Hours
5 Work Logs

Motivation

RoboCasa 시뮬레이션의 multi-view 비디오(left/right/wrist 3개 뷰)를 가로 concat하여 하나의 비디오로 구성한 뒤, Wan2.1 T2V 모델에 LoRA fine-tuning을 수행한다. 목표는 로봇 동작의 multi-view consistent 비디오 생성 모델을 만드는 것이다. 단일 뷰 생성은 이미 가능하지만, 3개 뷰 간 시점 일관성을 유지하면서 동시에 생성하는 것이 핵심 도전 과제다.

Key Progress

Apr 3 - 8 타임라인 high activity

Activity Heatmap

Thu
프레임워크 비교 분석
Fri
초기 학습 실험
Sat
장기 학습 완료 2건, 데이터 v2
Sun
Initial commit, I2V 계획
Mon
6개 병렬 학습 실행 중
Commits SLURM Jobs Docs/Analysis

SLURM 현황

~30 Total Jobs
6 Running
2 Long Jobs Done
80h+ GPU Hours

Job Status Distribution

RUNNING x6 COMPLETED (장기 2건: 1d3h, 1d4h) PREEMPTED (extra QOS)

장기 학습 완료

기간소요상태비고
Apr 5-61d 3hCOMPLETEDT2V LoRA 학습 (early config)
Apr 5-61d 4hCOMPLETEDT2V LoRA 학습 (data v1)
현재 6개 작업 동시 실행 중 — estimated 80h+ total GPU time

Git

Commits

241 files changed, +31,441 insertions

Data Pipeline

RoboCasa Multi-view Dataset
MimicGen 기반 합성 데모, multi-view concat (left + right + wrist)

전처리 버전 비교

Version방식해상도프레임문제점/개선
v1 전체 에피소드 균등 샘플 480p 33 동작 압축, 다양성 부족
v2 태스크별 균등 + 동작 구간 crop 480p 33 다양성 개선

RoboCasa Split 분석

Critical Assessment

Strengths
Weaknesses

전체 진행률

T2V LoRA Fine-tuning 학습 진행 중
I2V Pipeline 계획 단계
정량 평가 미착수
데이터 파이프라인 v2 완료

Next Steps