Wan2.1 T2V LoRA Fine-tuning for Multi-view Robot Video Generation
2026.04.03 - 04.08
1Commits
+31KLines
~30SLURM Jobs
80h+GPU Hours
5Work Logs
Motivation
RoboCasa 시뮬레이션의 multi-view 비디오(left/right/wrist 3개 뷰)를 가로 concat하여 하나의 비디오로 구성한 뒤, Wan2.1 T2V 모델에 LoRA fine-tuning을 수행한다. 목표는 로봇 동작의 multi-view consistent 비디오 생성 모델을 만드는 것이다.
단일 뷰 생성은 이미 가능하지만, 3개 뷰 간 시점 일관성을 유지하면서 동시에 생성하는 것이 핵심 도전 과제다.
Key Progress
Apr 3 - 8 타임라인high activity
Apr 3코드베이스 선정
4개 프레임워크 비교: DiffSynth-Studio, Finetrainers, Diffusers, CogVideoX-Factory. Finetrainers v0.2.0 선택 — LoRA/full fine-tuning, multi-resolution, B200 호환, Wan2.1 공식 지원.
Apr 6데이터 전처리 v1 → v2
v1 문제 발견: 로봇 동작이 압축되어 다양성 부족. v2: 태스크별 균등 샘플링 + 동작 구간만 crop. 480p, 33 frames.
Apr 6RoboCasa Split 분석
MimicGen 체계 분석. atomic 태스크당 최대 10K 합성 데모. filter_key로 train/valid 분리.
Apr 7I2V 파이프라인 추가 계획
T2V 외에 첫 프레임 조건부 Image-to-Video 추가. WanImageToVideoPipeline 활용 예정.