| Framework | Wan Support | Training | Memory | Maturity | Verdict |
|---|---|---|---|---|---|
| DiffSynth-Studio | 33 LoRA scripts, Wan2.2 포함 | SFT + distillation | 4-stage offload | ModelScope 지원 | no |
| Finetrainers v0.2.0 | T2V, I2V, Control | LoRA + full FT | group_offload, compile | HF 공식 | chosen |
| Diffusers Training | Community scripts | LoRA | Standard | HF 공식 | no |
| CogVideoX-Factory | CogVideo 중심 | SFT | — | SAT 기반 | no |
| Decision | Choice | Alternative | Rationale |
|---|---|---|---|
| View Concat | Horizontal (L|R|W) | Separate models per view | 단일 모델로 view consistency 유도, 학습 비용 1/3 |
| Base Model | Wan2.1-T2V-14B | Wan2.1-1.3B, CogVideoX | 14B가 복잡한 로봇 동작 표현에 충분한 capacity 제공. 1.3B는 multi-view concat에서 품질 저하 |
| Training | LoRA | Full fine-tuning | GPU 비용 절약, base model weights 보존. 추후 full FT 전환 가능 |
| Data Source | RoboCasa MimicGen | DROID real data | 시뮬레이션 데이터로 무제한 생성 가능, 카메라 intrinsic/extrinsic 파라미터 정확 |
| Preprocessing | v2 (task-balanced + motion crop) | v1 (random sampling) | v1에서 정적 장면 편향 및 동작 다양성 부족 문제 발생 |