| Phase | Status | Why Needed | Actual Result |
|---|---|---|---|
| Code Research | done | Wan fine-tuning 프레임워크 선정 | 4종 비교 → Finetrainers v0.2.0 선택 (LoRA+multi-res+B200) |
| Finetrainers Setup | done | 베이스 코드 구성 | Full clone, Wan2.1 T2V 파이프라인 확인 |
| RoboCasa 분석 | done | 학습 데이터 구조 파악 | MimicGen 체계, atomic 태스크당 10K 데모, filter_key 분리 |
| 전처리 v1 | done | Multi-view concat 데이터 생성 | left+right+wrist 가로 concat, 480p 33f |
| 전처리 v2 | done | v1의 동작 압축 문제 해결 | 태스크별 균등 샘플링 + 동작 구간 crop |
| T2V LoRA 학습 | running | 텍스트 → multi-view 비디오 생성 | 6 jobs RUNNING, 장기 학습 진행 중 |
| T2V 평가 | pending | 생성 품질 정량 평가 | 미시작 (FVD, multi-view consistency) |
| I2V 파이프라인 | pending | 첫 프레임 조건부 비디오 생성 | 설계 완료, WanImageToVideoPipeline 활용 예정 |
| I2V LoRA 학습 | pending | I2V fine-tuning | 미시작 |
| 정량 비교 | pending | T2V vs I2V, view consistency 비교 | 미시작 |
4종 비교 (Finetrainers, Diffusers script, SimpleTuner, MusePose) 중 Finetrainers v0.2.0 선택. LoRA + multi-resolution 지원, B200 호환, Wan2.1 T2V/I2V 파이프라인 내장.
v1: 전체 에피소드 가로 concat → 동작 구간이 희석되는 문제 발견.
v2: 태스크별 균등 샘플링 + 동작 구간만 crop하여 정보 밀도 개선.