v1 전처리에서 로봇 동작이 압축되어 학습 데이터의 motion diversity 부족. 생성 비디오가 정적이거나 단조로운 동작만 보여줌.
v1 문제점
Random Sampling
→
Idle Frames 포함
→
Motion Diversity 부족
- 전체 에피소드에서 uniform random으로 33 frame 추출
- 대기 시간(idle)이 그대로 포함되어 실제 동작 비율 낮음
- 학습 후 생성 비디오가 거의 움직이지 않는 결과
v2 개선 사항
Task-Balanced Sampling
→
Motion Crop
→
동작 다양성 확보
- 태스크별 균등하게 에피소드 선택 (task-balanced sampling)
- 동작 구간만 crop하여 idle 제거 (motion crop)
- 생성 비디오에 실제 로봇 동작이 반영됨
Quantitative Comparison (추정)
| Metric | v1 | v2 |
| Motion frames ratio |
~30% |
~80% |
| Task coverage |
biased |
balanced |
| Idle frames |
high |
minimal |
Takeaway
데이터 전처리가 생성 품질에 직접적 영향. Motion crop이 핵심 개선점이며, 단순 random sampling은 로봇 도메인에서 비효율적.
Wan2.1 fine-tuning을 위한 최적 프레임워크 선정. 4종 후보 비교 후 Finetrainers 선택.
4-Way Comparison
| Criteria |
DiffSynth |
Finetrainers |
Diffusers |
CogVideoX-Factory |
| Wan scripts |
33 (best) |
Good |
Basic |
None |
| Multi-resolution |
O |
O |
X |
X |
| B200 Compatibility |
Unknown |
O |
O |
Unknown |
| API Simplicity |
Complex |
Simple |
Simple |
Complex |
| LoRA + Full FT |
Both |
Both |
LoRA only |
SFT only |
|
Winner: Finetrainers
|
Decision Rationale
- DiffSynth는 스크립트 수가 가장 많지만, 자체 Pipeline 래퍼가 Diffusers와 비호환 — 디버깅 어려움
- Finetrainers는 HuggingFace 공식 프로젝트, Diffusers 파이프라인 직접 사용
- Multi-resolution bucket 지원으로 다양한 해상도 학습 가능
- B200 환경에서 검증된 호환성
Takeaway
스크립트 수보다 디버깅 용이성과 생태계 호환성이 중요한 선택 기준. DiffSynth의 자체 래퍼 레이어가 Diffusers 호환성을 깨뜨려 실사용에서 비용이 더 큼.
3개 뷰(left/right/wrist)를 horizontal concat하여 단일 비디오로 학습. View consistency 학습 여부 미검증.
Approach
Left View
+
Right View
+
Wrist View
→
Single Wide Video
3
Views
1/3
Training Cost
?
View Consistency
Trade-offs
| Aspect | Pros | Cons / Risks |
| 학습 비용 |
단일 모델, 비용 1/3 |
- |
| View consistency |
암묵적 학습 가능성 |
독립 생성 가능성 |
| 해상도 |
- |
개별 뷰 해상도 1/3 |
Next Steps
- View consistency metric 정량 평가 필요
- 생성된 비디오에서 view 간 동작 동기화 정도 측정
- 개별 모델 3개 vs concat 모델 1개 비교 실험 고려
Takeaway
Horizontal concat은 비용 효율적이나, 모델이 view 간 관계를 실제로 학습하는지는 아직 미검증. 정량 평가가 다음 우선순위.