DreamData Analysis

Preprocessing v1 vs v2 비교 / Framework 선정 근거 / Multi-View Concat 전략
3 Analyses
4 Frameworks Compared
v2 Current Pipeline

Analysis 1

Data Preprocessing v1 → v2 Critical Fix
v1 전처리에서 로봇 동작이 압축되어 학습 데이터의 motion diversity 부족. 생성 비디오가 정적이거나 단조로운 동작만 보여줌.

v1 문제점

Random Sampling Idle Frames 포함 Motion Diversity 부족

v2 개선 사항

Task-Balanced Sampling Motion Crop 동작 다양성 확보

Quantitative Comparison (추정)

Metricv1v2
Motion frames ratio ~30% ~80%
Task coverage biased balanced
Idle frames high minimal
Takeaway
데이터 전처리가 생성 품질에 직접적 영향. Motion crop이 핵심 개선점이며, 단순 random sampling은 로봇 도메인에서 비효율적.

Analysis 2

Framework Selection Decided
Wan2.1 fine-tuning을 위한 최적 프레임워크 선정. 4종 후보 비교 후 Finetrainers 선택.

4-Way Comparison

Criteria DiffSynth Finetrainers Diffusers CogVideoX-Factory
Wan scripts 33 (best) Good Basic None
Multi-resolution O O X X
B200 Compatibility Unknown O O Unknown
API Simplicity Complex Simple Simple Complex
LoRA + Full FT Both Both LoRA only SFT only
Winner: Finetrainers

Decision Rationale

Takeaway
스크립트 수보다 디버깅 용이성과 생태계 호환성이 중요한 선택 기준. DiffSynth의 자체 래퍼 레이어가 Diffusers 호환성을 깨뜨려 실사용에서 비용이 더 큼.

Analysis 3

Multi-View Concat Strategy Open Question
3개 뷰(left/right/wrist)를 horizontal concat하여 단일 비디오로 학습. View consistency 학습 여부 미검증.

Approach

Left View + Right View + Wrist View Single Wide Video
3 Views
1/3 Training Cost
? View Consistency

Trade-offs

AspectProsCons / Risks
학습 비용 단일 모델, 비용 1/3 -
View consistency 암묵적 학습 가능성 독립 생성 가능성
해상도 - 개별 뷰 해상도 1/3

Next Steps

Takeaway
Horizontal concat은 비용 효율적이나, 모델이 view 간 관계를 실제로 학습하는지는 아직 미검증. 정량 평가가 다음 우선순위.