Layout × Conditioning

DreamData — Inference Comparison Analysis

260406-260412 · A T2V · A I2V · B I2V 정성 비교 + 가설 검증

Models3
Tasks3
Generated9
Steps8000
Reproducibleseed=42

문제 정의 (이번 분석의 동기)

RoboCasa MG-30 데이터셋으로 8000 step까지 학습한 3개 모델(A T2V 1.3B, A I2V 14B, B I2V 14B)의 생성 품질을 직접 비교하여, "Layout × conditioning" 중 어느 축이 multi-view 비디오 생성 품질을 더 결정짓는지 확인. 가설: conditioning(I2V) > layout(가로 1×3).

실험 설정

항목
해상도A=192×960, B=352×640
num_frames49
num_inference_steps50
guidance_scale5.0
seed42
fps20
I2V conditioning image학습 데이터 첫 프레임 자동 추출
스케줄러FlowMatchEulerDiscreteScheduler
샘플 수3 task × 3 model = 9 비디오

정량/정성 결과

항목A T2V (1.3B)A I2V (14B)B I2V (14B)
3분할 구조보임매우 명확약함
GT 일관성낮음높음중간
wrist 뷰 구분약함약간 보임약함
전체 품질

task0 (pick mug → sink) 케이스: A T2V는 3분할은 보이나 색조가 파랗게 빠지고 GT와 구도 어긋남. A I2V는 GT 첫 프레임과 거의 동일한 구도를 유지하며 3분할 경계가 명확. B I2V는 상하 분할이 보이지만 view boundary가 흐림.

관찰 & 해석

1. I2V 효과 > Layout 효과

같은 14B I2V 안에서 Layout A vs B를 비교하면 A가 우위지만 차이는 "약함→중간"에 그친다. 같은 Layout A 안에서 T2V → I2V 전환은 "낮음→높음", "약함→매우 명확"으로 한 단계씩 점프. conditioning이 layout보다 더 강한 신호. 단, 14B T2V로 통제하지 않으면 conditioning 단독 효과는 분리 불가.

2. wrist view 문제는 conditioning으로도 해결 안 됨

I2V 첫 프레임에 wrist가 포함되어 있는데도 wrist는 외부 뷰와 상당히 비슷하게 나옴. 첫 프레임의 시각적 단서만으로는 모델이 49프레임 동안 wrist의 distinct dynamics(그리퍼 근접, 작은 motion, 큰 occlusion)를 유지하지 못한다. 데이터 다양성 문제 — wrist 분포가 학습셋에서 충분히 표현되지 않는다.

3. Layout B의 stretch가 학습을 방해

Layout B는 wrist를 가로 2배로 늘려 상단에 배치. 정사각형 wrist를 가로로 늘리면 modeled hand pose의 비율이 깨지고 downstream에서 ego-3D mapping이 어려워진다. Layout A의 1×3 가로는 각 view의 원본 비율을 유지해 distortion이 없다.

Strengths & Limitations of this analysis

Strengths

Limitations

Implications & Next

의미: 향후 모든 실험의 default를 Layout A + I2V로 고정. T2V 폐기 결정의 근거 데이터 확보. wrist 문제는 "데이터 다양성" 또는 "캡션 디테일" 트랙으로 분리하여 별도 해결 — 모델 크기를 더 키우는 것은 답이 아님이 시사됨.

다음 분석