260406-260412 · A T2V · A I2V · B I2V 정성 비교 + 가설 검증
RoboCasa MG-30 데이터셋으로 8000 step까지 학습한 3개 모델(A T2V 1.3B, A I2V 14B, B I2V 14B)의 생성 품질을 직접 비교하여, "Layout × conditioning" 중 어느 축이 multi-view 비디오 생성 품질을 더 결정짓는지 확인. 가설: conditioning(I2V) > layout(가로 1×3).
| 항목 | 값 |
|---|---|
| 해상도 | A=192×960, B=352×640 |
| num_frames | 49 |
| num_inference_steps | 50 |
| guidance_scale | 5.0 |
| seed | 42 |
| fps | 20 |
| I2V conditioning image | 학습 데이터 첫 프레임 자동 추출 |
| 스케줄러 | FlowMatchEulerDiscreteScheduler |
| 샘플 수 | 3 task × 3 model = 9 비디오 |
| 항목 | A T2V (1.3B) | A I2V (14B) | B I2V (14B) |
|---|---|---|---|
| 3분할 구조 | 보임 | 매우 명확 | 약함 |
| GT 일관성 | 낮음 | 높음 | 중간 |
| wrist 뷰 구분 | 약함 | 약간 보임 | 약함 |
| 전체 품질 | 중 | 상 | 중 |
task0 (pick mug → sink) 케이스: A T2V는 3분할은 보이나 색조가 파랗게 빠지고 GT와 구도 어긋남. A I2V는 GT 첫 프레임과 거의 동일한 구도를 유지하며 3분할 경계가 명확. B I2V는 상하 분할이 보이지만 view boundary가 흐림.
같은 14B I2V 안에서 Layout A vs B를 비교하면 A가 우위지만 차이는 "약함→중간"에 그친다. 같은 Layout A 안에서 T2V → I2V 전환은 "낮음→높음", "약함→매우 명확"으로 한 단계씩 점프. conditioning이 layout보다 더 강한 신호. 단, 14B T2V로 통제하지 않으면 conditioning 단독 효과는 분리 불가.
I2V 첫 프레임에 wrist가 포함되어 있는데도 wrist는 외부 뷰와 상당히 비슷하게 나옴. 첫 프레임의 시각적 단서만으로는 모델이 49프레임 동안 wrist의 distinct dynamics(그리퍼 근접, 작은 motion, 큰 occlusion)를 유지하지 못한다. 데이터 다양성 문제 — wrist 분포가 학습셋에서 충분히 표현되지 않는다.
Layout B는 wrist를 가로 2배로 늘려 상단에 배치. 정사각형 wrist를 가로로 늘리면 modeled hand pose의 비율이 깨지고 downstream에서 ego-3D mapping이 어려워진다. Layout A의 1×3 가로는 각 view의 원본 비율을 유지해 distortion이 없다.
의미: 향후 모든 실험의 default를 Layout A + I2V로 고정. T2V 폐기 결정의 근거 데이터 확보. wrist 문제는 "데이터 다양성" 또는 "캡션 디테일" 트랙으로 분리하여 별도 해결 — 모델 크기를 더 키우는 것은 답이 아님이 시사됨.