s_t → (a_{t:t+K}, s_{t+K}, V) 구조. 데이터 로더가 {t, t+K} 2 시점만 읽는다 (코드로 확정).WAM 계열은 관례적으로 첫 프레임 → T프레임 전체 비디오 + action을 공동 생성한다. 질문은 단순하다 — 중간 프레임 예측이 정말 필요한가? 첫 프레임을 주고 마지막 프레임 1장만 예측하면서 그 사이 action을 동시에 뽑으면 안 되는가?
decode_video=off로 둬도
비디오 latent를 여전히 4 step 함께 denoise한다 (action-only fast path 없음). VAE decode만 건너뛸 뿐,
비디오 예측 비용은 항상 지불한다.논문 본문(arXiv 2601.16163)에 더해 로컬 레포 코드 3종에서 실제 프레임 인덱스를 직접 확인했다. 요약문은 "future state images"라고만 쓰여 있어 몇 장인지 알 수 없었기 때문이다.
~/repos/Robotics/cosmos-policy/ — Cosmos Policy(Predict2-2B) 데이터 파이프라인~/repos/Robotics/cosmos/packages/cosmos3/ — Cosmos3-Nano-Policy 시퀀스 플랜~/repos/Robotics/X-WAM/comparison/models/*.yaml — 세 모델 실측 latency 레지스트리(동일 1×B200)중간 프레임은 디스크에서 읽지도 않는다. 논문 본문도 동일: "s and s′ only consist of the observations at time t and t+K", "we do not use input history nor predict future frames across multiple subsequent timesteps".
latent 시퀀스 = 11 프레임이며, 각 프레임이 비디오 클립이 아니라 개별 이미지 latent다:
즉 같은 NVIDIA 랩의 두 모델이 이 설계 축의 양 끝에 서 있다.
| 모델 | 미래 프레임 | params | action call | ms/action | SR |
|---|---|---|---|---|---|
| Cosmos Policy (Predict2) | 1 | 2B | 353 ms | 11.0 | LIBERO 98.5 / RoboCasa 67.1 (논문) |
| X-WAM | 9 | 5B | 237 ms (compiled) | 7.4 | RoboCasa 75.3 (자체 재현) |
| Cosmos3-Nano-Policy | 33 | 16B | 961 ms | 30.0 | RoboLab 37.1 (자체 측정) |
diffusion_steps_action: 10 vs diffusion_steps_video: 50 (ANS/early_stop 디커플링)
→ full 4D 생성 2100 ms에서 action path 352 ms로 6.0× 절감. "비디오가 추론을 느리게 한다"는
논거의 상당 부분이 X-WAM에선 이미 해결돼 있다.
남은 비용은 9프레임 × 3뷰 latent가 action의 10 step 내내 시퀀스에 남아 attention 비용을 낸다는 점. 여기가 horizon 축소로 얻을 수 있는 실제 잔여 이득이다.
| 연구 | 미래 프레임 | 핵심 |
|---|---|---|
| FLARE (NVIDIA, 2505.15659) | 0 (픽셀 생성 없음) | DiT feature ↔ 미래 관측 latent 정렬. baseline 대비 최대 +26%. "explicit frame generation은 비싸고 pixel fidelity vs task relevance가 상충" |
| UVA (RSS'25) | 학습 O / 추론 0 | 비디오·action 디코더 분리 → 추론 시 비디오 생성 스킵, Diffusion Policy급 속도 |
| Cosmos Policy | 1 (t+K) | 위 참조 |
| CoT-VLA (CVPR'25) | 1 (subgoal) | subgoal 이미지 자기회귀 예측 → action chunk. real +17%, sim +6% |
| VPP | 16 | 예측은 하되 중간 표현만 policy에 사용 |
Cosmos Policy Table 4 ablation: aux loss(미래 상태 + value) 제거 → LIBERO 98.5 → 97.0 (−1.5pp). from scratch → 94.6 (−3.9pp).
| arm | 미래 프레임 | 목적 |
|---|---|---|
| A | 9 (현행) | 대조군. 재현치 RoboCasa 75.3% |
| B | 1 (마지막만) | 제안 아이디어 |
| C | 0 (action만) | 미래 프레임 기여도 하한 |
experiments/vanilla_repro는 부적합하다
(world_size 1, batch 4, pretrained null → SR 11.0%). arm A도 동일 조건으로 새로 돌려야 한다.X-WAM 고유의 depth/pointmap 출력을 마지막 프레임에만 적용하면 "목표 point cloud를 예측하는 policy"가 된다. 현재 아무도 안 한 조합이며, 진행 중인 DROID pointmap A/B 파이프라인과 직결된다. horizon 축소가 3D 감독을 얼마나 보존하는지가 검증 포인트.
미해결 질문 — horizon K 자체. Cosmos Policy의 s′는 chunk 끝(1~3초)일 뿐 task-level goal이 아니다. K를 subtask 경계까지 늘리면 계층적 planning이 공짜로 생기는가? 이건 아직 아무도 안 봤다.