MoT는 이미 이득 없음으로 판정됐고, frame sparsity의 원래 동기(추론 가속)도 이전 벤치에서 bs1 기준 0% 이득으로 흔들리는 중이었다. 남은 것은 과학 질문: "미래 세계 상태의 조밀한 중간 표현이 control에 필요한가?" video 720토큰 중 중간 프레임 240토큰(33%)을 통째로 제거하고 학습·추론했을 때 RoboCasa SR이 유지되는지 검증한다.
비교 앵커는 같은 백본의 mot_v1b 60.50%. 사전 등록 동등 밴드는 |Δ| ≤ 4%p.
frame_sparsity=drop_middle: keep-index로 중간 프레임 토큰을 gather 단계에서 제외해 시퀀스 761→521로 축소. 레이어는 무수정 통과, head 출력은 full grid에 zero-scatter. 학습 loss는 kept 토큰만(마스크를 latent로 upsample), 추론은 generate() 호출당 고정 마스크 사용.
| subset | dropmid | mot_v1b (중간 유지) | Δ | z | 95% CI | 판정 |
|---|---|---|---|---|---|---|
| ALL (24) | 57.83% (694/1200) | 60.50% | −2.67%p | −1.33 | [−6.60, +1.26] | ns (유지) |
| PnP (8) | 41.50% (166/400) | 38.00% | +3.50%p | +1.01 | [−3.28, +10.28] | ns |
| non-PnP (16) | 66.00% (528/800) | 71.75% | −5.75%p | −2.49 | [−10.28, −1.22] | SIG |
태스크별 큰 변화: CloseSingleDoor 90.0%→66.0% (−24%p), OpenDrawer 80.0%→58.0% (−22%p), PnPMicrowaveToCounter 14.0%→34.0% (+20%p).
| 속도 측정 | 예상 | 실측 |
|---|---|---|
| forward bs1 (policy 추론) | 1.5× | 1.00× (커널런치 바운드) |
| forward bs4 / bs8 (bench) | — | 1.24× / 1.33× |
| 실제 학습 (4 GPU, bs4×accum8) | 1.24× | 1.01× (0.1380 vs 0.1366 it/s) |
Frame sparsity는 속도 축에서 완전히 기각됐다 — 토큰을 33% 줄여도 학습 wall-clock은 1%만 줄었다(학습 루프가 forward가 아니라 backward/optimizer 통신/dataloader에 바운드, CPU 스로틀 46% 관측). 벤치의 forward-only 수치를 시스템 이득으로 환산하면 안 된다는 것이 이 실험의 인프라 교훈.
과학 질문 축에서는 애매하지 않은 결과가 나왔다: 전체는 유지되지만 하위집합(non-PnP, 특히 articulated)에서는 실재하는 손실이 있다. MoT 분석에서도 관찰된 "PnP−non-PnP 해리"(MoT: non-PnP +2.1 / PnP −6.0)가 여기서도 반대 방향으로 반복된다(dropmid: non-PnP −5.75 / PnP +3.5) — 두 독립 실험에서 같은 패턴이 나왔으므로 우연으로 보기 어렵고, "어떤 world-model 축소가 어떤 스킬을 사는가"는 태스크 계열별로 갈린다는 가설이 강화된다.
관절 조작 계열의 손실이 중간 프레임 자체 때문인지, 아니면 감독 신호가 최종 프레임 하나로 줄어든 부작용인지 미분리 — 중간 프레임을 유지하되 loss만 끄는 대조군으로 분리 가능.
mae25(job 91863, keep 25%, own 4 GPU) 완주 대기 — non-PnP −5.75%p를 회복하는지가 핵심 질문. dropmid가 "완전 유지"였다면 mae25는 정보가 없었겠지만, 실재하는 손실이 나왔으므로 0% / 25% / 100% 3점 곡선이 의미를 갖는다. 결과 확보 시 새 카드로 판정 예정.