Index
2026-08-22 — Analysis

Frame Sparsity drop_middle — 24×50 최종 판정

X-WAM MoT | 중간 latent 프레임 33% 제거 실험 (앵커: mot_v1b 60.50%)

TL;DR

57.83%
dropmid SR (ALL)
−5.75%p
non-PnP Δ (SIG)
1.01×
학습 속도

1 배경 / 목적

MoT는 이미 이득 없음으로 판정됐고, frame sparsity의 원래 동기(추론 가속)도 이전 벤치에서 bs1 기준 0% 이득으로 흔들리는 중이었다. 남은 것은 과학 질문: "미래 세계 상태의 조밀한 중간 표현이 control에 필요한가?" video 720토큰 중 중간 프레임 240토큰(33%)을 통째로 제거하고 학습·추론했을 때 RoboCasa SR이 유지되는지 검증한다.

비교 앵커는 같은 백본의 mot_v1b 60.50%. 사전 등록 동등 밴드는 |Δ| ≤ 4%p.

선행 결과: 속도 동기는 이 실험 전 이미 두 번 기각됐다 — bs1 추론 1.00×(커널런치 바운드), bs4+ 벤치 1.19~1.33×이지만 사전 등록 목표(≥1.45×) 미달.

2 작업 내용

frame_sparsity=drop_middle: keep-index로 중간 프레임 토큰을 gather 단계에서 제외해 시퀀스 761→521로 축소. 레이어는 무수정 통과, head 출력은 full grid에 zero-scatter. 학습 loss는 kept 토큰만(마스크를 latent로 upsample), 추론은 generate() 호출당 고정 마스크 사용.

학습: mot_dropmid_v1_nodepth (job 89079), own 4 GPU, eff 128, lr 3e-5, 20k step 레시피: mot_v1b와 동일 (비교 가능성 확보 목적) 소요: 39h15m, NaN 0, 최종 loss video 0.150 / action 0.022 / proprio 0.003 평가: job 91654, 24×50 (24 task × 50 rollout), cfg=0, ckpt epoch=8-step=20000 고정

3 결과 (수치)

subsetdropmidmot_v1b (중간 유지)Δz95% CI판정
ALL (24)57.83% (694/1200)60.50%−2.67%p−1.33[−6.60, +1.26]ns (유지)
PnP (8)41.50% (166/400)38.00%+3.50%p+1.01[−3.28, +10.28]ns
non-PnP (16)66.00% (528/800)71.75%−5.75%p−2.49[−10.28, −1.22]SIG

태스크별 큰 변화: CloseSingleDoor 90.0%→66.0% (−24%p), OpenDrawer 80.0%→58.0% (−22%p), PnPMicrowaveToCounter 14.0%→34.0% (+20%p).

속도 측정예상실측
forward bs1 (policy 추론)1.5×1.00× (커널런치 바운드)
forward bs4 / bs8 (bench)1.24× / 1.33×
실제 학습 (4 GPU, bs4×accum8)1.24×1.01× (0.1380 vs 0.1366 it/s)
핵심 발견: 전체 SR로는 중간 프레임을 통째로 지워도 큰 차이가 없다(Δ−2.67%p, ns) — world model이 정책에 기여하는 경로가 "매 프레임 픽셀 예측"이 아닐 가능성.
실패: non-PnP, 특히 관절 조작(articulated) 계열(문/서랍의 연속 궤적 추종)은 중간 시점 장면 변화 표현을 실제로 사용하고 있었다 — 통째 제거 시 −22~−24%p로 붕괴.

4 Takeaway

의미

Frame sparsity는 속도 축에서 완전히 기각됐다 — 토큰을 33% 줄여도 학습 wall-clock은 1%만 줄었다(학습 루프가 forward가 아니라 backward/optimizer 통신/dataloader에 바운드, CPU 스로틀 46% 관측). 벤치의 forward-only 수치를 시스템 이득으로 환산하면 안 된다는 것이 이 실험의 인프라 교훈.

과학 질문 축에서는 애매하지 않은 결과가 나왔다: 전체는 유지되지만 하위집합(non-PnP, 특히 articulated)에서는 실재하는 손실이 있다. MoT 분석에서도 관찰된 "PnP−non-PnP 해리"(MoT: non-PnP +2.1 / PnP −6.0)가 여기서도 반대 방향으로 반복된다(dropmid: non-PnP −5.75 / PnP +3.5) — 두 독립 실험에서 같은 패턴이 나왔으므로 우연으로 보기 어렵고, "어떤 world-model 축소가 어떤 스킬을 사는가"는 태스크 계열별로 갈린다는 가설이 강화된다.

5 Next Steps

미해결 한계

관절 조작 계열의 손실이 중간 프레임 자체 때문인지, 아니면 감독 신호가 최종 프레임 하나로 줄어든 부작용인지 미분리 — 중간 프레임을 유지하되 loss만 끄는 대조군으로 분리 가능.

다음 실험

mae25(job 91863, keep 25%, own 4 GPU) 완주 대기 — non-PnP −5.75%p를 회복하는지가 핵심 질문. dropmid가 "완전 유지"였다면 mae25는 정보가 없었겠지만, 실재하는 손실이 나왔으므로 0% / 25% / 100% 3점 곡선이 의미를 갖는다. 결과 확보 시 새 카드로 판정 예정.