TL;DR — 분모는
전체 질의(VLM 답 정오와 무관). 온라인은 탐색을 허용하므로 blind도 0.29을 얻는다(S3에서 기권했던 질의에서도 0.28) —
메모리 신호는 "셀 − blind"로 읽는다. 답이 맞았던 질의에서도 0.44~0.52에 그치는 건 VLA pick 실패·VLM 허위 done(조작 축, 재생 oracle ceiling 0.658과 같은 축). 순위: frames-uniform(0.436) > rollforward-vis-pure(0.433) > textlog(0.385) > rollforward-v2(0.312) > blind(0.289).
0.433
rollforward-vis-pure
n=353
1셀별 SR (전체 질의 분모)
| 셀 (@gemini-3.6-flash) | n | SR_online | SR_strict(전부 lift) | 메모리 이득(−blind) | done율(허위) | 턴 상한 | 평균 턴 | $/ep | 같은 질의 재생 SR_C | Δ(온라인−재생) |
|---|
| frames-uniform (균등 16장) | 353/353 | 0.436 | 0.433 | +0.147 | 0.72 (0.34) | 0.19 | 8.5 | 0.120 | 0.463 (n=348) | -0.026 |
| rollforward-vis-pure (모델이 고른 프레임 ≤16) | 353/353 | 0.433 | 0.433 | +0.144 | 0.73 (0.35) | 0.20 | 8.6 | 0.126 | 0.477 (n=348) | -0.043 |
| rollforward-v2 (자필 텍스트 노트) | 353/353 | 0.312 | 0.309 | +0.023 | 0.62 (0.36) | 0.21 | 9.4 | 0.098 | 0.175 (n=348) | +0.132 |
| textlog (오라클 이벤트 로그) | 353/353 | 0.385 | 0.382 | +0.096 | 0.70 (0.36) | 0.25 | 9.8 | 0.089 | 0.296 (n=348) | +0.092 |
| blind (메모리 없음) | 353/353 | 0.289 | 0.289 | +0.000 | 0.60 (0.35) | 0.29 | 11.2 | 0.106 | 0.164 (n=348) | +0.129 |
재생 SR_C는 S3 답을 그대로 실행(틀린 답·기권 = 실패)한 값. Δ가 blind에서 가장 큰 이유 = 탐색(현재 방 물체 이름 + 방 이동 + pick 재시도). vis-pure는 S3가 kept 프레임 인덱스를 저장하지 않아 재-ingest 후 실행(260823).
2S3 답 정오로 쪼갠 온라인 SR
| 셀 | 전체 | S3 답 맞음(place_set) | S3 답 틀림(비기권) | S3 기권 | reached_only(바닥 답만) 질의 |
|---|
| frames-uniform (균등 16장) | 0.436 (154/353) | 0.521 (99/190) | 0.342 (52/152) | 0.273 (3/11) | 0.627 (37/59) |
| rollforward-vis-pure (모델이 고른 프레임 ≤16) | 0.433 (153/353) | 0.507 (105/207) | 0.333 (46/138) | 0.250 (2/8) | 0.627 (37/59) |
| rollforward-v2 (자필 텍스트 노트) | 0.312 (110/353) | 0.455 (35/77) | 0.241 (35/145) | 0.305 (40/131) | 0.525 (31/59) |
| textlog (오라클 이벤트 로그) | 0.385 (136/353) | 0.440 (70/159) | 0.230 (14/61) | 0.391 (52/133) | 0.441 (26/59) |
| blind (메모리 없음) | 0.289 (102/353) | 0.485 (33/68) | 0.204 (29/142) | 0.280 (40/143) | 0.322 (19/59) |
기권·오답 질의에서의 성공(0.2~0.34)은 메모리가 아니라 탐색으로 얻은 몫 — 온라인 SR을 "메모리 벤치 점수"로 쓰려면 blind 대비 이득 또는 답-정오 조건부로 봐야 한다. 반대로 "답 맞음" 열은 메모리가 맞아도 실행이 깎는 양(조작 ceiling)을 보여준다.
3층별 (온라인 / 같은 질의 재생)
| 셀 | find_target | find_distractor | single | multi | not_floor | floor |
|---|
| frames-uniform (균등 16장) | 0.416 /0.411 n=178 | 0.457 /0.514 n=175 | 0.440 /0.495 n=318 | 0.400 /0.171 n=35 | 0.427 /0.465 n=323 | 0.533 /0.433 n=30 |
| rollforward-vis-pure (모델이 고른 프레임 ≤16) | 0.416 /0.383 n=178 | 0.451 /0.572 n=175 | 0.450 /0.518 n=318 | 0.286 /0.114 n=35 | 0.433 /0.494 n=323 | 0.433 /0.300 n=30 |
| rollforward-v2 (자필 텍스트 노트) | 0.298 /0.240 n=178 | 0.326 /0.110 n=175 | 0.321 /0.182 n=318 | 0.229 /0.114 n=35 | 0.294 /0.164 n=323 | 0.500 /0.300 n=30 |
| textlog (오라클 이벤트 로그) | 0.404 /0.469 n=178 | 0.366 /0.121 n=175 | 0.393 /0.294 n=318 | 0.314 /0.314 n=35 | 0.387 /0.286 n=323 | 0.367 /0.400 n=30 |
| blind (메모리 없음) | 0.219 /0.137 n=178 | 0.360 /0.191 n=175 | 0.311 /0.179 n=318 | 0.086 /0.029 n=35 | 0.300 /0.173 n=323 | 0.167 /0.067 n=30 |
4예시 롤아웃 (합본 영상 — 턴 오버레이 포함, 배속 재생 권장)
같은 질의, 전략별 대조 — val_890__1 "Pick up the cup"
blind는 20턴 내내 방을 뒤지다 실패, textlog는 5턴, vis-pure는 3턴 만에 기억한 위치로 직행해 성공 — 메모리 신호가 궤적에 그대로 보인다.
같은 질의, 전략별 대조 — val_862__1 "Pick up the bowl"
동일 패턴: blind 20턴 ✗ / textlog 10턴 ✓ / vis-pure 3턴 ✓.
조작 ceiling — val_889__1 "Pick up the tissue box I moved earlier" (frames-uniform)
frames-uniform ✗ (20턴, pick 15회)
위치는 정확히 찾아 도달(reached ✓)했지만 π0.5가 pick을 15회 시도하고도 못 들어 실패 — 답 맞은 질의에서도 SR이 0.43~0.52에 머무는 이유.
5설정·출처
sbench_exec.online --strategies … --models gemini-3.6-flash --policy molmobot --navigate-mode drive --place-mode primitive (find: 사용 안 함) · 샤드 jsonl tmp/exec_online/online_full_s*.jsonl · 집계 sbench_exec.aggregate_online → tmp/exec_online_summary/summary.{json,md} · S3 답 정오 tmp/s3_flash_s*/results.json(place_set) · 리포트 빌더 tmp/build_online_full_report.py
관련: 재생 트랙 최종 260821-e2e_exec_sr_results.html · 채점 규칙 v5 턴 로그 · 저수준 VLA 교체(Cosmos) 260823-cosmos_vs_pi05_restore.html