Index
2026-08-24 — Experiment (online full eval)

Full online 실행 SR — S3 find 353질의 × 5전략 × gemini-3.6-flash

온라인 = 컨텍스트 단계 산출물만 메모리로 시딩(답은 쓰지 않음) → 매 턴 VLM(프레임 ≤4 + 현재 뷰 + 현재 방 물체 이름 목록 + 메모리) → subgoal → π0.5 mixv2 128스텝 · navigate = A* 주행 · 단일 12턴/멀티 25턴 · 성공 = 답별 채점(GT 들기, 바닥 답은 도달 ≤0.85 m) · 생성 03:25 · 행 1765 (셀당 353 목표)
TL;DR — 분모는 전체 질의(VLM 답 정오와 무관). 온라인은 탐색을 허용하므로 blind도 0.29을 얻는다(S3에서 기권했던 질의에서도 0.28) — 메모리 신호는 "셀 − blind"로 읽는다. 답이 맞았던 질의에서도 0.44~0.52에 그치는 건 VLA pick 실패·VLM 허위 done(조작 축, 재생 oracle ceiling 0.658과 같은 축). 순위: frames-uniform(0.436) > rollforward-vis-pure(0.433) > textlog(0.385) > rollforward-v2(0.312) > blind(0.289).
0.436
frames-uniform
n=353
0.433
rollforward-vis-pure
n=353
0.312
rollforward-v2
n=353
0.385
textlog
n=353
0.289
blind
n=353

1셀별 SR (전체 질의 분모)

셀 (@gemini-3.6-flash)nSR_onlineSR_strict(전부 lift)메모리 이득(−blind)done율(허위)턴 상한평균 턴$/ep같은 질의 재생 SR_CΔ(온라인−재생)
frames-uniform (균등 16장)353/3530.4360.433+0.1470.72 (0.34)0.198.50.1200.463 (n=348)-0.026
rollforward-vis-pure (모델이 고른 프레임 ≤16)353/3530.4330.433+0.1440.73 (0.35)0.208.60.1260.477 (n=348)-0.043
rollforward-v2 (자필 텍스트 노트)353/3530.3120.309+0.0230.62 (0.36)0.219.40.0980.175 (n=348)+0.132
textlog (오라클 이벤트 로그)353/3530.3850.382+0.0960.70 (0.36)0.259.80.0890.296 (n=348)+0.092
blind (메모리 없음)353/3530.2890.289+0.0000.60 (0.35)0.2911.20.1060.164 (n=348)+0.129
재생 SR_C는 S3 답을 그대로 실행(틀린 답·기권 = 실패)한 값. Δ가 blind에서 가장 큰 이유 = 탐색(현재 방 물체 이름 + 방 이동 + pick 재시도). vis-pure는 S3가 kept 프레임 인덱스를 저장하지 않아 재-ingest 후 실행(260823).

2S3 답 정오로 쪼갠 온라인 SR

전체S3 답 맞음(place_set)S3 답 틀림(비기권)S3 기권reached_only(바닥 답만) 질의
frames-uniform (균등 16장)0.436 (154/353)0.521 (99/190)0.342 (52/152)0.273 (3/11)0.627 (37/59)
rollforward-vis-pure (모델이 고른 프레임 ≤16)0.433 (153/353)0.507 (105/207)0.333 (46/138)0.250 (2/8)0.627 (37/59)
rollforward-v2 (자필 텍스트 노트)0.312 (110/353)0.455 (35/77)0.241 (35/145)0.305 (40/131)0.525 (31/59)
textlog (오라클 이벤트 로그)0.385 (136/353)0.440 (70/159)0.230 (14/61)0.391 (52/133)0.441 (26/59)
blind (메모리 없음)0.289 (102/353)0.485 (33/68)0.204 (29/142)0.280 (40/143)0.322 (19/59)
기권·오답 질의에서의 성공(0.2~0.34)은 메모리가 아니라 탐색으로 얻은 몫 — 온라인 SR을 "메모리 벤치 점수"로 쓰려면 blind 대비 이득 또는 답-정오 조건부로 봐야 한다. 반대로 "답 맞음" 열은 메모리가 맞아도 실행이 깎는 양(조작 ceiling)을 보여준다.

3층별 (온라인 / 같은 질의 재생)

find_targetfind_distractorsinglemultinot_floorfloor
frames-uniform (균등 16장)0.416 /0.411 n=1780.457 /0.514 n=1750.440 /0.495 n=3180.400 /0.171 n=350.427 /0.465 n=3230.533 /0.433 n=30
rollforward-vis-pure (모델이 고른 프레임 ≤16)0.416 /0.383 n=1780.451 /0.572 n=1750.450 /0.518 n=3180.286 /0.114 n=350.433 /0.494 n=3230.433 /0.300 n=30
rollforward-v2 (자필 텍스트 노트)0.298 /0.240 n=1780.326 /0.110 n=1750.321 /0.182 n=3180.229 /0.114 n=350.294 /0.164 n=3230.500 /0.300 n=30
textlog (오라클 이벤트 로그)0.404 /0.469 n=1780.366 /0.121 n=1750.393 /0.294 n=3180.314 /0.314 n=350.387 /0.286 n=3230.367 /0.400 n=30
blind (메모리 없음)0.219 /0.137 n=1780.360 /0.191 n=1750.311 /0.179 n=3180.086 /0.029 n=350.300 /0.173 n=3230.167 /0.067 n=30

4예시 롤아웃 (합본 영상 — 턴 오버레이 포함, 배속 재생 권장)

같은 질의, 전략별 대조 — val_890__1 "Pick up the cup"

blind ✗ (20턴)
textlog ✓ (5턴)
vis-pure ✓ (3턴)
blind는 20턴 내내 방을 뒤지다 실패, textlog는 5턴, vis-pure는 3턴 만에 기억한 위치로 직행해 성공 — 메모리 신호가 궤적에 그대로 보인다.

같은 질의, 전략별 대조 — val_862__1 "Pick up the bowl"

blind ✗ (20턴)
textlog ✓ (10턴)
vis-pure ✓ (3턴)
동일 패턴: blind 20턴 ✗ / textlog 10턴 ✓ / vis-pure 3턴 ✓.

조작 ceiling — val_889__1 "Pick up the tissue box I moved earlier" (frames-uniform)

frames-uniform ✗ (20턴, pick 15회)
위치는 정확히 찾아 도달(reached ✓)했지만 π0.5가 pick을 15회 시도하고도 못 들어 실패 — 답 맞은 질의에서도 SR이 0.43~0.52에 머무는 이유.

5설정·출처

sbench_exec.online --strategies … --models gemini-3.6-flash --policy molmobot --navigate-mode drive --place-mode primitive (find: 사용 안 함) · 샤드 jsonl tmp/exec_online/online_full_s*.jsonl · 집계 sbench_exec.aggregate_online → tmp/exec_online_summary/summary.{json,md} · S3 답 정오 tmp/s3_flash_s*/results.json(place_set) · 리포트 빌더 tmp/build_online_full_report.py

관련: 재생 트랙 최종 260821-e2e_exec_sr_results.html · 채점 규칙 v5 턴 로그 · 저수준 VLA 교체(Cosmos) 260823-cosmos_vs_pi05_restore.html