‹ Index

scene-mem v2 B1 — held-out val subtask accuracy

MemER Qwen3-VL-4B LoRA · deterministic rule-based scoring (no LLM-judge)
TL;DR — MemER scene-mem v2 LoRA, held-out val: final-query 0.0% (0/2); true compressed-memory recall (chunked) 0.0%
0.0%
PRIMARY final-query
0/2
5.0%
memory-turn match
3/60
0.0%
CHUNKED (true mem)
0/2
0.0%
NOT-chunked floor
0/0

Eval set (honest split)

Held-out val only: 2 test samples across 1 scenarios (split-val total 57). Train leak: NONE. MemER did NOT train on these scenarios.

base = gemini-2.5-flash adapter = None max_new_tokens = 2048

(2) Per-memory-turn narration match rate

bucketmatch ratecount
overall5.0% 3/60
fine segments5.17% 3/58
composite segments (verbatim)0.0% 0/2

(3) Keyframe selection quality

keyframe-count distribution: {0: 8, 1: 63, 2: 68, 3: 21, 4: 9, 5: 3, 6: 4, 8: 2}
mean keyframes/turn: 1.983
final-query emitted-a-keyframe rate: 100.0% (2/2)

(4) Chunked-vs-not memory-recall decomposition

bucketfinal-query acccount
CHUNKED (true compressed-memory recall) 0.0% 0/2
NOT-chunked (learned-prior floor) 0.0% 0/0
chunked = the test's target task instruction matches the _PNP pick-and-place regex reused verbatim from scripts/analyze_tier3b_vs_tier3a.py (object genuinely entered the bounded FIFO). chunked = true compressed-memory recall; notchunked = learned-prior floor.

Run

parse failures: 2 · duration: 2128.2s