recall accuracy만 측정 (순수 offline). 최대 리스크였던 door-open primitive 소멸.Mem.pdf로 오류 정정. M3는 임의 재구성이 아니라 MEM "Only Text Memory" ablation의 충실 재현.memory/ 빌더 3개만 분기. 입력 전부 동일(공정성).RoboCasa 기반 scene-memory 벤치(859 시나리오). 전체 로드맵 API → Open-VLM 튜닝 → ours 중 API 트랙을 먼저 완벽히. 측정 대상 = 사전 영상에서 여러 task 수행 후 final task에서 메모리를 정확히 반영해 올바른 instruction/타깃을 뽑는 능력. 메모리 표현 3종을 논문 충실 비교.
get_action(저수준 컨트롤러)을 미제공 → 아키텍처 미정. 데이터셋 구조·논문 메커니즘 파악이 선결.데이터셋 정밀 파악(NAS 스캔 규칙 준수) → 핵심 갈림길 사용자 확정 → 논문 2종 정밀 조사 → 스코프 2차 정정 → brainstorming→writing-plans 스킬로 설계서·계획서 산출.
pi.website/download/Mem.pdf 지목 → MEM 논문으로 정정(실재·명세된 메커니즘). ② 초기 설계의 embodied(primitive/memory_success)를 사용자 지시로 전면 제거.| 메소드 | 논문 근거 | 메모리 표현 | VLM 호출 | 프롬프트 출처 |
|---|---|---|---|---|
| M1 subsample | naive 하한 (MemER history-len baseline 계열) | 균일 K 프레임 | 0 (recall만) | 중립 |
| M2 MemER | arXiv 2510.20328 | 시각 keyframe (nominate→1D single-linkage d=5, median-low, last-8) | 세그먼트당 1 + recall | Appendix F verbatim |
| M3 MEM | PI π0.6 (Mem.pdf Sec III-B) | 압축 self-predict NL 메모리 carry-forward | 세그먼트당 1 + recall | Sec III-B 내용-충실 |
공통 파이프라인: video 균일샘플 → oracle 세그먼트 경계 → memory/ 빌더(분기) → 공용 recall(후보 grounding+1회 재질의) → metrics(strict/object) → cache resume → runner(dev→val→full).
docs/specs/2026-05-19-scene-mem-api-track-design.md + 구현계획 ...-plan.md (TDD 18태스크, 각 실패테스트→구현→통과→로컬commit, self-review로 spec 전 항목 커버 확인).M3가 MEM "Only Text Memory" ablation의 명세된 메커니즘 충실 재현이 되어 논문 근거가 견고. M1/M2/M3가 MEM Fig 6 ablation taxonomy(naive / keyframe[MemER 인용] / Only-Text)와 정확히 정합 → 비교축 정당. embodied 제거로 최대 구현 리스크 소멸, 파이프라인이 순수 offline로 단순화되어 비용·일정 예측 가능 + 메모리 표현력만 격리 측정.
val split 미정 — manifest는 data/scene_mem_v2/{train,val}.jsonl 참조하나 트리엔 combo_*만. NAS 광범위 스캔 금지 → 사용자가 val 시나리오 id 목록/경로 제공 필요(runner --val-list로 수용). dev/full은 즉시 가능.
구현 태스크 0(scaffold·venv)부터 TDD 착수 → dev 스모크에서 parse_fail==0·strict_acc 산출·API 비용 실측 → val → full. 가설: recall accuracy에서 M2≥M3>M1, long-horizon에서 M1 급락(MemER history-length 경향과 일치 예상).