Index
2026-05-19 — Research

awesome-memory-vla 전수 스캔 — SceneMem baseline 선별

SceneMem (CoRL 2026) | VLA+memory 61편 코드/학습코드 중심 평가

TL;DR

61
스캔 논문
9
Tier1 코드有
4
Tier2 컨택
3
Tier3 Track A
1
RoboCasa검증

1 배경 / 목적

실험계획서의 core-9 baseline은 lit-review 기반 고전 메모리 아키텍처(SMT/GTrXL/TTM 등)로 구성됐다. 그러나 reviewer는 "왜 최신 memory-VLA와 비교 안 했나"를 반드시 묻는다. 사용자가 지목한 github.com/avanturist322/awesome-memory-vla(VLA+memory 61편)를 한 편씩 보고, SceneMem regime(PandaOmron 모바일·room-scale·~6.8분·8,170프레임·멀티태스크·offline autoregressive recall)에 맞는 baseline을 코드/학습코드 유무 중심으로 선별.

기존 한계: baseline이 method 1개(MemER)뿐 + 고전계열만. 최신 memory-VLA 비교 부재는 벤치 논문의 치명적 공백. tabletop-short는 사용자 명시대로 "아예 다른 regime" → baseline 아니라 차별화 근거로 처리해야 함.

2 작업 내용

5개 병렬 조사 에이전트가 batch당 ~12편 담당. 각 논문: arXiv 초록 + 공식 repo README를 실제로 열어 (1) 메모리 계열 (2) regime/sim env (3) 코드 상태 (4) backbone (5) BasePolicy/B1 harness 통합비용 평가. 코드는 "coming soon" vs 실제 release를 repo 직접 확인으로 구분. 원자료: tmp/baseline_scan/batch_{A..E}.md, 통합본: claude/260519/research-memory_vla_baseline_scan.md.

핵심 판단축: 학습코드 유무(scene_mem_v2 재학습 필수) > regime 적합(모바일/room-scale/RoboCasa) > 통합비용. inference-only/promised-only는 저가치로 강등.

3 결과 — 4-Tier 선별

Tier 1 — 학습코드 공개, 지금 재학습 가능 최우선

Methodvenuerepo (★)regime통합비고
MemoryVLAICLR'26shihao1895/MemoryVLA (245)LIBERO-5 (tabletop)Med필수. MemER 직접 병렬군, 자기완결 학습코드
VPWEM2603.04910HarryLui98/code_vpwem (9)MoMaRT 모바일Med코드 있는 유일 모바일-검증 메모리법
HiF-VLACVPR'26OpenHelix-Team/HiF-VLA (56)LIBERO/CALVINMedOpenVLA backbone = core-9 동일계열
CronusVLA2506.19816InternRobotics/CronusVLA (99)SimplerEnv/LIBEROLow-MedSLURM/FSDP가 우리 클러스터 정합
Mixture-of-HorizonsICML'26Timsty1/MixtureOfHorizons (54)LIBERO/RoboTwin2Low-MedA1 chunked ablation과 직결
ContextVLA2510.04246huiwon-jang/ContextVLA (18)LIBEROLow최경량 메모리 baseline (압축 하한)
KC-VLA2603.01465cytoplastm/KC-VLA (13)ManiSkillMedA3 keyframe ablation 외부근거
EvoVLA2511.16166AIGeeksGroup/EvoVLA (126)Discoverse-LMedRL-finetuned 비교 요구 시
Gated Memory Policy2604.18933real-stanford/gated-memory-policy (30)MemMimic (short)MedGTrXL/TTM 옆 gated 계열 보강

Tier 2 — regime 최상 매치, 코드 미공개 저자 컨택

Methodvenue왜 중요액션
HAMLETICLR'26유일하게 RoboCasa Kitchen 검증(동일 sim 계열), moment-token, backbone-agnosticdaeone0920@kaist.ac.kr 조기코드
EchoVLA2511.18112모바일 매니퓰 + scene+episodic memory = PandaOmron 최근접 임베디먼트xdliang32@gmail.com / 2–3주 재현
"Scaling Short-Term Memory…" 명칭 미검증ICLR'26직접 RoboCasa 평가, gated-attn+hierarchical 압축, ~600프레임OpenReview 5SMNtmJFGa 코드 확인
Long-VLACoRL'25phase-aware 멀티태스크 마스킹, L-CALVIN가 subtask 분해와 구조적 근접"coming soon" release 모니터링

Tier 3 — Track A (offline 비디오-메모리 QA) 전용 차별축

Offline-recall은 본질적으로 long-egocentric-video memory-QA → robot 액션헤드 없는 순수 VLM long-video-memory가 직접 적용. RoboMME류 robot-only 벤치엔 없는 계열.

Method계열Track A 적합
VideoMem (2512.04540)VLM ultra-long video adaptive buffer+PRPO최적 순수-VLM, 코드없음·논문재현 가능
VLM² (2511.20644)dual working+episodic, egocentric 공간추론Track A 정렬, 코드없음
Notes-to-Self (ICRA'26)language-scratchpad memory우리 narration-as-memory와 동일 메커니즘, 인용+모니터링

Tier 4 — Related-work only (벤치마크, baseline 아님)

RoboMME(ICML'26): 가장 근접한 동시기 메모리 벤치 — 단 ManiSkill 고정베이스 tabletop·isolated probe·teacher-forcing 허용. 우리는 room-scale 모바일·8,170프레임 연속·no-teacher-forcing → competing 아님, complementary. MEM(2603.03596): 모바일·15분 키친으로 regime 최고지만 closed π0.6 → 재학습 불가, SceneMem 필요성의 최강 motivation 인용. 그 외 RMBench/RoboCerebra(NeurIPS'25)/RoboHiMan/LongBench/MIKASA-Robo(ICLR'26)/CALVIN/LIBERO-Mem(AAAI'26) = 관련 벤치 인용.

핵심 발견: 61편 중 RoboCasa 검증 = HAMLET 1편(코드미공개), 모바일 = MEM(closed)·EchoVLA(코드없음)·VPWEM(MoMaRT, 코드있음). 절대다수가 tabletop-short → SceneMem의 room-scale·8분·모바일 regime은 기존 메모리-VLA 연구의 실증적 공백.
검증 필요: (a) "PRISM" 명칭은 에이전트 추정 — 실제 제목으로 인용. (b) KV-Efficient VLA repo 스캔 시 404 — 재확인. (c) MemoryVLA 8,170프레임 long-context 워킹메모리 스케일 dry-run 실측 필요.

4 Takeaway

의미

core-9 갈아엎을 필요 없음 — anchor(Blind/GT-Oracle/OpenVLA/MemER) + 자체구현 고전계열(SMT·TTM·GTrXL·Recurrent BC·DT) 유지 위에 코드 있는 최신 memory-VLA 3종(MemoryVLA·VPWEM + HiF-VLA|CronusVLA)을 얹으면 "최신 비교 누락" 리뷰 리스크 소멸.

MemoryVLA는 필수 — ICLR'26, 자기완결 학습코드, MemER의 직접 병렬군(perceptual-cognitive vs retrieval)이 핵심 비교쌍이 됨.

regime 차별화가 데이터로 입증 — 61편 분포 자체가 SceneMem novelty 근거. ④ Track A 독자성 — VLM long-video-memory + language-scratchpad는 robot-only 벤치엔 없음 → Track A를 별도 leaderboard로 키우면 동시기 벤치와 비중첩 기여.

5 Next Steps

즉시 실행 가능

MemoryVLA·VPWEM·CronusVLA repo clone → scene_mem_v2 → BasePolicy 어댑터(P0 critical-path)와 통합. HiF-VLA는 OpenVLA 계열이라 core-9 OpenVLA 파이프 재사용.

저자 컨택 3건 (병렬)

HAMLET(RoboCasa 직접) · EchoVLA(모바일 임베디먼트) · ICLR OpenReview RoboCasa 논문. 받으면 primary, 데드라인 내 무응답이면 related-work.

문서 반영 완료

실험계획서 §1 baseline suite 재구성(업데이트 섹션), context.md 갱신. novelty 문구 수정은 보류 유지하되 본 스캔의 "regime 공백" 데이터를 차별화 표 근거로 활용 가능.