Index
2026-08-24 — Plan

ICLR 2027 논문 계획 — 구성·내용·Placeholder 설계

scene_bench | Overleaf 클론 ~/repos/Robotics/scene_bench_paper | 사용자 검토용 초안

TL;DR

9p
본문 배분 완료
3/8
실험 절 실측 보유
4
Placeholder
13
Fig+Table

1 논문 한 줄 주장 & 포지셔닝

Thesis

"가정(house) 스케일에서 로봇이 쌓은 이력(retrospective memory)과 실행 중 상태 추적(online execution memory)을, 누출이 통제된 조건에서 실제 navigation–manipulation 행동으로 평가하는 최초의 벤치마크"

포지셔닝 원칙 (260821 분석 확정): 볼륨(93h vs RoboCasa365 2,200h)으로 싸우면 진다. 주장 축은 ① 에피소드 길이 10~16×(10,520/17,250스텝 vs 현존 최장 기억벤치 RoboMemArena 1,076) ② 고유 질의 ≈1,160개(기억벤치 대비 45~73×, 시드 반복 아님) ③ 기억 종류 분해 — restore·resume은 조사한 어느 벤치에도 없음. 빈칸 = "긴 것 × 기억 축".

제목 — 가제 확정 (사용자 결정 260824)

SceneMem-Bench: Factorizing Retrospective Memory and Online Execution State in Household Robots — 벤치 이름 = SceneMem-Bench로 본문·표기 통일

2 스토리라인 — 논리 사슬 5단

#명제근거상태
가정용 task는 두 종류의 이력에 의존 — 회고 기억(위치·상태·진행·규칙) + 실행 중 상태 갱신제안 덱 v2 slide 2–3프레이밍
기존 벤치는 교차를 못 잼 — 기억벤치는 테이블탑 단기, 긴 벤치는 기억 축 없음8기준 coverage 표 + 포지셔닝 3축 실측실측 ✅
집 전체·5~15분·전자동 생성 벤치 — 4가족 × Direct/Stateful, 공리 6개 릴리즈 게이트DATAGEN_OVERVIEW + v0.7 릴리즈 153편/759질의실측 ✅
평가는 기억 실패와 제어 실패를 분리 — 2-stage + 3-tier + 답별 채점S3 353질의 · full online 1,765행 · E2E 재생 격자실측 ✅
총점 하나로는 안 보이던 구조 4건이 드러남S3 층별 + full online + cap-8실측 ✅
파는 방식: "만들었다"가 아니라 "만들었더니 이게 보였다" — 벤치 논문이면서 empirical finding 4개를 동봉하는 구조.

3 섹션별 구성 (본문 9p 배분)

1 Introduction (~1.2p) — 사용자 제공 문안(260824) 기반

P1 문제: 가사 작업은 현재 관찰 처리만으로 안 됨 — 이전 에피소드 정보(retrospective) + 작업 중 누적 수행 상태(online execution)를 함께 활용. 기존 벤치는 장기 물체 탐색 / 궤적 내 조작 기억 / 장시간 planning 중 일부에만 집중 → 통제 조건 평가 불가.
P2 제안: MolmoSpaces 환경에서 memory-grounded VLA benchmark (260824 결정 RoboCasa Kitchen 부착은 후속 — 논문 v1 제외, 문안의 "RoboCasa와" 삭제). Finding/Restore/Resume/Routine × Direct/Stateful 교차. 동일 관찰·명령 + 다른 이력 → 다른 정답인 task pair로 기억의 인과적 필요성 평가(= 공리 A6 반사실 짝의 구현).
P3 뒷받침(추가 권장): 왜 어려운가 3가지(텔레옵 불가→전자동 생성 / 누출→공리 게이트 / compounding→tier 분리) + 발견 4건 프리뷰. 규모 수치(10~16×, ≈1,160)는 기여가 아니라 뒷받침 문장으로.

Contributions 5개 (사용자 문안 확정)

C1 장기 기억 × 수행 기억 독립 축 통제 · C2 multi-room nav+manip 결합 household task · C3 4기능 포괄(위치 검색+상태 복원+작업 재개+규칙 적용) · C4 Memory VLM + VLA(π0.5) 2-stage baseline · C5 Oracle/predicted/shuffled memory 조건 + 단계별 지표로 기억 검색·상태 갱신·행동 grounding·제어 실패 구분

2 Related Work (~0.8p) — 4그룹 + Table 1 (8기준 coverage)

(a) 로봇 기억 벤치(RoboMME·RoboMemArena·MemoryBench·FindingDory·EgoMemReason — 테이블탑 단기 또는 nav-only) (b) Long-horizon(CALVIN·LIBERO-Long·RoboCasa365·LongAct — 기억 축 없음) (c) 메모리 증강 방법(MemER·Memer·π-mem·Memory VLA·MemoAct — "방법은 있는데 잴 벤치가 없다" 프레임, M1~M3 출처) (d) VLA·시뮬(π0.5·GR00T·Cosmos·MolmoSpaces).

STARBench 해소 (260824): amrl.cs.utexas.edu/STAR = arXiv 2511.14004 (Chen et al., UT Austin AMRL) — 시공간 물체 탐색 벤치(visible/interactive/commonsense search, sim + 실물 Tiago). 구분: 탐색 단일 기능 + LLM 고수준 도구 vs 우리 4기능 × low-level VLA. 덱의 세부 표현("3–6 day patrol")은 논문 본문 대조 후 사용. 실물 평가 보유 벤치라 sim-only 방어 문구에서도 정면 인지 필요.

3 Benchmark (~2.3p)

3.1 에피소드 = [심기(관찰만)]→[개입 N]→[질의]. 4분류(Finding 어디 있지 / Resume 어디까지 / Restore 원래 어땠지 / Routine 여긴 어떻게) × Direct/Stateful. 규율: 모든 질의는 "현재 관측에 없는 정보"를 채워야 함.
3.2 전자동 생성 — 5단계 파이프라인, 시나리오 문법(shift/relocate/twin_merge/decoy/store_in), 원시동작 생성-검증(도킹 링 180후보 × grasp DB × IK), 임계값은 실패 실측에서 역산. 실패도 데이터(misplaced/scoring 라벨 → 답별 채점의 출처).
3.3 누출 통제 공리 A1~A6 = 릴리즈 차단 게이트 + 실전 사례(blind 0.75 상식 누출 적발 → 반상식 배치 교정).
3.4 통계 + 포지셔닝 차트. ⚠️ routine 포함 완성태로 기술(사용자 지시) — 본문은 4가족 동등, 통계는 200편/≈1,160행(find 480 + restore 192 + resume ~400 + routine ~90), v0.7 실측(153편/759질의)은 "현재 릴리즈" 각주로.

4 Evaluation Protocol (~1.2p)

2-stage(Memory-VLM → π0.5, 온라인은 128스텝당 VLM 1턴 plan-first) × 3-tier(VLM eval 기호 / 재생 접지 / full online 풀스택).

평가 조건 (C5 프레임)구현 전략상태
No historyblind
Oracle memorytextlog
Predicted memoryframes-uniform / vis-pure / rollforward-v2 / tagmem(ours)
Raw history / Short window전 프레임·최근 구간 (문맥 상한 대조군)🔲 소규모
Shuffled memory이력 뒤섞기 — 기억 의존 인과 검증🔲 PH-4

단계별 지표(C5 후반부): MEMORY(검색·접지) → EXECUTION(subgoal 진행·중복/누락) → CONTROL(nav/manip·회복) → OUTCOME(SR — 답별 채점, 바닥 답 도달 ≤0.85m, sr_strict 병기) + memory signal(=전략−blind) · 층별 분해 · 조건부 SR. 기존 3-tier 실측이 이 4계층에 그대로 사상.

5 Experiments (~2.3p) — 실측 3절 + PH 4절

내용핵심 수치상태
5.2VLM Eval 주표 (5전략×2모델×3가족+층별)총점 0.45~0.69 수렴, 층별 역전: textlog 옮긴 물체 0.78~0.80 vs 본 물체 0.12~0.17, 시각은 정반대✅ S3
5.3Full Online Eval + Δ재생vis-pure 0.439 ≈ frames 0.436 > textlog 0.385 > rf-v2 0.312 > blind 0.289; 텍스트 온라인 이득 +0.09~+0.13, oracle ceiling 0.647✅ 260824
5.4저장 제약 (cap16→cap8)vis −0.15 vs tagmem −0.03 교차; tagmem 최악-케이스 min 0.36 vs vis 0.14✅ 260823
5.5모델 격자: GPT-5.6 · Qwen3-VL · Gemini · Claude · Robotics-ER표 뼈대 + 각주 "camera-ready에서 채움" — 2모델 실측(vis-pure flash 0.78 vs sonnet 0.39)이 격자 필요성을 선증명🔲 PH-1
5.61-stage VLA 라인업 확정: π0.5 · Cosmos 3 · HAMLET(?) (no-nav subset) — GR00T·RLDX-1·DreamZero는 여유 시 각주로π0.5·Cosmos 어댑터 ✅ 즉시 가능; HAMLET은 체크포인트 가용성 확인(성사 시 "1-stage 암묵 메모리 vs 2-stage 명시 메모리" 대조축 완성). Cosmos 예비 실측(평면 내려놓기 4/13 vs π0.5 0/4)은 각주/부록🔲 PH-2
5.7Routine 결과 — 본문 §3은 완성태 기술(사용자 지시), 빈 것은 수치뿐질의·판정 설계 확정(260821); Table 3·4에 routine 열 사전 배치🔲 PH-3
5.8인과 통제(격상): shuffled memory · oracle→predicted 격차 · raw/short-window · generalizationC5에 명시된 이상 필수 — PH-1과 함께 최우선 (~$10)🔲 PH-4 필수

6 Analysis (~0.7p) — 발견 4건 승격

F1 텍스트/시각 상보성(기억 매체가 질의 종류를 가름) · F2 매체 선호의 모델 종속(같은 16장·같은 프롬프트에서 정반대 → 리더보드는 메서드×모델 격자) · F3 온라인 실행의 탐색 회복(VLM eval만으로는 과소평가) · F4 저장 제약 교차(예산이 실전 제약일 때 구조화가 이김). + 정성 실패 사례 1개(허위 done / write-phase 오인식).

7 Limitations & Conclusion (~0.5p)

sim-only(선제 방어: 카메라 분포 −40pp 실측 = 실물 이전의 비자명성을 우리가 정량화) · rule-based nav 생성 · tagmem 부분 우위(정직하게) · 실물 로봇 트랙 부재. (routine은 완성태 기술이므로 limitation에서 제외 — 투고 전 생성 완료가 전제)

R ICLR 2027 포맷 준수 규칙 (템플릿 실측, 260824)

사용자 지시: 포맷 훼손 금지, 템플릿 규칙 그대로 준수. iclr2027_conference.tex에서 직접 추출한 규칙:

규칙내용우리 적용
분량본문 9p 강한 상한(제출) / 10p(rebuttal·camera-ready), 참고문헌 무제한§2 배분 합계 = 정확히 9.0p — Fig 크기가 최대 변수, 넘치면 3.2 생성 상세·5.8 인과 통제 상세부터 Appendix행
스타일 파일수정 금지 ("grounds for rejection"), 줄번호 본문 참조 금지.sty/.bst 불변, vspace 핵 등 편법 금지
익명성\iclrfinalcopy 주석 유지 = 저자 숨김⚠️ HF Keh0t0/scene-mem-benchmark는 계정명 노출 — 익명 미러 필요
인용natbib — 문장 성분 \citet / 괄호 \citep, References 알파벳순iclr2027_conference.bib에 축적
Figure/TableFig 캡션 아래 · Table 제목 , lower case, 연번결과 표 6개 모두 위-캡션
AI use statement필수 절 (불산입, ≤1p) — 생성형 AI 사용 내역 + 검증 절차Claude Code 사용(하네스·분석·집필 보조) 정직 기재 + 저자 검증 문구. 누락 = 규정 위반
Ethics / Reproducibility권장 (불산입, 각 ≤1p, refs 앞)벤치 논문이라 Reproducibility는 사실상 필수 취급 — 익명 코드/데이터 링크 + Appendix 참조
조판US Letter, pdflatex, width=x\linewidthFig는 pdf export

4 Figure / Table 계획 (13개)

ID내용소스상태
Fig 1Teaser: 타임라인 + "같은 관측·다른 이력→다른 정답"덱 v2 slide 8 재구성신규 제작
Fig 24가족 × Direct/Stateful 격자 + 예시 질의덱 v2 slide 7신규 제작
Fig 3생성 파이프라인 5단계 + 생성-검증DATAGEN §0·§1신규 제작
Fig 4포지셔닝 차트 (길이·질의 수)260821 dataviz✅ 있음
Fig 52-stage × 3-tier 프로토콜260824 덱 slide 26신규 제작
Fig 6층별 상보성 바차트S3 데이터데이터 ✅
Fig 7저장 제약 cap16→cap8260823 실측데이터 ✅
Tab 1Related work 8기준 coverage덱 v2 slide 6STARBench 확인 후
Tab 2데이터셋 통계 (v0.7/목표 구분)DATAGEN §0-3
Tab 3VLM eval 주표S3
Tab 4Full online SR + Δ재생260824 full eval
Tab 5모델 격자 확장🔲 PH-1
Tab 61-stage VLA🔲 PH-2

5 Placeholder 우선순위 & 리스크

PH실험선행 조건예상 규모
PH-1API 모델 격자 (GPT-5.6, Qwen3-VL, Gemini, Claude, ER)키·어댑터만 (하네스 그대로)모델당 ~$40, 1일 — 가성비 최고
PH-21-stage VLA = π0.5 · Cosmos 3 · HAMLET(?) (no-nav subset)subset 정의 (π0.5·Cosmos 어댑터 ✅) + HAMLET 가용성 확인모델당 수 시간 (sbatch)
PH-3Routine ~90행데이터 생성팀 (우리 통제 밖)생성 후 eval 반나절
PH-4shuffled memory / raw·short-window / generalization — C5 지탱, 격상하네스 소규모 수정~$10 — PH-1과 동순위 최우선
리스크: ① sim-only 리뷰(§7 선제 방어 — STARBench 실물 Tiago·RoboMemArena 실물 5task 보유를 정면 인지) ② STARBench 미확인해소(arXiv 2511.14004) ③ v1 scene-mem 수치 이식 금지(260810 확정 — 인용만) ④ 260824 덱 slide 37 수치는 캠페인 중간값 — 논문은 context.md 최종값만 ⑤ routine 순증분 아님(총계 각주 필수) + 완성태 기술의 전제 리스크: 투고 전 생성 미완이면 3가족 체제 fallback — routine 문장은 한 곳에 모아 되돌림 diff 최소화 ⑥ 분모 규약(전체 353, 기권·재시도 의미론 Setup 명시) ⑦ RoboCasa 표기해소(260824 결정: 후속 작업, v1은 MolmoSpaces 단독) ⑧ 익명성 vs 데이터 공개: HF 계정명 노출 — 제출용 익명 미러(anonymous.4open.science 등) 준비.

6 오픈 이슈 (사용자 결정 대기) & 작성 순서

결정 대기 (해소 2건 반영)

벤치 이름해소: SceneMem-Bench 가제 확정 ② tagmem의 지위(부속 베이스라인 vs "ours" 강조 — 현 근거는 저장 제약·최악-케이스 우위라 주장 수위를 거기 맞추는 걸 권장) ③ STARBench해소: arXiv 2511.140041-stage 후보해소: π0.5 + Cosmos 3 + HAMLET(?) — 잔여 확인은 HAMLET 가용성뿐(불가 시 2종 진행) ⑤ routine 생성 일정 — 완성태 기술의 전제라 투고 전 완료 필수, 데이터팀 확답 필요 ⑥ 모델 실명 표기 여부(벤치 관례상 실명 권장)

작성 순서

§3 Benchmark(자료 최다) → §4 Protocol → §5 실측 3절 + PH 뼈대 → §2 Related(+Tab 1, STARBench 확정됨) → §1 Intro·§6 Analysis(결과 고정 후 주장 수위 조절) → Abstract + 성명 3종(AI use statement 필수 · Reproducibility · Ethics — 불산입, 마지막 단계). Figure는 §3와 병행(Fig 1~3 제작 시간 최대).

승인 시 다음 단계

Overleaf 클론(~/repos/Robotics/scene_bench_paper)에 섹션 스켈레톤 + 실측 표 + PH 표(빈칸)를 커밋 → git push로 Overleaf 반영.