~/repos/Robotics/scene_bench_paper | 사용자 검토용 초안"가정(house) 스케일에서 로봇이 쌓은 이력(retrospective memory)과 실행 중 상태 추적(online execution memory)을, 누출이 통제된 조건에서 실제 navigation–manipulation 행동으로 평가하는 최초의 벤치마크"
포지셔닝 원칙 (260821 분석 확정): 볼륨(93h vs RoboCasa365 2,200h)으로 싸우면 진다. 주장 축은 ① 에피소드 길이 10~16×(10,520/17,250스텝 vs 현존 최장 기억벤치 RoboMemArena 1,076) ② 고유 질의 ≈1,160개(기억벤치 대비 45~73×, 시드 반복 아님) ③ 기억 종류 분해 — restore·resume은 조사한 어느 벤치에도 없음. 빈칸 = "긴 것 × 기억 축".
| # | 명제 | 근거 | 상태 |
|---|---|---|---|
| ① | 가정용 task는 두 종류의 이력에 의존 — 회고 기억(위치·상태·진행·규칙) + 실행 중 상태 갱신 | 제안 덱 v2 slide 2–3 | 프레이밍 |
| ② | 기존 벤치는 교차를 못 잼 — 기억벤치는 테이블탑 단기, 긴 벤치는 기억 축 없음 | 8기준 coverage 표 + 포지셔닝 3축 실측 | 실측 ✅ |
| ③ | 집 전체·5~15분·전자동 생성 벤치 — 4가족 × Direct/Stateful, 공리 6개 릴리즈 게이트 | DATAGEN_OVERVIEW + v0.7 릴리즈 153편/759질의 | 실측 ✅ |
| ④ | 평가는 기억 실패와 제어 실패를 분리 — 2-stage + 3-tier + 답별 채점 | S3 353질의 · full online 1,765행 · E2E 재생 격자 | 실측 ✅ |
| ⑤ | 총점 하나로는 안 보이던 구조 4건이 드러남 | S3 층별 + full online + cap-8 | 실측 ✅ |
P1 문제: 가사 작업은 현재 관찰 처리만으로 안 됨 — 이전 에피소드 정보(retrospective) + 작업 중 누적 수행 상태(online execution)를 함께 활용. 기존 벤치는 장기 물체 탐색 / 궤적 내 조작 기억 / 장시간 planning 중 일부에만 집중 → 통제 조건 평가 불가.
P2 제안: MolmoSpaces 환경에서 memory-grounded VLA benchmark (260824 결정 RoboCasa Kitchen 부착은 후속 — 논문 v1 제외, 문안의 "RoboCasa와" 삭제). Finding/Restore/Resume/Routine × Direct/Stateful 교차. 동일 관찰·명령 + 다른 이력 → 다른 정답인 task pair로 기억의 인과적 필요성 평가(= 공리 A6 반사실 짝의 구현).
P3 뒷받침(추가 권장): 왜 어려운가 3가지(텔레옵 불가→전자동 생성 / 누출→공리 게이트 / compounding→tier 분리) + 발견 4건 프리뷰. 규모 수치(10~16×, ≈1,160)는 기여가 아니라 뒷받침 문장으로.
C1 장기 기억 × 수행 기억 독립 축 통제 · C2 multi-room nav+manip 결합 household task · C3 4기능 포괄(위치 검색+상태 복원+작업 재개+규칙 적용) · C4 Memory VLM + VLA(π0.5) 2-stage baseline · C5 Oracle/predicted/shuffled memory 조건 + 단계별 지표로 기억 검색·상태 갱신·행동 grounding·제어 실패 구분
(a) 로봇 기억 벤치(RoboMME·RoboMemArena·MemoryBench·FindingDory·EgoMemReason — 테이블탑 단기 또는 nav-only) (b) Long-horizon(CALVIN·LIBERO-Long·RoboCasa365·LongAct — 기억 축 없음) (c) 메모리 증강 방법(MemER·Memer·π-mem·Memory VLA·MemoAct — "방법은 있는데 잴 벤치가 없다" 프레임, M1~M3 출처) (d) VLA·시뮬(π0.5·GR00T·Cosmos·MolmoSpaces).
3.1 에피소드 = [심기(관찰만)]→[개입 N]→[질의]. 4분류(Finding 어디 있지 / Resume 어디까지 / Restore 원래 어땠지 / Routine 여긴 어떻게) × Direct/Stateful. 규율: 모든 질의는 "현재 관측에 없는 정보"를 채워야 함.
3.2 전자동 생성 — 5단계 파이프라인, 시나리오 문법(shift/relocate/twin_merge/decoy/store_in), 원시동작 생성-검증(도킹 링 180후보 × grasp DB × IK), 임계값은 실패 실측에서 역산. 실패도 데이터(misplaced/scoring 라벨 → 답별 채점의 출처).
3.3 누출 통제 공리 A1~A6 = 릴리즈 차단 게이트 + 실전 사례(blind 0.75 상식 누출 적발 → 반상식 배치 교정).
3.4 통계 + 포지셔닝 차트. ⚠️ routine 포함 완성태로 기술(사용자 지시) — 본문은 4가족 동등, 통계는 200편/≈1,160행(find 480 + restore 192 + resume ~400 + routine ~90), v0.7 실측(153편/759질의)은 "현재 릴리즈" 각주로.
2-stage(Memory-VLM → π0.5, 온라인은 128스텝당 VLM 1턴 plan-first) × 3-tier(VLM eval 기호 / 재생 접지 / full online 풀스택).
| 평가 조건 (C5 프레임) | 구현 전략 | 상태 |
|---|---|---|
| No history | blind | ✅ |
| Oracle memory | textlog | ✅ |
| Predicted memory | frames-uniform / vis-pure / rollforward-v2 / tagmem(ours) | ✅ |
| Raw history / Short window | 전 프레임·최근 구간 (문맥 상한 대조군) | 🔲 소규모 |
| Shuffled memory | 이력 뒤섞기 — 기억 의존 인과 검증 | 🔲 PH-4 |
단계별 지표(C5 후반부): MEMORY(검색·접지) → EXECUTION(subgoal 진행·중복/누락) → CONTROL(nav/manip·회복) → OUTCOME(SR — 답별 채점, 바닥 답 도달 ≤0.85m, sr_strict 병기) + memory signal(=전략−blind) · 층별 분해 · 조건부 SR. 기존 3-tier 실측이 이 4계층에 그대로 사상.
| 절 | 내용 | 핵심 수치 | 상태 |
|---|---|---|---|
| 5.2 | VLM Eval 주표 (5전략×2모델×3가족+층별) | 총점 0.45~0.69 수렴, 층별 역전: textlog 옮긴 물체 0.78~0.80 vs 본 물체 0.12~0.17, 시각은 정반대 | ✅ S3 |
| 5.3 | Full Online Eval + Δ재생 | vis-pure 0.439 ≈ frames 0.436 > textlog 0.385 > rf-v2 0.312 > blind 0.289; 텍스트 온라인 이득 +0.09~+0.13, oracle ceiling 0.647 | ✅ 260824 |
| 5.4 | 저장 제약 (cap16→cap8) | vis −0.15 vs tagmem −0.03 교차; tagmem 최악-케이스 min 0.36 vs vis 0.14 | ✅ 260823 |
| 5.5 | 모델 격자: GPT-5.6 · Qwen3-VL · Gemini · Claude · Robotics-ER | 표 뼈대 + 각주 "camera-ready에서 채움" — 2모델 실측(vis-pure flash 0.78 vs sonnet 0.39)이 격자 필요성을 선증명 | 🔲 PH-1 |
| 5.6 | 1-stage VLA 라인업 확정: π0.5 · Cosmos 3 · HAMLET(?) (no-nav subset) — GR00T·RLDX-1·DreamZero는 여유 시 각주로 | π0.5·Cosmos 어댑터 ✅ 즉시 가능; HAMLET은 체크포인트 가용성 확인(성사 시 "1-stage 암묵 메모리 vs 2-stage 명시 메모리" 대조축 완성). Cosmos 예비 실측(평면 내려놓기 4/13 vs π0.5 0/4)은 각주/부록 | 🔲 PH-2 |
| 5.7 | Routine 결과 — 본문 §3은 완성태 기술(사용자 지시), 빈 것은 수치뿐 | 질의·판정 설계 확정(260821); Table 3·4에 routine 열 사전 배치 | 🔲 PH-3 |
| 5.8 | 인과 통제(격상): shuffled memory · oracle→predicted 격차 · raw/short-window · generalization | C5에 명시된 이상 필수 — PH-1과 함께 최우선 (~$10) | 🔲 PH-4 필수 |
F1 텍스트/시각 상보성(기억 매체가 질의 종류를 가름) · F2 매체 선호의 모델 종속(같은 16장·같은 프롬프트에서 정반대 → 리더보드는 메서드×모델 격자) · F3 온라인 실행의 탐색 회복(VLM eval만으로는 과소평가) · F4 저장 제약 교차(예산이 실전 제약일 때 구조화가 이김). + 정성 실패 사례 1개(허위 done / write-phase 오인식).
sim-only(선제 방어: 카메라 분포 −40pp 실측 = 실물 이전의 비자명성을 우리가 정량화) · rule-based nav 생성 · tagmem 부분 우위(정직하게) · 실물 로봇 트랙 부재. (routine은 완성태 기술이므로 limitation에서 제외 — 투고 전 생성 완료가 전제)
사용자 지시: 포맷 훼손 금지, 템플릿 규칙 그대로 준수. iclr2027_conference.tex에서 직접 추출한 규칙:
| 규칙 | 내용 | 우리 적용 |
|---|---|---|
| 분량 | 본문 9p 강한 상한(제출) / 10p(rebuttal·camera-ready), 참고문헌 무제한 | §2 배분 합계 = 정확히 9.0p — Fig 크기가 최대 변수, 넘치면 3.2 생성 상세·5.8 인과 통제 상세부터 Appendix행 |
| 스타일 파일 | 수정 금지 ("grounds for rejection"), 줄번호 본문 참조 금지 | .sty/.bst 불변, vspace 핵 등 편법 금지 |
| 익명성 | \iclrfinalcopy 주석 유지 = 저자 숨김 | ⚠️ HF Keh0t0/scene-mem-benchmark는 계정명 노출 — 익명 미러 필요 |
| 인용 | natbib — 문장 성분 \citet / 괄호 \citep, References 알파벳순 | iclr2027_conference.bib에 축적 |
| Figure/Table | Fig 캡션 아래 · Table 제목 위, lower case, 연번 | 결과 표 6개 모두 위-캡션 |
| AI use statement | 필수 절 (불산입, ≤1p) — 생성형 AI 사용 내역 + 검증 절차 | Claude Code 사용(하네스·분석·집필 보조) 정직 기재 + 저자 검증 문구. 누락 = 규정 위반 |
| Ethics / Reproducibility | 권장 (불산입, 각 ≤1p, refs 앞) | 벤치 논문이라 Reproducibility는 사실상 필수 취급 — 익명 코드/데이터 링크 + Appendix 참조 |
| 조판 | US Letter, pdflatex, width=x\linewidth | Fig는 pdf export |
| ID | 내용 | 소스 | 상태 |
|---|---|---|---|
| Fig 1 | Teaser: 타임라인 + "같은 관측·다른 이력→다른 정답" | 덱 v2 slide 8 재구성 | 신규 제작 |
| Fig 2 | 4가족 × Direct/Stateful 격자 + 예시 질의 | 덱 v2 slide 7 | 신규 제작 |
| Fig 3 | 생성 파이프라인 5단계 + 생성-검증 | DATAGEN §0·§1 | 신규 제작 |
| Fig 4 | 포지셔닝 차트 (길이·질의 수) | 260821 dataviz | ✅ 있음 |
| Fig 5 | 2-stage × 3-tier 프로토콜 | 260824 덱 slide 26 | 신규 제작 |
| Fig 6 | 층별 상보성 바차트 | S3 데이터 | 데이터 ✅ |
| Fig 7 | 저장 제약 cap16→cap8 | 260823 실측 | 데이터 ✅ |
| Tab 1 | Related work 8기준 coverage | 덱 v2 slide 6 | STARBench 확인 후 |
| Tab 2 | 데이터셋 통계 (v0.7/목표 구분) | DATAGEN §0-3 | ✅ |
| Tab 3 | VLM eval 주표 | S3 | ✅ |
| Tab 4 | Full online SR + Δ재생 | 260824 full eval | ✅ |
| Tab 5 | 모델 격자 확장 | — | 🔲 PH-1 |
| Tab 6 | 1-stage VLA | — | 🔲 PH-2 |
| PH | 실험 | 선행 조건 | 예상 규모 |
|---|---|---|---|
| PH-1 | API 모델 격자 (GPT-5.6, Qwen3-VL, Gemini, Claude, ER) | 키·어댑터만 (하네스 그대로) | 모델당 ~$40, 1일 — 가성비 최고 |
| PH-2 | 1-stage VLA = π0.5 · Cosmos 3 · HAMLET(?) (no-nav subset) | subset 정의 (π0.5·Cosmos 어댑터 ✅) + HAMLET 가용성 확인 | 모델당 수 시간 (sbatch) |
| PH-3 | Routine ~90행 | 데이터 생성팀 (우리 통제 밖) | 생성 후 eval 반나절 |
| PH-4 | shuffled memory / raw·short-window / generalization — C5 지탱, 격상 | 하네스 소규모 수정 | ~$10 — PH-1과 동순위 최우선 |
① 벤치 이름 → 해소: SceneMem-Bench 가제 확정 ② tagmem의 지위(부속 베이스라인 vs "ours" 강조 — 현 근거는 저장 제약·최악-케이스 우위라 주장 수위를 거기 맞추는 걸 권장) ③ STARBench → 해소: arXiv 2511.14004 ④ 1-stage 후보 → 해소: π0.5 + Cosmos 3 + HAMLET(?) — 잔여 확인은 HAMLET 가용성뿐(불가 시 2종 진행) ⑤ routine 생성 일정 — 완성태 기술의 전제라 투고 전 완료 필수, 데이터팀 확답 필요 ⑥ 모델 실명 표기 여부(벤치 관례상 실명 권장)
§3 Benchmark(자료 최다) → §4 Protocol → §5 실측 3절 + PH 뼈대 → §2 Related(+Tab 1, STARBench 확정됨) → §1 Intro·§6 Analysis(결과 고정 후 주장 수위 조절) → Abstract + 성명 3종(AI use statement 필수 · Reproducibility · Ethics — 불산입, 마지막 단계). Figure는 §3와 병행(Fig 1~3 제작 시간 최대).
Overleaf 클론(~/repos/Robotics/scene_bench_paper)에 섹션 스켈레톤 + 실측 표 + PH 표(빈칸)를 커밋 → git push로 Overleaf 반영.