Index
2026-08-21 scene-mem benchmark 계획 통계 v1 · 200편

Scene-Mem 벤치마크 포지셔닝

기존 로봇 벤치마크와 나란히 놓고 에피소드 길이 · 질의 개수 · 집 다양성 세 축에서 어디에 서 있는지 재봤다. 총 데이터 볼륨으로는 지지 않을 수 없고, 이길 수 있는 축은 따로 있다.

10–16×
에피소드 한 편의 길이가 현존 최장인 RoboMemArena(평균 1,076 스텝)의 10~16배다. type1 중앙 10,520 스텝(420.8 s), type2 중앙 17,250 스텝(690 s) — 25 Hz 연속 제어 기준. 기억을 물어보려면 먼저 기억할 시간이 있어야 한다.
200컨텍스트 편
200서로 다른 집
93 h영상 (3 카메라)
480find
192restore
~400resume
~90routine (추정)

축 1얼마나 긴가

메모리 벤치마크의 1차 제약은 한 에피소드 안에 담기는 시간이다. 에피소드가 30초면 "기억"과 "짧은 문맥"이 구분되지 않는다. 아래는 같은 단위(시뮬레이터 연속 제어 스텝)로 맞춘 비교다.

에피소드 길이 — 연속 제어 스텝
막대 = 평균(또는 롤아웃 상한). 괄호는 제어 주파수가 공개된 경우의 실시간 환산.
기존 벤치마크 Scene-Mem (ours)
LIBERO-Long
275 · ~14 s @20 Hz
RoboMME
481 · ~24 s (20 Hz 가정)
RoboMemArena
1,076 · 제어 Hz 비공개
CALVIN (롤아웃 상한)
1,800 · 60 s @30 Hz
Scene-Mem type1
10,520 · 420.8 s @25 Hz
Scene-Mem type2
17,250 · 690 s @25 Hz
05k 10k15k
LongAct는 AI2-THOR 이산 액션(인간 >500, 상한 16,000)이라 연속 제어 스텝과 단위가 달라 이 차트에서 제외했다 — 아래 표에는 있다. RoboMME의 초 환산은 ManiSkill 기본 20 Hz 가정이며 논문 미기재다.

왜 이 차이가 필요한가. 우리 편에는 type1 기준 4~5개의 pick-and-place 사건이 순차로 들어간다. 첫 사건에서 옮긴 물건을 마지막에 물어보면 정답과 질의 사이가 400초 이상 벌어진다. v0 샘플 실측으로 s_since_last_seen이 같은 행 안에서 241.3초 vs 0.1초로 갈리는 사례가 확인됐다 — 한 질의 안에 "기억해야 하는 것"과 "보고 있는 것"이 같이 들어간다. 1,000 스텝(≈40 s)짜리 에피소드에서는 이 대조가 만들어지지 않는다.


축 2질의가 몇 개, 얼마나 다양한가

"task 16개 × 시드 50회 = 800 에피소드"와 "서로 다른 질의 1,160개"는 다른 얘기다. 아래는 서로 다른 지시문/질의의 수로 맞춘 비교 — 시드 반복은 세지 않았다.

고유 평가 질의(과제) 수
같은 지시문을 여러 시드로 반복 실행한 것은 1개로 센다.
기존 벤치마크 Scene-Mem (ours)
MemoryBench
3
LIBERO-Long
10
RoboMME
16 · 평가 800 ep
RoboMemArena
26 · 서브태스크 151
CALVIN
34
LongAct
300 · 평균 9 goal/ep
RoboCasa365
365
Scene-Mem
≈ 1,160 · 편당 5.8
0300 600900
Scene-Mem의 1,160행은 전부 다른 집 · 다른 물체 · 다른 이력에서 나온다 — 같은 지시문의 시드 반복이 아니다. routine ~90은 추정치(§3)이며 나머지 1,072는 생성 계획 확정값이다.

구성 — 어떤 질의가 몇 개인가

find 480 restore 192 resume ~400 routine ~90 (추정)
가족kind세부 축편당근거
findfind_target× single2011004.80생성 계획 확정
find_target× multi31
find_distractor× single233
find_distractor× multi15
소계4801004.80
restorerestoreorigin=first × single122(100)
find와 동일 편
1.92생성 계획 확정
restoreorigin=previous24
restore× multi (n ≤ 3)46
소계192(100)1.92
resumeresume컷 지점 (press / visit / put_in)300~5001003~5생성 계획 확정
routineD1배치 규칙~40(type1)0.40추정 §3 참조
D2절차 규칙~30(type2)0.30
D3금지~20(type1)0.20
소계~900.4570~120
합계≈ 1,1602005.81,050~1,290

추정routine은 왜 ~90행인가

routine(D)만 아직 생성 계획이 없어 추정했다. 근거를 다 적어두니 값이 틀리면 가정을 바꿔서 다시 세면 된다. 하위 3종은 taxonomy 확정본 기준 D1 배치 규칙 · D2 절차 규칙 · D3 금지다.

구조적 상한이 먼저다. routine은 "패턴을 유도해서 일반화"하는 과제라 같은 규칙의 사례가 편 안에 3회 이상 나오고, 4번째를 홀드아웃으로 물어야 성립한다. type1 편의 이벤트 예산이 4~5개이므로 규칙 하나가 편을 통째로 소비한다 — 편당 최대 1행이 구조적 상한이고, find(4.8)·restore(1.9)처럼 편을 나눠 쓸 수 없다.

하위내용어느 편에 붙나저작 가능 비율 가정추정 행
D1 배치 규칙 — "이 집에서 컵류는 항상 싱크대로 간다"를 3회 관측 → 4번째 물건을 어디 둘지 type1 (이벤트 4~5개 중 3개를 규칙에 씀) 100편 중 40% — 나머지는 이벤트 구성이 규칙을 못 만든다~40
D2 절차 규칙 — "이 집에서 X를 하려면 먼저 Y를 한다"는 순서를 반복에서 유도 type2 (이미 반복 유닛 구조: press ×3, visit ×4, put ×3) 100편 중 30% — 순서 제약이 있는 task 조합에서만~30
D3 금지 — "여기엔 절대 안 둔다"를 관측에서 유도, 안 하는 것이 정답 type1 100편 중 20% — 음성 판정(안 함) 설계가 가장 까다롭다~20
합계~90 (70~120)

낙관 시나리오 (~120행). D1을 같은 편에서 두 규칙(예: 배치 규칙 + 금지)로 겹쳐 저작하면 편당 2행이 나온다. 다만 두 규칙이 서로 간섭하지 않는지 검증 비용이 붙는다.

비관 시나리오 (~70행). "3회 반복 + 홀드아웃"을 강제하면 D3의 음성 판정이 "그냥 안 한 것"과 구분되지 않는 경우가 많아 자격 탈락률이 올라간다. v0 샘플의 find 탈락률이 5.3%였던 것에 비하면 routine은 20~30%를 각오해야 한다.

공짜가 아니다 — 반드시 기록해둘 트레이드오프. routine은 편 저작 단계에서 이벤트 구성에 패턴을 심어야 나온다. 규칙을 심은 편은 이벤트가 "같은 규칙의 반복"이 되므로 물체·목적지 다양성이 떨어지고, 그만큼 그 편에서 나오는 find/restore 행이 줄어들 수 있다. routine 40편을 저작하면 find가 최대 수십 행 깎이는 것을 감수해야 한다. routine을 순증분으로 계산하면 안 된다.


비교한 장으로 본 전체 비교

숫자는 각 논문·공식 페이지에 명시된 값만 옮겼고, 없는 항목은 —로 뒀다. 출처는 하단 각주.

벤치마크연도무대 에피소드 길이에피소드/데모 고유 질의기억 축
CALVIN2022테이블탑 4 env 1,800 스텝 상한
60 s @30 Hz
play 24 h434 task 없음 (언어 체이닝)
LIBERO-Long2023테이블탑 ~275 스텝
~14 s @20 Hz
500 데모10 레이아웃10 task 없음 (장기 조합)
MemoryBench
(SAM2Act)
2025테이블탑 (RLBench) 3 task 1축 (공간 기억)
RoboCasa3652026주방 (단일 공간)
horizon 1.5× 상향
2,200 h
인간 600 + 합성 1,600
2,500 주방365 task 없음 (스케일·일반화)
RoboMME2026테이블탑 (ManiSkill) 481 스텝 1,600 데모
770k 스텝
16 task
평가 800 ep
4축 temporal/spatial/
object/procedural
RoboMemArena2026sim + 실물 (Mobile Aloha) 1,076 스텝 2,600 궤적
100/task
26 sim + 5 real
서브태스크 151
서브태스크 68.9%
기억 의존
LongAct2026다중 방 집 (AI2-THOR) >500 이산 액션
상한 16,000
300 에피소드100+ 집 300
평균 9 goal/ep
없음 (계획 자율성)
Scene-Mem (ours)2026다중 방 집 (MuJoCo, 연속) 10,520 / 17,250 스텝
420.8 / 690 s @25 Hz
200편
93 h · 8.4 M 프레임
200 집
후보 3,494채
≈ 1,160 4가족 + 하위 15종

설계 축 — 무엇을 재는 벤치인가

CALVINLIBERO-LRoboCasa365 RoboMMERoboMem
Arena
LongActScene-Mem
다중 방 · 집 전체
연속 제어 (이산 액션 아님)
편마다 다른 집/씬
기억 축을 종류별로 분해
사용자 발화로 중간에 끊고 재개
원상복구(원래 자리 되돌리기)
에피소드 > 5분
총 데이터 볼륨 최상위

△ = 부분적. RoboMemArena는 서브태스크 기억 의존 비율(68.9%)은 재지만 기억 종류별 분해는 없다. RoboMME의 temporal 축이 카운팅·재개를 일부 포함한다. LongAct는 상한 16,000 이산 액션이라 실시간 길이를 환산할 수 없다.


요약어디서 이기고 어디서 지는가

이기는 축 3개

  1. 에피소드 길이 — 10,520~17,250 스텝. 2위(RoboMemArena 1,076)의 10~16배. 기억-질의 간격이 400초 이상 벌어지는 유일한 벤치다.
  2. 질의 수 × 다양성 — ≈1,160개가 전부 다른 집·물체·이력. 2위(RoboCasa365 365 task)의 3.2배이고, 기억 벤치 중에서는 RoboMME(16)·RoboMemArena(26) 대비 40~70배.
  3. 기억 종류의 분해 — find/restore/resume/routine 4가족 + 하위 15종. 특히 원상복구(restore)발화 중단 후 재개(resume)는 조사한 어느 벤치에도 없다.

지는 축 — 미리 인정하고 갈 것

  1. 총 데이터 볼륨 — 93 h vs RoboCasa365 2,200 h. 24배 차이다. 우리는 학습용 데이터셋이 아니라 평가용 벤치라고 명확히 포지셔닝해야 한다.
  2. 씬 절대 수 — 200채 vs RoboCasa365 2,500 주방. 다만 저쪽은 주방 한 칸이고 우리는 집 전체(모든 방)라 축이 다르다.
  3. 실물 로봇 평가 없음 — RoboMemArena는 5개 실물 task를 함께 낸다. 우리는 시뮬레이션 전용이므로 "sim-only" 지적이 리뷰에서 반드시 나온다.

한 문장 포지셔닝. “기억 벤치마크들은 짧고(≤1,076 스텝) 테이블탑이며 과제가 수십 개다. 대규모 벤치마크들은 길지 않고(주방 한 칸, atomic 위주) 기억 축이 없다. Scene-Mem은 집 전체를 7~11분 동안 돌아다닌 편 200개 위에, 기억의 종류를 4가족으로 분해한 질의 1,160개를 얹는다.

로봇 · 관측 사양

항목
로봇MobileFranka — franka_droid 7 관절 + 홀로노믹 베이스
액션base [x, y, yaw] · arm 7 관절 · gripper 2치 — 40 ms 주기 (25 Hz)
카메라3대 · 640×480 · 25 fps (exo ×2 + wrist)
편당 프레임type1 7,500~13,500 · type2 13,000~21,500
영상 총량≈31 h/카메라 = 93 h · ≈2.8 M 프레임/카메라 (총 8.4 M)
방 커버편마다 집의 방 전부 (조합 조건)
배포 크기≈85 GB (contexts/ 28 + 57 GB · eval/ 1~3 MB)