기존 로봇 벤치마크와 나란히 놓고 에피소드 길이 · 질의 개수 · 집 다양성 세 축에서 어디에 서 있는지 재봤다. 총 데이터 볼륨으로는 지지 않을 수 없고, 이길 수 있는 축은 따로 있다.
메모리 벤치마크의 1차 제약은 한 에피소드 안에 담기는 시간이다. 에피소드가 30초면 "기억"과 "짧은 문맥"이 구분되지 않는다. 아래는 같은 단위(시뮬레이터 연속 제어 스텝)로 맞춘 비교다.
왜 이 차이가 필요한가.
우리 편에는 type1 기준 4~5개의 pick-and-place 사건이 순차로 들어간다. 첫 사건에서 옮긴 물건을
마지막에 물어보면 정답과 질의 사이가 400초 이상 벌어진다. v0 샘플 실측으로
s_since_last_seen이 같은 행 안에서 241.3초 vs 0.1초로 갈리는 사례가 확인됐다 —
한 질의 안에 "기억해야 하는 것"과 "보고 있는 것"이 같이 들어간다.
1,000 스텝(≈40 s)짜리 에피소드에서는 이 대조가 만들어지지 않는다.
"task 16개 × 시드 50회 = 800 에피소드"와 "서로 다른 질의 1,160개"는 다른 얘기다. 아래는 서로 다른 지시문/질의의 수로 맞춘 비교 — 시드 반복은 세지 않았다.
| 가족 | kind | 세부 축 | 행 | 편 | 편당 | 근거 |
|---|---|---|---|---|---|---|
| find | find_target | × single | 201 | 100 | 4.80 | 생성 계획 확정 |
| find_target | × multi | 31 | ||||
| find_distractor | × single | 233 | ||||
| find_distractor | × multi | 15 | ||||
| 소계 | 480 | 100 | 4.80 | |||
| restore | restore | origin=first × single | 122 | (100) find와 동일 편 | 1.92 | 생성 계획 확정 |
| restore | origin=previous | 24 | ||||
| restore | × multi (n ≤ 3) | 46 | ||||
| 소계 | 192 | (100) | 1.92 | |||
| resume | resume | 컷 지점 (press / visit / put_in) | 300~500 | 100 | 3~5 | 생성 계획 확정 |
| routine | D1 | 배치 규칙 | ~40 | (type1) | 0.40 | 추정 §3 참조 |
| D2 | 절차 규칙 | ~30 | (type2) | 0.30 | ||
| D3 | 금지 | ~20 | (type1) | 0.20 | ||
| 소계 | ~90 | — | 0.45 | 70~120 | ||
| 합계 | ≈ 1,160 | 200 | 5.8 | 1,050~1,290 | ||
routine(D)만 아직 생성 계획이 없어 추정했다. 근거를 다 적어두니 값이 틀리면 가정을 바꿔서 다시 세면 된다. 하위 3종은 taxonomy 확정본 기준 D1 배치 규칙 · D2 절차 규칙 · D3 금지다.
구조적 상한이 먼저다. routine은 "패턴을 유도해서 일반화"하는 과제라 같은 규칙의 사례가 편 안에 3회 이상 나오고, 4번째를 홀드아웃으로 물어야 성립한다. type1 편의 이벤트 예산이 4~5개이므로 규칙 하나가 편을 통째로 소비한다 — 편당 최대 1행이 구조적 상한이고, find(4.8)·restore(1.9)처럼 편을 나눠 쓸 수 없다.
| 하위 | 내용 | 어느 편에 붙나 | 저작 가능 비율 가정 | 추정 행 |
|---|---|---|---|---|
| D1 | 배치 규칙 — "이 집에서 컵류는 항상 싱크대로 간다"를 3회 관측 → 4번째 물건을 어디 둘지 | type1 (이벤트 4~5개 중 3개를 규칙에 씀) | 100편 중 40% — 나머지는 이벤트 구성이 규칙을 못 만든다 | ~40 |
| D2 | 절차 규칙 — "이 집에서 X를 하려면 먼저 Y를 한다"는 순서를 반복에서 유도 | type2 (이미 반복 유닛 구조: press ×3, visit ×4, put ×3) | 100편 중 30% — 순서 제약이 있는 task 조합에서만 | ~30 |
| D3 | 금지 — "여기엔 절대 안 둔다"를 관측에서 유도, 안 하는 것이 정답 | type1 | 100편 중 20% — 음성 판정(안 함) 설계가 가장 까다롭다 | ~20 |
| 합계 | ~90 (70~120) | |||
낙관 시나리오 (~120행). D1을 같은 편에서 두 규칙(예: 배치 규칙 + 금지)로 겹쳐 저작하면 편당 2행이 나온다. 다만 두 규칙이 서로 간섭하지 않는지 검증 비용이 붙는다.
비관 시나리오 (~70행). "3회 반복 + 홀드아웃"을 강제하면 D3의 음성 판정이 "그냥 안 한 것"과 구분되지 않는 경우가 많아 자격 탈락률이 올라간다. v0 샘플의 find 탈락률이 5.3%였던 것에 비하면 routine은 20~30%를 각오해야 한다.
공짜가 아니다 — 반드시 기록해둘 트레이드오프. routine은 편 저작 단계에서 이벤트 구성에 패턴을 심어야 나온다. 규칙을 심은 편은 이벤트가 "같은 규칙의 반복"이 되므로 물체·목적지 다양성이 떨어지고, 그만큼 그 편에서 나오는 find/restore 행이 줄어들 수 있다. routine 40편을 저작하면 find가 최대 수십 행 깎이는 것을 감수해야 한다. routine을 순증분으로 계산하면 안 된다.
숫자는 각 논문·공식 페이지에 명시된 값만 옮겼고, 없는 항목은 —로 뒀다. 출처는 하단 각주.
| 벤치마크 | 연도 | 무대 | 에피소드 길이 | 에피소드/데모 | 씬 | 고유 질의 | 기억 축 |
|---|---|---|---|---|---|---|---|
| CALVIN | 2022 | 테이블탑 4 env | 1,800 스텝 상한 60 s @30 Hz |
play 24 h | 4 | 34 task | 없음 (언어 체이닝) |
| LIBERO-Long | 2023 | 테이블탑 | ~275 스텝 ~14 s @20 Hz |
500 데모 | 10 레이아웃 | 10 task | 없음 (장기 조합) |
| MemoryBench (SAM2Act) | 2025 | 테이블탑 (RLBench) | — | — | — | 3 task | 1축 (공간 기억) |
| RoboCasa365 | 2026 | 주방 (단일 공간) | — horizon 1.5× 상향 |
2,200 h 인간 600 + 합성 1,600 |
2,500 주방 | 365 task | 없음 (스케일·일반화) |
| RoboMME | 2026 | 테이블탑 (ManiSkill) | 481 스텝 | 1,600 데모 770k 스텝 |
— | 16 task 평가 800 ep |
4축 temporal/spatial/ object/procedural |
| RoboMemArena | 2026 | sim + 실물 (Mobile Aloha) | 1,076 스텝 | 2,600 궤적 100/task |
— | 26 sim + 5 real 서브태스크 151 |
서브태스크 68.9% 기억 의존 |
| LongAct | 2026 | 다중 방 집 (AI2-THOR) | >500 이산 액션 상한 16,000 |
300 에피소드 | 100+ 집 | 300 평균 9 goal/ep |
없음 (계획 자율성) |
| Scene-Mem (ours) | 2026 | 다중 방 집 (MuJoCo, 연속) | 10,520 / 17,250 스텝 420.8 / 690 s @25 Hz |
200편 93 h · 8.4 M 프레임 |
200 집 후보 3,494채 |
≈ 1,160 | 4가족 + 하위 15종 |
| 축 | CALVIN | LIBERO-L | RoboCasa365 | RoboMME | RoboMem Arena | LongAct | Scene-Mem |
|---|---|---|---|---|---|---|---|
| 다중 방 · 집 전체 | – | – | – | – | – | ✓ | ✓ |
| 연속 제어 (이산 액션 아님) | ✓ | ✓ | ✓ | ✓ | ✓ | – | ✓ |
| 편마다 다른 집/씬 | – | – | ✓ | – | – | ✓ | ✓ |
| 기억 축을 종류별로 분해 | – | – | – | ✓ | △ | – | ✓ |
| 사용자 발화로 중간에 끊고 재개 | – | – | – | △ | – | – | ✓ |
| 원상복구(원래 자리 되돌리기) | – | – | – | – | – | – | ✓ |
| 에피소드 > 5분 | – | – | – | – | – | △ | ✓ |
| 총 데이터 볼륨 최상위 | – | – | ✓ | – | – | – | – |
△ = 부분적. RoboMemArena는 서브태스크 기억 의존 비율(68.9%)은 재지만 기억 종류별 분해는 없다. RoboMME의 temporal 축이 카운팅·재개를 일부 포함한다. LongAct는 상한 16,000 이산 액션이라 실시간 길이를 환산할 수 없다.
이기는 축 3개
지는 축 — 미리 인정하고 갈 것
한 문장 포지셔닝. “기억 벤치마크들은 짧고(≤1,076 스텝) 테이블탑이며 과제가 수십 개다. 대규모 벤치마크들은 길지 않고(주방 한 칸, atomic 위주) 기억 축이 없다. Scene-Mem은 집 전체를 7~11분 동안 돌아다닌 편 200개 위에, 기억의 종류를 4가족으로 분해한 질의 1,160개를 얹는다.”
| 항목 | 값 |
|---|---|
| 로봇 | MobileFranka — franka_droid 7 관절 + 홀로노믹 베이스 |
| 액션 | base [x, y, yaw] · arm 7 관절 · gripper 2치 — 40 ms 주기 (25 Hz) |
| 카메라 | 3대 · 640×480 · 25 fps (exo ×2 + wrist) |
| 편당 프레임 | type1 7,500~13,500 · type2 13,000~21,500 |
| 영상 총량 | ≈31 h/카메라 = 93 h · ≈2.8 M 프레임/카메라 (총 8.4 M) |
| 방 커버 | 편마다 집의 방 전부 (조합 조건) |
| 배포 크기 | ≈85 GB (contexts/ 28 + 57 GB · eval/ 1~3 MB) |