Index
2026-08-18 — Analysis

HF 데이터셋 v0.7 파악 — Keh0t0/scene-mem-benchmark

scene_bench | VLM eval 재개 — 153 에피소드 / 759 질의 정식 릴리즈 구조 분석 + 파이프라인 적합성 판정

TL;DR

153
에피소드
79
하우스
759
채점 가능 질의
75
multi-step
43.7GB
용량

1 질의 스키마 v0.7 — 무엇이 새로운가

필드내용파이프라인 영향
query"Pick up the bowl I moved earlier" — Navigate→Pick 전환task_type GT = pick
stepssingle 684 / multi 75 (답 전부, 순서 무관)EvalAnswer에 object_ids 리스트 확장
scoringlifted 634 / reached_only 125 (종료 상태에서 들 수 없는 물체)Tier B 실행형에서 의미, Tier A는 지목만
twin_nearby동일 쌍둥이 26cm 내 — 채점은 항상 body id우리 닫힌 후보(uid 선택) 계약과 정합 ✓
misplacedno / on_floor / wrong_surface — 반상식 배치 실재distractor 상식 누출(A1) 대응 + 난이도 축
concealment·needs_openfixture 내부 은폐, h5에 scene_joint_qpos 신설은폐 규율 (a) 구현됨
answers[i].*room/surface null 가능(on_floor), seen_s, s_since_last_seen, settled_frame, pickable, pick_fail, twins후보 계약에 "floor" 처리 + 난이도 계층화 재료
dropped_*ineligible 27(비관측 답, ≥1.0s@≥50px 게이트) + ambiguous 50 — 제거 근거 기록eval_fixes 버그 게이트 → sanity+계층화로 전환
260813 검증 보고서와의 대응: 질의 시점 정답 가시(버그④)→관측 게이트 내장 · fork/vase 미신고 ambiguity→50건 제거+body-id 채점 · distractor 상식 누출→misplaced 축 · 은폐 부재→concealment/needs_open. 지적 사항이 사실상 전부 수용된 릴리즈.

2 로더 호환성 (실측: val_101__0/__2)

동일: data/<house>__<seed>/{eval_spec, meta, subtasks, traj.h5, final_state.npz, videos/3캠} 동일: traj_0/obs_scene {tracked_objects(24), event_results, fps, steps_emitted, videos, visibility} 동일: final_state.npz {names, pose, robot_base_pose, frame} · subtasks[].slots (room 자연어 유지) 신규: obs_scene.scene_joints · event_results[].gazed · h5 scene_joint_qpos(T,30) · meta.n_steps → episode_loader · textlog/frames-* · rollforward 청크: 무수정 동작 전망

3 E6 어댑테이션 계획

① 채점 계약: task_type=pick(질의 template 따름), object_id(s)가 1차 신호(body-id 철학 정합), room/surface는 non-null일 때만 2차 채점 + surface 후보에 "floor" ② steps=multi — 답 리스트 set-equality ③ eval_fixes → sanity 체크 + 난이도 계층화(misplaced/concealment/twin/seen_s/s_since_last_seen) ④ 신규 회귀 픽스처(val_101__0) — 기존 구샘플 테스트는 유지 ⑤ 파일럿 서브셋(10~15 eps, kind×steps×misplaced 층화) → 10전략×2모델 재실측 → 전량 스윕은 비용 산정 후 결정 (759질의 규모, 대략 $300~800/2모델 예상 — 정밀 산정 예정).