misplaced(반상식 배치) · concealment/needs_open 축 신설.steps=multi(75 — 답 전부를 한 롤아웃에), scoring(lifted 634/reached_only 125). 실패 이벤트도 답 유효(42% 실패율 유지 — 우리 failed_event 제외 규칙 폐기).| 필드 | 내용 | 파이프라인 영향 |
|---|---|---|
query | "Pick up the bowl I moved earlier" — Navigate→Pick 전환 | task_type GT = pick |
steps | single 684 / multi 75 (답 전부, 순서 무관) | EvalAnswer에 object_ids 리스트 확장 |
scoring | lifted 634 / reached_only 125 (종료 상태에서 들 수 없는 물체) | Tier B 실행형에서 의미, Tier A는 지목만 |
twin_nearby | 동일 쌍둥이 26cm 내 — 채점은 항상 body id | 우리 닫힌 후보(uid 선택) 계약과 정합 ✓ |
misplaced | no / on_floor / wrong_surface — 반상식 배치 실재 | distractor 상식 누출(A1) 대응 + 난이도 축 |
concealment·needs_open | fixture 내부 은폐, h5에 scene_joint_qpos 신설 | 은폐 규율 (a) 구현됨 |
answers[i].* | room/surface null 가능(on_floor), seen_s, s_since_last_seen, settled_frame, pickable, pick_fail, twins | 후보 계약에 "floor" 처리 + 난이도 계층화 재료 |
dropped_* | ineligible 27(비관측 답, ≥1.0s@≥50px 게이트) + ambiguous 50 — 제거 근거 기록 | eval_fixes 버그 게이트 → sanity+계층화로 전환 |
① 채점 계약: task_type=pick(질의 template 따름), object_id(s)가 1차 신호(body-id 철학 정합), room/surface는 non-null일 때만 2차 채점 + surface 후보에 "floor" ② steps=multi — 답 리스트 set-equality ③ eval_fixes → sanity 체크 + 난이도 계층화(misplaced/concealment/twin/seen_s/s_since_last_seen) ④ 신규 회귀 픽스처(val_101__0) — 기존 구샘플 테스트는 유지 ⑤ 파일럿 서브셋(10~15 eps, kind×steps×misplaced 층화) → 10전략×2모델 재실측 → 전량 스윕은 비용 산정 후 결정 (759질의 규모, 대략 $300~800/2모델 예상 — 정밀 산정 예정).