~/sample/val_136__0·val_290__0 실측 규약 | 변경 목록 확정| # | 항목 | 우리가 임의로 정한 것 (T1~T4) | 실데이터 (~/sample 실측) | 판정 |
|---|---|---|---|---|
| 1 | Embodiment/정책 | 고정베이스 Franka 8-dim(관절7+그리퍼1) @15.15Hz, π0.5-FT franka_2cam_15k | mobile Franka 11-dim {arm:7, base:[x,y,yaw], gripper:1} @25Hz | 결정필요 §2 |
| 2 | 스킬 어휘 | pick / pick_and_place (navigate 없음) | 질의 template NavToObj ("Navigate to the bowl I moved earlier"), 성공 1.5m+가시 | 변경 navigate=N0 텔레포트 추가 |
| 3 | 에피소드 초기 상태 | sampler 즉석 생성 (로봇 랜덤 배치) | write-phase 종료 상태에서 질의 시작 (eval 세션 확정). 복원 소스 = final_state.npz + h5 env_states | 변경 상태 복원 어댑터 |
| 4 | Instruction 소스 | CLI 자유 문장 | queries[].query + kind(find_target/distractor) + ambiguous/answers | 변경 query 주입 + abstain 매핑(없는 게 정답) |
| 5 | 카메라 | 2캠 624×352 | 3캠(wrist/exo1/exo2) 640×480 25fps | 변경 VLA 어댑터: wrist+exo1 선택+letterbox |
| 6 | 제어 주기/예산 | pnp horizon 900스텝(=60s@15Hz) | 25Hz → 60s=1500스텝. 세그먼트 실측 22~30s | 변경 Hz/horizon 프로필 재계산 |
| 7 | subgoal 문법 | pnp = 원자 1덩어리 (PromptSampler 5템플릿) | write-phase는 Pick+Place(tail) 분할, "Place the {} in or on the {}" = 정책 템플릿에 없는 OOD 문구 | 유지 (우리가 맞음 — 분할 문구 따라가면 안 됨) |
| 8 | 객체 ID/인벤토리 | body uid + category + room + 좌표 | answers.obj가 동일 uid 규약 확인 (stand_6bc0…_2_0_7) | 유지 (room 3자 매핑만 확인 항목) |
| 9 | done 판정 | oracle 물리 술어 + timeout | NavToObj: 1.5m 이내+가시 | 유지+확장 NavToObjTask.judge 재사용 |
| 10 | retract-home | 고정베이스 보간 복귀 | mobile이면 base 이동 존재 | 유지(조건부) 텔레포트 시 arm home으로 흡수 |
| 11 | VLM 모델/조건 | gemini-3.6-flash, oracle | eval 세션과 공유 (blind/textlog/frames) | 유지 |
| 12 | W-obs/W-act | 하네스 무관(실행만) | W-act ("I moved") 수용 확정 | 무관 (eval 세션 소관) |
실데이터 로봇(mobile 11-dim)을 우리 π0.5-FT(고정 8-dim)가 그대로 굴릴 수 없다.
base 3-dim은 정책이 아니라 오케스트레이터 텔레포트(navigate 스킬)로 처리, arm+gripper 8-dim만 π0.5-FT 담당. 새 학습 0, 현행 체크포인트 그대로. 벤치 공리 A3(메모리/제어 분리)와 일치 — navigate는 "어디로 갈지의 결정"만 측정하고 이동 제어 분산을 제거.
본 데이터셋이 학습 셋으로도 제공될 때 가능한 별도 학습 트랙. Tier B 고충실도 조건으로 추후 승격.
| # | 작업 | 내용 |
|---|---|---|
| 1 | 상태 복원 어댑터 | final_state.npz/env_states → free body pose·관절 qpos·로봇 base setter (API 확인 완료) |
| 2 | navigate 스킬 | N0 텔레포트 + NavToObjTask judge + 텔레포트 시 arm home |
| 3 | abstain 매핑 | distractor 질의 → VLM "없으면 abort(not_present)" 규칙 (기권도 정답 — 공리 A5) |
| 4 | dataset 프로필 | 3캠 640×480@25 → VLA wrist+exo1 letterbox / horizon 1500 / policy_dt 40ms |
| 5 | room 매핑 검증 | answers.room(정수) ↔ infer_room_name ↔ uid 접미사(초기 방 추정) 3자 대조 |
| 6 | (장기) mobile 정책 | 11-dim FT 트랙 — 데이터셋 학습 셋 확보 시 |