gr00t-idm env) / simulator replay(robocasa env, mujoco 3.2.6) — 별도 sbatch 2개IDM의 held-out 평가(CosSim=0.161, MSE=0.081)는 normalized action space에서의 오차이다. 이 수치가 실제 로봇 궤적의 품질을 반영하는지 직접 확인이 필요하다.
세 가지 핵심 질문에 답하는 것이 목표:
MG-30 학습에 미사용된 held-out 에피소드 선정. 기존 idm_heldout 데이터셋(720 ep, 리렌더링 완료) 활용.
held-out 에피소드 비디오 → IDM 추론 → predicted action 저장. 기존 IDM_dump/dump_idm_actions.py 활용.
원본 HDF5의 initial state에서 GT action과 IDM action을 각각 리플레이. robocasa/scripts/playback_dataset.py 기반 신규 스크립트 작성.
궤적 divergence, task success rate, per-dim 분석, 체크포인트 간 비교.
| 메트릭 | 설명 | 계산 |
|---|---|---|
| EEF Position Error | 위치 궤적 divergence | ‖eef_pos_gt[t] − eef_pos_idm[t]‖₂ per step |
| EEF Rotation Error | 회전 궤적 divergence | quaternion distance |
| Gripper Agreement | open/close 일치율 | sign 일치 비율 |
| Task Success (GT) | GT action task 완수 | env._check_success() at final step |
| Task Success (IDM) | IDM action task 완수 | env._check_success() at final step |
| State Divergence | 전체 물리 상태 차이 | ‖state_gt[t] − state_idm[t]‖₂ |
| Divergence Onset | 궤적 이탈 시작 step | first t where ‖pos_err‖ > threshold |
| Cumulative Reward | 총 보상 | sum(rewards) |
| 항목 | 상태 | 비고 |
|---|---|---|
| held-out LeRobot 데이터셋 | 완료 | 720 ep, 리렌더링+변환 완료 |
| IDM best checkpoint | 진행 중 | 100K step 학습 완료 대기, 임시로 ckpt-10K 사용 |
| LeRobot ↔ HDF5 에피소드 매핑 | 미확인 | parquet action으로 매칭 필요 |
| Action 포맷 매칭 검증 | 미확인 | unapply() 후 scale 검증 필요 |
| eval_idm_simulator.py 스크립트 | 미작성 | 신규 작성 필요 |
| GT action replay determinism 확인 | 미확인 | 원본 states와 비교하여 검증 필요 |
gr00t-idm)과 시뮬레이터(robocasa)가 다른 conda env → sbatch 2개 별도 제출.CosSim=0.161이 "낮다"고 해서 IDM이 쓸모없다고 결론 내리기 이르다. 실제로 simulator에서 task를 완수할 수 있다면 DreamData 파이프라인의 pseudo label 품질이 충분하다는 것이 확인된다. 반대로 task를 전혀 완수하지 못한다면 MG-3000 규모 확장이나 task별 IDM 학습이 선행되어야 한다.
이 평가 결과가 전체 DreamData 프로젝트의 다음 Phase (pseudo label → policy 학습) 진입 여부를 결정하는 핵심 gate다.
prepare_idm_heldout_dataset.py에 매핑 정보 저장 여부 확인