data/robotwin_tau.py) + zmq 브릿지(X-WAM 와이어 포맷 그대로, 클라이언트 수정 0) + 평가 스크립트까지 전 구간 구현mismatched_keys: [] — action proj/head 포함 전량 로드 (RoboCasa 실험과 달리 action-space 단절 없음)naive τ₀-VAM RoboCasa 63.0% vs X-WAM released 75.3%의 −12.3pp 갭 원인이 "τ₀ pretrain(dual-arm,
head/wrist 캠, rel-eef6d)과 RoboCasa(single-arm, exo 캠, sim)의 3중 임바디먼트 미스매치"로 좁혀졌다
(claude/260818/research-tau0_pretrain_embodiment.md). 이 가설을 검증하려면 τ₀ pretrain
토폴로지와 정합하는 환경 — dual-arm aloha-agilex + head/left/right 캠을 갖춘 RoboTwin 2.0 —에서
action_in_dim 20을 그대로 유지한 채 posttrain·평가해 pretrain 전이량을 다시 측정해야 한다.
앵커는 X-WAM released RoboTwin 성능 90.7%(demo_randomized, 50 task × 100).
260826-robotwin_vulkan_gate.html).Vulkan 관문 통과 확인 후, 데이터부터 학습·평가까지 전 배관을 τ₀-native 20채널 포맷으로 구축했다.
HDF5 직독 + JPEG 디코드(mp4 변환 불필요). X-WAM shim과 동일한 BASE_COORD_XFORM/
EEF_AXES_XFORM으로 base 프레임 변환, rot6d = R의 col0|col1, actions = τ₀
abs_eef_to_rela(body-frame delta) 33 step, state = 현재 abs 20ch, gripper 반전(τ₀: 1=close,
state는 ×120). 검증: adjust_bottle 500 ep → 55,223 clips, 로드 0.09 s/sample, world↔τ₀ 왕복 오차 0 /
quat 4e-10, rela_eef_to_abs 재구성 오차 1.2e-7 (추론 경로와 정합).
X-WAM evaluation/X-WAM/deploy_policy.py의 와이어 포맷(proprio16 = [xyz, quat wxyz, grip]×2
base-frame / actions (T,16) 절대 pose)을 그대로 구현 → 클라이언트 측 수정 0. 내부:
proprio16→state20 → TauPolicy.play(relative/eef6d → 절대 20ch) → rot6d→quat, gripper 재반전.
broker + τ₀ 서버(GPU당 1) + robotwin_client(50 task, GPU 라운드로빈, PARALLEL_CLIENTS) →
_result.txt 집계 → eval_summary.json. 전체 job을 isaac-lab 컨테이너로 실행.
스모크는 scripts/robotwin_sim_smoke.sh(expert play_once 렌더).
| 항목 | 결과 | Job |
|---|---|---|
| pretrained 로드 (action_in_dim 20) | mismatched_keys: [] (전량 로드) | - |
| 데이터셋 단위검증 (adjust_bottle) | 55,223 clips, 왕복 오차 0, rel→abs 1.2e-7 | - |
| 브릿지 왕복 (pretrain ckpt, ep0 관측) | actions (32,16) finite, quat 노름 1.0000, 0.29 s/call | - |
| zero-shot 거동 | 32-step R-arm 경로 0.09 m (expert 0.53 m) — 미학습 정상 범위 | - |
| 학습 스모크 (40 step, adjust_bottle) | action loss 0.62 → 0.185 | - |
| E2E 평가 스모크 (isaac-lab 컨테이너) | 통과, 4분 56초, adjust_bottle 2 rollout, SR 0/2(zero-shot 예상값) | 95671 |
| worker sim 렌더 스모크 | COMPLETED, 1분 26초 | 95634 |
| 본 학습 (54k step, own QOS 8 GPU) | RUNNING, 36,724/54,000 step, loss 0.18→0.10대, 1.02 s/it | 95687 |
| 워처 평가 18k (10 task × 20) | preempt로 중단 → 재제출 대기 | 95876→95984(PENDING) |
| 워처 평가 36k (10 task × 20) | 취소 → 재제출 대기 | 95982→95985(PENDING) |
τ₀ native 포맷으로 posttrain하는 전 배관(데이터→브릿지→학습→평가)이 준비 완료됐고, 특히 pretrained 가중치가 재초기화 없이 전량 로드된다는 사실이 확인됐다. 이는 RoboCasa 실험에서 겪었던 action-space 단절이 없는 조건이라는 뜻으로, 54k 최종 평가 결과가 나오면 "embodiment 정합 시 τ₀ pretrain이 실제로 얼마나 전이되는가"를 RoboCasa(63.0% vs 75.3%, −12.3pp)와 직접 대조할 수 있다. 갭이 크게 줄어들면 embodiment mismatch 가설이 강화되고, 여전히 갭이 남으면 sim 도메인 차이나 eef 자세 규약 불일치(코사인 유사도 L −0.29 / R +0.34) 쪽으로 원인을 좁혀야 한다.
18k/36k 중간 평가 job이 두 차례(preempt 1회, cancel 1회) 중단돼 재제출 대기 중(95984, 95985 PENDING) — 학습 곡선 형태를 아직 확인 못함. eef 자세 규약 불일치(z-score 정규화가 분포 형태까지 맞추진 못함)가 native 실험 해석에 노이즈로 남아있음.
1) 18k/36k 재제출 평가 완료 확인 → 학습 곡선 추세 파악. 2) 54k step 완료(약 5시간 후 예상, 현재 36.7k) → 50 task × 100 풀 평가 → X-WAM released 90.7% 앵커와 비교, RoboCasa 갭(−12.3pp)과 대조. 3) 결과에 따라 eef 자세 규약 정렬 변형(τ₀ pretrain 평균 자세에 맞춘 고정 회전) 실험 여부 결정.