action_proj_in/action_head 3텐서만 재초기화, action expert 30블록 + video tower 전부 로드.forward_pass import(기동 불가) + max_step 도달 후 무한 1-step epoch(813 epoch 실측).τ₀-WM VAM의 naive 성능(TTC off, 기본 5-step 추론)을 RoboCasa 24-task에서 측정해 X-WAM released robocasa_sft 75.3%(동일 pretrained-init 조건의 앵커)와 비교한다. 사용자 결정: τ₀ pretrained init. 데이터·평가 하네스·샘플 예산을 X-WAM과 정렬해 교란을 최소화.
runner/posttrain.py:55의 forward_pass import — 리포 전체에 정의 없음(죽은 import). 제거.| 검증 항목 | 결과 | 비고 |
|---|---|---|
| Dataset 단독 테스트 | 통과 | 300,304 clips, shape/finite 정상 |
| partial load (20→7) | 설계대로 | mismatched 3텐서만 (action in/out proj) |
| 스모크 60 step loss | 유한 | total 0.5-0.7 (video 0.13-0.18 / action 0.32-0.6), NaN 0 |
| 메모리 (bs 12, 1 GPU) | 107 GB / 180 GB | 8-GPU 동일 bs 여유 |
| 저장/재개 | 정상 | step_50 11GB + accelerator_state, config 제자리 갱신 → 풀 재개 |
| 브릿지 왕복 | 통과 | actions (32,7) finite, 0.24s/call (첫 콜 1.78s) |
| 학습 속도 | 6.0 s/it | login 1-GPU bs12 = 0.51 s/sample, X-WAM 대비 3× — worker 실측 필요 |
| job 78541 | PENDING | core 풀 포화 (own 8/8 본인 사용 중), sbmr 자동 재큐 10회 |
X-WAM 앵커와 데이터(동일 1,235 ep)·평가(동일 클라이언트/시드/1,200 rollouts)·샘플 예산(2.56M)이 정렬된 naive 비교가 준비됐다. 추론 비용도 동급(0.24s vs ~0.18s/call)이라 평가 조건 차이는 아키텍처(action expert + 1-pass video feature vs in-sequence token + 10-step joint denoise)로 수렴한다.
RUNNING 전환 시 sjob 78541로 8/8 GPU active + it/s 실측 (단일-GPU 사고 방지 절차). 속도가 나쁘면 dataloader 프로파일.
완료 후 MODEL_PATH=experiments/posttrain_robocasa/run1/step_27000 bash scripts/eval_robocasa_tau.sh — EVAL_RANKS=0 스모크 → full 24×50 sbm 제출. 중간 ckpt 조기 평가도 고려.