TORCHDYNAMO_DISABLE=1을 예방 적용.| 항목 | torch 2.7.1+cu128 | torch 2.8.0+cu129 |
|---|---|---|
| worker 8-GPU NCCL | step 0 hang (2h+) | 78808로 검증 예정 |
| 로그인 NCCL 스모크 | — | 2-GPU 30/30 통과 |
| 학습 속도 (bs12/GPU) | 6.0 s/it | 1.0 s/it |
| 27k step 예상 (8 GPU) | ~45 h | ~9 h |
30-step loss: action 8.0 → 1.7 (재초기화된 head 빠른 수렴), video 0.15 안정. 종료 시 rank 1 teardown race(exit 120)는 저장 완료 후 발생하는 cosmetic — sbmr는 FAILED를 재큐하지 않아 무한루프 위험 없음.
이 클러스터 B200에서 pip 기본 cu126/cu128 torch 휠은 함정이다 — sm_100 최적화가 cu129 휠부터 온전하며, 성능 3× 저하와 다중 rank hang이 같은 뿌리였다. 새 env는 같은 클러스터에서 검증된 스택(torch 2.8.0+cu129)을 기본값으로 삼을 것. 부수 효과로 학습 예산이 45h→9h로 줄어 실험 회전이 5배 빨라졌다.