torch.hub 재다운로드 중 DDP 멀티-rank race condition (OSError: Directory not empty). 마지막 체크포인트 phaseB_47500.pt 보존. 재시작 필요.24-task RoboCasa 전체 데이터셋에 대한 3-track ablation: Any4D (frozen monocular backbone + Phase-B connector), DA3-v2 (multi-view backbone + paper-aligned loss v2), DA3-v1 (multi-view backbone + 자체 설계 loss v1). 각 트랙 50K step 목표, backbone의 cross-view attention 유무와 loss 설계 차이가 수렴 품질에 미치는 영향 측정.
어제(260609) 마지막 카드 기준: Any4D 47.3K·DA3-v2 38.3K·DA3-v1 40.9K. 오늘(260611) Any4D job이 Jun 9 재시작 직후 크래시 → 현재 중단 상태. DA3 두 트랙은 RUNNING 중 (job 11853 / 11869).
Jun 9 10:53 UTC, phaseB_47500.pt에서 resume하여 재시작.
DDP 4 rank가 동시에 torch.hub.load("facebookresearch/dinov2", ...) 호출 →
각 rank가 _get_cache_or_reload() 내에서 shutil.rmtree()로 기존 zip 캐시 삭제 시도.
rank 2가 삭제 경쟁에서 패배, OSError: [Errno 39] Directory not empty: facebookresearch-dinov2-7764ea0/로 abort.
rank 1은 SIGTERM(-15)로 종료. 총 런타임 1분 미만.
torch_hub_force_reload=False임에도 캐시가 없거나 불완전한 경우 hub가 재다운로드를 시도. 4 rank가 동시에 같은 zip→dir 압축 해제·삭제를 하면서 충돌. 마지막 체크포인트 phaseB_47500.pt는 NAS에 보존됨.어제 38.3K → 오늘 45.9K (+7.6K, ~1.6일). v2 loss 구성: L_D(conf-weighted depth) + L_M(mask) + L_P(3D point) + L_C(9-DoF cam) + L_grad. 최근 로그:
어제 40.9K → 오늘 48.4K (+7.5K, ~1.6일). v1 loss는 depth + ray + pose. ro(회전 오차)가 50–120° 범위에서 불규칙하게 진동, 수렴 없음. 최근 로그:
| Track | Job | 어제 step | 오늘 step | 진행률 | 주요 지표 | 상태 |
|---|---|---|---|---|---|---|
| Any4D | 11851 | 47.3K | 47.5K (중단) | 95.0% | loss≈0.28 (Jun 9 기준) | CRASHED |
| DA3-v2 | 11869 | 38.3K | 45.9K (+7.6K) | 91.8% | loss≈0.065–0.21 | RUNNING |
| DA3-v1 | 11853 | 40.9K | 48.4K (+7.5K) | 96.8% | ro≈52–124° | RUNNING (diverged) |
| step | loss (total) | L_D (depth) | L_M (mask) | L_P (3D pt) | L_C (cam) | L_grad |
|---|---|---|---|---|---|---|
| 44300 | 0.0864 | 0.026 | 0.024 | 0.023 | 0.008 | 0.005 |
| 45000 | 0.1009 | 0.024 | 0.036 | 0.019 | 0.019 | 0.003 |
| 45550 | 0.0646 | 0.010 | 0.031 | 0.010 | 0.012 | 0.001 |
| 45900 | 0.0736 | 0.022 | 0.023 | 0.016 | 0.009 | 0.003 |
torch.hub의 DDP 비안전성: 멀티 rank가 동시에 캐시 재다운로드를 시도하면 OSError: Directory not empty 발생.
학습 자체의 문제가 아니며, 체크포인트(47500.pt) 보존됨. 재시작 시 hub 캐시 사전 확보 필요.
DA3-v1 vs v2 비교 측면에서 50K 완주 후 loss 곡선 ablation이 가능해진다. v1 ro 발산은 rotation loss 스케일 / GT alignment 방식의 문제로 추정 (v2는 L_C 9-DoF cam constraint 추가). Any4D 트랙은 monocular pseudo-label의 frame-level scale ambiguity 외에 별도 infra 이슈가 있음 — 재시작 시 rank-safe hub 로딩 보장 필요.
torch.hub.load("facebookresearch/dinov2", ...)를 rank 0만 실행 후 barrier, 나머지 rank는 캐시 로드만 하도록 수정 또는 pre-download script 실행.