Latent-IDM A multistream 트랙 (per-layer SelfAttn + token concat)은 cluster 만석으로 PREEMPT 10여 회 겪은 뒤 ckpt-55K까지만 도달했고, 55K eval (EEF 104.99 mm, 전 트랙 최고)을 먼저 진행했다. 이후 sub partition이 idle 구간에 Job 8449 제출하여 47분 만에 ckpt-60K 저장 완료. Job 8456으로 24-ep eval 실시.
목적: (1) 55K → 60K 5K 추가 학습이 개선인지 overfit인지 확인, (2) 55K에서 관찰된 PnP win / door loss 패턴이 noise인지 구조적인지 검증, (3) saturation 여부 확정하여 향후 cycle 학습 step 수 결정.
get_action() device/dtype 분기에서 cosmos_pooled_cache_multistream 분기 누락 → KeyError: 'z0'. cosmos_pooled_cache 분기에 합쳐서 수정 후 재제출(Job 6194)로 해결.55K까지 5 lineage(5635→5879→5989→6055→끊김) 소진 후, 5/6 sub idle 구간에 sbmr로 재제출. 47분 만에 ckpt-60000 저장 완료.
| 트랙 | EEF mm | Gripper acc | Params | 비고 |
|---|---|---|---|---|
| Latent-A v1 single L27 | 114.23 | 84.27% | 315M | baseline |
| Latent-A v3 multi concat {18,24,30} | 110.88 | 86.19% | 315M | dim concat |
| Multistream ckpt-60K | 107.46 | 83.95% | 401M | 60K final |
| Multistream ckpt-55K ⭐ | 104.99 | 83.76% | 401M | best |
| Task | v3 mm | 60K mm | Δ mm | 방향 |
|---|---|---|---|---|
| PnPSinkToCounter | 229.0 | 123.0 | −106 | ✅ 큰 개선 |
| PnPMicrowaveToCounter | 358.3 | 284.3 | −74 | ✅ 큰 개선 |
| PnPCounterToMicrowave | 160.7 | 93.7 | −67 | ✅ 큰 개선 |
| TurnOnSinkFaucet | 94.8 | 54.8 | −40 | ✅ 큰 개선 |
| TurnOffSinkFaucet | 95.5 | 84.5 | −11 | ✅ 개선 |
| OpenSingleDoor | 81.3 | 68.3 | −13 | ✅ 개선 |
| CloseDoubleDoor | 242.3 | 332.3 | +90 | ❌ 큰 악화 |
| OpenDoubleDoor | 150.6 | 227.6 | +77 | ❌ 큰 악화 |
v1, v3, multistream 모두 50K 이후 eval 변동 <±5 mm. 향후 새 아키텍처 실험 시 학습 step을 30K~40K로 줄여도 결과 거의 동일할 가능성. 탐색 cycle 2× 가속 가능.
55K와 60K 두 체크포인트 모두 v1/v3 대비 EEF 개선. saturation 구간에서도 per-layer attention의 구조적 이점이 유지됨을 2-point 검증으로 확인. PnP grasp/place에서 layer-wise semantic 보존 가설 입증.
multistream gripper acc (83.95%) < v3 (86.19%, −2.2%p). KV token 3× 증가(64→192)로 gripper-specific signal이 dilution되는 것으로 추정. EEF와 gripper 간 trade-off 존재. 향후 gripper head 별도 weighting 고려.
PnP task는 multistream, door articulated task는 v3 — task type 또는 visual feature에 따라 routing layer를 학습하는 hybrid track 실험. multistream이 PnP에서 −67~−106 mm, v3가 door에서 +77~+90 mm 악화하므로 상보적 결합 시 전 task 최적화 가능성.
Latent-IDM C (N=4 layer-routed ActionDiT, 8 GPU 60K 학습 제출 대기)가 완료되면 multistream 60K (107.46 mm) 대비 비교. block-level routing이 per-stream attention보다 door task에서 우위인지 확인.
CloseDouble/OpenDouble에서 구조적 악화 원인 미분석. 가설: spatial trajectory(door angle over time)는 layer별 semantic이 분리되면 오히려 temporal coherence가 깨짐. per-stream attention이 layer 간 중복 정보를 노이즈로 증폭할 가능성. ablation: per-stream SelfAttn layer 수 1→0 또는 4 비교.