get_action() device/dtype 분기에서 cosmos_pooled_cache_multistream 누락 → KeyError: 'z0'Latent-IDM 연구는 Cosmos-Predict2 14B frozen backbone의 hidden representation을 IDM action head에 활용하는 방식을 개선하는 것이 목표다. v3 multi-layer concat (dim-level fusion)에서 EEF 110.9 mm를 얻었지만 Linear projection이 layer별 정보를 충분히 fuse하지 못한다는 가설이 남아있었다.
Multistream 가설: 각 layer에 별도 Linear + SelfAttention(2L) + layer position embedding을 적용해 layer-wise representation을 충분히 학습한 뒤 token 차원으로 concat하여 fusion하면, dim-level fusion보다 풍부한 representation을 만들 수 있다.
gr00t/model/action_head/multi_stream_projector.py — 새 모듈 (n_layers=3 stream)
gr00t/model/action_head/flow_matching_action_head_idm.py — cosmos_pooled_cache_multistream 분기 추가 (forward / encode_visual / get_action 3곳)
IDM_dump/base_latent_A_cached_multistream.yaml — feature_source만 다른 yaml
8 GPU × 60K steps 목표. Cluster 만석으로 PREEMPTED 4회 (Jobs 5635→5879→5989→6055). lineage 끊겨 ckpt-55K로 임시 평가. 60K resume은 Job 6216으로 별도 제출.
flow_matching_action_head_idm.py:745 get_action() device/dtype 분기에 cosmos_pooled_cache_multistream 누락 → cosmos_latent else-branch로 fallback하여 data["z0"] 접근. cosmos_pooled_cache 분기에 multistream을 합쳐 해결. 재제출(Job 6194) 28분 정상 종료.
| 트랙 | EEF mm | Gripper Acc | Params |
|---|---|---|---|
| Latent-A multistream ckpt-55K | 104.99 ⭐ | 83.76% | 401M |
| Latent-A v3 multi concat {18,24,30} | 110.88 | 86.19% | 315M |
| Latent-A v1 single L27 | 114.23 | 84.27% | 315M |
| Task | v3 mm | multistream mm | Δ |
|---|---|---|---|
| PnPSinkToCounter | 229.0 | 121.9 | −107 |
| PnPMicrowaveToCounter | 358.3 | 274.7 | −84 |
| PnPCounterToMicrowave | 160.7 | 91.7 | −69 |
| TurnOnSinkFaucet | 94.8 | 56.3 | −39 |
| PnPStoveToCounter | 116.9 | 99.9 | −17 |
| TurnOffSinkFaucet | 95.5 | 81.5 | −14 |
| OpenSingleDoor | 81.3 | 71.0 | −10 |
| ⬇ 악화 구간 | |||
| CloseDoubleDoor | 242.3 | 328.8 | +87 |
| OpenDoubleDoor | 150.6 | 188.5 | +38 |
| PnPCounterToStove | 61.3 | 88.7 | +27 |
| PnPCounterToSink | 93.7 | 116.2 | +23 |
| PnPCabToCounter | 90.4 | 111.6 | +21 |
PnP 계열 태스크(object affordance + grasp 정밀도 중요)에서 multistream이 큰 이득. 단일 fusion보다 per-layer attention 후 fusion이 더 풍부한 representation을 제공한다는 가설이 해당 태스크에서 검증됐다.
Door manipulation처럼 spatial trajectory가 중요한 태스크는 v3 dim-level fusion이 더 적합. 두 방식이 상보적 — 단일 모델 안에서 태스크별 routing이 가능한지 다음 실험 대상.
gripper accuracy 손해 원인: KV token 수 64 → 192 (3×)로 인해 gripper-specific signal이 cross-attn에서 dilution됐을 가능성. gripper head 별도 weighting이 필요할 수 있다.
5K saturation: v1/v3 기준 55K vs 60K 차이 미미 (114.0→114.2, 110.5→110.9). multistream 60K 결과도 ~104-105 mm 예상.
정확한 수치 확정. 55K 대비 ~0.5-1 mm 변동 예상. 완료 후 24-ep eval 재제출.
Door 태스크는 v3 fusion, PnP 태스크는 multistream → routing layer 학습 또는 mixture-of-experts 형태로 결합 가능한지 설계 검토.
token 수 3× 증가에 따른 cross-attn dilution이 gripper acc 하락 원인인지 분석. gripper signal에 별도 loss weight 부여 또는 gripper-specific attention mask 실험.
ActionDiT block i가 Cosmos hidden layer f(i)만 KV로 받는 layer-routed 설계 (π0.5 KI 영감). multistream과 달리 block-level 1:1 routing. dense N=12 Phase 1 이후 sparse Phase 2 계획 수립됨.