Index
2026-05-07 — Analysis

Latent-IDM A Multistream ckpt-60K 최종 평가

GR00T-Dreams | 55K 대비 saturation 확인 + per-task 패턴 검증

TL;DR

107.46
EEF mm (60K)
104.99
EEF mm (55K best)
110.88
EEF mm (v3 baseline)
83.95%
Gripper acc (60K)

1 배경 / 목적

Latent-IDM A multistream 트랙 (per-layer SelfAttn + token concat)은 cluster 만석으로 PREEMPT 10여 회 겪은 뒤 ckpt-55K까지만 도달했고, 55K eval (EEF 104.99 mm, 전 트랙 최고)을 먼저 진행했다. 이후 sub partition이 idle 구간에 Job 8449 제출하여 47분 만에 ckpt-60K 저장 완료. Job 8456으로 24-ep eval 실시.

목적: (1) 55K → 60K 5K 추가 학습이 개선인지 overfit인지 확인, (2) 55K에서 관찰된 PnP win / door loss 패턴이 noise인지 구조적인지 검증, (3) saturation 여부 확정하여 향후 cycle 학습 step 수 결정.

선행 버그: ckpt-55K eval 첫 제출(Job 6189)이 get_action() device/dtype 분기에서 cosmos_pooled_cache_multistream 분기 누락 → KeyError: 'z0'. cosmos_pooled_cache 분기에 합쳐서 수정 후 재제출(Job 6194)로 해결.

2 작업 내용

60K 학습 재개

55K까지 5 lineage(5635→5879→5989→6055→끊김) 소진 후, 5/6 sub idle 구간에 sbmr로 재제출. 47분 만에 ckpt-60000 저장 완료.

Job: 8449 (60K 학습 완성) → 8456 (24-ep eval) 학습 재개 기점: ckpt-55000 완성 시간: 47분 (sub idle, 5/6 am) Eval: heldout 24 ep, simulator replay

아키텍처 리마인더

cache (B, 64, 15360) ← v3 multi cache 재사용 (l18-24-30) ↓ split last dim → 3×(B, 64, 5120) Stream 18: Linear(5120→1024) + layer_emb[0] + SelfAttn(2L) → (B, 64, 1024) Stream 24: Linear(5120→1024) + layer_emb[1] + SelfAttn(2L) Stream 30: Linear(5120→1024) + layer_emb[2] + SelfAttn(2L) ↓ concat tokens (dim=1) fused (B, 192, 1024) → vl_self_attention(4L) → DiT cross-attn(8L) → action Params: 401M (v3 315M 대비 +27%) KV tokens: 192 (v3 64 대비 3×, attention cost ~9×)

3 결과

전체 비교 (24-ep heldout)

트랙EEF mmGripper accParams비고
Latent-A v1 single L27114.2384.27%315Mbaseline
Latent-A v3 multi concat {18,24,30}110.8886.19%315Mdim concat
Multistream ckpt-60K107.4683.95%401M60K final
Multistream ckpt-55K ⭐104.9983.76%401Mbest
55K → 60K 악화: +2.47 mm (55K 104.99 → 60K 107.46). 5K 추가 학습이 mild overfit 또는 noise 구간임을 확인. saturation 확정.
60K vs v3: −3.42 mm (3.1% 개선). 60K도 architectural 우위 유지. saturation 구간에서도 v3 대비 개선 견고.

Per-task 패턴 (60K vs v3, 주요 변동)

Taskv3 mm60K mmΔ mm방향
PnPSinkToCounter229.0123.0−106✅ 큰 개선
PnPMicrowaveToCounter358.3284.3−74✅ 큰 개선
PnPCounterToMicrowave160.793.7−67✅ 큰 개선
TurnOnSinkFaucet94.854.8−40✅ 큰 개선
TurnOffSinkFaucet95.584.5−11✅ 개선
OpenSingleDoor81.368.3−13✅ 개선
CloseDoubleDoor242.3332.3+90❌ 큰 악화
OpenDoubleDoor150.6227.6+77❌ 큰 악화
PnP grasp/place 패턴 55K와 동일: 55K의 PnPSinkToCounter −107, PnPMicrowaveToCounter −74 패턴이 60K에서도 −106, −74로 거의 동일. 구조적 우위.
Door articulated 악화 55K와 동일: CloseDouble 55K +87 → 60K +90, OpenDouble 55K +38 → 60K +77. layer-wise per-stream attention이 spatial trajectory(door angle) 표현에 열등한 구조적 한계.

4 Takeaway

5K Saturation 확정 → 학습 cycle 가속 가능

v1, v3, multistream 모두 50K 이후 eval 변동 <±5 mm. 향후 새 아키텍처 실험 시 학습 step을 30K~40K로 줄여도 결과 거의 동일할 가능성. 탐색 cycle 2× 가속 가능.

Multistream 우위는 architectural, noise가 아님

55K와 60K 두 체크포인트 모두 v1/v3 대비 EEF 개선. saturation 구간에서도 per-layer attention의 구조적 이점이 유지됨을 2-point 검증으로 확인. PnP grasp/place에서 layer-wise semantic 보존 가설 입증.

Gripper accuracy trade-off

multistream gripper acc (83.95%) < v3 (86.19%, −2.2%p). KV token 3× 증가(64→192)로 gripper-specific signal이 dilution되는 것으로 추정. EEF와 gripper 간 trade-off 존재. 향후 gripper head 별도 weighting 고려.

5 Next Steps

Hybrid track 후보

PnP task는 multistream, door articulated task는 v3 — task type 또는 visual feature에 따라 routing layer를 학습하는 hybrid track 실험. multistream이 PnP에서 −67~−106 mm, v3가 door에서 +77~+90 mm 악화하므로 상보적 결합 시 전 task 최적화 가능성.

Latent-C와 직접 비교

Latent-IDM C (N=4 layer-routed ActionDiT, 8 GPU 60K 학습 제출 대기)가 완료되면 multistream 60K (107.46 mm) 대비 비교. block-level routing이 per-stream attention보다 door task에서 우위인지 확인.

미해결: Door articulated 열등 원인

CloseDouble/OpenDouble에서 구조적 악화 원인 미분석. 가설: spatial trajectory(door angle over time)는 layer별 semantic이 분리되면 오히려 temporal coherence가 깨짐. per-stream attention이 layer 간 중복 정보를 노이즈로 증폭할 가능성. ablation: per-stream SelfAttn layer 수 1→0 또는 4 비교.