RobocasaLatentIDMDatasetHiddenMultiLayer, cosmos_hidden_multilayer_cache feature_source 분기, dataset collate 추가됨현재 Latent-IDM 트랙들의 공통 한계: 모든 ActionDiT block이 동일한 Cosmos hidden을 KV로 본다.
π0.5 KI 구조에서의 영감: VLM (depth=18) + Action expert (depth=18)가 동일 depth MoE transformer로 구성. 매 transformer block에서 modality별 Q/K/V 분리 + joint self-attn으로 VLM layer i의 hidden ↔ Action expert block i가 자동으로 대응된다. Cosmos가 frozen + cached인 우리 setting에서 이 correspondence를 수동으로 구현한다.
가설 H-LR: ActionDiT block i(얕은 layer: 시각 디테일 처리) ↔ Cosmos hidden layer f(i)(얕은 layer: 저수준 특징) 정렬이 자연스럽게 이루어지면 EEF가 개선된다. 반가설 H0: Cosmos hidden 27(late layer)이 이미 충분히 condensed → routing 무효.
Layer 선택: Cosmos DiT 36 blocks 중 균등 12개.
gr00t/data/dataset_latent_idm.py에 RobocasaLatentIDMDatasetHiddenMultiLayer + collate_latent_idm_hidden_multi 추가됨.
flow_matching_action_head_idm.py에 feature_source = "cosmos_hidden_multilayer_cache" 분기 추가. kv_projectors = nn.ModuleList([nn.Linear(5120, 1024) for _ in range(12)]) — per-layer projector.
| 후보 | Layer 수 | ActionDiT depth | Cache | 트리거 조건 |
|---|---|---|---|---|
| (a) 4-layer-4-block | 4 [5,14,23,32] | 4 | 2.2 TB | Phase 1 ≤120 mm (큰 win) |
| (b) 4-layer-12-block | 4 [5,14,23,32] | 12 (3 block per layer) | 2.2 TB | Phase 1 ∈[130,140] mm |
| (c) 6-layer-12-block | 6 [5,11,17,23,29,35] | 12 (2 block per layer) | 3.3 TB | Phase 1 ∈[120,130] mm |
| Run | Cache | 학습 cost | EEF 목표 |
|---|---|---|---|
| Latent-A multistream (현재 best) | 84 GB (v3 재사용) | 60K × ~11 s/step | 104.99 mm ✨ |
| Phase 1 dense N=12 | 6.7 TB | 60K × ~11 s/step ≈ 7.6일 | ≤125 mm |
| Phase 2 (a) 4-layer-4-block | 2.2 TB | 60K × ~5 s/step ≈ 3.5일 | ≤ Phase 1 |
| Phase 2 (b) 4-layer-12-block | 2.2 TB | 60K × ~9 s/step ≈ 6.3일 | ≤ Phase 1 |
| Phase 2 (c) 6-layer-12-block | 3.3 TB | 60K × ~10 s/step ≈ 6.9일 | ≤ Phase 1 |
gradient_checkpointing 필수.
단순 KV 확장(v3 concat, multistream)이 아닌 layer ↔ depth 정렬이 latent-IDM의 sweet spot임이 검증됨. π0.5 KI의 MoE per-block 가설이 frozen Cosmos backbone + cached KV setting에서도 transfer됨을 보임. 향후 모든 latent-IDM 실험의 default 구조가 될 수 있다.
Cosmos block 27은 이미 충분히 condensed한 representation. extra layer 정보는 marginal noise. → latent track은 batch + sliced KV로 충분. 다음 투자는 OOD/domain transfer 시나리오 검증으로 전환.
Multistream과의 차별점: multistream은 token 수를 3×(192)로 늘려 모든 block이 보게 함. Layer-routed는 token 수를 64 그대로 유지하되 각 block이 보는 layer를 다르게 함. 두 접근이 상보적 — 결과에 따라 hybrid 설계 가능.
scripts/run_cache_hidden_multi_mg30.sh sbm 제출 (8 GPU, core-extra). mg30 + heldout 각각 ~7 min. NAS 영구화 경로: /home/nas_main/taewoongkang/cache/cosmos_hidden_mg30/multi12_sigma30/ (6.7 TB).
tmp/test_latent_C_routed_forward.py: dummy hidden_multi (2, 12, 5, 27, 48, 5120), B=2, 10 step backward. peak <30 GB, loss finite 확인.
step time ~11 s/step (v3 대비 ~30% slow — kv_projectors 12개 + 12 block routing overhead). 60K 본 학습 sbmr 5 제출. Multistream 60K 완료 후 병렬 제출 가능.
per-layer projector 12개가 over-parameterize로 small-data overfit 위험 → train_loss vs eval gap 모니터링. early layer hidden norm 불균형 → trunc_normal init scale=1/√(in_dim) + 1k step warmup. 필요 시 per-layer RMSNorm 추가.