Index
2026-04-18 — Analysis

IDM Held-out 평가 및 DreamGen 논문 비교 분석

GR00T-Dreams | IDM MG-30 (720 ep) held-out eval + arxiv 2505.12705 비교

TL;DR

0.161
CosSim ckpt-10K
0.078
CosSim ckpt-20K
720
Held-out eps
0.081
MSE ckpt-10K

1 배경 / 목적

MG-30 (720 ep)으로 from-scratch 학습한 IDM의 실질적인 품질을 수치로 파악하고, DreamGen 논문(arxiv 2505.12705)의 설정과 비교하여 현재 접근이 올바른 방향인지 검증.

기존 한계: 학습 loss (0.109)만으로는 IDM이 실제로 쓸만한지 판단 불가. CosSim/MSE 절댓값 기준이 없어 "0.16이 좋은 건지 나쁜 건지" 불명확.

두 가지 질문에 답하는 것이 목표:

2 작업 내용

1. IDM Held-out 평가

MG-30 학습에 사용되지 않은 별도 720 ep (task당 30개)로 평가.

스크립트: scripts/eval_idm_action_quality.py 데이터: /home/nas_main/taewoongkang/Dataset/robocasa/idm_heldout (720 ep) 평가 방식: normalized space에서 GT action vs IDM predicted action 비교 Inference: 3 samples 평균 (stochastic 모델이므로) 체크포인트: ckpt-10K (outputs/idm_robocasa_mg30/), ckpt-20K (outputs/idm_robocasa_mg30_100k/)

2. DreamGen 논문 (arxiv 2505.12705) 분석

Section 3.1 핵심 설정:

Video world model: 1,200 human demo로 고정 학습 IDM: data scenario별 — low=720, mid=2400, high=7200 ep Policy: real data + IDM pseudo label로 GR00T fine-tune 평가: downstream task success rate (IDM 자체 메트릭 미보고)

3. HuggingFace 공식 체크포인트 분석

seonghyeonye/IDM_robocasa: global_step=60,000, loss=0.0127, 데이터=FullSet (수만 ep), 32 GPU 학습. 이것은 범용 배포용이며 논문 실험에서 사용한 체크포인트가 아님.

3 결과

Held-out 평가 (normalized space, 3 inference 평균)

메트릭ckpt-10K (3 epoch)ckpt-20K (6.7 epoch)비고
Cosine Similarity0.161 ± 0.380.078 ± 0.4110K가 best
MSE (overall)0.08080.082520K 소폭 악화
Normalized MSE1.1391.113normalized MSE >1 = random보다 약간 나쁨
MAE0.1520.151거의 동일

Per-dim MSE (ckpt-20K)

Action 차원MSE해석
eef_pos (3dim)0.17~0.25가장 오차 큼
eef_rot (3dim)0.02~0.03양호
gripper (1dim)0.25binary라 높음
base/ctrl (5dim)~0.00미사용 차원 (항상 0)
ckpt-20K에서 CosSim 하락: 10K→20K 추가 학습이 held-out에서 오히려 역효과. Overfitting 징후. 100K 학습 중 best checkpoint는 10K 근방일 가능성 높음.

DreamGen 논문 vs 우리 세팅 비교

항목DreamGen 논문 (low data)우리 (현재)
IDM 학습 데이터720 ep (MG-30)720 ep (MG-30)
IDM 자체 평가미보고 (downstream만)CosSim=0.161 측정
최종 평가Task success rate미진행 (다음 단계)
공식 HF ckptFullSet (별도)우리가 직접 학습
논문과 동일 세팅 확인: DreamGen도 low data 시나리오에서 720 ep로 IDM 학습. 논문 Figure 4에서 low data(720)로도 downstream policy 성능 향상 확인됨.

4 Takeaway

주요 의미

1. 우리 세팅이 논문과 동일하다는 것이 확인됨. DreamGen이 low data 시나리오에서 IDM을 720 ep로 학습하고 downstream에서 효과를 보였다면, 우리가 같은 데이터로 학습한 IDM도 downstream 실험 가치가 있다.

2. CosSim 0.08~0.16은 낮아 보이지만 판단 기준이 없다. 논문이 이 수치를 보고하지 않는 이유는, IDM action의 normalized-space CosSim이 downstream 성능과 직접 연결되지 않기 때문일 가능성이 높다. simulator replay로 실질적 품질을 검증해야 한다.

3. Overfitting 확인 → 100K 학습에서 early stopping 필요. ckpt-10K가 held-out best. 100K 학습 완료 후 체크포인트별 eval 필수.

5 Next Steps

단기 (이번 주)

중기