← 목록으로
2026-05-28 · DreamData · Analysis

Synthetic IDM Open-loop Sim 재생 결과

Cosmos AR(ar_p3_init0_v2) 생성 비디오 → droid-IDM action 추출 → robocasa sim open-loop 재생 | 24 task × 3 ep = 72 ep

TL;DR

11.1%
전체 SR (8/72)
24
Tasks
72
총 에피소드
67%
Best (TurnSinkSpout)
0%
PnP 계열 전체

1 배경 / 목적

DreamGen 파이프라인의 핵심 가설 검증: Cosmos로 생성한 합성 비디오에서 droid-IDM이 추출한 action이 실제 시뮬레이터에서 실행 가능한가?

260527에 파이프라인(open-loop 재생 + 3-view 영상 생성)을 구축했고, 오늘 4-GPU 병렬 잡(10010–10013)이 완료되었다. 24 task 각 3 ep = 72 ep 전체 재생 결과가 집계됐다.

Cosmos AR model : ar_p3_init0_v2 (14B, DROID-init, 47.2k steps) IDM : droid_idm (SigLIP2 + DiT flow matching, MG-3000 학습) 재생 방식 : open-loop (IDM action 시퀀스 전부 실행, closed-loop X) 에피소드당 조건 : 실제 heldout 데모의 초기 상태(reset_to) 재현 SLURM 잡 : 10010 (Close/Coffee 6tasks), 10011 (Open/PnP1 6tasks), 10012 (PnP2/Turn1 6tasks), 10013 (Turn2 6tasks)

2 작업 내용

scripts/run_eval_synthetic_idm_replay.sh가 각 task별로 cosmos 생성 비디오 3개를 선택, droid-IDM으로 action을 추출하고, robocasa v0.2 sim에 순차 투입(open-loop). 성공 여부는 _check_success() 기준(relaxed threshold)으로 판정.

4-GPU 분할 (task당 독립 잡)

Job 10010 → CloseDoubleDoor, CloseDrawer, CloseSingleDoor, CoffeePressButton, CoffeeServeMug, CoffeeSetupMug Job 10011 → OpenDoubleDoor, OpenDrawer, OpenSingleDoor, PnPCabToCounter, PnPCounterToCab, PnPCounterToMicrowave Job 10012 → PnPCounterToSink, PnPCounterToStove, PnPMicrowaveToCounter, PnPSinkToCounter, PnPStoveToCounter, TurnOffMicrowave Job 10013 → TurnOffSinkFaucet, TurnOffStove, TurnOnMicrowave, TurnOnSinkFaucet, TurnOnStove, TurnSinkSpout 각 잡: GPU 1, 18 CPU, 200 GB, ~10-20분 완료

3 결과

전체 SR: 8/72 = 11.1%. 4개 잡(각 18 ep) 합산 — Job별 3/18(16.7%), 1/18(5.6%), 1/18(5.6%), 3/18(16.7%).

24-task 전체 결과표

Task성공총 epSR
TurnSinkSpout2367%
CloseDrawer1333%
CoffeePressButton1333%
CoffeeServeMug1333%
OpenSingleDoor1333%
TurnOffMicrowave1333%
TurnOffSinkFaucet1333%
CloseDoubleDoor030%
CloseSingleDoor030%
CoffeeSetupMug030%
OpenDoubleDoor030%
OpenDrawer030%
PnPCabToCounter030%
PnPCounterToCab030%
PnPCounterToMicrowave030%
PnPCounterToSink030%
PnPCounterToStove030%
PnPMicrowaveToCounter030%
PnPSinkToCounter030%
PnPStoveToCounter030%
TurnOffStove030%
TurnOnMicrowave030%
TurnOnSinkFaucet030%
TurnOnStove030%
성공 task 패턴: TurnSinkSpout(단일 회전 동작), CloseDrawer(단방향 밀기), CoffeePressButton(점 접촉), CoffeeServeMug(놀라운 - pick+place 계열인데 성공), OpenSingleDoor, TurnOff* 시리즈. 공통점: 비교적 단순한 end-effector trajectory + 목표 오차 margin이 큰 task.
PnP 계열 8개 전원 0%. Cosmos 생성 비디오의 물체 위치·자세가 실제 reset 초기 상태와 불일치 → IDM이 추출한 action의 pick 시점·위치가 틀림. open-loop 재생이므로 보정 불가.

4 Takeaway

파이프라인 타당성 vs. 직접 성능

파이프라인 자체는 작동한다. 72 ep 모두 에러 없이 실행됐고, 성공 케이스도 실재한다(8개). 그러나 11.1% SR은 DreamGen pseudo-data로 policy 학습하기에 충분하지 않다 — policy 학습에 쓰려면 action quality가 GT demo 수준이어야 하는데, open-loop 11%는 too noisy.

핵심 병목: (A) Cosmos 비디오의 초기 물체 배치가 sim reset 상태와 불일치 (PnP 0% 원인), (B) open-loop 재생 자체의 한계 — 단 한 번의 action 시퀀스가 실제 물리 feedback 없이 실행되므로 오차가 누적. 두 문제 모두 closed-loop policy 학습으로 넘기면 희석될 수 있음.

긍정적 신호: 7개 task에서 1~2/3 성공. IDM action이 완전히 랜덤하지 않음(task-relevant trajectory 생성 중). frappe_midA/B 학습(오늘 실행 중)처럼 합성 데이터를 policy fine-tuning에 혼합하는 방식으로 활용하는 것이 현실적.

5 Next Steps