← 목록으로
TL;DR
- 전체 SR: 8/72 = 11.1%. 단순 1DoF task에서 선택적 성공 — TurnSinkSpout 67%, CloseDrawer/CoffeePressButton/CoffeeServeMug/OpenSingleDoor/TurnOffMicrowave/TurnOffSinkFaucet 각 33%.
- PnP 계열(8개) 전원 0%. 조작 복잡도가 높은 task(물체 파지+위치 이동)는 open-loop IDM action으로 성공 불가.
- 파이프라인 자체는 검증됨 — 72 ep 모두 시뮬레이터에서 정상 실행, 영상 생성·action 추출·replay 전 단계 에러 없음.
1 배경 / 목적
DreamGen 파이프라인의 핵심 가설 검증: Cosmos로 생성한 합성 비디오에서 droid-IDM이 추출한 action이 실제 시뮬레이터에서 실행 가능한가?
260527에 파이프라인(open-loop 재생 + 3-view 영상 생성)을 구축했고, 오늘 4-GPU 병렬 잡(10010–10013)이 완료되었다. 24 task 각 3 ep = 72 ep 전체 재생 결과가 집계됐다.
Cosmos AR model : ar_p3_init0_v2 (14B, DROID-init, 47.2k steps)
IDM : droid_idm (SigLIP2 + DiT flow matching, MG-3000 학습)
재생 방식 : open-loop (IDM action 시퀀스 전부 실행, closed-loop X)
에피소드당 조건 : 실제 heldout 데모의 초기 상태(reset_to) 재현
SLURM 잡 : 10010 (Close/Coffee 6tasks), 10011 (Open/PnP1 6tasks),
10012 (PnP2/Turn1 6tasks), 10013 (Turn2 6tasks)
2 작업 내용
scripts/run_eval_synthetic_idm_replay.sh가 각 task별로 cosmos 생성 비디오 3개를 선택, droid-IDM으로 action을 추출하고, robocasa v0.2 sim에 순차 투입(open-loop). 성공 여부는 _check_success() 기준(relaxed threshold)으로 판정.
4-GPU 분할 (task당 독립 잡)
Job 10010 → CloseDoubleDoor, CloseDrawer, CloseSingleDoor,
CoffeePressButton, CoffeeServeMug, CoffeeSetupMug
Job 10011 → OpenDoubleDoor, OpenDrawer, OpenSingleDoor,
PnPCabToCounter, PnPCounterToCab, PnPCounterToMicrowave
Job 10012 → PnPCounterToSink, PnPCounterToStove, PnPMicrowaveToCounter,
PnPSinkToCounter, PnPStoveToCounter, TurnOffMicrowave
Job 10013 → TurnOffSinkFaucet, TurnOffStove, TurnOnMicrowave,
TurnOnSinkFaucet, TurnOnStove, TurnSinkSpout
각 잡: GPU 1, 18 CPU, 200 GB, ~10-20분 완료
3 결과
전체 SR: 8/72 = 11.1%. 4개 잡(각 18 ep) 합산 — Job별 3/18(16.7%), 1/18(5.6%), 1/18(5.6%), 3/18(16.7%).
24-task 전체 결과표
| Task | 성공 | 총 ep | SR |
| TurnSinkSpout | 2 | 3 | 67% |
| CloseDrawer | 1 | 3 | 33% |
| CoffeePressButton | 1 | 3 | 33% |
| CoffeeServeMug | 1 | 3 | 33% |
| OpenSingleDoor | 1 | 3 | 33% |
| TurnOffMicrowave | 1 | 3 | 33% |
| TurnOffSinkFaucet | 1 | 3 | 33% |
| CloseDoubleDoor | 0 | 3 | 0% |
| CloseSingleDoor | 0 | 3 | 0% |
| CoffeeSetupMug | 0 | 3 | 0% |
| OpenDoubleDoor | 0 | 3 | 0% |
| OpenDrawer | 0 | 3 | 0% |
| PnPCabToCounter | 0 | 3 | 0% |
| PnPCounterToCab | 0 | 3 | 0% |
| PnPCounterToMicrowave | 0 | 3 | 0% |
| PnPCounterToSink | 0 | 3 | 0% |
| PnPCounterToStove | 0 | 3 | 0% |
| PnPMicrowaveToCounter | 0 | 3 | 0% |
| PnPSinkToCounter | 0 | 3 | 0% |
| PnPStoveToCounter | 0 | 3 | 0% |
| TurnOffStove | 0 | 3 | 0% |
| TurnOnMicrowave | 0 | 3 | 0% |
| TurnOnSinkFaucet | 0 | 3 | 0% |
| TurnOnStove | 0 | 3 | 0% |
성공 task 패턴: TurnSinkSpout(단일 회전 동작), CloseDrawer(단방향 밀기), CoffeePressButton(점 접촉), CoffeeServeMug(놀라운 - pick+place 계열인데 성공), OpenSingleDoor, TurnOff* 시리즈. 공통점: 비교적 단순한 end-effector trajectory + 목표 오차 margin이 큰 task.
PnP 계열 8개 전원 0%. Cosmos 생성 비디오의 물체 위치·자세가 실제 reset 초기 상태와 불일치 → IDM이 추출한 action의 pick 시점·위치가 틀림. open-loop 재생이므로 보정 불가.
4 Takeaway
파이프라인 타당성 vs. 직접 성능
파이프라인 자체는 작동한다. 72 ep 모두 에러 없이 실행됐고, 성공 케이스도 실재한다(8개). 그러나 11.1% SR은 DreamGen pseudo-data로 policy 학습하기에 충분하지 않다 — policy 학습에 쓰려면 action quality가 GT demo 수준이어야 하는데, open-loop 11%는 too noisy.
핵심 병목: (A) Cosmos 비디오의 초기 물체 배치가 sim reset 상태와 불일치 (PnP 0% 원인), (B) open-loop 재생 자체의 한계 — 단 한 번의 action 시퀀스가 실제 물리 feedback 없이 실행되므로 오차가 누적. 두 문제 모두 closed-loop policy 학습으로 넘기면 희석될 수 있음.
긍정적 신호: 7개 task에서 1~2/3 성공. IDM action이 완전히 랜덤하지 않음(task-relevant trajectory 생성 중). frappe_midA/B 학습(오늘 실행 중)처럼 합성 데이터를 policy fine-tuning에 혼합하는 방식으로 활용하는 것이 현실적.
5 Next Steps
- frappe_midA/B 결과 대기 — FRAPPE alignment으로 학습한 policy가 동일 24-task eval에서 frappe_base(63.5%) 대비 얼마나 향상되는지 확인. 합성 데이터 없이 alignment만으로 얼마나 얻는지의 ablation.
- closed-loop IDM 검증 — open-loop 11.1% → closed-loop policy(frappe_b2_mix 계열)가 합성 데이터를 흡수한 후 SR이 얼마나 향상되는지 비교. 11.1% open-loop가 실제 policy 학습에 가치 있는 noise-level인지 판단.
- PnP 대책 — Cosmos 초기 상태 conditioning 개선(ep_meta 기반 init 상태 주입) 또는 PnP task 제외 후 나머지 16 task 서브셋으로 DreamGen loop 실험.
- 더 많은 ep 시도 — 현재 task당 3 ep는 statistically weak. task당 10 ep (=240 ep 총합)로 재검증 시 패턴이 더 명확해질 것.