Index
2026-06-12 — Experiment

DreamZero-DROID 추론 레이턴시 벤치마크 (1×B200)

DreamData / dreamzero | Jobs 14931, 14948, 14949

TL;DR

2529
action_call ms (eager)
2473
action_call ms (compiled)
9.5 Hz
eff. action Hz (eager)
2.3%
compile 개선률
105 ms
action당 레이턴시

1 배경 / 목적 (왜)

DreamZero-DROID (Wan2.2-TI2V-5B 백본)의 실제 추론 레이턴시를 표준 프로토콜로 측정해 cross-model 비교표 (X-WAM, Cosmos-Policy, pi0.5 등)에 합산하기 위한 벤치마크.

DreamZero는 video + action을 하나의 causal joint-diffusion pass로 동시 예측한다. action_call이 이미 16-step joint denoise + action unnormalize 전체를 포함하므로, full4D (RGB 비디오)의 추가 비용은 VAE decode뿐이다. 이 구조는 Cosmos-Policy-RoboCasa (action 353ms → +VAE → full 459ms)와 동일한 분해 방식.

또한 운영 환경(default ubuntu:22.04 worker)에서 torch.compile이 없는 eager 모드가 실제 serving 경로이므로, compiled와의 갭을 정량화했다.

2 작업 내용 (어떻게)

벤치마크 스크립트

tmp/bench_dreamzero_latency.pyeval_utils/serve_dreamzero_wan22.DreamZeroWan225BPolicy serving 경로를 직접 구동. 합성 obs (랜덤 RGB 3뷰 + proprio)로 shape 결정 레이턴시 측정.

실행 프로토콜

hw: 1× B200 GPU (--gres=gpu:1, --qos=own) batch: 1 warmup: 5 calls (KV-cache 초기화 + 컴파일 포함) timed: 30 calls (cuda.synchronize 후 시각 기록) precision: bf16 resolution: 180×320 num_inference_steps: 16 num_frame_per_block: 2 decoupled_inference: false

실행 방식 (3 jobs)

Job모드컨테이너경과
14931Eager (TORCHDYNAMO_DISABLE=1)ubuntu:22.04 (기본)8m 12s
14948Eager (재측정)ubuntu:22.04 (기본)6m 44s
14949Compiled (BENCH_COMPILE=1)nvcr.io/nvidia/pytorch:25.04-py313m 32s

Eager 첫 실행(14931)이 8m인 이유: 이미지 pull + KV-cache 첫 초기화 overhead. 14948 재실행 6m 44s는 캐시 히트.

측정 대상 분해

3 결과 (수치)

주요 레이턴시 비교 (median, n=30)

모드action_call (ms)vae_decode (ms)full4D (ms)eff. action Hzpolicy Hz
Eager (ubuntu:22.04) 2529 93.6 2622 9.5 Hz 0.4 Hz
Compiled (pytorch:25.04-py3) 2473 93.4 2566 9.7 Hz 0.42 Hz

Eager 상세 통계 (n=30)

지표action_call (ms)vae_decode (ms)
min223093.3
p10224793.3
median252993.6
p90278193.7
max280194.2
std2040.17
action_call std 204ms (8%): 16-step flow-matching diffusion의 내부 스케줄 분산으로 보임. vae_decode는 std 0.17ms로 안정적이라 diffusion step이 주범.

파생 지표 (Eager 기준)

24
action chunk 크기
105 ms
action당 레이턴시
0.4 Hz
policy call Hz
9.5 Hz
effective action Hz
VAE decode 비중: 93.6ms / 2622ms = 3.6%. full4D의 비용은 거의 전부 joint diffusion이다. 비디오 생성을 끄더라도 레이턴시는 사실상 동일.

torch.compile 효과

지표EagerCompiled개선
action_call median2529 ms2473 ms−56 ms (−2.3%)
full4D median2622 ms2566 ms−56 ms (−2.1%)
eff. action Hz9.5 Hz9.7 Hz+0.2 Hz
compile 개선 2.3%: 16-step diffusion 루프에서 torch.compile이 효과를 거의 못 봤다. B200 memory bandwidth에서 bottle-neck이 없고 flow-step 자체가 compute-bound이라 dynamo graph break 없이 전부 커버해도 marginal.

4 Takeaway

cross-model 위치

Cosmos-Policy-RoboCasa (action 353ms, full4D 459ms)와 비교하면 DreamZero-DROID는 action_call이 7× 더 느리다. 이는 Wan2.2-5B (16 diffusion steps) vs Cosmos-Policy의 flow-matching step 차이에서 기인한다. effective action Hz는 chunk 크기 (DreamZero=24 vs Cosmos=N/A)가 다르므로 단순 비교는 어렵고, 실제 로봇 제어에서 end-to-end SR이 더 중요한 지표다.

5 Next Steps