Index
2026-08-16 — Analysis

Augmentation Ablation — no-aug vs 5-way 비교, McNemar/Holm 검정

ImageWAM | RoboCasa 24-task closed-loop, 5개 모델 240 paired rollout

TL;DR

0.533
no-aug SR (24-task)
0.590
p vs B24 (설계 대조)
5
비교 모델 수
240
paired rollout / 모델

1 배경 / 목적

ImageWAM 논문 전문(19쪽)을 augmentation / color jitter / crop / rotation / flip / brightness / saturation 키워드로 전수 검색한 결과 서술이 0건이었다. 유일한 "augmented" 언급은 데이터셋 얘기("do not incorporate the augmented LIBERO-Plus training data")이고, RoboTwin의 "heavy scene randomization"은 데이터 수집 단계지 학습 증강이 아니다.

지금까지 켜온 증강(p=0.5, jitter/gamma/noise/crop/rotate)은 저자가 레포에 남긴 config robotwin_omnigen2.yaml에서 rotate까지 그대로 가져온 것이다. 논문에는 없고 코드에만 있는 항목이라, 기존에 파악한 논문↔코드 불일치 3건(action denoising steps 3 vs 10 / λ 가중 / τ⋆)에 이은 네 번째 불일치다.

RoboCasa는 human teleop demo라 RoboTwin 같은 scene randomization이 없다. 그 위에 photometric augmentation을 얹는 게 도움인지 손해인지 측정한 적이 없어서, B24 설정에서 증강만 끄고 나머지를 전부 동일하게 재학습해 비교했다.

변수 통제: 논문 Table 8 하이퍼파라미터 전부 일치 확인 (betas (0.9,0.95) / warmup 0.05T / min LR 0.01x / grad clip 1.0 / lr 1e-4 / wd 1e-2 / bf16 / ZeRO-1 / 8 GPU / batch 10 / 5 epoch / horizon 16 / chunk 16). hydra 조합 결과를 직접 diff해 video_augmentation 서브트리와 wandb 이름만 다름을 확인, 실행된 run의 저장 config로도 재확인했다.

2 작업 내용

기존 B24(논문 설계, 증강 on) 학습에서 augmentation config만 끈 no-aug 변형을 새로 학습했다. 기존에 이미 24-task 전체 학습 + closed-loop 평가가 끝난 B24 / C24(predicted) / C-joint(FastWAM-Joint 추론) / D-min(txt→target) 4개와 합쳐 5-way 비교를 구성했다.

평가 프로토콜: RoboCasa 표준 절차적 생성 (reset_to HDF5 아님) 5개 모델 × 24 task × 10 rollout/task = 모델당 240 rollout, 전부 완주 통계: 모델쌍마다 McNemar 부호검정 (paired binary success/fail) 설계된 대조: no-aug vs B24 (증강 유무만 다른 유일한 쌍)

모델당 240 rollout이라는 표본 크기에서, 캠페인 전체(이전 4-변형 6쌍 + 이번 no-aug 4쌍)로 지금까지 총 10번의 pairwise McNemar 검정을 돌렸다는 점을 반영해 다중비교 보정을 적용했다: 최소 p를 Holm 기준 α/10 = 0.005와 비교.

3 결과 (수치)

모델24-task 전체 SR기존 20-task신규 4-task
no-aug (증강 off)0.5330.5850.275
B24 (증강 on, 논문 설계)0.5120.5800.175
D-min (C + txt→target)0.4960.5500.225
C-joint (동시 denoise)0.4920.5400.250
C-pred (C 기본)0.4670.5200.200

McNemar, no-aug 대 나머지

비교no-aug만 성공 / 상대만 성공pHolm 생존 (α/10=0.005)
vs C-pred37 / 210.048탈락
vs C-joint38 / 280.268탈락
vs D-min37 / 280.321탈락
vs B24 (설계된 대조)30 / 250.590탈락
증강 질문은 답이 안 나왔다. 설계된 대조인 no-aug vs B24가 p=0.590이다. +0.021 SR 차이는 노이즈 범위 안에 있다 — "증강이 도움된다"도 "손해다"도 주장할 수 없다.
p=0.048을 유의하다고 읽으면 안 된다. 이 캠페인에서 pairwise McNemar를 누적 10번 돌렸다 (4변형 6쌍 + no-aug 4쌍). α=0.05로 10번 검정하면 최소 하나가 우연히 0.05 아래로 내려올 확률이 ~40%다. Holm 보정 시 가장 작은 p를 0.05/10=0.005와 비교해야 하며, 0.048 > 0.005이므로 하나도 살아남지 못한다. 하필 no-aug vs C-pred(가장 멀리 떨어진 두 조건)라 그럴듯해 보이는 것도 함정.
순서만은 안정적: no-aug ≥ B24 > D-min ≈ C-joint > C-pred. target 경로를 읽는 세 변형(D-min/C-joint/C-pred)이 전부 안 읽는 두 변형(no-aug/B24)보다 아래다. 개별 비교는 전부 underpowered이지만 다섯 조건에서 순위 역전은 없었다.

no-aug의 이득은 거의 전부 신규 4-task에서 나온다 (0.175 → 0.275, +0.1). 기존 20-task는 0.580 → 0.585로 사실상 평평하다. 신규 4-task는 40 rollout뿐이라 성공 4개 차이 — 노이즈로 봐야 한다. loss로 비교하면 안 된다: no-aug 최종 loss 0.0782로 다른 넷(0.0886~0.0956)보다 확연히 낮지만, 증강을 끄면 학습 분포 자체가 쉬워져서 내려가는 값이라 조건이 다른 loss끼리는 비교 불가 — closed-loop SR로만 판단해야 한다.

부수 관측 — 증강의 CPU 비용은 실재한다

s/stepCPU throttle
증강 on (B24 / C24 / D-min)2.13 ~ 2.51543 ~ 578%
증강 off (no-aug)1.93 ~ 2.5598%
throttle이 5배 이상 떨어졌다. jitter/gamma/crop/rotate가 dataloader CPU 부하의 상당 부분이었다. 성능 이득이 없다면 끄는 쪽이 자원 면에서 유리하다는 근거는 된다 (SR 근거는 아님).

4 Takeaway

의미

논문↔코드 4번째 불일치(augmentation)를 직접 검증했지만, 표본 크기가 결론을 낼 만큼 크지 않다는 게 이번 분석의 핵심 결과다. 5개 조건(no-aug/B24/D-min/C-joint/C-pred) 모두 통계적으로 구분 불가능한 채로 남아있고, 이전 카드(260807-robocasa_run_b_reproduction.html)에서 확정한 "병목은 아키텍처가 아니라 target의 정보원"이라는 결론과 방향은 일치한다 — target을 읽는 변형이 전부 하위권이라는 순서가 이번에도 재확인됐다. 다만 augmentation 자체는 별개 축이고, 지금 데이터로는 논문에 쓸 결론을 만들 수 없다.

5 Next Steps

미해결 한계

검정력이 근본 문제다. 240 rollout, discordant pair 쌍당 50~66개로는 0.02~0.05 수준의 SR 차이를 판정할 수 없다. 다섯 조건을 실제로 가르려면 태스크당 rollout을 40~65개(4~6배)로 늘려야 하고, 4 GPU 기준 모델당 ~5시간 × 5모델 = 약 25시간이 든다.

다음 실험

우선순위 판단 필요: (a) rollout을 늘려 기존 5개 조건을 통계적으로 확정할지(25시간, "차이 없음"을 확증하는 방향), (b) 여전히 미실행인 E 변형(video/target이 action을 attend해서 미래를 action-conditioned로 만드는 구조, ~13시간 + eval)을 돌릴지 — E는 DPI 천장을 뚫는 유일한 미시도 개입이며, target 경로 개입 3종(predicted/joint/D-min) 전부 실패한 것이 그 근거다. 둘 다 미승인 상태.