ImageWAM 논문 전문(19쪽)을 augmentation / color jitter / crop / rotation / flip / brightness / saturation 키워드로 전수 검색한 결과 서술이 0건이었다. 유일한 "augmented" 언급은 데이터셋 얘기("do not incorporate the augmented LIBERO-Plus training data")이고, RoboTwin의 "heavy scene randomization"은 데이터 수집 단계지 학습 증강이 아니다.
지금까지 켜온 증강(p=0.5, jitter/gamma/noise/crop/rotate)은 저자가 레포에 남긴 config robotwin_omnigen2.yaml에서 rotate까지 그대로 가져온 것이다. 논문에는 없고 코드에만 있는 항목이라, 기존에 파악한 논문↔코드 불일치 3건(action denoising steps 3 vs 10 / λ 가중 / τ⋆)에 이은 네 번째 불일치다.
RoboCasa는 human teleop demo라 RoboTwin 같은 scene randomization이 없다. 그 위에 photometric augmentation을 얹는 게 도움인지 손해인지 측정한 적이 없어서, B24 설정에서 증강만 끄고 나머지를 전부 동일하게 재학습해 비교했다.
video_augmentation 서브트리와 wandb 이름만 다름을 확인, 실행된 run의 저장 config로도 재확인했다.기존 B24(논문 설계, 증강 on) 학습에서 augmentation config만 끈 no-aug 변형을 새로 학습했다. 기존에 이미 24-task 전체 학습 + closed-loop 평가가 끝난 B24 / C24(predicted) / C-joint(FastWAM-Joint 추론) / D-min(txt→target) 4개와 합쳐 5-way 비교를 구성했다.
모델당 240 rollout이라는 표본 크기에서, 캠페인 전체(이전 4-변형 6쌍 + 이번 no-aug 4쌍)로 지금까지 총 10번의 pairwise McNemar 검정을 돌렸다는 점을 반영해 다중비교 보정을 적용했다: 최소 p를 Holm 기준 α/10 = 0.005와 비교.
| 모델 | 24-task 전체 SR | 기존 20-task | 신규 4-task |
|---|---|---|---|
| no-aug (증강 off) | 0.533 | 0.585 | 0.275 |
| B24 (증강 on, 논문 설계) | 0.512 | 0.580 | 0.175 |
| D-min (C + txt→target) | 0.496 | 0.550 | 0.225 |
| C-joint (동시 denoise) | 0.492 | 0.540 | 0.250 |
| C-pred (C 기본) | 0.467 | 0.520 | 0.200 |
| 비교 | no-aug만 성공 / 상대만 성공 | p | Holm 생존 (α/10=0.005) |
|---|---|---|---|
| vs C-pred | 37 / 21 | 0.048 | 탈락 |
| vs C-joint | 38 / 28 | 0.268 | 탈락 |
| vs D-min | 37 / 28 | 0.321 | 탈락 |
| vs B24 (설계된 대조) | 30 / 25 | 0.590 | 탈락 |
no-aug의 이득은 거의 전부 신규 4-task에서 나온다 (0.175 → 0.275, +0.1). 기존 20-task는 0.580 → 0.585로 사실상 평평하다. 신규 4-task는 40 rollout뿐이라 성공 4개 차이 — 노이즈로 봐야 한다. loss로 비교하면 안 된다: no-aug 최종 loss 0.0782로 다른 넷(0.0886~0.0956)보다 확연히 낮지만, 증강을 끄면 학습 분포 자체가 쉬워져서 내려가는 값이라 조건이 다른 loss끼리는 비교 불가 — closed-loop SR로만 판단해야 한다.
| s/step | CPU throttle | |
|---|---|---|
| 증강 on (B24 / C24 / D-min) | 2.13 ~ 2.51 | 543 ~ 578% |
| 증강 off (no-aug) | 1.93 ~ 2.55 | 98% |
논문↔코드 4번째 불일치(augmentation)를 직접 검증했지만, 표본 크기가 결론을 낼 만큼 크지 않다는 게 이번 분석의 핵심 결과다. 5개 조건(no-aug/B24/D-min/C-joint/C-pred) 모두 통계적으로 구분 불가능한 채로 남아있고, 이전 카드(260807-robocasa_run_b_reproduction.html)에서 확정한 "병목은 아키텍처가 아니라 target의 정보원"이라는 결론과 방향은 일치한다 — target을 읽는 변형이 전부 하위권이라는 순서가 이번에도 재확인됐다. 다만 augmentation 자체는 별개 축이고, 지금 데이터로는 논문에 쓸 결론을 만들 수 없다.
검정력이 근본 문제다. 240 rollout, discordant pair 쌍당 50~66개로는 0.02~0.05 수준의 SR 차이를 판정할 수 없다. 다섯 조건을 실제로 가르려면 태스크당 rollout을 40~65개(4~6배)로 늘려야 하고, 4 GPU 기준 모델당 ~5시간 × 5모델 = 약 25시간이 든다.
우선순위 판단 필요: (a) rollout을 늘려 기존 5개 조건을 통계적으로 확정할지(25시간, "차이 없음"을 확증하는 방향), (b) 여전히 미실행인 E 변형(video/target이 action을 attend해서 미래를 action-conditioned로 만드는 구조, ~13시간 + eval)을 돌릴지 — E는 DPI 천장을 뚫는 유일한 미시도 개입이며, target 경로 개입 3종(predicted/joint/D-min) 전부 실패한 것이 그 근거다. 둘 다 미승인 상태.