corr(a, −span) = 0.99~1.00). 하나의 전역 스케일로 3뷰를 동시에 metric으로 만들 수 없음.X-WAM을 베이스라인으로 삼아 연구하려는 입장에서 depth가 어디까지 믿을 만한지 검증. viser 3D 뷰어에서 wrist 뷰가 유독 이상(스케일 불일치 + flat)한 것이 출발점.
모델을 비판하기 전에 측정 도구부터 검증했고, 두 개가 실제로 틀려 있었습니다.
K_orig로 언프로젝트하도록 수정.resize→crop(0.95)→resize 체인을 NEAREST로 재현.RoboCasa 8 task, 스케일 프로토콜별 뷰별 median 오차:
| 프로토콜 | agentview_L | agentview_R | eye_in_hand |
|---|---|---|---|
| global-linear | 19.1 | 25.1 | 51.6 cm |
| per-view-linear | 5.6 | 4.9 | 7.0 cm |
| per-view-disp | 7.1 | 7.7 | 5.2 cm |
| global-disp | 101.6 | 66.5 | 71.3 |
원인: 같은 출력값이 뷰마다 다른 거리를 뜻합니다. 0.3~0.4m 구간에서 exo1은 0.296, wrist는 0.074 — 4배 차이. 직선 하나로 동시 만족 불가.
X=(u−cx)z/fx라 z가 2배면 x,y도 2배 → 광선 방향 팽창(단순 이동이 아님)이라 시각적으로 크게 틀어져 보입니다.
gen = (z_max − z)/(z_max − z_min) 형태의 장면별·뷰별 min-max 정규화와 정합합니다:
| 뷰 | corr(b, z_max) | corr(a, −span) |
|---|---|---|
| RoboCasa exo1 / exo2 | 0.91 / 0.94 | 0.88 / 0.83 |
| DROID ext1 / ext2 | 0.89 / 0.99 | 0.99 / 1.00 |
| wrist (RoboCasa / DROID) | 0.56 / 0.99 | 0.50 / 0.39 |
DROID exo에서 corr(a, −span)가 0.99~1.00 — slope가 장면 depth span에 의해 사실상 완전히 결정됩니다. 교과서적 min-max 거동이며, 두 체크포인트·sim/실사 양쪽에서 재현됩니다.
best affine을 씌운 뒤 GT 변동을 얼마나 재현하는지(std_pred/std_gt)와 R²:
| R² (전체) | R² (근거리 제외) | 재현율 (전체) | 재현율 (제외) | |
|---|---|---|---|---|
| RoboCasa exo1 / exo2 | 0.87 | — | 0.93 | — |
| RoboCasa wrist | 0.65 | 0.40 | 0.74 | 0.59 |
| DROID ext1 / ext2 | 0.65 / 0.68 | — | 0.80 / 0.82 | — |
| DROID wrist | 0.33 | 0.22 | 0.54 | 0.36 |
왜 wrist만? 뷰가 보는 거리 범위의 안정성이 결정적으로 다릅니다:
| 뷰 | z_max 변동 | span 변동 | CV |
|---|---|---|---|
| exo1 | 1.61–2.09m (×1.3) | ×1.4 | 0.12 |
| exo2 | 1.63–2.00m (×1.2) | ×1.2 | 0.07 |
| wrist | 0.63–1.42m (×2.3) | ×2.4 | 0.28 |
RoboCasa의 두 agentview는 intrinsic이 동일하고 보는 거리대도 같은데, 같은 물리 거리에서 exo2 = exo1 × 1.87 ± 0.16 (8 scene 전부 일관):
| 거리 | exo1 | exo2 |
|---|---|---|
| 0.4–0.5 m | 0.246 | 0.502 |
| 0.6–0.8 m | 0.180 | 0.339 |
| 1.0–1.3 m | 0.100 | 0.185 |
결함만 나열하면 불공정하므로 반대 방향도 검증했습니다. GT를 전혀 쓰지 않고 두 exo 클라우드의 3D 정합만으로 exo2의 스케일을 풀었을 때:
| consistency만으로 | GT로 fit | 차이 | |
|---|---|---|---|
| exo2 depth 오차 | 6.0 cm | 4.7 cm | +1.3 cm |
| slope 상대오차 | 23.9% | ||
| 생성 exo1↔exo2 정합 | 5.1–7.7 cm | GT 기준선 1.0 cm | |
과거 결과 정정: 260623의 cross-view 12.2cm는 하나의 전역 affine을 강제해 나온 값입니다. per-view 정규화가 실재하므로 올바른 파라미터화로는 ~6.5cm — 모델의 3D 일관성은 당시 결론보다 약 2배 좋습니다.
| # | 주장 | 근거 강도 |
|---|---|---|
| 1 | per-view·per-scene up-to-affine → 논문의 "3D spatial reconstruction"은 뷰별·장면별 외부 스케일 앵커 없이는 성립 안 함 | 강함 (sim·실사, 두 ckpt 모두) |
| 2 | 근거리(wrist) depth 붕괴 — 실사 R² 0.22~0.33. 조작 영역이 가장 약함 | 강함 (DROID에서 악화) |
| 3 | 뷰 슬롯 gain 얽힘 (1.87×) | 보류 (DROID 미재현) |
| 4 | joint 3D 기하 자체는 실재 → "3D를 모른다"는 과장 | 반증 균형 |
b≈z_max 증거는 exo에서 강하고 wrist는 약함). VAE 3채널 평균 디코딩이 압축을 더할 가능성(단, 세 뷰에 동일 작용이라 exo/wrist 격차는 설명 못 함). wrist joint 기하는 중첩 마스킹/3뷰 동시 최적화로 재판정 필요.