$161, ~9,600콜, 모델당 4~6h (체크포인트 재개 가능)$80에 걸려 같은 날 353질의(47%) budget sweep(S3, $72.3)으로 대체 — 남은 406질의는 미실행53715b0)S1(v3 계약, n=18)에서 누출 제거를 확인했고 텍스트/시각 상보성을 발견했지만, 표본이 3편·18질의로 방향성 수준이었다. 다음 결정은 "이 신호를 전체 759질의(153편)로 확대해서 재현되는지 볼 것인가, 아니면 먼저 방법을 더 다듬을 것인가"였다. 초판 계획은 후자로 흘렀다: 전략 5개 중 약한 것을 걸러내고, 텍스트+시각 하이브리드를 새로 만들고, 별칭(alias) 처리를 ablation하는 "메서드 개발" 로드맵이었다.
a3ed0f7 초판 → dd7d9ee rescope).| 항목 | 방침 |
|---|---|
| 전략 집합 | 측정 조건이지 경쟁자가 아니다. 점수가 낮다고 제외하지 않는다 (rollforward-v2 유지) |
| 새 메서드 | 요청 없으면 만들지 않는다 (hybrid 보류) |
| 실패 분석 | 원인이 하네스면 수정, 원인이 모델이면 기록만 |
| 다음 단계 | "더 잘하게"가 아니라 "더 많이·더 공정하게 측정" |
하네스 결함 → 수정 완료: textlog가 outcome 5종을 뭉갬(낙하 사건 소멸) · floor를 방 축에 넣어 정답을 오답 처리 · (잔여) 방 이름 미유도 38건이 채점에서 빠짐
모델 한계 → 기록만: 시각 전략이 동일 인스턴스를 합쳐 multi 개수를 못 셈("Only one bowl appears in the memory") · 자필 노트(rollforward-v2)가 flash에서 blind 이하 · textlog가 distractor 질의에 무력
assert_no_episode_leak) + blind 대조군이 상시 감시260819-s3_budget_sweep.html 참조. 이 계획서는 그 축소판의 "원 스펙" 역할로 남는다.| 항목 | 계획(S2, 전량) | 실행(S3, budget sweep) |
|---|---|---|
| 질의 수 | 759 (100%) | 353 (47%, 분포 L1거리 0.016) |
| 비용 | $161 | $72.3 |
| 전략 수 | 5 (필터링 없음) | 5 (동일 원칙 적용) |
| 모델 수 | 2 (flash/sonnet) | 2 (동일) |
| 남은 질의 | — | 406 (53%, 미실행) |
① 방 이름 조인 확장 — 커밋 53715b0로 당일 구현. 미유도 답
38건 → 6건으로 감소(84%↓). S3 실행이 이 수정 이후에 돌았으므로 예산 표본 결과에
반영됨.
이 계획 문서의 핵심 가치는 실행된 숫자가 아니라 이후 모든 eval 라운드에 적용되는 원칙을 고정한 것이다 — 전략은 측정 조건이지 경쟁자가 아니므로 점수가 낮다고 빼지 않고, 새 메서드는 요청 없이 만들지 않으며, 실패는 원인이 하네스인지 모델인지로만 분기한다. 이 원칙이 없었다면 S1의 "flash에서 rollforward-v2가 blind보다 낮다"는 결과를 조용히 걸러내고 리더보드를 보기 좋게 만들었을 것이다.
동시에 이 계획은 예산이라는 외부 제약과 충돌했다 — $161 전량 계획이 $80 상한을 넘어서면서, 같은 날 분포 일치 표본으로 축소된 S3가 사실상의 실행판이 됐다. 계획과 실행의 괴리(759 → 353) 자체가 "계획은 스펙, 실행은 예산이 정한다"는 이 프로젝트의 실무 패턴을 보여준다.
계획에 명시한 하네스 작업 2건 중 1건(방 이름 조인)만 당일 완료됐고, body-id 사후 해소는 아직 수치가 없다. 전량 759질의 중 406질의(53%)가 여전히 미실행 상태로 남아 있다.