260406-260412 · 10-step roadmap update
Phase 1 (씬 설명) → Phase 2 (action triplet) → Graph Build → 4축 쿼리 엔진 → VQA 평가의 5단계 파이프라인. 이번 주는 Phase 1/2의 출력 품질을 v3 → v4로 한 단계 끌어올리고, QA 생성 + 평가 단계를 동시에 spec했다.
| Phase | 목적 | 상태 | 코멘트 |
|---|---|---|---|
| Phase 1 — 씬 설명 | 2초 간격 프레임 → action 감지 | ✅ 5/5 성공 | structured JSON 직접 추출 (전략 B) |
| Phase 2 — Action triplet | 0.5초 간격 → agent/instrument/patient | 🔄 3/5 성공 | 2/5 JSON 잘림 (Gemini thinking token) |
| Phase 1/2 프롬프트 v4 | P0 노이즈 제거 | ✅ 완료 | −47% object 노드 |
| Graph Build — JSON → NetworkX | structured JSON → 그래프 | ❌ 미구현 | graph_builder.py 작성 필요 |
| Entity resolution | object ID 동의어 통합 | ❌ 미구현 | P1, cutting_board/chopping_board 등 |
| Scene 노드 | 물리적 장소 클러스터링 | ❌ 미구현 | — |
| QA 생성 파이프라인 | 5단계 spec | ✅ 설계 완료 | 코드 미작성 |
| QA Feedback v1 | 부자연스러운 질문 식별 | ✅ 완료 | 3가지 corrective rule 정리 |
| 4축 쿼리 엔진 | Object/Action/Time/Space 쿼리 | ❌ 미구현 | — |
| VQA 평가 | QA 데이터셋으로 시스템 평가 | ❌ 미착수 | — |
처음에는 그래프에서 직접 QA를 추출할 계획도 검토했으나 자기 채점이 되므로 벤치마크로 무의미. Why: QA는 순수 VLM + 사람 검증으로 만들고, 그래프는 평가 시에만 사용하기로 결정.
원래는 entity_resolver 등 후처리 코드를 먼저 만들 계획이었지만, P0 (프롬프트 수정) 작업의 ROI가 압도적임이 확인됨 (−47% 효과). P1 코드는 P0가 못 잡는 잔여 노이즈에만 집중하기로.
| Step | 입력 → 출력 | VLM 호출 / 영상 | 비용 / 영상 |
|---|---|---|---|
| 1. 영상 분할 | video → 60s segments | 0회 | $0 |
| 2. Event Description | segment → time-indexed JSON | 10회 (10분) | $0.02 |
| 3-1. 구간 내 QA | description → L1/L2 QA | 10회 | $0.02 |
| 3-2. Cross-event QA | 인접 2~3 segment → L3 QA | 9회 | $0.02 |
| 4. Long-term QA | 전체 summary → L4 QA | 1회 | $0.01 |
| 5. 자동 검증 | QA 쌍 → valid/corrected | ~50회 | $0.05 |
| 10분 합계 | ~80회 | ~$0.12 |
| 마일스톤 | 예상 | 실제 | 코멘트 |
|---|---|---|---|
| v4 그래프 품질 | 04-10 | 04-09 | 1일 단축 |
| QA 파이프라인 설계 | 04-09 | 04-09 | 예정대로 |
| VQA Feedback v1 | — | 04-10 | 긴급 사이클 |
| QA 생성 코드 구현 | 04-13 | — | 다음 사이클 |
| graph_builder.py | 04-15 | — | — |