Graph + QA Spec

Graph_VLM — QA Pipeline & Roadmap

260406-260412 · 10-step roadmap update

Steps10
완료3/10
10min Cost$0.12
VLM Calls80

Overall Vision

Phase 1 (씬 설명) → Phase 2 (action triplet) → Graph Build → 4축 쿼리 엔진 → VQA 평가의 5단계 파이프라인. 이번 주는 Phase 1/2의 출력 품질을 v3 → v4로 한 단계 끌어올리고, QA 생성 + 평가 단계를 동시에 spec했다.

Phase 체크리스트 (이번 주 갱신)

Phase목적상태코멘트
Phase 1 — 씬 설명2초 간격 프레임 → action 감지✅ 5/5 성공structured JSON 직접 추출 (전략 B)
Phase 2 — Action triplet0.5초 간격 → agent/instrument/patient🔄 3/5 성공2/5 JSON 잘림 (Gemini thinking token)
Phase 1/2 프롬프트 v4P0 노이즈 제거✅ 완료−47% object 노드
Graph Build — JSON → NetworkXstructured JSON → 그래프❌ 미구현graph_builder.py 작성 필요
Entity resolutionobject ID 동의어 통합❌ 미구현P1, cutting_board/chopping_board 등
Scene 노드물리적 장소 클러스터링❌ 미구현
QA 생성 파이프라인5단계 spec✅ 설계 완료코드 미작성
QA Feedback v1부자연스러운 질문 식별✅ 완료3가지 corrective rule 정리
4축 쿼리 엔진Object/Action/Time/Space 쿼리❌ 미구현
VQA 평가QA 데이터셋으로 시스템 평가❌ 미착수

이번 주 계획 변경

변경 1 — QA 생성을 그래프와 분리

처음에는 그래프에서 직접 QA를 추출할 계획도 검토했으나 자기 채점이 되므로 벤치마크로 무의미. Why: QA는 순수 VLM + 사람 검증으로 만들고, 그래프는 평가 시에만 사용하기로 결정.

변경 2 — P0 프롬프트 개선이 P1 코드 작업보다 우선

원래는 entity_resolver 등 후처리 코드를 먼저 만들 계획이었지만, P0 (프롬프트 수정) 작업의 ROI가 압도적임이 확인됨 (−47% 효과). P1 코드는 P0가 못 잡는 잔여 노이즈에만 집중하기로.

QA 생성 파이프라인 5단계 스펙

Step입력 → 출력VLM 호출 / 영상비용 / 영상
1. 영상 분할video → 60s segments0회$0
2. Event Descriptionsegment → time-indexed JSON10회 (10분)$0.02
3-1. 구간 내 QAdescription → L1/L2 QA10회$0.02
3-2. Cross-event QA인접 2~3 segment → L3 QA9회$0.02
4. Long-term QA전체 summary → L4 QA1회$0.01
5. 자동 검증QA 쌍 → valid/corrected~50회$0.05
10분 합계~80회~$0.12

Dependencies & Risks

Milestones

마일스톤예상실제코멘트
v4 그래프 품질04-1004-091일 단축
QA 파이프라인 설계04-0904-09예정대로
VQA Feedback v104-10긴급 사이클
QA 생성 코드 구현04-13다음 사이클
graph_builder.py04-15