Research Note

Temporal Scene Graph Memory for Egocentric VQA

Why this approach, what alternatives existed, what we chose and why
Graph VLM · 2026-04-08
Research Question

Egocentric 비디오에서 시간적으로 먼 이벤트에 대한 질문에 답하려면 어떤 memory 구조가 적합한가? 프레임 단위 VQA의 한계를 극복할 수 있는 구조적 memory representation은?

Related Work & Our Positioning

1. Frame-level VQA Rejected
GPT-4V, Gemini Vision
Method 질문 시점의 프레임(들)을 VLM에 직접 입력
Limit Context window 제한으로 장기 기억 불가. "5분 전 칼 위치"에 답하려면 수천 프레임 입력 필요 — 비용/속도 비현실적
우리와의 차이: 사전에 그래프로 요약 저장하여 질문 시점에 graph traversal만 수행. 프레임을 다시 읽지 않는다.
2. Video Summarization → QA Rejected
Text summary pipeline
Method 비디오를 텍스트로 요약한 후 QA 수행
Limit 요약 시 공간 관계(칼이 도마 위)와 상태 변화(whole → chopped) 정보 손실
우리와의 차이: 그래프가 spatial relation과 temporal state change를 구조적으로 보존. 자연어 요약과 달리 관계가 명시적 엣지로 표현됨.
3. Scene Graph Generation (SGG) Partial Adopt
Per-frame scene graph
Method 프레임 단위 scene graph 생성
Limit 프레임 간 object identity 추적 불가. 시간축 정보 없음.
채택 이유: 개별 프레임의 scene graph 아이디어를 차용하되, 시간축을 추가하여 temporal scene graph로 확장. SGG의 spatial triplet 구조는 유지.
4. EPIC-Fields (3D Reconstruction) Partial Adopt
SfM-based 3D reconstruction + camera pose
Method SfM으로 주방 전체 3D 재구성 + camera pose 제공
Adopt Camera pose를 entity resolution에 활용 (position distance 기반 object identity)
Reject 3D point cloud는 미사용 — 계산 비용 대비 이득 불분명 (future work)

Our Approach: Temporal Scene Graph + VLM

Core Idea

VLM으로 프레임 쌍에서 structured triplet 추출 → 시간축으로 연결된 graph 구축. Graph는 3종 노드(Object, Action, Keyframe)와 3종 엣지(spatial, participates, temporal)로 구성.

Why This Approach Is Better (Hypotheses)

  1. Structured memory — 자연어 요약 대비 공간/시간 관계가 명시적으로 표현됨. "칼이 도마 위에 있다"가 엣지로 존재하므로 hallucination 없이 검색 가능.
  2. Incremental — 스트리밍으로 그래프 확장 가능. 전체 비디오를 재처리할 필요 없이 새 프레임 도착 시 노드/엣지 추가.
  3. Queryable — Graph traversal로 복잡한 시공간 질문에 답변 가능. "셀러리를 자른 후 어디에 놓았는가?" → action node에서 temporal edge를 따라감.
  4. VLM leverage — Object detection 모델 학습 없이 VLM의 범용 인식 능력 활용. 도메인별 fine-tuning 불필요.

Technical Decisions

Decision Choice Alternative Rationale
VLM model Gemini 2.5 Flash GPT-4V, Claude Cost ($0.085/min), structured output quality, speed. 가격 대비 성능 최적.
Graph structure Object+Action+Keyframe Object+Relation only Action을 first-class node로 두면 "무엇을 했나" 질문에 직접 답 가능. Relation만으로는 temporal reasoning이 약해짐.
Entity resolution VLM dedup + Camera pos Embedding similarity, object detector Camera position이 가장 신뢰도 높았음. 실험으로 검증됨.
Scene nodes Removed (scene-free) Include scene hierarchy Scene 노드가 query를 복잡하게 만들고 정보량 대비 비용 높음. 제거 후 query 단순화 확인.
Sampling rate 2s intervals 1s, 0.5s, adaptive 2s가 cost/quality 균형점. 주방 action은 보통 2s 이상 지속. 1s는 중복 triplet이 급증.

Open Questions

References