{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:AS3H2SN5JCS7WD6GVXWSLC7XCS","short_pith_number":"pith:AS3H2SN5","schema_version":"1.0","canonical_sha256":"04b67d49bd48a5fb0fc6aded258bf714bac33798b340e032c63f54dde6001cf8","source":{"kind":"arxiv","id":"2503.00540","version":1},"attestation_state":"computed","paper":{"title":"Streaming Video Question-Answering with In-context Video KV-Cache Retrieval","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bolin Li, Fangxun Shu, Guanghao Zhang, Hao Cheng, Hao Jiang, Haoyuan Li, Shangzhe Di, Tao Zhong, Wanggui He, Zhelun Yu","submitted_at":"2025-03-01T15:53:33Z","abstract_excerpt":"We propose ReKV, a novel training-free approach that enables efficient streaming video question-answering (StreamingVQA), by seamlessly integrating with existing Video Large Language Models (Video-LLMs). Traditional VideoQA systems struggle with long videos, as they must process entire videos before responding to queries, and repeat this process for each new question. In contrast, our approach analyzes long videos in a streaming manner, allowing for prompt responses as soon as user queries are received. Building on a common Video-LLM, we first incorporate a sliding-window attention mechanism, "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.00540","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-03-01T15:53:33Z","cross_cats_sorted":[],"title_canon_sha256":"f266c7ae0520675c88e891d9c7c0f0f8b1b7acefd271acdcc7245a05bbdae132","abstract_canon_sha256":"f0353e0d48a751070b36a6f5ec50c7d6351bf4e3afaac6fdbdaec6558979b7a0"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:22:24.853818Z","signature_b64":"i9/qyy2GzjCBaOhy84lzQ+fo/k17HK6jJvOq+BFmFW32sHG+w84+1mdSvHH2fxjYN+UIj2gRZz0IL+DS2KNHCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"04b67d49bd48a5fb0fc6aded258bf714bac33798b340e032c63f54dde6001cf8","last_reissued_at":"2026-07-05T10:22:24.853287Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:22:24.853287Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Streaming Video Question-Answering with In-context Video KV-Cache Retrieval","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bolin Li, Fangxun Shu, Guanghao Zhang, Hao Cheng, Hao Jiang, Haoyuan Li, Shangzhe Di, Tao Zhong, Wanggui He, Zhelun Yu","submitted_at":"2025-03-01T15:53:33Z","abstract_excerpt":"We propose ReKV, a novel training-free approach that enables efficient streaming video question-answering (StreamingVQA), by seamlessly integrating with existing Video Large Language Models (Video-LLMs). Traditional VideoQA systems struggle with long videos, as they must process entire videos before responding to queries, and repeat this process for each new question. In contrast, our approach analyzes long videos in a streaming manner, allowing for prompt responses as soon as user queries are received. Building on a common Video-LLM, we first incorporate a sliding-window attention mechanism, "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.00540","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.00540/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.00540","created_at":"2026-07-05T10:22:24.853351+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.00540v1","created_at":"2026-07-05T10:22:24.853351+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.00540","created_at":"2026-07-05T10:22:24.853351+00:00"},{"alias_kind":"pith_short_12","alias_value":"AS3H2SN5JCS7","created_at":"2026-07-05T10:22:24.853351+00:00"},{"alias_kind":"pith_short_16","alias_value":"AS3H2SN5JCS7WD6G","created_at":"2026-07-05T10:22:24.853351+00:00"},{"alias_kind":"pith_short_8","alias_value":"AS3H2SN5","created_at":"2026-07-05T10:22:24.853351+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":19,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25658","citing_title":"Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25621","citing_title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07577","citing_title":"OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31557","citing_title":"EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2505.15269","citing_title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2511.18127","citing_title":"SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2511.14582","citing_title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2510.09608","citing_title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2511.21998","citing_title":"Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2601.01322","citing_title":"LinMU: Multimodal Understanding Made Linear","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2601.14724","citing_title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2602.22455","citing_title":"Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2603.20284","citing_title":"STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07575","citing_title":"Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03351","citing_title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24317","citing_title":"Don't Pause! Every prediction matters in a streaming video","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10060","citing_title":"Mosaic: Cross-Modal Clustering for Efficient Video Understanding","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07575","citing_title":"Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10060","citing_title":"Mosaic: Cross-Modal Clustering for Efficient Video Understanding","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS","json":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS.json","graph_json":"https://pith.science/api/pith-number/AS3H2SN5JCS7WD6GVXWSLC7XCS/graph.json","events_json":"https://pith.science/api/pith-number/AS3H2SN5JCS7WD6GVXWSLC7XCS/events.json","paper":"https://pith.science/paper/AS3H2SN5"},"agent_actions":{"view_html":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS","download_json":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS.json","view_paper":"https://pith.science/paper/AS3H2SN5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.00540&json=true","fetch_graph":"https://pith.science/api/pith-number/AS3H2SN5JCS7WD6GVXWSLC7XCS/graph.json","fetch_events":"https://pith.science/api/pith-number/AS3H2SN5JCS7WD6GVXWSLC7XCS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS/action/storage_attestation","attest_author":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS/action/author_attestation","sign_citation":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS/action/citation_signature","submit_replication":"https://pith.science/pith/AS3H2SN5JCS7WD6GVXWSLC7XCS/action/replication_record"}},"created_at":"2026-07-05T10:22:24.853351+00:00","updated_at":"2026-07-05T10:22:24.853351+00:00"}