{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:AF4Z2JBRLYUYQSTIGKMYOCEACJ","short_pith_number":"pith:AF4Z2JBR","schema_version":"1.0","canonical_sha256":"01799d24315e29884a6832998708801276b6e86f30a1ebfe37f623297a260b6b","source":{"kind":"arxiv","id":"2406.08085","version":2},"attestation_state":"computed","paper":{"title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Haoji Zhang, Jiashi Feng, Jifeng Dai, Xiaojie Jin, Yansong Tang, Yiqin Wang, Yong Liu","submitted_at":"2024-06-12T11:07:55Z","abstract_excerpt":"Benefiting from the advancements in large language models and cross-modal alignment, existing multi-modal video understanding methods have achieved prominent performance in offline scenario. However, online video streams, as one of the most common media forms in the real world, have seldom received attention. Compared to offline videos, the 'dynamic' nature of online video streams poses challenges for the direct application of existing models and introduces new problems, such as the storage of extremely long-term information, interaction between continuous visual content and 'asynchronous' use"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.08085","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2024-06-12T11:07:55Z","cross_cats_sorted":[],"title_canon_sha256":"9e39f5009102ac0236491f2108ca1738e9c5271df20bdb4dcc1d514845ed0323","abstract_canon_sha256":"ee623902fad67b0c36335bcb7cabea523036d210c08f03f36377f72164d3e30b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:38:10.587490Z","signature_b64":"LfXvrGl7GxrHJMlQE+MHQtLmlXEPNvnxuF/WnKMqpbvsyQ6SxbdlYi4tw1xos5e8lFNgaypNm+2BcAi9NvjODg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"01799d24315e29884a6832998708801276b6e86f30a1ebfe37f623297a260b6b","last_reissued_at":"2026-07-05T08:38:10.586928Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:38:10.586928Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Haoji Zhang, Jiashi Feng, Jifeng Dai, Xiaojie Jin, Yansong Tang, Yiqin Wang, Yong Liu","submitted_at":"2024-06-12T11:07:55Z","abstract_excerpt":"Benefiting from the advancements in large language models and cross-modal alignment, existing multi-modal video understanding methods have achieved prominent performance in offline scenario. However, online video streams, as one of the most common media forms in the real world, have seldom received attention. Compared to offline videos, the 'dynamic' nature of online video streams poses challenges for the direct application of existing models and introduces new problems, such as the storage of extremely long-term information, interaction between continuous visual content and 'asynchronous' use"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.08085","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.08085/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.08085","created_at":"2026-07-05T08:38:10.586989+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.08085v2","created_at":"2026-07-05T08:38:10.586989+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.08085","created_at":"2026-07-05T08:38:10.586989+00:00"},{"alias_kind":"pith_short_12","alias_value":"AF4Z2JBRLYUY","created_at":"2026-07-05T08:38:10.586989+00:00"},{"alias_kind":"pith_short_16","alias_value":"AF4Z2JBRLYUYQSTI","created_at":"2026-07-05T08:38:10.586989+00:00"},{"alias_kind":"pith_short_8","alias_value":"AF4Z2JBR","created_at":"2026-07-05T08:38:10.586989+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":34,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25658","citing_title":"Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2606.24477","citing_title":"video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19849","citing_title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17360","citing_title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.20726","citing_title":"How Well Can Your Video Model Remember? Measuring Memory-Budget Trade-offs in Long Video Understanding","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17798","citing_title":"LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09547","citing_title":"Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07433","citing_title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06991","citing_title":"Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03100","citing_title":"Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation","ref_index":81,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03890","citing_title":"OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15054","citing_title":"LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27074","citing_title":"IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31598","citing_title":"Linear Scaling Video VLMs for Long Video Understanding","ref_index":79,"is_internal_anchor":false},{"citing_arxiv_id":"2411.02327","citing_title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2505.15269","citing_title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17065","citing_title":"PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17283","citing_title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17360","citing_title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2511.21998","citing_title":"Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2408.10188","citing_title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2512.21334","citing_title":"Streaming Video Instruction Tuning","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2601.14724","citing_title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2505.18719","citing_title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","ref_index":87,"is_internal_anchor":false},{"citing_arxiv_id":"2602.20913","citing_title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","ref_index":63,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ","json":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ.json","graph_json":"https://pith.science/api/pith-number/AF4Z2JBRLYUYQSTIGKMYOCEACJ/graph.json","events_json":"https://pith.science/api/pith-number/AF4Z2JBRLYUYQSTIGKMYOCEACJ/events.json","paper":"https://pith.science/paper/AF4Z2JBR"},"agent_actions":{"view_html":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ","download_json":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ.json","view_paper":"https://pith.science/paper/AF4Z2JBR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.08085&json=true","fetch_graph":"https://pith.science/api/pith-number/AF4Z2JBRLYUYQSTIGKMYOCEACJ/graph.json","fetch_events":"https://pith.science/api/pith-number/AF4Z2JBRLYUYQSTIGKMYOCEACJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ/action/storage_attestation","attest_author":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ/action/author_attestation","sign_citation":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ/action/citation_signature","submit_replication":"https://pith.science/pith/AF4Z2JBRLYUYQSTIGKMYOCEACJ/action/replication_record"}},"created_at":"2026-07-05T08:38:10.586989+00:00","updated_at":"2026-07-05T08:38:10.586989+00:00"}