{"as_of":"2026-08-14T17:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:feeec455bb97635fba7a2da7ad322506d88a9ba1ac0923073e1a728fa4ffb70c","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:50:24.333801Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05703/citation-record","integrity":"/paper/2608.05703/integrity","json":"/paper/2608.05703/citation-record.json","paper":"/paper/2608.05703"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.227021Z","title":"A simple baseline for streaming video under- standing.arXiv preprint arXiv:2604.02317, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.227021Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:c386b8237227d7fe0cc0a0c836ca1d8aa4713e8f733f3ebda96a08f6a55f6169","observation_id":"3903d1a2-3c6e-4527-846d-a9016c6c01a5","resolution":{"observed_at":"2026-08-08T00:50:24.227021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.894729Z","title":"Improving patient safety through video monitoring.Rehabilitation Nursing, 2016","venue":null,"work_id":"02a55487-dbaf-4366-bf23-dabb275c2170","year":2016},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.231022Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:ead7698aa84568d44f60a71ed8fe5202d80d7417c38cf0bd948c7859c2571be3","observation_id":"4a577aba-f4ab-4436-a7bd-e48ce53a87ba","resolution":{"observed_at":"2026-08-08T00:50:24.898118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.885058Z","title":"Safefac: Video- based smart safety monitoring for preventing industrial work accidents.Expert Systems with Applications, 215:119397, 2023","venue":null,"work_id":"d1b2737f-b0a4-4e44-a721-96d2b3456d56","year":2023},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.234541Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:36a850e604eaa64a5065c3d568ff1ee408385288c4fb2398dbc52f078fe50283","observation_id":"3d2d6482-5087-4e89-a260-2cc3170b3b15","resolution":{"observed_at":"2026-08-08T00:50:24.888592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.875169Z","title":"When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis.Accident Analysis & Prevention, 219:108077, 2025","venue":null,"work_id":"ff13880d-d747-41ba-9745-a80edbfdaa82","year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.238171Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:04a4496ef71dbcc5c6c723aaf0bc4a93d415de3049b45973c64a12286d36d9cc","observation_id":"e43d4235-558d-4ad6-a9e2-38a61c0926f0","resolution":{"observed_at":"2026-08-08T00:50:24.878978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.241392Z","title":"Interactive language: Talking to robots in real time.IEEE Robotics and Automation Letters, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.241392Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:822bea57897764ac6422912bb967233aea690aa498e2ccc35c6f2d11f47196a9","observation_id":"59bbdf9c-5194-48aa-83eb-8cf564613e3a","resolution":{"observed_at":"2026-08-08T00:50:24.241392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-08-08T00:50:24.245044Z","title":"Robix: A unified model for robot interaction, reasoning and planning.arXiv preprint arXiv:2509.01106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.245044Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:a3bd75c808be88786cad160ea2c61fe3ce9c6fc3e56f49ae51c8705495fba5da","observation_id":"d3f2bba2-f884-4ca0-b96e-b336c4464c22","resolution":{"observed_at":"2026-08-08T00:50:24.245044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.248995Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.248995Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:d290680fefa7fd8e75b90cf092bb119b510f35e94b504c7fbbf22cc1bf7e111d","observation_id":"cf9a048d-fca0-417e-9c42-503fd413c479","resolution":{"observed_at":"2026-08-08T00:50:24.248995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.252135Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.252135Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:d03ccc20109749cedb3686896fe72f0a9e838aa27b9ee151294e32178a88d4f3","observation_id":"16ca9a20-18a1-4408-97c1-00812ad7e5aa","resolution":{"observed_at":"2026-08-08T00:50:24.252135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.255218Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.255218Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:28ee59a9bd50cb1dcfd8aa23faea4534d1ba395a4dda38128974f3af0173b3c8","observation_id":"4a18752b-f8f3-476c-8fc3-44a0b062ecc1","resolution":{"observed_at":"2026-08-08T00:50:24.255218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T00:50:24.258340Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.258340Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:d8f15fc36098c1ce6de41c324a473f4a4e36a3e39cb5341858c9527e9c14754d","observation_id":"82799247-ef52-46e2-b753-2b9232383c0f","resolution":{"observed_at":"2026-08-08T00:50:24.258340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-12T14:16:56.866074Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.00248","snapshot_observed_at":"2026-08-08T00:50:24.261792Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.261792Z"},"links":{"cited_paper":"/paper/2607.00248","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:92e272103cb61e108f8e64010d6df744ead852310b401b86c1e8e7ff0ee5769f","observation_id":"5664c91d-ae8f-429d-80cc-c56d7150b537","resolution":{"observed_at":"2026-08-08T00:50:24.261792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.842257Z","title":"GPT-Realtime-2: A multimodal speech-to-speech large language model","venue":null,"work_id":"c1330866-7353-442a-b930-6bd5600642d3","year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.265553Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:92c3a4b6b04d551379b552c826856aacc21dbcdd95a6bb2aeeb42819cd399507","observation_id":"2cf61a10-1d53-4a5e-8ab6-a20354a97fd1","resolution":{"observed_at":"2026-08-08T00:50:24.845727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04184","last_updated":"2026-04-05T16:53:46Z","snapshot_observed_at":"2026-08-14T11:57:19.486396Z","submitted_at":"2026-04-05T16:53:46Z","title":"AURA: Always-On Understanding and Real-Time Assistance via Video Streams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04184","snapshot_observed_at":"2026-08-08T00:50:24.268633Z","title":"Aura: Always-on understanding and real-time assistance via video streams","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.268633Z"},"links":{"cited_paper":"/paper/2604.04184","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:b7ef875cf36d05add7ebcdd014e2af976767d2c4f273d302b5f59ad5949fa51f","observation_id":"d37bf162-a569-4e01-a7bb-dff7f6b76b50","resolution":{"observed_at":"2026-08-08T00:50:24.268633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.272031Z","title":"Interaction models: A scalable approach to human-ai collaboration.Thinking Machines Lab: Connectionism, May 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.272031Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:b1028980bddcb1d2df02b246a586ac49ce429526fdeadd59bf8d9e98fb9474c5","observation_id":"c7eba5f1-b69a-48e8-b106-1c41ab5f84d9","resolution":{"observed_at":"2026-08-08T00:50:24.272031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.827083Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"3a1521d4-0d0b-4113-9ea5-c74673543c91","year":2024},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.275109Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:926818aa695beb0f34ecf1166d9777596f9226c38d9b3afde5921959aa417945","observation_id":"25ff5857-ae51-497e-8706-aeb77515ae2b","resolution":{"observed_at":"2026-08-08T00:50:24.830601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.278098Z","title":"Dispider: Enabling video llms with active real-time interaction via disentangled perception, decision, and reaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.278098Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:ea0d34d4bddf00a0189d3db53d4e9e2c5cafa56f9c38f199271e4b78e9e44c8b","observation_id":"58b7d634-87c6-41e9-8e3e-957ea1589e48","resolution":{"observed_at":"2026-08-08T00:50:24.278098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.281054Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.281054Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:4ee261d32a64dbc51bcb6b8fe60da22d94d9ed5849c12202767001e3b24bbc00","observation_id":"9c899d0e-caee-47dd-b09e-668c6d2f4c6b","resolution":{"observed_at":"2026-08-08T00:50:24.281054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.284148Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.284148Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:0a25be510799081d1e4921fb8ea788c4c75813dceb857aa134cf09de8d96d296","observation_id":"31843355-7f06-403b-bf30-c4f36e4b8725","resolution":{"observed_at":"2026-08-08T00:50:24.284148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.799177Z","title":"Omnimmi: A comprehensive multi-modal interaction benchmark in streaming video contexts","venue":null,"work_id":"123b722d-4b7c-4427-a7a6-85c208325de4","year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.286701Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:90c91dadc4475927314c404a895394f6523f61b24b7d6c55e9b0e35a22fda2e9","observation_id":"95b6604d-2dc4-4b75-9603-591c921618e6","resolution":{"observed_at":"2026-08-08T00:50:24.802600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27393","last_updated":"2026-04-30T04:05:43Z","snapshot_observed_at":"2026-08-11T08:01:37.262348Z","submitted_at":"2026-04-30T04:05:43Z","title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27393","snapshot_observed_at":"2026-08-08T00:50:24.289509Z","title":"Minicpm-o 4.5: Towards real-time full-duplex omni-modal interaction","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.289509Z"},"links":{"cited_paper":"/paper/2604.27393","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:472477269c992cbda51d2a722ac5a62e2f32b83011247e44dad91146d685f70e","observation_id":"e09a70cb-c01a-4f3b-9c2e-4c94e180ab8d","resolution":{"observed_at":"2026-08-08T00:50:24.289509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12262","last_updated":"2026-07-17T07:23:56Z","snapshot_observed_at":"2026-08-09T09:42:44.258435Z","submitted_at":"2026-03-12T17:59:51Z","title":"Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.12262","snapshot_observed_at":"2026-08-08T00:50:24.292417Z","title":"Video streaming thinking: Videollms can watch and think simultaneously.arXiv preprint arXiv:2603.12262, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.292417Z"},"links":{"cited_paper":"/paper/2603.12262","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:d3e1040abdb91ed62ad74c2d289a6f58ef2144ea3445618732ab249c60bfbd40","observation_id":"ce204b9c-a39a-47c6-85d5-c11a4fc3e4c7","resolution":{"observed_at":"2026-08-08T00:50:24.292417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.789836Z","title":"Streamforest: Efficient online video understanding with persistent event memory","venue":null,"work_id":"6040e220-800e-4533-9bee-32f6369541cf","year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.295249Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:1793f9343015c45e92534b74d7c9234aaad0e49c15ee92562d82c0fb5a3bd76e","observation_id":"a5a6a0bf-3362-4624-b25f-4bafb160593d","resolution":{"observed_at":"2026-08-08T00:50:24.793276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.297756Z","title":"Thinking in streaming video.arXiv preprint arXiv:2603.12938, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.297756Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:889c930370dd277834309195b5cfd61ad724a191720c12072b885d01d0a94f64","observation_id":"38847f93-255c-4b9f-bca7-8479eb977004","resolution":{"observed_at":"2026-08-08T00:50:24.297756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07512","last_updated":"2026-06-24T07:20:45Z","snapshot_observed_at":"2026-08-05T18:56:46.594974Z","submitted_at":"2026-06-05T17:59:21Z","title":"MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism","version":2},"cited_work":{"arxiv_id":"2606.07512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.07512","snapshot_observed_at":"2026-08-08T00:50:24.524643Z","title":"MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism","venue":"cs.CV","work_id":"799060f0-c5f0-455a-9766-0e1c998d814a","year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.300279Z"},"links":{"cited_paper":"/paper/2606.07512","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:ff7cc53e662054c594c4a954ee0be008dca58edd25c1e3cf9344259491862cb7","observation_id":"0ac28c44-b74b-405f-8d10-12b3a7cb4cf1","resolution":{"observed_at":"2026-08-08T00:50:24.531503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.303426Z","title":"Seeing, listening, remembering, and reasoning: A multimodal agent with long-term memory.arXiv preprint arXiv:2508.09736, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.303426Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:546e6fc6c84bb6c0e96320e113c260089d85076e7d8dd73ac3144d8990cd8d73","observation_id":"5ea62cd8-0878-4201-814c-69b47c0be8cf","resolution":{"observed_at":"2026-08-08T00:50:24.303426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.780628Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":"207a9198-8a86-4dec-9681-564a479ce1ce","year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.306535Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:c4d77ac8a4bc82b4aeb3cebf0eecdeca3e705f764ce06a8fb04827bd2147ecaa","observation_id":"b3ee4ad1-a74e-4d7e-8b8f-4b866dcd6611","resolution":{"observed_at":"2026-08-08T00:50:24.783779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18157","last_updated":"2026-07-03T16:53:00Z","snapshot_observed_at":"2026-08-11T14:24:23.632733Z","submitted_at":"2026-01-26T05:20:47Z","title":"Agentic Very Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18157","snapshot_observed_at":"2026-08-08T00:50:24.309568Z","title":"Agentic very long video understanding.arXiv preprint arXiv:2601.18157, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.309568Z"},"links":{"cited_paper":"/paper/2601.18157","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:206dcb8645bd4192a6f1a2f0304d27c2063a6527966a05efbd34b558389aa614","observation_id":"875285ee-8527-4e50-93f8-63a78aee8821","resolution":{"observed_at":"2026-08-08T00:50:24.309568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.771697Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.Advances in Neural Information Processing Systems, 37:28828– 28857, 2024","venue":null,"work_id":"b7136d45-bbcd-4932-872a-e0baff1b3c17","year":2024},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.312926Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:221963334cd0fd403f83e052679f51fbfae0cd69fb68b80c14996601e4968836","observation_id":"8c9e68c5-d467-4f3f-ab8a-4febd009af69","resolution":{"observed_at":"2026-08-08T00:50:24.774905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.762636Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":null,"work_id":"3178a1e1-a8a9-4c91-8f39-fe7dfe1b8b50","year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.315905Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:c72929ce27799d99faf1853027386478d797e3166dc86d9b9a79287216d5188e","observation_id":"ed3b5740-1506-43fb-91e7-877a7c3bfa18","resolution":{"observed_at":"2026-08-08T00:50:24.765627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.318968Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? InProceedings of the Computer Vision and Pattern Recognition Conference, pages 18902–18913, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.318968Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:ccca8ae7d4ae1e33286688f7cd33b4a1168fc3aec67e569391d49fa6c22d18d2","observation_id":"6fb8e054-2ff6-4dee-b9bd-0d52cc08a61f","resolution":{"observed_at":"2026-08-08T00:50:24.318968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.747857Z","title":"Online video understanding: Ovbench and videochat-online","venue":null,"work_id":"bd496da4-dd77-4275-a6b9-593ec5027cf7","year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.322017Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:3f33c86b644b39dd79afe8d5fb387cb73457e8217694218fcb3e3cf3b667ad0f","observation_id":"a4ed0abe-f650-4c8f-b88d-7ba8f15f0366","resolution":{"observed_at":"2026-08-08T00:50:24.751138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.737379Z","title":"Rtv-bench: Benchmarking mllm continuous perception, understanding and reasoning through real-time video.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":"87534b98-8a5c-4898-b71b-d8312102e744","year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.324946Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:481ef0d8ed6a5297d8af6f6c84bd47a31aa6d0620e3c205a4902b160d5509127","observation_id":"8f433c35-7286-413f-b921-3c0e9a8e6cd5","resolution":{"observed_at":"2026-08-08T00:50:24.741064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.725443Z","title":"Ost- bench: Evaluating the capabilities of mllms in online spatio-temporal scene understanding.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":"47ee815c-9d0f-4195-8e88-f2822932e760","year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.327981Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:c5f3125e14397d1863edea575012ceabf68a9061d9248d5f1ef48a0d3659da8c","observation_id":"5560658a-e2d9-403b-87c0-a50731452018","resolution":{"observed_at":"2026-08-08T00:50:24.729246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:50:24.330915Z","title":"Can vision-language models answer face to face questions in the real-world?arXiv preprint arXiv:2503.19356, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.330915Z"},"links":{"citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:fac6945a0477bb91bac0960d8574070bcbf24aa1f9898ad8b0f717c63410a603","observation_id":"9b00560a-cfbb-425a-bc4f-714bc25329e6","resolution":{"observed_at":"2026-08-08T00:50:24.330915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07177","last_updated":"2026-05-11T11:21:13Z","snapshot_observed_at":"2026-08-12T18:36:31.023736Z","submitted_at":"2026-05-08T03:16:08Z","title":"HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07177","snapshot_observed_at":"2026-08-08T00:50:24.333801Z","title":"what room number did the actress mention?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:24.333801Z"},"links":{"cited_paper":"/paper/2605.07177","citing_paper":"/paper/2608.05703"},"observation_digest":"sha256:843e42b3532344059060028525298ea3247e65057316ff69b41730ef8bef2fa3","observation_id":"e53c0b9f-8478-4534-8b78-99aab0de20cf","resolution":{"observed_at":"2026-08-08T00:50:24.333801Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05703","last_updated":"2026-08-06T07:46:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:35:22.793785Z","submitted_at":"2026-08-06T07:46:37Z","title":"StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2608.05703."}