{"as_of":"2026-08-11T06:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f55629129d000fcd6e4f3234864a8b8644c19f610e26c70222e8ec13f3113dbe","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:27:17.092553Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T18:17:53.013043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T03:19:29.923486Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"cited_work":{"arxiv_id":"2605.25621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25621","snapshot_observed_at":"2026-07-04T03:19:29.923486Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","venue":"cs.CV","work_id":"6cbd4220-4dbe-4b3f-b384-5f1df4d42210","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-06T15:40:32.013079Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2605.25621","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:04f5ced1401013d448f2eff7e7e0bca7618333392fdff66650585c22b52f71f9","observation_id":"b97ac6e8-80aa-4a3e-9e93-87bf007ccd4b","resolution":{"observed_at":"2026-07-04T03:19:29.925891Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.25621/citation-record","integrity":"/paper/2605.25621/integrity","json":"/paper/2605.25621/citation-record.json","paper":"/paper/2605.25621"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:68bb461725906b52b1c8d8696623e5a217eaa9e42a8eb4e3343f686dafc3f098","observation_id":"169f237b-32aa-4abf-acba-d2b279e0472e","resolution":{"observed_at":"2026-06-29T22:34:02.128741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:8514cfafbc70ac9b47b53119cfec3a726240f3155d6772f539d4e946e8991928","observation_id":"c6ad0c3a-9735-4f59-938e-d003d854098a","resolution":{"observed_at":"2026-06-29T22:34:02.121593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:4b95f1bb8f50d05927b9f66b4b3cfaee86d40b521e12ec2d6293e6f4955e6474","observation_id":"40ab513a-9664-482d-980e-aab957d1e648","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:44a0ab01b269191d958aa11e4ef54475390de8e2148a62881f4a983a688f9959","observation_id":"6fdc9f69-c0c2-4913-a6df-6f964c446a6a","resolution":{"observed_at":"2026-06-29T22:34:02.120447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:724937e0ada6231b1dace019b9f7e874f99654e8c5f7f4664d14134b04b140af","observation_id":"cd1981c4-98dc-4c92-bbfd-a2c421f95181","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Online video understanding: A comprehensive benchmark and memory-augmented method.arXiv e-prints, pages arXiv–2501, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:550a0aac3c12ea93488550006ae2e3cf0e05acc0576a08aaee6f7e0cec912f90","observation_id":"b532b3e5-3fe4-413f-9725-37d5115e37c6","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00540","last_updated":"2025-03-01T15:53:33Z","snapshot_observed_at":"2026-08-07T17:37:08.261243Z","submitted_at":"2025-03-01T15:53:33Z","title":"Streaming Video Question-Answering with In-context Video KV-Cache Retrieval","version":1},"cited_work":{"arxiv_id":"2503.00540","doi":"10.48550/arxiv.2503.00540","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00540","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streaming video question-answering with in-context video kv-cache retrieval","venue":"ArXiv.org","work_id":"f9b28e0b-f48b-484b-a271-22ecec990b86","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2503.00540","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:49bbc548b92cdf8205691d1c61c0203b5670ad585637c35977975fc9cb8f7e3c","observation_id":"4a2f9743-d63c-4a06-8b9b-83b1964581a0","resolution":{"observed_at":"2026-06-29T22:34:02.124501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09086","last_updated":"2024-09-11T12:44:12Z","snapshot_observed_at":"2026-07-06T19:15:08.847236Z","submitted_at":"2024-09-11T12:44:12Z","title":"Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU","version":1},"cited_work":{"arxiv_id":"2409.09086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.09086","snapshot_observed_at":"2026-06-29T23:04:01.890632Z","title":"arXiv preprint arXiv:2409.09086 , year=","venue":null,"work_id":"a39835cb-5203-4c3f-8b16-617e876b482e","year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2409.09086","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:76671cfd8db840a8fe256bf563a7b0a9545683d692fbe8e0e6aaf3a9a8d8ad34","observation_id":"1e70f0f2-cf34-40c3-a958-22be8f4e8bf0","resolution":{"observed_at":"2026-06-29T22:34:02.112392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:07:17.387158Z","title":"Streamforest: Efficient online video understanding with persistent event memory","venue":null,"work_id":"32e5b409-8977-42f0-b368-7217e051f67d","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:d9061d45c8769512135809a0d52c030b7df296e2bbc0e6c371471fcd22e2fbcc","observation_id":"fa9a1958-b772-49d3-a5f3-6ec2c5b6113c","resolution":{"observed_at":"2026-06-29T22:34:02.117824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21334","last_updated":"2026-04-10T15:00:46Z","snapshot_observed_at":"2026-08-11T06:30:04.954877Z","submitted_at":"2025-12-24T18:59:36Z","title":"Streaming Video Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2512.21334","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21334","snapshot_observed_at":"2026-07-03T00:57:30.599699Z","title":"Streaming Video Instruction Tuning","venue":"cs.CV","work_id":"9ee3a429-617c-4c74-87ef-2facd67423f1","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2512.21334","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:a2865553e5e8e1a51ec3314e685cdcea8944aeb6946b6c429fff0db24c5a4075","observation_id":"44eee74d-88f2-4cdd-abf1-72cc66110158","resolution":{"observed_at":"2026-06-29T22:34:02.092580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Streammind: Unlocking full frame rate streaming video dialogue through event-gated cognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:3584dd31e6c9ecb5af1de2d1cbd77d1dee1598628679f1e2f40f4059bb2d5041","observation_id":"07960c7c-acc5-45c9-821e-b7b33dc352e9","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Dispider: Enabling video llms with active real-time interaction via disentangled perception, decision, and reaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:568823fc5e9b37956a8b40f40a6d389627d8802e905384f727144de5eb6b1e35","observation_id":"3635b394-98ac-450c-a418-0428ec103da1","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:07:12.766858Z","title":"Streamready: Learning what to answer and when in long streaming videos,","venue":null,"work_id":"61f5cb42-34c1-4d30-8a03-54fdd5a30f03","year":2026},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:56a9346888d441a722f28fab6c1ea2e101253337435e352361b6b010638fd9e6","observation_id":"73d34c97-5e41-49c6-96e1-f2106e8a44df","resolution":{"observed_at":"2026-06-29T22:34:02.078593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Videochat: Chat-centric video understanding.Science China Information Sciences, 68(10):200102, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:30ee4dc968e376fb5a98af6ffb48a333681d92f50acc97bf5aaaefadbbf05d4a","observation_id":"ebb1124c-d1f7-4a5f-a6b9-c12848310fb1","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:1a7eb03f92f3205d3157e4fc110bcd03862981d64fdfea5f2c4532546aeee64b","observation_id":"c2145412-cd14-4103-a20e-0fe4fcf48399","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:c948d282393ac233cebd54dc61dae43e485b64f516774db6ec43105ce6333b2b","observation_id":"8528f3dd-9cad-4af7-b93b-c19ef9be8b0a","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:0924394d7ad2dd8bcba2de2057fa39abcd618bb4461b7694d1eec4e229336ee4","observation_id":"97775ab4-3dc8-4782-b1cb-b56c8a7f21c2","resolution":{"observed_at":"2026-06-29T22:34:02.064876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:4232ca3c9401de792bd099c01c3fb6328ce783483392c841f4998eae8e2f810e","observation_id":"8c758867-2559-4d80-a7be-ec27ec704beb","resolution":{"observed_at":"2026-06-29T22:34:02.073382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Videollm-mod: Efficient video-language streaming with mixture-of-depths vision computation.Advances in Neural Information Processing Systems, 37:109922–109947, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:ccc1ac0893a72386553ba50420e19d907ee73785df6e9ce5e9ebb503ea58ebd2","observation_id":"ea00e0e8-bebe-40a9-8fff-6dd28c05a162","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Flash-vstream: Efficient real-time understanding for long video streams","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:6f2387bdd1ab6a0da8f8f414d24bb391ccf5abbbbb35399bc50fe4674a9720d9","observation_id":"54c6c3c8-1aea-418d-b4df-af03ab51a3ba","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Timechat-online: 80% visual tokens are naturally redundant in streaming videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:c7962ff9a9375c078dcb8dcfa10789e13ceb44b8f191f81037f9abca4fe16ae0","observation_id":"215ba10d-8f04-4e8e-8627-ef8e155eb9bd","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08646","last_updated":"2025-03-30T05:25:58Z","snapshot_observed_at":"2026-08-10T13:39:22.041993Z","submitted_at":"2024-12-11T18:59:54Z","title":"StreamChat: Chatting with Streaming Video","version":2},"cited_work":{"arxiv_id":"2412.08646","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08646","snapshot_observed_at":"2026-07-04T03:19:29.954304Z","title":"Streamchat: Chatting with streaming video","venue":null,"work_id":"1a45af3b-5b7e-43d4-a428-8beac30141ce","year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2412.08646","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:d2500efc8aa0e4a6dcdee75b682be21cab11d0694a1c82d6cae8c41e5dcf274e","observation_id":"a8aa3ef4-d219-4cc9-a7c0-609d51473a4a","resolution":{"observed_at":"2026-06-29T22:34:02.061005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15269","last_updated":"2026-04-23T12:54:38Z","snapshot_observed_at":"2026-08-10T22:50:24.267781Z","submitted_at":"2025-05-21T08:47:15Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","version":2},"cited_work":{"arxiv_id":"2505.15269","doi":"10.48550/arxiv.2505.15269","metadata_source":"pith","pith_arxiv_id":"2505.15269","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","venue":"cs.CV","work_id":"a00b4d7a-5adc-4855-89a1-5356dc946a85","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2505.15269","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:279d5b6304de65bbfbb23db87125161677eabeb7726e5846747a17b6397ac906","observation_id":"ef958bc4-8acd-42f4-a146-d42ff1e7cbc1","resolution":{"observed_at":"2026-06-29T22:34:02.052622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:03aa23ddc70f90a51eaa4ee604276f48ea36944ee7af6e59da88fd7134d93105","observation_id":"f970b990-1f10-43af-91a3-cf86e80520b0","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.10323","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:07:12.880048Z","title":"Roma: Real-time omni-multimodal assistant with interactive streaming under- standing,","venue":null,"work_id":"377bfb1e-2dfe-4661-9502-1dffb4e767ab","year":2026},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:bd66cbb493ad455746cb29b7668601d4c9745e1ec59be09f87586cb8c4818abe","observation_id":"14b4f96c-c2b2-4dda-9146-edf5da925d82","resolution":{"observed_at":"2026-06-29T22:34:02.060633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:8c5dff7e3bbf7e1329ea63cecb3f9d6096dd53d624fb45ec63eb90abd67eb271","observation_id":"5b25ed02-b6a7-4dd2-890b-464239b3ef4b","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? InProceedings of the Computer Vision and Pattern Recognition Conference, pages 18902–18913, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:ef9aededf6beae28e725aa1bb2b8f663bf06959610b6ae464dc66db3284f1a92","observation_id":"c724b174-a450-42e7-82c2-db9d94cf9fed","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2411.03628","doi":"10.48550/arxiv.2411.03628","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video un- derstanding","venue":"arXiv (Cornell University)","work_id":"caec985b-dd2d-4dbb-9199-d147732de99a","year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:b2979265cd1457325cbcd2be875f916e9aa08db33ed83eb64af2655b5673b0f1","observation_id":"ccc60d2c-bc99-4704-94b3-9b9082c406ef","resolution":{"observed_at":"2026-06-29T22:34:02.070102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-08-10T15:52:49.177380Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"cited_work":{"arxiv_id":"2501.13468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13468","snapshot_observed_at":"2026-07-04T03:19:29.878882Z","title":"Streaming video under- standing and multi-round interaction with memory-enhanced knowledge","venue":null,"work_id":"05bede93-84f8-4b7b-b6e5-10f6ff02394b","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2501.13468","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:8fb3686fb78c81df4e1d03f6066a1d69a47f182951d7468d3edef7d3cf9c7ed6","observation_id":"28611be7-b521-4a79-b59f-77353832f72c","resolution":{"observed_at":"2026-06-29T22:34:02.045071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Finevideo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:f20cc129d11e1830c0aa68bc7cfb279034bf809d036477031245b738ac004eb7","observation_id":"945b7361-df98-4827-b89a-4dbdaeeb8869","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:d155c8c1fe1e09f6c2654f0db9062d6ef57b6fdeb68912ec93ff3f93dbb3dee6","observation_id":"d2575b81-030b-4026-bfa4-cc35bcc6833b","resolution":{"observed_at":"2026-06-29T22:34:02.047325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19054","last_updated":"2026-06-28T06:24:45Z","snapshot_observed_at":"2026-07-13T22:13:00.259166Z","submitted_at":"2026-03-19T15:47:50Z","title":"Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding","version":2},"cited_work":{"arxiv_id":"2603.19054","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.19054","snapshot_observed_at":"2026-07-02T17:07:12.864692Z","title":"Em-Garde: A propose-match framework for proactive streaming video understanding","venue":"cs.CV","work_id":"23ed999f-9308-4f81-ac9e-823cb8ec0aa8","year":2026},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2603.19054","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:d09ee2df41655508a4e71c8627a3c0709b26933798ed1349e2f243ca1192b2ac","observation_id":"bc26f964-8476-4210-b91f-3110481eaaf7","resolution":{"observed_at":"2026-06-30T02:16:16.461780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:86fb1fe3c133294a0c6949f36d5fbd5ceb9a19e80293c086eefc904ad7b37431","observation_id":"e41eb15f-f198-48ec-8970-35862b1c854f","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:c4f0e256c254803932ebfbdc905aa571ffe9c34359949698982972640f5013da","observation_id":"1b8dcaf7-61a5-4e19-9c98-12c904288101","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":"2505.21374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-07-04T16:39:58.338552Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","venue":"cs.CV","work_id":"6d26f54b-33e5-4b18-86b0-7202ab41b867","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:aa94393fe07239f62ee2d5d34f4b3ce68f03403e6b922d35223fce4ff6168a4b","observation_id":"8b6961c6-fb28-48f4-87a0-972e1ae5cf3c","resolution":{"observed_at":"2026-06-29T22:34:02.050453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17862","doi":"10.48550/arxiv.2505.17862","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":"arXiv (Cornell University)","work_id":"8c7aec87-020f-4959-9199-7df8b9231cc4","year":2025},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:226b9958a6c7883ff5b70734f56f6621dd61e0fb4aa19164d1a364687cce6fbc","observation_id":"38b23bee-7f19-4a5a-9d59-0ec521497203","resolution":{"observed_at":"2026-06-29T22:34:02.063984Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:06c9368c71015715f022e44b5a0f819479b902b26cda515660343b4a7e346c3b","observation_id":"05debda2-f479-45aa-9e00-15ccd78d2c0e","resolution":{"observed_at":"2026-06-29T22:34:02.067305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-10T11:57:00.228306Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":"2408.15542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-07-04T00:29:15.346488Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":"5e709eaf-2719-4a1e-8ee6-1d5f6f1ac2fd","year":2024},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:7c99ae1c3e85310e78cc124c1a0ea85596627bafb0bb17785fb6930ab8ddd2ab","observation_id":"06199d9c-9c90-4ba0-bca6-6dfab8cdebb0","resolution":{"observed_at":"2026-06-29T22:34:02.071338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"•0-2: static setup; talking head; minimal motion; no meaningful props","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:cddbf721600c0e3cff1e74fcef35b82d19905bbc238b1b81efb47d31a1f38d6c","observation_id":"f5115b0c-5cb2-4f1f-8278-f26d90da003c","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"•0-2: fragmented; contradictory; scenes don’t connect; ASR unintelligible","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:1884f16c5f095ba06bd135d6f91fb9a897671ee9b406fb829d978b544a1bcd24","observation_id":"8606ab11-5a12-4b9d-9f2a-c29761d939f1","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"•0-2: mostly filler; few concrete entities; repetitive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:cd2848d9d997d3018987fe590916ee242190e5f1e0fb964df3658fdeeb8c4ce7","observation_id":"050c6f7e-1ecf-43d3-917b-ea00d0925d76","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"•0-2: unrelated (generic voiceover vs visuals); frequent mismatches","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:6301b160dc7e92f7b6420a3bef6b9de42d2d27952c046e8fc6078721bcef9219","observation_id":"f56556e7-284a-4721-8914-f08ec43eec89","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"video_uid","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:22c46753f08c85b45a8cd723b49bf0ee24e9426303f96d5c88892cf6b06c0db4","observation_id":"49d3bb98-7e57-4da3-846d-321cd6b9b0a7","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"<Yes> \" followed by the original assistant answer text. • Video path:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:65d25f523d1de726829df3f635b47db340039e8399f9b03c15a66de0ecb2ffdd","observation_id":"d5aac817-5dc7-4643-8d28-7ca760f85017","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T22:27:17.092553Z","title":"summary\",","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T22:27:17.092553Z"},"links":{"citing_paper":"/paper/2605.25621"},"observation_digest":"sha256:a2292b79217b208e0124c535658984bada369a4803cd6fd26336be91bd7e0bdc","observation_id":"389f07da-e2c4-4235-946a-7f76e1419e71","resolution":{"observed_at":"2026-06-29T22:27:17.092553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":20,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2605.25621."}