{"as_of":"2026-08-06T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a4c13b1d02ffca247069b63c5002b8f41330c0ff66ecba395eec3312b4ad534","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T18:17:53.013043Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.19849/citation-record","integrity":"/paper/2606.19849/integrity","json":"/paper/2606.19849/citation-record.json","paper":"/paper/2606.19849"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:7aa179a99a8128c0a07f149748b50e5af790c114e09f42f8fbf4c71587775dc4","observation_id":"1fc1d94a-4226-4e22-b418-2282d55d60d7","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the 33rd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:53052959b1745a9104a3b0698e47d7d9d7079631f4a0dd30391cb09f4d159851","observation_id":"ef078e75-8586-4449-80ab-f9a63c9d4d4b","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-07-06T20:24:50.262766Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"cited_work":{"arxiv_id":"2501.13468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13468","snapshot_observed_at":"2026-07-04T03:19:29.878882Z","title":"Streaming video under- standing and multi-round interaction with memory-enhanced knowledge","venue":null,"work_id":"05bede93-84f8-4b7b-b6e5-10f6ff02394b","year":2025},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2501.13468","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:c2da7d1c8b637873106395f1dff030af4c052a42fbfc07a8fb4cb45edd66f553","observation_id":"ddcad86d-fe93-4418-b99d-a8e7fa07a6d4","resolution":{"observed_at":"2026-07-04T03:19:29.882474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:08c49631e72cd466641c7eef4dc4d28cce11e41d68a0bed88603ff6378d14783","observation_id":"2cbe530f-ceb4-4ee7-bac4-5fae17998bcf","resolution":{"observed_at":"2026-07-04T03:19:29.896742Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18269","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:08.172355Z","title":"Stream- ingtom: Streaming token compression for efficient video un- derstanding","venue":null,"work_id":"6530c90e-bd82-4d7a-bcc5-611c713645f1","year":2025},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:8653f91c0bc6f8505d629c02a9a8b8d4cfb24aa40379e9d0e355509be934bc10","observation_id":"75c77f7f-2ff9-4771-a1cb-1ba21544632b","resolution":{"observed_at":"2026-07-04T03:19:29.887628Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.00891","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:19:29.889686Z","title":"Accelerating streaming video large language models via hierarchical token compression","venue":null,"work_id":"a3ecdf36-13d0-4963-b6db-299a71d77fde","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:6f638da14913355f0f02eae60e8d0fd02212322cf02c147e07f0b873a4814075","observation_id":"cfe17f3b-533e-414d-967c-d09d07a4f21e","resolution":{"observed_at":"2026-07-04T03:19:29.892192Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:d3f3a2f95d616012c4cc5f2c3131d1c436453a4767512689de95e8d6bb3d40c3","observation_id":"34b52803-ebcc-4c94-a226-b43b4656d169","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:37d74f6ed54c0ce4de8656b917ff14208d1c861348cb4a8be0a8fd5dcb0123bc","observation_id":"29cdd8a3-f975-4ea7-8695-a8ff0e826c83","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:5bd8b5c49742c9cc15c82585fbeb4da81ed9265c25ce93c72aae834013b73dc0","observation_id":"f87648d6-4d35-4257-a0de-ceb9d9ab0506","resolution":{"observed_at":"2026-07-04T03:19:29.992600Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"IEEE Transactions on Neural Networks and Learning Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:9a04b62dae05dbc9c8bfbcb4f3f1b2d54650a85a6dd7b6ba9be01f85533b50bd","observation_id":"96963e74-64af-43a8-9300-e14b43a15fca","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:3f761aa9c1114f9be4eec5a01c5130f0682936953c9ed3a79e2027d44ef85156","observation_id":"92463c1f-5b6c-46c9-9181-fd0733883067","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:c3eb07e405096e88eb8b0b73aa063334b07516cedab12deda9fbe5f7c5dbc584","observation_id":"7afc38e7-e714-4364-b938-4bc588bfb0c3","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"IEEE Robotics and Automation Letters , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:faf8ca63d886424d846a41db4ed8b4b7889f1df47beb38eab566003215ae2db0","observation_id":"173dacb9-01c9-4106-833a-c2ef9a5cde78","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:210fa5820318d486113687ca23978ab2cf9064f70fe743b7878bfa8478cff64d","observation_id":"f0c8c0f8-3110-47c8-80ff-1722c02525d9","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:2ce89b10c53f520a394c9077c5cd5b2c70d4ff1b7797764c5d732e4193793c24","observation_id":"21f5c89b-a8db-4ada-90f4-c11548d2e178","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:ac4ed20a4af7f41ddd298bff7e1d9178171e7a434bccfd95906e37d1365a14a8","observation_id":"2482bbcb-bee1-4358-9786-ffb2835a7421","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-07-06T18:50:13.559866Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:23bd92ff4bf33f71511fede5465a03a4bc0278bbc27c69d0b249411e7de42258","observation_id":"cf97c963-6366-4263-830e-b9b627f77316","resolution":{"observed_at":"2026-07-04T03:19:29.901021Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":"2501.00574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-07-04T16:49:57.265026Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","venue":"cs.CV","work_id":"52ec7cb6-1ef6-4366-a43f-d4c13fce23ad","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:c2084bf2faa760fdfd6f233fd264ef18bcf63709d4a99e1b25f2397e16b20c73","observation_id":"a3eb1385-31d6-423c-b654-d54bef28fc13","resolution":{"observed_at":"2026-07-04T03:19:29.917353Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:a455d77742c2f47d895232f8b32610800f45cf1e220841d18400887deccb60d6","observation_id":"c2ac3790-e461-4c0c-9030-676d90e73d63","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08646","last_updated":"2025-03-30T05:25:58Z","snapshot_observed_at":"2026-07-06T20:05:28.003434Z","submitted_at":"2024-12-11T18:59:54Z","title":"StreamChat: Chatting with Streaming Video","version":2},"cited_work":{"arxiv_id":"2412.08646","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08646","snapshot_observed_at":"2026-07-04T03:19:29.954304Z","title":"Streamchat: Chatting with streaming video","venue":null,"work_id":"1a45af3b-5b7e-43d4-a428-8beac30141ce","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2412.08646","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:17a54bc9102f88fa629dad1d85c3b55f47d7b11509d0e4596d48e34b671d26ec","observation_id":"8f51edd8-6a78-4cf7-95ed-595404fffeed","resolution":{"observed_at":"2026-07-04T03:19:29.956581Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:b42ba71486adf55a3b08207c8601fb304768fee7d1bad4b2ccaddad9a07827eb","observation_id":"7d52ba81-dd25-4ff6-90c8-b0c8c41be390","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09387","last_updated":"2025-03-17T03:09:39Z","snapshot_observed_at":"2026-08-04T02:32:29.912243Z","submitted_at":"2025-03-12T13:30:40Z","title":"VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers","version":2},"cited_work":{"arxiv_id":"2503.09387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.09387","snapshot_observed_at":"2026-07-04T03:19:29.931063Z","title":"Yiqiao Jin, Qinlin Zhao, Yiyang Wang, Hao Chen, Kai- jie Zhu, Yijia Xiao, and Jindong Wang","venue":null,"work_id":"39e3d7fb-e3fb-41f5-b12c-32e8070c9b9b","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2503.09387","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:8bea5b8a5f52a3ca45b42bf4cddb6fe65ebb5e5df8ad67f57ffcb8996bac1dfd","observation_id":"8623104e-8fbf-445a-a8ac-08dc40e1f056","resolution":{"observed_at":"2026-07-04T03:19:29.933235Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":"2406.08085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-07-04T20:00:08.182505Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"f53e5fea-3444-480b-aa38-be98378c0ced","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:bef703db66d7941c0eb332d377ae8ad9a9dd974bc3323641d1ed128ee1662b6c","observation_id":"587d4ed6-2de8-4cf1-aff5-54b31c752bf1","resolution":{"observed_at":"2026-07-04T03:19:29.905981Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:47e6c826d0cdc07ce57a5403fa0531de48fa11b68019072f1e7af8d0fa77108b","observation_id":"f3d56aba-765b-46a0-a8d4-bc771247039b","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15717","last_updated":"2025-08-21T16:56:29Z","snapshot_observed_at":"2026-08-05T17:57:24.408444Z","submitted_at":"2025-08-21T16:56:29Z","title":"StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2508.15717","doi":"10.48550/arxiv.2508.15717","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streammem: Query-agnostic kv cache memory for stream- ing video understanding.arXiv preprint arXiv:2508.15717","venue":"ArXiv.org","work_id":"752bf839-d545-4378-a68d-4a958ba10cee","year":2025},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2508.15717","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:5027a5bc3243f9962c2a405982ed95c42c86901ace506d535c12f4d689a3a752","observation_id":"11599888-17d0-4323-832f-e6fb8103d1b0","resolution":{"observed_at":"2026-07-04T03:19:29.960321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-04T06:52:46.954992Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":"2412.09596","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-07-04T03:19:29.961741Z","title":"Internlm-xcomposer2","venue":null,"work_id":"cb73923b-ac69-41ed-96d6-8508ba1df8d0","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:4d50c58a51a726aa4649b4c90f3de51822fcbbb02d80c8f0d97b1092b27ecf16","observation_id":"d8002c6b-4f07-46a7-b86c-10a96f7a00a3","resolution":{"observed_at":"2026-07-04T03:19:29.964055Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:df6c895f11bed11e85ef6cb798a1876bd7888ce96bfbf7acfd4da5f417a75b4b","observation_id":"196ff7d6-de0b-4d9d-b129-80d684cad140","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":"2410.17247","doi":"10.48550/arxiv.2410.17247","metadata_source":"pith","pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","venue":"cs.CV","work_id":"ca5cea36-45c6-4d00-8408-14876a5d59c3","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:fc2bf1e77496946b5ab0a2474a1a549461943e09588d9f1a0e4a19afab19b4a6","observation_id":"3e9991d2-bb10-46f2-81ca-fead8404e23e","resolution":{"observed_at":"2026-07-04T03:19:29.921678Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":"2210.09461","doi":"10.48550/arxiv.2210.09461","metadata_source":"pith","pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Token Merging: Your ViT But Faster","venue":"cs.CV","work_id":"528509bc-2611-4e7f-a772-ea14d25b6dae","year":2022},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:aaa753a70538c759f638aeb643be33d463439d65b341c8b67a4a5c8aaad669bd","observation_id":"b90cbab9-42e6-4e48-a182-ad53b7479708","resolution":{"observed_at":"2026-07-04T03:19:29.985580Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:55ec708a54eaedc242f02ccfd36819b93ef9af56e35345cb265f5524716276b4","observation_id":"b4c2e5bb-5ad8-48a9-a6cc-e92223ff3957","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:66e3951c770a42d4a4600b60ab3df5bc71a3e07cc77b9d374b579ed043ec8333","observation_id":"6774e7e9-bbe3-41a6-ae2a-da04a729711b","resolution":{"observed_at":"2026-07-04T03:19:29.929448Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-07-06T21:36:35.142284Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-07-04T03:19:29.938511Z","title":"arXiv preprint arXiv:2506.03990 , year=","venue":null,"work_id":"9f7446a4-8c5a-4dea-b3ba-b307cabcb570","year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:f1555541893caab2270f82825a859a1390e611ff6b0986ee0feae5dd190c9b2b","observation_id":"3bcde7a0-8149-44a2-85f6-c3ce2e762161","resolution":{"observed_at":"2026-07-04T03:19:29.940719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:c2dfe51e86a297ab4f7790ad5d25ca064248b8abe26a1511cc5dd4d191b72ba4","observation_id":"6535d9c7-d42f-4f50-8ad3-de33390fdbae","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":"2410.17434","doi":"10.48550/arxiv.2410.17434","metadata_source":"pith","pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","venue":"cs.CV","work_id":"82f3cbed-22bb-41b5-b9c9-67304154cd52","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:0afd7015b188bae8abd9971b5f36c41de404aacd0e80299a12c21b9c1d452b5c","observation_id":"01b1a457-ab8f-4eac-ac0b-baa52b3e9208","resolution":{"observed_at":"2026-07-04T03:19:29.974860Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":"2406.02069","doi":"10.48550/arxiv.2406.02069","metadata_source":"pith","pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","venue":"cs.CL","work_id":"6317700d-f903-4ce1-8f53-b43cb146d48b","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:69e7483cad990a3044ce77d1fcbf17e4fcd0986e7430b6e8825e117a7e4b9dc8","observation_id":"45273a3d-31b5-4716-9edc-13812a00eb6d","resolution":{"observed_at":"2026-07-04T03:19:29.909699Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:7df788bb10347480fe0f4f7333124d777ba8cae28294bbff475fa71a2ebcb9db","observation_id":"e4264ae9-2682-4d21-8091-0a69b87d36ba","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:94eb169ab4d24d7f3ab8e502aff80e5ac2320c94cead402b5de5c65c5e4aa085","observation_id":"0db0c20e-db22-4fd9-a64e-b9a7e234c2f1","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:939e84a7ac210a3238e17304865ad427ed54f297920f01db2da12c0bec136c29","observation_id":"eaad0510-ca15-480a-98e2-647ee88a5d91","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05510","last_updated":"2025-03-27T17:40:09Z","snapshot_observed_at":"2026-07-06T20:18:58.432111Z","submitted_at":"2025-01-09T19:00:01Z","title":"OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?","version":2},"cited_work":{"arxiv_id":"2501.05510","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05510","snapshot_observed_at":"2026-07-04T03:19:29.950974Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding?","venue":null,"work_id":"aa3866ff-d08d-457f-be75-99b6b66be18f","year":2025},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2501.05510","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:575f871bf2deb4234a68b952a78ce4591b872067fa114152f9eba54ecd24629c","observation_id":"693ee081-db65-464a-b9b1-9cb3d0fbaeb2","resolution":{"observed_at":"2026-07-04T03:19:29.952804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:75deee0f7ec09bb95e436599c1e9e864b4b8cb27e8f6a38dffa9240cf865fe79","observation_id":"2ed2e3ba-811e-4a69-95ff-2bf800920e3b","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:cfc8cf9722cf088567e3d306d0d66badfaa5e98a153ce209f49d77019b03c1a4","observation_id":"0845474c-eb32-4d1f-9441-1a7740143a28","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:448bffc8b122aadbf21789f4cf0311a7bb0cca534058443412b89c8a1ff91a8b","observation_id":"e22c3dbd-30bb-4f2e-9ac5-8fcbbc96d28d","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08989","last_updated":"2025-08-12T14:57:03Z","snapshot_observed_at":"2026-08-05T21:18:50.938138Z","submitted_at":"2025-08-12T14:57:03Z","title":"KFFocus: Highlighting Keyframes for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":"2508.08989","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08989","snapshot_observed_at":"2026-07-04T03:19:29.942462Z","title":"arXiv preprint arXiv:2508.08989 , year=","venue":null,"work_id":"f5ad3785-9179-4cf2-8654-2bbc78aa0534","year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2508.08989","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:4e49c7eb2e030086e8730acc55bb647e121184c1d82ed6d9a100cabe45876d26","observation_id":"8ead382a-2da2-4b12-8d78-c80ca562edda","resolution":{"observed_at":"2026-07-04T03:19:29.944554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:95552289fdeb32906e33bfd0edd23013206d21b8adc2e147fbe0a0688578da1f","observation_id":"6d8d2735-6aa3-4bb2-9289-36540bdd9d4e","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.04592","last_updated":"2026-04-19T16:23:58Z","snapshot_observed_at":"2026-08-03T02:05:46.790260Z","submitted_at":"2026-03-04T20:37:30Z","title":"From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models","version":3},"cited_work":{"arxiv_id":"2603.04592","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.04592","snapshot_observed_at":"2026-07-04T03:19:29.934951Z","title":"From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models","venue":"cs.CL","work_id":"d9048665-1279-4be5-98c3-e4e5ce57a9da","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2603.04592","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:bc58d7bd3531f394d4ab3b511a0f0f8c46c95de199d60769a8f9dde24b227ead","observation_id":"db19ec13-44b0-46eb-8546-6b3e89e973d2","resolution":{"observed_at":"2026-07-04T03:19:29.936756Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.02872","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:19:29.969173Z","title":"arXiv preprint arXiv:2603.02872 , year=","venue":null,"work_id":"dba1b986-a2e1-46f9-97c7-dc2aceaac2bd","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:de212b84e0c4bb22824fef00715265af30bfa1dec3251f1995abb50c1a91d421","observation_id":"a68e089f-d2f5-4ebc-9ef4-8c5d671a53d6","resolution":{"observed_at":"2026-07-04T03:19:29.971334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.06843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:19:29.987267Z","title":"Speak While Watching: Unleashing true real-time video understanding capability of multimodal large language models","venue":null,"work_id":"10351395-4690-4a55-b47d-ea0514dfdfc3","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:f7d3cdaac52ac0ede9490023dea2b0dad8d035c863b66002a5cfc63807d16c98","observation_id":"6166ac83-c6b7-4e24-80fa-41b8e284bd8c","resolution":{"observed_at":"2026-07-04T03:19:29.989226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"2026 , publisher=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:5ab06296948c40d5cadf5999b02b3bf30fb8e8b392ab5777a7184fe4b513cd6c","observation_id":"182f0ac3-a389-4a62-8b86-5a227dadb77a","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.23699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:49:39.889908Z","title":"Hidrop: Hierarchical vision token reduction in mllms via late injection, concave pyramid pruning, and early exit","venue":null,"work_id":"6e7191a0-faa3-41e3-a327-715e69c5dbe5","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:8a2198a96c60eac27ccb347aad43078736625244474a9315d7d4c3c024aa30f5","observation_id":"22cff380-010e-475d-b9fa-0a04669a385b","resolution":{"observed_at":"2026-07-04T03:19:29.949430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"cited_work":{"arxiv_id":"2602.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07574","snapshot_observed_at":"2026-07-04T08:19:44.559138Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","venue":"cs.CV","work_id":"a6a24176-5e00-4f62-8080-29fda7e3709c","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2602.07574","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:dbc2be82db026f961d742519d6fb401b4fbe207aac7cb21c3dda903d7320e3f0","observation_id":"0ff9dad2-ab9e-4d4a-9b72-d7405e708a29","resolution":{"observed_at":"2026-07-04T03:19:29.982411Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13915","last_updated":"2025-04-10T17:13:08Z","snapshot_observed_at":"2026-07-06T21:11:39.503336Z","submitted_at":"2025-04-10T17:13:08Z","title":"Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding","version":1},"cited_work":{"arxiv_id":"2504.13915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13915","snapshot_observed_at":"2026-07-04T13:19:50.790416Z","title":"Memory-efficient streaming videollms for real-time procedural video understanding","venue":null,"work_id":"74bc44fa-7cf0-445e-a837-49c5d4faab49","year":2025},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2504.13915","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:833e0775437405ff2f569aff2c2c37a18dc079356e5247245ca6f846948b03bf","observation_id":"2c8e5c87-6ccb-4223-91dd-63bf3045848d","resolution":{"observed_at":"2026-07-04T03:19:29.979377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:9a9397f040c5b27389c45d6828857811c1c37e9dca00f187b987a1e113303941","observation_id":"cd428dcc-a918-47eb-beb4-5e637edbc8a5","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13707","last_updated":"2025-03-17T20:25:41Z","snapshot_observed_at":"2026-08-03T14:05:52.079179Z","submitted_at":"2025-03-17T20:25:41Z","title":"Long-VMNet: Accelerating Long-Form Video Understanding via Fixed Memory","version":1},"cited_work":{"arxiv_id":"2503.13707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13707","snapshot_observed_at":"2026-07-04T03:19:29.965898Z","title":"arXiv preprint arXiv:2503.13707 , year=","venue":null,"work_id":"af2cf224-8e73-418d-b4cd-d5ffd6835557","year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2503.13707","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:d3ac96121cf19a9b16a4f81c4b037c06b74647ee7074bd3111a86edb11f46dfd","observation_id":"1f195bc8-a584-4be3-80e2-4de01b3728fd","resolution":{"observed_at":"2026-07-04T03:19:29.967731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:17:53.013043Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:9ebfc7d2f79c80aa2e7d2d6071bb00986abc55c0fdbafa14acff1031282f9203","observation_id":"29df1547-5574-4afe-a0c4-a58b5637236a","resolution":{"observed_at":"2026-06-26T18:17:53.013043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12015","last_updated":"2022-02-24T10:56:17Z","snapshot_observed_at":"2026-07-06T12:41:14.674744Z","submitted_at":"2022-02-24T10:56:17Z","title":"Learning to Merge Tokens in Vision Transformers","version":1},"cited_work":{"arxiv_id":"2202.12015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.12015","snapshot_observed_at":"2026-07-04T05:09:36.498887Z","title":"Learn- ing to merge tokens in vision transformers","venue":null,"work_id":"1231d256-2489-42e5-a2ec-24a67c94a6d6","year":2022},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2202.12015","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:5333189d25ee8f167626125e958ff8f204062158b6036914ddcd0c5e854564a2","observation_id":"934e1f69-e30d-4e48-bf54-9d239a0a191a","resolution":{"observed_at":"2026-07-04T03:19:29.913691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25621","last_updated":"2026-05-25T09:23:19Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T09:23:19Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","version":1},"cited_work":{"arxiv_id":"2605.25621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25621","snapshot_observed_at":"2026-07-04T03:19:29.923486Z","title":"StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering","venue":"cs.CV","work_id":"6cbd4220-4dbe-4b3f-b384-5f1df4d42210","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2605.25621","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:204c14be608c92be661df6298bfb384d78e209340353df118eb70b6902c50844","observation_id":"b97ac6e8-80aa-4a3e-9e93-87bf007ccd4b","resolution":{"observed_at":"2026-07-04T03:19:29.925891Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":23,"parse_uncertain":0,"unresolved":27,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2606.19849."}