{"as_of":"2026-08-05T23:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7879d5c77d7c1c618096a3f04d00d7c7af98e7ca3cafa32c63e2c4f202d83aa5","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T12:55:04.564442Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:24:16.121151Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T12:09:48.861966Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:2f1670bef2f373a390b801cb3560257f6fbbc6c2b5c91f35735ef81eb26866f7","observation_id":"a5039699-9c3f-488e-ae47-0640d570164f","resolution":{"observed_at":"2026-05-11T23:11:13.681304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:9ea13ba94090950b55e1beba2e836d4193c8eebfd473227d52ab8a30fe1cca46","observation_id":"9888cebf-3702-4571-b03c-8ec4b3f3ee2c","resolution":{"observed_at":"2026-05-11T03:50:56.380773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2605.31557","last_updated":"2026-06-01T11:50:06Z","snapshot_observed_at":"2026-07-06T23:40:42.277618Z","submitted_at":"2026-05-29T17:20:10Z","title":"EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T22:40:13.720341Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2605.31557"},"observation_digest":"sha256:2b77613ba7ec0a993511e8f1f3227efd9753955efae4cf8f62173bcb1f9de184","observation_id":"982963f1-25ae-4d72-bcbf-69094a119b62","resolution":{"observed_at":"2026-06-28T22:42:46.367821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2605.31598","last_updated":"2026-05-29T17:59:02Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:59:02Z","title":"Linear Scaling Video VLMs for Long Video Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T23:00:11.246232Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2605.31598"},"observation_digest":"sha256:7da6cb7527140c850ebaeed1a48dfa4a2021d9ee464e4e553119108a60d423b5","observation_id":"938730a4-2fad-4209-a227-1d726c4c523f","resolution":{"observed_at":"2026-06-28T23:02:46.250562Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2606.03890","last_updated":"2026-06-02T16:51:32Z","snapshot_observed_at":"2026-07-06T23:44:05.167767Z","submitted_at":"2026-06-02T16:51:32Z","title":"OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:07.122615Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2606.03890"},"observation_digest":"sha256:302cec678ab5f91045e2c6ac5a7a02dcec999e531decbae966cfbbd6b5a77a4a","observation_id":"63b23346-2c99-4ab1-b812-7df47e421337","resolution":{"observed_at":"2026-07-02T02:16:27.082560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2606.08615","last_updated":"2026-06-07T13:00:19Z","snapshot_observed_at":"2026-08-05T22:03:12.300616Z","submitted_at":"2026-06-07T13:00:19Z","title":"Harnessing Streaming Video in the Wild","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T18:47:55.910417Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2606.08615"},"observation_digest":"sha256:2021034822d491177ede9090a43b23395b9d54d3091f27d63c26b17302f77647","observation_id":"350146db-d5f0-4a42-82c9-553310b200d2","resolution":{"observed_at":"2026-07-02T22:37:25.699669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:08c49631e72cd466641c7eef4dc4d28cce11e41d68a0bed88603ff6378d14783","observation_id":"2cbe530f-ceb4-4ee7-bac4-5fae17998bcf","resolution":{"observed_at":"2026-07-04T03:19:29.896742Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2606.23581","last_updated":"2026-06-22T16:47:00Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:47:00Z","title":"Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-26T07:13:19.593093Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2606.23581"},"observation_digest":"sha256:99e04bae1f7e9c696e69884687bbef5b3e9b08c9cf2cbe273f2d2ced77c97984","observation_id":"311c7af6-c71b-4ebb-892b-1c9ec32b3021","resolution":{"observed_at":"2026-07-04T12:09:48.863194Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-08-02T05:40:49.468513Z","title":"Hermes: Kv cache as hierarchical memory for efficient streaming video understanding.arXiv preprint arXiv:2601.14724, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-03T10:51:28.799282Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:49.468513Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:41a80a309084d43946f2a44cfa6b4864a10d092f5988fe9550e7a03959834afe","observation_id":"1fab58bf-3224-4412-add9-4d877e13272f","resolution":{"observed_at":"2026-08-02T05:40:49.468513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-08-01T12:28:00.825262Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19547","last_updated":"2026-07-21T19:46:38Z","snapshot_observed_at":"2026-08-01T12:28:00.037667Z","submitted_at":"2026-07-21T19:46:38Z","title":"ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T12:28:00.825262Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2607.19547"},"observation_digest":"sha256:68455d877018c52e75b5dbd8403f405c344a00b0e7b253b34c3bf88730d4ef07","observation_id":"fd4feeb3-aec0-4ae2-bbb9-7012c9f0416f","resolution":{"observed_at":"2026-08-01T12:28:00.825262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-31T11:46:42.281851Z","title":"2601.14724 , archiveprefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24560","last_updated":"2026-07-27T15:31:23Z","snapshot_observed_at":"2026-07-31T11:46:35.203983Z","submitted_at":"2026-07-27T15:31:23Z","title":"EgoPlay: Event-Triggered Video Editing for Egocentric Streams","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-07-31T11:46:42.281851Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2607.24560"},"observation_digest":"sha256:4c464ed6d2a32c07378138b79eda23450d2c23015e816712e7fa9a025dfdff4a","observation_id":"545c03c7-662e-4940-ad74-f9d562effd61","resolution":{"observed_at":"2026-07-31T11:46:42.281851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-08-04T03:21:48.390988Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28312","last_updated":"2026-08-01T16:00:11Z","snapshot_observed_at":"2026-08-05T23:21:49.581608Z","submitted_at":"2026-07-30T14:47:00Z","title":"ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T03:21:48.390988Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2607.28312"},"observation_digest":"sha256:f09d7d65f61b1b3efae326c42ced34b7121ddcef93ac300324af684d0b99b67e","observation_id":"b6646d2c-2b96-4cac-90eb-6ff616bfe3d6","resolution":{"observed_at":"2026-08-04T03:21:48.390988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-08-04T17:24:16.121151Z","title":"2601.14724 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01980","last_updated":"2026-08-03T09:42:42Z","snapshot_observed_at":"2026-08-05T23:27:54.290658Z","submitted_at":"2026-08-03T09:42:42Z","title":"AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T17:24:16.121151Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2608.01980"},"observation_digest":"sha256:db7116014af2783bcbb8ad2c5e4827a77eecab8d5321e20e8a6671db1fb690c8","observation_id":"2841afe3-39a4-481c-bd96-9094add4e35c","resolution":{"observed_at":"2026-08-04T17:24:16.121151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.14724/citation-record","integrity":"/paper/2601.14724/integrity","json":"/paper/2601.14724/citation-record.json","paper":"/paper/2601.14724"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"c3bbe461-e9e3-4e2f-874f-90b481778be5","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:fb81c0c2ef6c06c76b071725d24bd9f240cc53219e43e27c3e397b6ea89ff3c5","observation_id":"eeefd53d-e0b5-4f98-8fbf-e0017f999331","resolution":{"observed_at":"2026-05-16T12:57:54.430090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Atkinson and R.M","venue":null,"work_id":"6e39df9b-c074-410a-8b9e-4e280dc28a05","year":1968},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:b262ec63f1f9e08a6079eac101adf7bcec50a9c4958982636f9ce959e1c1a80a","observation_id":"6c73279b-806e-4a4d-9a57-9db91dd32821","resolution":{"observed_at":"2026-05-16T12:57:54.432800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bf4a86f4-bdae-411f-9079-c762cda0a064","year":null},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:672d6d4209a9c57f2f8e7bcc1eb4e02298b34be4a4a23689c6106b27176a1145","observation_id":"2c83fdc4-308f-4cb9-9b94-ed37b14cfb63","resolution":{"observed_at":"2026-05-16T12:57:54.448507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Baddeley and Graham Hitch","venue":null,"work_id":"7912514d-d174-477c-8baa-b8d42810d544","year":1974},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:6e63c4c2dd0bbfc24fced20151c2fb5e12f247030512659c0b0ef66ab27acd7f","observation_id":"cabb502f-7ce8-4f7c-92e6-20e31458f223","resolution":{"observed_at":"2026-05-16T12:57:54.420947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:494d3b279c6ce8b2bd1928152e9cc6645c345fec47252c18508627549d5bd457","observation_id":"70df9ede-de91-42c0-a414-7f8b96845227","resolution":{"observed_at":"2026-05-16T12:57:53.908356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:d8bf8a549b54539fed8c2f6f74d8fb7fea4917b29993ce880dfb489770ceb4a0","observation_id":"c030607d-b495-451c-b085-053afa3546d3","resolution":{"observed_at":"2026-05-16T12:57:53.971715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":"2501.00663","doi":"10.1016/j.est.2015.06.001","metadata_source":"pith","pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Titans: Learning to Memorize at Test Time","venue":"cs.LG","work_id":"fb2b7625-b733-43cb-af52-00b0a31a8d7f","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:f6118c29c8560cb010c5a2bb546170a85d6dc4536d6418b003c03dfb31e3d9b0","observation_id":"007cc5c6-158d-4843-96b9-1e82af710733","resolution":{"observed_at":"2026-05-16T12:57:53.975270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T06:55:03.802588+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T06:55:03.802588+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11816","last_updated":"2024-06-17T17:55:32Z","snapshot_observed_at":"2026-08-02T08:01:10.902033Z","submitted_at":"2024-06-17T17:55:32Z","title":"VideoLLM-online: Online Video Large Language Model for Streaming Video","version":1},"cited_work":{"arxiv_id":"2406.11816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11816","snapshot_observed_at":"2026-07-01T22:26:17.921497Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"509ce1d6-0f20-40a9-bd70-d14e2dfd5a5e","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2406.11816","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:19198707fb3477368f54ac31276a134a942802a4bdf1e83226f2bf54cac5aae2","observation_id":"fed96e5a-87f0-4260-884c-d4087dd1756b","resolution":{"observed_at":"2026-05-16T12:57:53.856695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18269","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:08.172355Z","title":"Stream- ingtom: Streaming token compression for efficient video un- derstanding","venue":null,"work_id":"6530c90e-bd82-4d7a-bcc5-611c713645f1","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:ece6a8bc7f7481b89081892d15f6160b7237540d309c2ea5c7f0b26d8566a6c6","observation_id":"34e9df43-e14f-445a-96b6-6be4e86c103a","resolution":{"observed_at":"2026-05-16T12:57:53.882760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:03:41.183496Z","title":"arXiv preprint arXiv:2511.07278 , year=","venue":null,"work_id":"54042d36-b4f6-4098-8710-7be74e9835dc","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:900495e5f7e76c71e464b5fa5fc6ff10b86420f02367a521fe2373220455a9c7","observation_id":"2ef11b82-c427-48f5-a06a-29a9c2e1e9ae","resolution":{"observed_at":"2026-05-16T12:57:53.823325Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:6bcce3daa432f99684d0fac5201eb953cffd4ee6497a9f6896ecc337935116a7","observation_id":"44b267b5-78da-4a54-98f9-d17b9143b795","resolution":{"observed_at":"2026-05-16T12:57:53.921405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:6ffa8f63e4f0082fbc8e08af0a70ed68fa613ee4531e03e16e49713a961643fc","observation_id":"feca7946-f607-4e82-9756-6fe719286aea","resolution":{"observed_at":"2026-05-16T12:57:53.900078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:33606fc96b51e83a325a8d5fb8c5dae62123275a512d80a0a93718372c82dd21","observation_id":"3db7d4dd-4193-4ee2-af66-4d7f950becb9","resolution":{"observed_at":"2026-05-16T12:57:53.895827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00540","last_updated":"2025-03-01T15:53:33Z","snapshot_observed_at":"2026-08-04T22:38:58.974464Z","submitted_at":"2025-03-01T15:53:33Z","title":"Streaming Video Question-Answering with In-context Video KV-Cache Retrieval","version":1},"cited_work":{"arxiv_id":"2503.00540","doi":"10.48550/arxiv.2503.00540","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00540","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streaming video question-answering with in-context video kv-cache retrieval","venue":"ArXiv.org","work_id":"f9b28e0b-f48b-484b-a271-22ecec990b86","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2503.00540","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:014a6ea323f2d06d862bf6c41e250bb20f85db0a4bc02dcac54ae6710530c3f9","observation_id":"fdac2be5-65b6-448f-8898-94b65a3e1724","resolution":{"observed_at":"2026-05-16T12:57:53.956540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memory: A contribution to experimental psychology","venue":null,"work_id":"da1baad8-218d-4455-8d85-2a53fee30aa7","year":2013},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:a789ff9fc5ff15a669c8b920944b7eb6878e64abb49d9ef5d4ca1ea90c2e5c85","observation_id":"82104efb-e7b6-4c6a-a83f-034e1cac68d2","resolution":{"observed_at":"2026-05-16T12:57:54.438105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos","venue":null,"work_id":"6d1e1c14-aa21-40c9-8086-95b8438374d7","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:e74d1daa54118862ad9d3f3cd7bca86dd93f2793953a1d79e08d910543c61347","observation_id":"890803af-01d2-449c-a2f7-626978946bee","resolution":{"observed_at":"2026-05-16T12:57:54.427366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:4370a797b30db7866c4498467cd5dfc996b6e4452afab45fcd5b64463bb5272b","observation_id":"58748ca8-f6e4-4b6f-88d7-5929ef0962e8","resolution":{"observed_at":"2026-05-16T12:57:53.964477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07058","last_updated":"2022-03-11T19:40:26Z","snapshot_observed_at":"2026-07-06T11:57:42.646453Z","submitted_at":"2021-10-13T22:19:32Z","title":"Ego4D: Around the World in 3,000 Hours of Egocentric Video","version":3},"cited_work":{"arxiv_id":"2110.07058","doi":"10.48550/arxiv.2110.07058","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07058","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2110.07058 , eprint =","venue":"arXiv (Cornell University)","work_id":"870f2932-8d10-46fc-84f8-b9e0152acc94","year":2022},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2110.07058","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:186789a6358881f66258c897a168a26a428bc656ae11fa59a2661ed38f97e7ae","observation_id":"8c87d7b7-da7a-4fbd-8e8c-70ae44d96a13","resolution":{"observed_at":"2026-05-16T12:57:53.819073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:b6e3dc84679ea321c4b2d67e7c1147c1284011976890d6b448c51767562c96ad","observation_id":"e019c0bd-8595-4c25-bb6d-e3170c9cace1","resolution":{"observed_at":"2026-05-16T12:57:53.982616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13564","last_updated":"2026-01-13T09:33:57Z","snapshot_observed_at":"2026-07-30T04:57:05.391864Z","submitted_at":"2025-12-15T17:22:34Z","title":"Memory in the Age of AI Agents","version":2},"cited_work":{"arxiv_id":"2512.13564","doi":"10.48550/arxiv.2512.13564","metadata_source":"pith","pith_arxiv_id":"2512.13564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Memory in the Age of AI Agents","venue":"cs.CL","work_id":"1ff75a14-302e-4906-aa86-1f96fbcf12ff","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2512.13564","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:235c816a769a9b10bd8e5700457ba2c580488f3f51718a414042f81586645be2","observation_id":"b3f5d12b-8e79-4b6f-adec-88619d778632","resolution":{"observed_at":"2026-05-16T12:57:53.943809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10937","last_updated":"2020-07-21T16:54:33Z","snapshot_observed_at":"2026-07-06T09:40:39.700392Z","submitted_at":"2020-07-21T16:54:33Z","title":"MovieNet: A Holistic Dataset for Movie Understanding","version":1},"cited_work":{"arxiv_id":"2007.10937","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.10937","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movienet: A holistic dataset for movie under- standing","venue":null,"work_id":"62fda0ae-6f48-45ea-8741-79cc015e0fee","year":2020},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2007.10937","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:922b04422e491f6f0287ca8b2a5435e8bd937817b61c8d54542355b85db2d628","observation_id":"596cf76f-bcf8-490d-bce8-5565ccfad14c","resolution":{"observed_at":"2026-05-16T12:57:53.960327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01518","last_updated":"2024-10-02T13:09:41Z","snapshot_observed_at":"2026-07-06T19:26:02.193680Z","submitted_at":"2024-10-02T13:09:41Z","title":"InfiniPot: Infinite Context Processing on Memory-Constrained LLMs","version":1},"cited_work":{"arxiv_id":"2410.01518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.01518","snapshot_observed_at":"2026-07-01T08:15:31.567977Z","title":"Infinipot: Infinite context processing on memory-constrained llms","venue":null,"work_id":"e2c7f16f-d47c-4794-838f-50eb65ab8594","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2410.01518","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:3fa716fbc458e385a2771b11d765a2b0270e6d5aa97c155d390080f7c45af50e","observation_id":"51394f83-e005-4531-a029-9c6a5146d345","resolution":{"observed_at":"2026-05-16T12:57:53.827708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.15745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.347155Z","title":"Infinipot-v: Memory-constrained kv cache com- pression for streaming video understanding","venue":null,"work_id":"798f7dbf-55e6-44c0-9508-6aec9da8c639","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:f0d27cdca1da4edb63b4f0ec03c1b107ee746e7952fb5a9f4cabcd4159b6d214","observation_id":"f2b325d0-b592-4242-a870-d8a998c63cca","resolution":{"observed_at":"2026-05-16T12:57:53.891568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":"481d0e96-78ef-4870-890b-2feb6ba7f68e","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:0c0d3f0be55e81c8234f65e9991c6eb260e51a53c084145e6466dd8c8b1a725c","observation_id":"fdb428ea-cf70-4938-a36a-6c4ecb1ab4d4","resolution":{"observed_at":"2026-05-16T12:57:54.445564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":"2311.17005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-07-04T08:29:41.281374Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","venue":"cs.CV","work_id":"4ada183a-2d55-48d4-b8b7-a491b95e490e","year":2023},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:3f2ee301caffee3b3f0224fb990869fed1316a5e0e53ed5e236aff953b291036","observation_id":"dec76cd9-6cc1-4bdc-b315-c7a48ee6782e","resolution":{"observed_at":"2026-05-17T20:22:35.388231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05510","last_updated":"2025-03-27T17:40:09Z","snapshot_observed_at":"2026-07-06T20:18:58.432111Z","submitted_at":"2025-01-09T19:00:01Z","title":"OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?","version":2},"cited_work":{"arxiv_id":"2501.05510","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05510","snapshot_observed_at":"2026-07-04T03:19:29.950974Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding?","venue":null,"work_id":"aa3866ff-d08d-457f-be75-99b6b66be18f","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2501.05510","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:204f6cf4a8c6683f79d06d9c243a1bb485460361cfedef2231718383d7dd36eb","observation_id":"64639c42-d365-455b-84b7-b22b794da0bd","resolution":{"observed_at":"2026-05-16T12:57:53.869588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:4d57789ed729188ba9ae38bdc5637e614f15fb09dbfd7740b5e6ae8c91af773f","observation_id":"03fd888e-7c74-439c-9582-e6d7ba631392","resolution":{"observed_at":"2026-05-16T12:57:53.836328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video understanding","venue":null,"work_id":"c44d8294-9a4d-4d0f-86ad-a9b22aee103c","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:055708cc75437888dc84079bccbf996388e2609a827d6a99dc6c75088b5de5f0","observation_id":"0e4d39fc-a2c3-4992-a246-21e09a9af8df","resolution":{"observed_at":"2026-05-16T12:57:54.435515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge","venue":null,"work_id":"c7f3e3cb-75f0-4ff0-a6db-6b84ff6dba58","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:157b094c48979963db7972442cd8421728e789b257dafd731f98038ca1046a38","observation_id":"3db1b08f-2d8b-4279-a72b-1e0636a1f15b","resolution":{"observed_at":"2026-05-16T12:57:54.424701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":"2408.15542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-07-04T00:29:15.346488Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":"5e709eaf-2719-4a1e-8ee6-1d5f6f1ac2fd","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:a6cf8915ba5cf08a456678930dba685165099f8dd06c21c67ae46682f4a20b5f","observation_id":"8313bc12-2f58-443d-87b3-565b183979ff","resolution":{"observed_at":"2026-05-16T12:57:53.873910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-07-06T16:07:21.951225Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:149537ba78a2e637815a7adb5d13f102da80d456e2c367b759048b7d67ca85db","observation_id":"86434552-e4a1-40e7-b298-5d29ddd11a74","resolution":{"observed_at":"2026-05-16T12:57:53.948203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15269","last_updated":"2026-04-23T12:54:38Z","snapshot_observed_at":"2026-08-03T01:07:06.468931Z","submitted_at":"2025-05-21T08:47:15Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","version":2},"cited_work":{"arxiv_id":"2505.15269","doi":"10.48550/arxiv.2505.15269","metadata_source":"pith","pith_arxiv_id":"2505.15269","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","venue":"cs.CV","work_id":"a00b4d7a-5adc-4855-89a1-5356dc946a85","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2505.15269","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:a7eccf8490ff09f1551c8b412311d27559e054fe879ba639509723134f75b555","observation_id":"5ed47c81-1051-40a5-a7c8-62837a2f8c0b","resolution":{"observed_at":"2026-05-16T12:57:53.904250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:96aa9e76b77ce622d825a3b6cd51f6ee0be19b7474be3f479611d44688345274","observation_id":"6e6375ef-3606-4b64-862d-c524d1fb7b6e","resolution":{"observed_at":"2026-05-16T12:57:53.848782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-03T06:31:15.541423Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":"2310.08560","doi":"10.48550/arxiv.2310.08560","metadata_source":"pith","pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemGPT: Towards LLMs as Operating Systems","venue":"cs.AI","work_id":"2698f5ad-c84c-40ca-b839-0912dae10ba2","year":2023},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:3e707929799751f980a766b78b2e31ff7f5dda11ee644279528b579c01be6d3d","observation_id":"f4e937ae-bb78-4de8-a3ae-2459881d3ccc","resolution":{"observed_at":"2026-05-16T12:57:53.840439Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:35.543803+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13786","last_updated":"2023-10-30T18:35:48Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:54:37Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2305.13786","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13786","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"84bc36aa-86b0-4ad1-aa2e-7dda96d156fc","year":2023},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2305.13786","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:02a79907f5a799e3ba73925c2d8c28c7903323d8f34816a614291b5ca1760518","observation_id":"3c68a8dd-bae2-424e-9ef6-57b524686eb7","resolution":{"observed_at":"2026-05-16T12:57:53.852870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03218","last_updated":"2025-01-06T18:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2025-01-06T18:55:10Z","title":"Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction","version":1},"cited_work":{"arxiv_id":"2501.03218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03218","snapshot_observed_at":"2026-07-01T22:26:17.926283Z","title":"Dispider: Enabling video llms with active real-time interaction via disentangled perception, decision, and reaction","venue":null,"work_id":"ddebbf8f-fd3e-4972-adce-027205da1952","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2501.03218","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:56b457b80aba1f4c0632a89215c58a17338ee32eb8bdf0f3cf355fefd4366031","observation_id":"6362aea4-172e-4120-8ee6-f36894c11b30","resolution":{"observed_at":"2026-05-16T12:57:53.912952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.02808","last_updated":"2016-04-11T06:44:53Z","snapshot_observed_at":"2026-08-04T12:37:06.527185Z","submitted_at":"2016-04-11T06:44:53Z","title":"NTU RGB+D: A Large Scale Dataset for 3D Human Activity Analysis","version":1},"cited_work":{"arxiv_id":"1604.02808","doi":"10.48550/arxiv.1604.02808","metadata_source":"pith","pith_arxiv_id":"1604.02808","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NTU RGB+D: A Large Scale Dataset for 3D Human Activity Analysis","venue":"cs.CV","work_id":"31c355d2-43b3-4b7e-83d0-866754c3ba84","year":2016},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/1604.02808","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:a558cbf68d302485a4efc485d48dca89cdbc18138d8e7bf4ac1185390794cb0b","observation_id":"9036f4a4-0d06-4363-b275-d80103f7e919","resolution":{"observed_at":"2026-05-16T12:57:53.952237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02441","last_updated":"2025-04-24T01:47:25Z","snapshot_observed_at":"2026-07-06T21:03:35.698923Z","submitted_at":"2025-04-03T09:58:19Z","title":"Cognitive Memory in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.02441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02441","snapshot_observed_at":"2026-07-01T09:45:40.262128Z","title":"Theodore R","venue":null,"work_id":"ac0048d6-17f8-4166-ace0-32dbb58fd01e","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2504.02441","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:5c933caaf4e594da375476b2882c9bd292d52696ea9bbe9a315a2a9feca2eb4b","observation_id":"3826a984-a7f4-4ced-ae51-652b23a95305","resolution":{"observed_at":"2026-05-16T12:57:53.990059Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":"2410.17434","doi":"10.48550/arxiv.2410.17434","metadata_source":"pith","pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","venue":"cs.CV","work_id":"82f3cbed-22bb-41b5-b9c9-67304154cd52","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:25e6eef621bdde4b2d40950911dbf9fb5d8270b4535a058cae596dd732cc1809","observation_id":"a98ebbc7-2db3-40b5-92f2-def2c0edfa2f","resolution":{"observed_at":"2026-05-16T13:53:33.725971Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22925","last_updated":"2025-07-23T12:45:44Z","snapshot_observed_at":"2026-07-06T22:05:22.373440Z","submitted_at":"2025-07-23T12:45:44Z","title":"Hierarchical Memory for High-Efficiency Long-Term Reasoning in LLM Agents","version":1},"cited_work":{"arxiv_id":"2507.22925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22925","snapshot_observed_at":"2026-07-04T08:49:41.387446Z","title":"Hierarchical memory for high-efficiency long-term reasoning in llm agents","venue":null,"work_id":"ae3a439e-f728-432f-a6ff-e43eaa5bcf08","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2507.22925","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:a36125e5b49c1542b48dad7766191011d8c19dd863a887f31d21f9ecf0f3688e","observation_id":"a2128ac5-4dc8-4a60-acb3-4a2d9c4f98da","resolution":{"observed_at":"2026-05-16T12:57:53.809989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-05T13:11:54.824513Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":"2411.15024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"746ed7dd-7dd8-4f43-8853-1a30cd36ed9b","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:380ffe5c30e1ca5485d3138d2c673983e756c238ad9c4e20b26be8b64c4c8933","observation_id":"2b08a16f-941a-4a64-8f19-744306d50b72","resolution":{"observed_at":"2026-05-16T12:57:53.927169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.523830Z","title":"Streambridge: Turning your offline video large language model into a proactive streaming assistant","venue":null,"work_id":"6f0d7f4a-5862-4b5f-8e70-eeaff1ed8a54","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:120fffd34adfc046dd1a03f46d289eaccf8c88ad4a4cce1979c0c24c73ff7627","observation_id":"d6b90fdf-30db-4e8c-9abd-c6d583ec1412","resolution":{"observed_at":"2026-05-16T12:57:53.831831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic-vlm: Simple dynamic visual token compression for videollm","venue":null,"work_id":"e04521ee-9709-44ac-90bb-d9c31a91e703","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:7c09e02b45c8a581d028f1b17b827f5ba71538dc4c1fc7f3eea6fd7251c961e7","observation_id":"476a5a0c-e658-47ab-9889-1366d360a8d6","resolution":{"observed_at":"2026-05-16T12:57:54.451880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:b429970462ef9ed2c8a9f2eb84e7cd0662686c2130ebec5a39d20862e2842fce","observation_id":"29d6dc38-c57d-461f-bb7c-12a29c09fe52","resolution":{"observed_at":"2026-05-16T12:57:53.968230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":"2405.19209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":"e68024d4-8bd3-4e50-a45b-d0d58d446dba","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:5b8f7fe1615d105a77c8acf3e5c4130024b956525c8cf5340416aff10dd63c68","observation_id":"5f1de1df-84e0-4e28-bce3-6e91b5a6de45","resolution":{"observed_at":"2026-05-16T12:57:53.878322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-07-06T20:24:50.262766Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"cited_work":{"arxiv_id":"2501.13468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13468","snapshot_observed_at":"2026-07-04T03:19:29.878882Z","title":"Streaming video under- standing and multi-round interaction with memory-enhanced knowledge","venue":null,"work_id":"05bede93-84f8-4b7b-b6e5-10f6ff02394b","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2501.13468","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:e4294ee52a4be27c53a868d66928dcf1b3af2c53bafeff76a5cdfbbfedb03811","observation_id":"10b406f3-de90-4880-aaa4-951d4684bfcd","resolution":{"observed_at":"2026-05-16T12:57:53.814670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09608","last_updated":"2025-10-10T17:59:58Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:59:58Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","version":1},"cited_work":{"arxiv_id":"2510.09608","doi":"10.48550/arxiv.2510.09608","metadata_source":"pith","pith_arxiv_id":"2510.09608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","venue":"cs.CV","work_id":"e6785f4f-90d8-45ab-8e34-1a406ea2db88","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2510.09608","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:3489128cf965f0b37a3d887ee23f785baccd62d7b7fb9c2ccba1dc1ba1e0ef31","observation_id":"a6c17c7e-b2ec-4310-a3e3-3796ecbdb388","resolution":{"observed_at":"2026-05-17T11:51:33.451476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01875","last_updated":"2026-04-29T13:44:54Z","snapshot_observed_at":"2026-07-06T22:07:07.294341Z","submitted_at":"2025-08-03T18:15:42Z","title":"StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2508.01875","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.01875","snapshot_observed_at":"2026-07-02T17:27:15.714091Z","title":"StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding","venue":"cs.CV","work_id":"129a53a1-987b-419c-a0c3-59c8f376a91d","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2508.01875","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:6acee5c9b6f42af8d955aaa30bf53cea47927ea29d45ba6f401de5180f06bf9e","observation_id":"8b0a0d65-411c-44ad-981c-e1360292c619","resolution":{"observed_at":"2026-05-16T12:57:53.939593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.04467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:36:44.294444Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":"78db09dd-8c3c-4787-8310-3981dc6965f7","year":2026},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:ee5649ccc87046ff9768e0075e42692db7fff6faed20423edb9a5a1ead96375e","observation_id":"db91a4c5-2860-4117-9e7c-b12a377fdd75","resolution":{"observed_at":"2026-05-16T12:57:53.887328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15717","last_updated":"2025-08-21T16:56:29Z","snapshot_observed_at":"2026-08-05T17:57:24.408444Z","submitted_at":"2025-08-21T16:56:29Z","title":"StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2508.15717","doi":"10.48550/arxiv.2508.15717","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streammem: Query-agnostic kv cache memory for stream- ing video understanding.arXiv preprint arXiv:2508.15717","venue":"ArXiv.org","work_id":"752bf839-d545-4378-a68d-4a958ba10cee","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2508.15717","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:9391031611f5b009348cabaf4cb97b0a1e037dc1f689c96f3fba25681fea8171","observation_id":"a862863e-3446-48f2-8225-ec78e055dbe8","resolution":{"observed_at":"2026-05-16T12:57:53.993597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17343","last_updated":"2025-04-24T07:59:46Z","snapshot_observed_at":"2026-07-06T21:14:04.815568Z","submitted_at":"2025-04-24T07:59:46Z","title":"TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos","version":1},"cited_work":{"arxiv_id":"2504.17343","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17343","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timechat-online: 80% visual tokens are naturally redundant in streaming videos","venue":null,"work_id":"9ac6613c-204a-45e0-b458-fa6ab43cc0ab","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2504.17343","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:bafae59f22097682d65f5deb5cd9cd5d94bdef1b20dbe96a50beb6cee5dfca2d","observation_id":"11abff98-bfa7-4491-9d0d-7670db5d6b1e","resolution":{"observed_at":"2026-05-16T12:57:53.845048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streamforest: Efficient online video understanding with persistent event memory","venue":null,"work_id":"32056813-29dc-415b-88aa-12d2dffe32bf","year":null},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:cc9392c818f3efd9eebd8c4a8a5a510bc3b85a017369334e2586341fd2300517","observation_id":"6fd65a51-7f34-4024-aeea-8907c4eb203c","resolution":{"observed_at":"2026-05-16T12:57:54.442053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:07:17.387158Z","title":"Streamforest: Efficient online video understanding with persistent event memory","venue":null,"work_id":"32e5b409-8977-42f0-b368-7217e051f67d","year":2025},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:cee2fbc714c7a07f2c8200ad32f1260cec4ce72ad910b2f4404a4035811d3348","observation_id":"0ad8191f-d155-4f05-a614-629215b5949b","resolution":{"observed_at":"2026-05-16T12:57:53.917416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":"2406.08085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-07-04T20:00:08.182505Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"f53e5fea-3444-480b-aa38-be98378c0ced","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:0a1eed1a94bd3a77a1b7fbcfbb6c4c50e65cd374819a4deac16b01990b261ab3","observation_id":"22a96c46-ffa6-459c-a1f9-b95b727ad2cb","resolution":{"observed_at":"2026-05-16T12:57:53.864829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:368a5ae9faca248c941f62fca65b73ebfad868c873389f3beda9593b3a94bc08","observation_id":"ff464fde-2c93-413f-85b0-02642e352f9f","resolution":{"observed_at":"2026-05-16T12:57:53.860496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:ef098652f20ac2df2999857612b4ba395c210293c134690928da00a9a062ee14","observation_id":"8e80d361-9caf-4698-a92a-d715b48a041d","resolution":{"observed_at":"2026-05-16T12:57:53.935463Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":40,"verified_fuzzy":10},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 13 inbound Pith citation observations for arXiv:2601.14724."}