{"as_of":"2026-08-04T18:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1abaf1ff836e87973f0d56b9029665fa57845bbe8ae50e44142ed3c8bf604e0d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T02:12:20.651111Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T03:21:47.718375Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07897","snapshot_observed_at":"2026-08-04T03:21:47.718375Z","title":"M.; Cai, Y.; Yang, M.-H.; and Wang, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28312","last_updated":"2026-08-01T16:00:11Z","snapshot_observed_at":"2026-08-04T17:28:04.023927Z","submitted_at":"2026-07-30T14:47:00Z","title":"ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T03:21:47.718375Z"},"links":{"cited_paper":"/paper/2605.07897","citing_paper":"/paper/2607.28312"},"observation_digest":"sha256:49d5c36540f9a011b8334591fdf0b8c6f52444e21be5218530d49cf3ae44d6dd","observation_id":"113d77bf-03e9-452a-8d1b-4a14e641c4ac","resolution":{"observed_at":"2026-08-04T03:21:47.718375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.07897/citation-record","integrity":"/paper/2605.07897/integrity","json":"/paper/2605.07897/citation-record.json","paper":"/paper/2605.07897"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:4786786db8b22a07fa8dba579b6374c8fb7f2ded89e2903ac70e6350106e6e2d","observation_id":"3ef130f4-3c4d-4368-a1d6-c2729db0baaf","resolution":{"observed_at":"2026-05-11T03:50:56.728343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":"9fce0e5b-2df7-4e95-9a3f-8e2643730474","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:672e3fee39356f4d37894e982b9c0ac727f65833f2b1e9de0e743c31893d9708","observation_id":"aca26757-b3c8-4ee5-85ca-89377c2e702f","resolution":{"observed_at":"2026-05-14T13:50:58.296353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:34:23.589812Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"0d337e44-da4f-48a9-abf6-5bf7cc7c395e","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:92cfd97619f6df8f8df92d7e74646262ebc266e4231a50dd7dba4769b12dc91a","observation_id":"11bb9116-a31f-4db5-9986-2dea5053d1e1","resolution":{"observed_at":"2026-05-14T13:50:58.282447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end autonomous driving: Challenges and frontiers.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"e06a309d-8049-404b-bd7f-18f4dc848abd","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:e9986b4ce29e369c53c1eaad7f8ce3162e7c85ec03cd09370700bae88860311d","observation_id":"e39ad353-654d-49ad-8495-0f4fb42c4eea","resolution":{"observed_at":"2026-05-14T13:50:58.275673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101","venue":null,"work_id":"d11e14a2-3976-4af5-bdfd-ad5f9b29d04a","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:55980ffb87f8d477e5dad2227ac66e6c33ede14ee0f6f5f824e26dfd8b5cb4ff","observation_id":"67294575-ce6b-4214-b2d7-2e3d96f52576","resolution":{"observed_at":"2026-05-14T13:50:58.335451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming video question-answering with in-context video kv-cache retrieval","venue":null,"work_id":"3913aa4a-e18c-4083-9948-6a72e48dfb75","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:1f7cd4d14fe479915d78ab81fc9d693c19fdbf8e3d6f43982f76d93e7627fd82","observation_id":"73cbad4a-5406-4008-a837-973b8350428e","resolution":{"observed_at":"2026-05-14T13:50:58.279141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04560","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contextnav: Towards agentic multimodal in-context learning","venue":null,"work_id":"438b9680-f931-49a1-bf2f-5ec272d54879","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:952a1364ddd0e07a421045685cf6e8d29fd564edf001b2c7309571916ca1fafe","observation_id":"5a0e7e1d-e4e0-4693-bc82-fd3ad1ff0c3b","resolution":{"observed_at":"2026-05-11T03:50:56.682389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vispeak: Visual instruction feedback in streaming videos.ICCV","venue":null,"work_id":"ebe9ed03-e315-47f8-ae0d-cea7623f1bf7","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:5f0808602ce3aadbc206df512f3b4b2e616dd120ebac0b63cd9ed3c29453f4ae","observation_id":"c3c5ac3f-d520-4fac-bc78-2f09cf970c3a","resolution":{"observed_at":"2026-05-14T13:50:58.329770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.756495Z","title":"Framemind: Frame-interleaved chain-of-thought for video reasoning via reinforcement learning","venue":null,"work_id":"89e207e7-f80b-4dee-bee3-05fb8ca2e8d1","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:65e4707482034254aa5e7217e4be6994ca7476d5a481ecaa051845eab74d49a4","observation_id":"7c5c557c-67ee-4cfb-b736-c68cf4ec02c9","resolution":{"observed_at":"2026-05-11T03:50:56.358339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online video understanding: Ovbench and videochat-online","venue":null,"work_id":"bfedd154-a8ab-4ee2-8765-d4762e92ae46","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:9cff6b6a6abe0cef268fb723da020f8bce9e1e1d04c3623ca06d60c36f0f0607","observation_id":"08fafee2-43ab-4884-8e57-c6f90e5993d9","resolution":{"observed_at":"2026-05-14T13:50:58.321534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:6f40f337b94b47d92ad08421f3041386ce9067653a86b473ee123df51ed7367b","observation_id":"164185d6-5052-4626-a537-f2f29a40f0bd","resolution":{"observed_at":"2026-05-11T03:50:56.600709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Colbert: Efficient and effective passage search via contextualized late interaction over bert","venue":null,"work_id":"7f6306ac-089a-4670-a6f8-27913b76d5ec","year":2020},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:5b5b5ddfe94c0caee0502dab247df061ea9535abca665dde9b9691bb76fc151f","observation_id":"856863e4-259a-41bf-a02b-b435c1916619","resolution":{"observed_at":"2026-05-14T13:50:58.293819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interaction methods for smart glasses: A survey.IEEE access, 6:28712–28732","venue":null,"work_id":"1bb0a04f-8198-47cd-bef7-96d5b763c2e9","year":2018},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:e1019889af2b1a96cb902e7529e4e8ff951c274c63987499d72c4265afc4f4d1","observation_id":"f7674042-f15d-49a9-988d-8babf5d5f3af","resolution":{"observed_at":"2026-05-14T13:50:58.310617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:c56e5721e2221f3fbf380ec2c8aaa0687b676905b8cd15d509bc2638b75c4f41","observation_id":"12cfcf3d-8cf4-4513-bd55-77f4657c2a65","resolution":{"observed_at":"2026-05-11T03:50:56.660336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2411.03628","doi":"10.48550/arxiv.2411.03628","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video un- derstanding","venue":null,"work_id":"caec985b-dd2d-4dbb-9199-d147732de99a","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:8507b901945e70e4b0a574a3e696bd2ccc2f001a581b5d38d44b76d83ea020d5","observation_id":"66471926-6853-4272-a1f4-7383aab5a4e5","resolution":{"observed_at":"2026-05-11T03:50:56.707856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai.IEEE/ASME Transactions on Mechatronics","venue":null,"work_id":"abec8419-3efd-4d1c-abf2-c55890db016c","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:ab32685a870c7ebf4966d14cbd3c944ed450a43692365b7b7a48fd5a81885c96","observation_id":"930384d9-d9c0-4594-9ade-d05441dec74b","resolution":{"observed_at":"2026-05-14T13:50:58.304421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12938","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:07:12.890978Z","title":"Thinking in streaming video","venue":null,"work_id":"d76098fe-8c64-4d90-92e4-ce36c34c9ed6","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:3384ff4f32bc0a55347405e8a43afbc2559cdf256847d3c1df3dfbc1e1fd4a2b","observation_id":"2da1e5ae-2c09-4a3b-bac5-f7af9f1b4ce8","resolution":{"observed_at":"2026-05-11T03:50:56.723910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"9825992b-3381-4126-a699-062cc39ce1e9","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:060da94429e4911b0f32eabc694676fe8b69e3afb1bade06808a65775e9cef30","observation_id":"33c38f6c-0c47-437a-a022-5ef812e39d04","resolution":{"observed_at":"2026-05-14T13:50:58.306839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13334","last_updated":"2025-07-21T17:48:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T17:50:36Z","title":"A Survey of Context Engineering for Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.13334","doi":"10.48550/arxiv.2507.13334","metadata_source":"pith","pith_arxiv_id":"2507.13334","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A Survey of Context Engineering for Large Language Models","venue":"cs.CL","work_id":"8936785a-a829-4d9c-b641-ee29311824e4","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2507.13334","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:367e5f2bd0a9593163ae3c21c9f677405dc0584c8227f5edf9bc2792a358fadd","observation_id":"834c531f-c251-499a-86cd-301799397b71","resolution":{"observed_at":"2026-05-13T20:58:45.795434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.12906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated differentiable working memory for long-context language modeling","venue":null,"work_id":"e1f00cdd-300e-4354-9455-890521d85ff4","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:13172622afeba9451407e22a03fac7ba68f2af68869c582559a2ea7b4b725eb5","observation_id":"4077ec18-0598-48a5-97b2-22f5156a1595","resolution":{"observed_at":"2026-05-11T03:50:56.510940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15269","last_updated":"2026-04-23T12:54:38Z","snapshot_observed_at":"2026-08-03T01:07:06.468931Z","submitted_at":"2025-05-21T08:47:15Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","version":2},"cited_work":{"arxiv_id":"2505.15269","doi":"10.48550/arxiv.2505.15269","metadata_source":"pith","pith_arxiv_id":"2505.15269","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval","venue":"cs.CV","work_id":"a00b4d7a-5adc-4855-89a1-5356dc946a85","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2505.15269","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:a112e5ba93489ebc700824fb1764e274a10a856c098af67c36c106a771888d2a","observation_id":"4721a065-4802-484a-8aa8-555228acd816","resolution":{"observed_at":"2026-05-11T03:50:56.573338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? InCVPR, pages 18902–18913","venue":null,"work_id":"4bccd7eb-29dc-4b6c-ab28-578f9b88084a","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:610e514974bbca1d55d8bbf0f1fb5ffb459966a3db61630587a1defca4d2b007","observation_id":"8a3a5fa0-23f5-438e-8bd8-5f15150b23e4","resolution":{"observed_at":"2026-05-14T13:50:58.337915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Athresholdselectionmethodfromgray-levelhistograms.IEEETransactionsonSystems,Man,andCybernetics, 9(1):62–66","venue":null,"work_id":"cd77b15d-afd0-4709-b77a-18f2ee172e51","year":1979},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:d98693ab01eb558e6a0db037a58d2fe254c8c15d8c5b7cfc18c094a0ea78a83e","observation_id":"394ee2b2-0a37-46b4-9afe-d094c66f3237","resolution":{"observed_at":"2026-05-14T13:50:58.288427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming long video understanding with large language models.NeurIPS, 37:119336–119360","venue":null,"work_id":"c263a154-7186-4b84-a8b4-af000f64f0be","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:36cfccdc735640d59690ef0efdc85cebeb72d27958432ab73565da240a9b1338","observation_id":"cf0aef41-8c40-469c-8371-14da1d47333b","resolution":{"observed_at":"2026-05-14T13:50:58.285159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dispider: Enabling video llms with active real-time interaction via disentangled perception, decision, and reaction","venue":null,"work_id":"e5368276-7cbb-40b2-82ac-82daf99c1d23","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:63ff603f981a589abc319670f724bb835aaf45585fd72ec2eaaa1ab14959cbd0","observation_id":"05bfd455-20aa-43be-ac4e-e18d0848ae8e","resolution":{"observed_at":"2026-05-14T13:50:58.319311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":"4966c069-8411-4d49-9f3c-8175dea6ec08","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:c45467057985238a724f202a1a6cce9a7a73c5b5fd532bda8ee7f5ef38edc5bb","observation_id":"a3b26720-147f-4ae9-a996-392e139c8168","resolution":{"observed_at":"2026-05-14T13:50:58.317309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.02317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:57:30.607600Z","title":"A Simple Baseline for Streaming Video Understanding","venue":null,"work_id":"fdb77ee7-ee71-4919-a8c0-0de4924801f5","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:be3702ced1e71ebfec7e870962d4500a12e0f1f8a09cfbf1b1a674ebebeb7bf2","observation_id":"fdfbf315-9d46-48a6-b71f-c2678416f48d","resolution":{"observed_at":"2026-05-11T03:50:56.672127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video understanding with large language models: A survey.IEEE Transactions on Circuits and Systems for Video Technology","venue":null,"work_id":"450f52af-f193-4d2b-a7bf-2d140e96e311","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:168905091db4c717dc7bb4346bcd90ebba67aaff47022c2468943b41fa36366e","observation_id":"e23b966d-1cb3-40e9-8228-87b3ede4758b","resolution":{"observed_at":"2026-05-14T13:50:58.327400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T03:37:46.178537Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:7160ca35151174b5dcef9dbe636d7eab25fe2de1506b96e6c9f458887eaeff94","observation_id":"f2dbf2c8-d2ff-4443-b3ef-e4526cd558b5","resolution":{"observed_at":"2026-05-11T03:50:56.640450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streambridge: Turning your offline video large language model into a proactive streaming assistant.NeurIPS","venue":null,"work_id":"dad99ce3-7d70-4112-8a24-881394242318","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:9fc1ba45631759c5201a0b6806b66c73760efe07f0f0a87875868247845c4013","observation_id":"214a7323-1d43-4b65-a7c7-11d81a1ec7cc","resolution":{"observed_at":"2026-05-14T13:50:58.301870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":"2304.14407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":"bd186832-fce9-4e7a-845b-19a5d5673de2","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:715beac60a810c12cba518fb63c698fc332b28ab666bb4139589b9a65a287256","observation_id":"46f6a05a-b353-4bc2-8862-e30fd90d321a","resolution":{"observed_at":"2026-05-11T03:50:56.473686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:b548eaab3df5f56deba7bb2a3adfad11fef09137bd44f6997610877261ebc7b5","observation_id":"5ce4d7eb-816a-44b9-acb1-7698013bf443","resolution":{"observed_at":"2026-05-11T03:50:56.484333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:3793b72c0374d41e2a7ed394a19b7def43b3467d905bbc9a05ccb8dd9563e4df","observation_id":"c2a8e64d-bb3c-445d-94b8-46bc820064af","resolution":{"observed_at":"2026-05-11T03:50:56.415498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-07-31T17:49:53.858930Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":"2501.12386","doi":"10.48550/arxiv.2501.12386","metadata_source":"pith","pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","venue":"cs.CV","work_id":"5801b83f-d5f4-4020-bad2-4bc47f71fe7d","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:2b0fa5094160331d853a9fff19b0e094e815fde6feb666786416c46658a7e857","observation_id":"f258556c-d103-4168-afd5-85ef3680fb2f","resolution":{"observed_at":"2026-05-17T02:52:20.835573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"cited_work":{"arxiv_id":"2602.00181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00181","snapshot_observed_at":"2026-07-04T17:40:00.889429Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","venue":"cs.CV","work_id":"dc4f2508-790c-49af-834e-d524a67beda6","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2602.00181","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:668cc17a8ddd0e08241f2872acb4f5fd2729191e1f90d9124a4f76853c8ccad2","observation_id":"049a96ef-ffc7-4c3a-82ae-51cae100a626","resolution":{"observed_at":"2026-05-11T03:50:56.493339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.NeurIPS","venue":null,"work_id":"c105c6d3-349a-4a3a-b7cb-308edb774bbc","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:942b95ab1e7f542c8649361d00f3b7d66539c3ee9ec671b1cca68d231d774726","observation_id":"a1a9b116-c700-434b-bd40-d91c97c3ea38","resolution":{"observed_at":"2026-05-14T13:50:58.313099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.02096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:08.216260Z","title":"Fluxmem: Adaptive hierarchical memory for streaming video understanding","venue":null,"work_id":"b772bceb-41f1-4390-a2bb-e406c445262d","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:dd5e265bdae322974d4653e8b210ba7c32456e1ccceb4f262d4682562dca254e","observation_id":"ca0e2e08-160f-4b92-ae6b-17df6761d35d","resolution":{"observed_at":"2026-05-11T03:50:56.434561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09608","last_updated":"2025-10-10T17:59:58Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:59:58Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","version":1},"cited_work":{"arxiv_id":"2510.09608","doi":"10.48550/arxiv.2510.09608","metadata_source":"pith","pith_arxiv_id":"2510.09608","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","venue":"cs.CV","work_id":"e6785f4f-90d8-45ab-8e34-1a406ea2db88","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2510.09608","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:91c06a6190f5454e7af009cbbac4ec8c3dd2b6f21d6225b9b12176c53d10f8a8","observation_id":"ca912523-693d-4cc0-bbc8-1a4248e47317","resolution":{"observed_at":"2026-05-17T11:51:33.451476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15717","last_updated":"2025-08-21T16:56:29Z","snapshot_observed_at":"2026-08-04T15:51:47.648176Z","submitted_at":"2025-08-21T16:56:29Z","title":"StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2508.15717","doi":"10.48550/arxiv.2508.15717","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15717","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Streammem: Query-agnostic kv cache memory for stream- ing video understanding.arXiv preprint arXiv:2508.15717","venue":null,"work_id":"752bf839-d545-4378-a68d-4a958ba10cee","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2508.15717","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:1ec3f4befed634d8cdcc8f85bbe58723b838be0c56df1f89f7c1a0cefe16bffd","observation_id":"4ccd50be-7e92-49ec-9989-e43b071e86f1","resolution":{"observed_at":"2026-05-11T03:50:56.370849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timechat-online: 80% visual tokens are naturally redundant in streaming videos","venue":null,"work_id":"57a60492-546c-49ef-9559-5fc5f53fb45e","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:968453b0aa65e844822074b6260187c49725a59ad4bf61ade588a252695e36f3","observation_id":"71c3f810-d55d-475c-8b6d-829ad8fbdb2f","resolution":{"observed_at":"2026-05-14T13:50:58.324135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streamforest: Efficient online video understanding with persistent event memory.NeurIPS","venue":null,"work_id":"9d76237f-90b4-4ccb-9f91-7fdb6a464c6c","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:48920898be4a63511c28508c03647b26ff6a581db6858d03a8def8e25734d973","observation_id":"7972e66d-952c-44ae-879d-643026da7ba4","resolution":{"observed_at":"2026-05-14T13:50:58.315244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:74745503ee0b7bb646761a4f18aaf2c2018d0af86c80586d8e8290c33a3720fe","observation_id":"75411568-414b-4639-92f5-0aef2823a9bd","resolution":{"observed_at":"2026-05-13T15:02:01.218694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"869d0768-d043-4f76-96cb-e0c285dce49e","year":2025},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:ebec053412a6f234bd8ba544d34a9aa682f407386a916cec261f3b3ac02865a4","observation_id":"ed007fe1-729a-4b8d-83c9-ede42513274c","resolution":{"observed_at":"2026-05-14T13:50:58.332328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-07-29T23:57:46.682251Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"cited_work":{"arxiv_id":"2601.14724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14724","snapshot_observed_at":"2026-07-04T12:09:48.861966Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","venue":"cs.CV","work_id":"c081a4c3-1313-4b9c-91eb-903564249448","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2601.14724","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:ea78e0ef7e2f87a48912aa5c78e1aa87c431ff0bb183bea1676b09150aee36bf","observation_id":"9888cebf-3702-4571-b03c-8ec4b3f3ee2c","resolution":{"observed_at":"2026-05-11T03:50:56.380773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:485588474c52100ae98e56f30753005b96773fad3d4356e7fe61a7f79be73573","observation_id":"b1dfc6ce-be28-46e3-aaa0-58a0929a12f8","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:8651fc5efd84ab655ad899f675de2b1ce876a28faeb3a97eceafdce56d1c42fb","observation_id":"02b79e42-e07e-4354-8171-c48e8b5cede1","resolution":{"observed_at":"2026-05-11T03:50:56.454106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22142","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weavetime: Stream from earlier frames into emergent memory in videollms","venue":null,"work_id":"b8d17304-7e55-4249-b5bd-72784bb7c1ef","year":2026},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:e0bd8888c795cae4124580ef2ade1014de77b10b6d5613c93b34c2557174bf04","observation_id":"8c780156-d464-416c-b990-d3138c9315e9","resolution":{"observed_at":"2026-05-11T03:50:56.530833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Whatobjectsarevisible?","venue":null,"work_id":"cdf572e5-95cd-4753-81e0-630de0e1d385","year":null},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:6c122b4153331c206766ba4657a6ca9d2a7d5b34c581f011f44fc4f326dd7677","observation_id":"4d6215a8-9efa-4e93-b82e-05d7f8b4d6ec","resolution":{"observed_at":"2026-05-14T13:50:58.298959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What objects are visible in the scene ?","venue":null,"work_id":"cf60e847-ea56-4e2a-afef-9a8ef4c17076","year":null},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:010fa65dfc23d47ae603d6e9407c78115e24a741c7729d3b4b1250719a53f78f","observation_id":"22a250f7-bf45-45ab-bbd4-efe61ed1d5f8","resolution":{"observed_at":"2026-05-14T13:50:58.291504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:20:15.696237Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":25,"verified_fuzzy":24},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2605.07897."}