{"as_of":"2026-08-11T10:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11f5fc4e0ae80bdb92f095f269732bc08c0b632fb20a30fda18d759eb293841e","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T18:09:59.236030Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:27:46.664630Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T10:58:03.480373Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"cited_work":{"arxiv_id":"2603.01455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01455","snapshot_observed_at":"2026-07-03T10:58:03.480373Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","venue":"cs.CV","work_id":"de041e69-5471-41af-ac94-cccece20ef6f","year":2026},"citing_paper":{"arxiv_id":"2606.07397","last_updated":"2026-06-05T15:38:08Z","snapshot_observed_at":"2026-08-03T17:34:16.563583Z","submitted_at":"2026-06-05T15:38:08Z","title":"Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T20:48:31.993369Z"},"links":{"cited_paper":"/paper/2603.01455","citing_paper":"/paper/2606.07397"},"observation_digest":"sha256:b7a376e884c0654920e719801295d116dc2f5b165c8319ffd9193a0f1a2786c6","observation_id":"3b0736f9-0c87-4c2f-8e15-64cb654a8117","resolution":{"observed_at":"2026-07-02T20:17:21.356027Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"cited_work":{"arxiv_id":"2603.01455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01455","snapshot_observed_at":"2026-07-03T10:58:03.480373Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","venue":"cs.CV","work_id":"de041e69-5471-41af-ac94-cccece20ef6f","year":2026},"citing_paper":{"arxiv_id":"2606.12018","last_updated":"2026-06-10T12:44:02Z","snapshot_observed_at":"2026-08-03T20:21:32.396120Z","submitted_at":"2026-06-10T12:44:02Z","title":"MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T09:43:56.299302Z"},"links":{"cited_paper":"/paper/2603.01455","citing_paper":"/paper/2606.12018"},"observation_digest":"sha256:e0f36c900c26d589bef2a5d29190093bed9c63d5ee31fe826aee03cdcd6f9dff","observation_id":"ecb2deb6-c7e5-4163-9018-55b689de3521","resolution":{"observed_at":"2026-07-03T10:58:03.481588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"cited_work":{"arxiv_id":"2603.01455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01455","snapshot_observed_at":"2026-07-03T10:58:03.480373Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","venue":"cs.CV","work_id":"de041e69-5471-41af-ac94-cccece20ef6f","year":2026},"citing_paper":{"arxiv_id":"2606.31410","last_updated":"2026-07-01T03:59:21Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:36:35Z","title":"Xiaomi-GUI-0 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T06:07:48.137351Z"},"links":{"cited_paper":"/paper/2603.01455","citing_paper":"/paper/2606.31410"},"observation_digest":"sha256:707fcf27749ccebac226f268846b2035a127d658804e86634550d9d03a69881a","observation_id":"2f4d6e20-97a5-4bdd-a9ae-d16db14bc916","resolution":{"observed_at":"2026-07-01T09:55:40.349060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"cited_work":{"arxiv_id":"2603.01455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01455","snapshot_observed_at":"2026-07-03T10:58:03.480373Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","venue":"cs.CV","work_id":"de041e69-5471-41af-ac94-cccece20ef6f","year":2026},"citing_paper":{"arxiv_id":"2606.31410","last_updated":"2026-07-01T03:59:21Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:36:35Z","title":"Xiaomi-GUI-0 Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-02T19:37:49.661596Z"},"links":{"cited_paper":"/paper/2603.01455","citing_paper":"/paper/2606.31410"},"observation_digest":"sha256:821cc92e97dd288c86f4d7a6efabb06c538b968fa84e00d224e672a28a422c82","observation_id":"cfa67b57-089a-469f-9130-3974647e9a7b","resolution":{"observed_at":"2026-07-02T19:47:18.999836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01455","snapshot_observed_at":"2026-07-11T19:16:37.302399Z","title":"From verbatim to gist: Distilling pyramidal multimodal memory via semantic information bottleneck for long-horizon video agents.arXiv preprint arXiv:2603.01455, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04425","last_updated":"2026-08-10T13:11:37Z","snapshot_observed_at":"2026-08-11T10:18:55.456901Z","submitted_at":"2026-07-05T17:37:12Z","title":"UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:37.302399Z"},"links":{"cited_paper":"/paper/2603.01455","citing_paper":"/paper/2607.04425"},"observation_digest":"sha256:66d909696d564602528c4e810974763b572b4903c158b94d818e740803c473d1","observation_id":"baf01ff1-873c-48ed-839b-1b9b7c85d152","resolution":{"observed_at":"2026-07-11T19:16:37.302399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01455","snapshot_observed_at":"2026-08-02T05:40:44.305707Z","title":"From verbatim to gist: Distilling pyramidal multimodal memory via semantic information bottleneck for long-horizon video agents.arXiv preprint arXiv:2603.01455, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13298","last_updated":"2026-07-14T22:09:48Z","snapshot_observed_at":"2026-08-07T01:40:11.166031Z","submitted_at":"2026-07-14T22:09:48Z","title":"FOLIO: Focused Semantic Memory for Streaming Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:44.305707Z"},"links":{"cited_paper":"/paper/2603.01455","citing_paper":"/paper/2607.13298"},"observation_digest":"sha256:e17bf40f9a5f90fcff3e335a9771145ef44ab0dbd372940fb6f16bd8a9b8d866","observation_id":"17f89242-abae-4e70-a51f-d88a8812ddd7","resolution":{"observed_at":"2026-08-02T05:40:44.305707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01455","snapshot_observed_at":"2026-08-10T15:27:46.664630Z","title":"From verbatim to gist: Distilling pyramidal multimodal memory via semantic information bot- tleneckforlong-horizonvideoagents.arXivpreprint arXiv:2603.01455, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07067","last_updated":"2026-08-07T10:16:56Z","snapshot_observed_at":"2026-08-11T10:10:54.042514Z","submitted_at":"2026-08-07T10:16:56Z","title":"DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:27:46.664630Z"},"links":{"cited_paper":"/paper/2603.01455","citing_paper":"/paper/2608.07067"},"observation_digest":"sha256:0d5a400bb5f1bd38b16ec8b666b632f411befc6ed9e5c72c5c08305049f7ae7c","observation_id":"1f54c517-b46d-4551-8608-2ad739758dec","resolution":{"observed_at":"2026-08-10T15:27:46.664630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.01455/citation-record","integrity":"/paper/2603.01455/integrity","json":"/paper/2603.01455/citation-record.json","paper":"/paper/2603.01455"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:f12083dda276f09a14b555fac5db1a6f92d14b8af21fc6b5122911c11e7b80b7","observation_id":"cc156a03-de17-4bd0-8e80-bba526553996","resolution":{"observed_at":"2026-05-15T18:10:13.155913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:7fbf7a52f4ea1d615849ab5b94bb64ab4536e63edb2333bfab1bcd0af084583b","observation_id":"664a6953-e737-4c58-a9e9-b3faf37c7571","resolution":{"observed_at":"2026-05-15T18:10:13.138587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videominer: Iteratively grounding key frames of hour-long videos via tree- based group relative policy optimization","venue":null,"work_id":"aeab2701-ca7c-4e33-93b0-d17d72b32ec5","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:68ebe6239e7b1ccfe4a0cbdc7af5566085231dd1d7c754aa4813797e7e08d003","observation_id":"de650f8b-18bc-46f8-bf4b-94dfd41637c4","resolution":{"observed_at":"2026-05-15T18:10:13.495780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:497f5f01f7e0a13c9dae00dd6ef2936200ca5a4f1c40b88e6a56dc8e68880912","observation_id":"2a28a8ff-da50-4c82-87a3-e1e5b4e4fcf7","resolution":{"observed_at":"2026-05-15T18:10:13.150161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards large language models with human-like episodic memory.Trends in Cognitive Sciences","venue":null,"work_id":"97933320-5823-4cd6-b61a-c3f77fac80e7","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:70a52359f3c08552810815d891f52f20c8f0c559f69ffb30a57f42014dcf189c","observation_id":"24ec224f-bd4c-47f2-b2fd-670a6ac9458a","resolution":{"observed_at":"2026-05-15T18:10:13.512146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video- mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"b45d1419-932c-4b8b-a0b9-6a2f307a56b6","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:82e2ac21bc8e2fe7facbafef153619e6cfb18bb0dfdbb0a19531bedd531a03cc","observation_id":"65645373-9018-4f07-9609-564a85ed5cf2","resolution":{"observed_at":"2026-05-15T18:10:13.503934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":"2501.01957","doi":"10.48550/arxiv.2501.01957","metadata_source":"pith","pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","venue":"cs.CV","work_id":"510354f3-222a-48da-bda9-96a2df30bb68","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:d59556b3e9385594244b7eb187f39f6215f36fc7ba953cc36c4b8f8988a849c8","observation_id":"c9b382f0-5f33-433b-b3b0-7ed2fe5477cf","resolution":{"observed_at":"2026-05-17T21:08:19.955297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inducing high energy-latencyoflargevision-languagemodelswith verbose images","venue":null,"work_id":"d4ac6131-4b98-4221-ae8d-3476ab1eeacd","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:ead3320f847206f94fb2edc283740498f4a03e8013bed998c398b23697c99af6","observation_id":"8fbf239e-910b-4428-b273-4da57db7d6ba","resolution":{"observed_at":"2026-05-15T18:10:13.499850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video under- standing","venue":null,"work_id":"688fffdc-1426-40e5-ab5c-ba6caf7da264","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:62b7632b5d4c344b45f09e4d5beef054d1070e6d69fa5636de70c3d5107e1d75","observation_id":"5e5a71de-842e-4006-8d89-b03d77d2a21a","resolution":{"observed_at":"2026-05-15T18:10:13.516297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"View from the top: Hierarchies and reverse hierarchies in the visual system.Neuron, 36(5):791–804","venue":null,"work_id":"adfc8bee-6323-49dc-b8b5-fd72c8b50e75","year":2002},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:6ba36f907a651285f464499d61d82fa9c86a3a7fc758d1519c957ae2e4824433","observation_id":"1212c5af-ecda-4b89-bcd8-ef90209d5865","resolution":{"observed_at":"2026-05-15T18:10:13.507897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01448","doi":"10.48550/arxiv.2511.01448","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lightweight and cognitive agentic memory for efficient long- term interaction","venue":"ArXiv.org","work_id":"b5db1457-da04-4002-ae46-fbbb7788da06","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:66e4c84d53fb97169e92f26c5505952b342e83ce5bfd5d0e953f7f84c5341d33","observation_id":"e2605757-1e64-4e5c-a073-994223232c67","resolution":{"observed_at":"2026-05-15T18:10:13.113991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:4520814a984310969a0b139adc8a37f034997e2b681e6f1a15cce772d9aa3f35","observation_id":"24f5bf25-7579-4845-9bfb-692322018610","resolution":{"observed_at":"2026-05-15T18:10:13.071050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":"43fc6efa-6637-43b1-9932-db8fbd11f38b","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:87903c7ed4592424ecca2a2bff4cbec70131cea237be9fd17641f30b40297aec","observation_id":"f92fd66a-635c-463a-acec-78abb64e8fa4","resolution":{"observed_at":"2026-05-15T18:10:13.418998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"0abc0e9b-011f-432e-9c60-cb4cc76c069e","year":2022},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:4263f58e49b7dafa361cb96f086057e1045029d0575403530ea173872b090e35","observation_id":"9c12cb24-b5e0-4cff-88cd-342167ecb798","resolution":{"observed_at":"2026-05-15T18:10:13.486822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large lan- guage models","venue":null,"work_id":"5cf9b4d1-e79a-49ba-b58d-71d0b66faa37","year":2023},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:0dde10243b614233ef340755e2236fc56342df37ea47d38a5308e3f0cdb11afd","observation_id":"247fea39-5a72-4225-bbb3-d20fd3775268","resolution":{"observed_at":"2026-05-15T18:10:13.504286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama- vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"ff7408e3-f050-4fb6-95c1-435f3dd2229a","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:5e833e91df21954e1d4ff04bb148fa6cd0e434decb90a81e8d8e97c66d48e4fa","observation_id":"39938b33-4bf6-4e1a-8b85-7a39d71390ab","resolution":{"observed_at":"2026-05-15T18:10:13.499076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llava: Learning united visual representation by alignment before projec- tion","venue":null,"work_id":"4616eb90-f9d9-404c-9570-47e1f50b9d0b","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:f33e40168b1eac4a672e1920a0446752f0c73fc410e51903ad0fe8ed7d155222","observation_id":"8d334c04-4072-44ba-a6e6-53b6f39117b7","resolution":{"observed_at":"2026-05-15T18:10:13.515404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892– 34916","venue":null,"work_id":"7274844b-65d3-4466-b04c-d91ba2ab97d8","year":2023},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:acac5455197bfc28b1f2d4aa036102919e49e57f6db978956709f54c016d5c91","observation_id":"a4ec8e0f-80e4-48f5-aefc-54e53d20ed84","resolution":{"observed_at":"2026-05-15T18:10:13.446404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.09736","doi":"10.48550/arxiv.2508.09736","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seeing, listening, remembering, and reasoning: A multi- modal agent with long-term memory","venue":"arXiv (Cornell University)","work_id":"4e96e6d1-1009-4e40-bbfe-9317a90452ab","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:78e38a6fab114f1ff4f7dde621c361f2dbdba52b61dc020f9ae3963a2df6a6fc","observation_id":"72c29613-599b-4000-a140-8b60cfd7b9eb","resolution":{"observed_at":"2026-05-15T18:10:13.084528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T09:19:47.876951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T09:19:47.876951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.13093","doi":"10.48550/arxiv.2411.13093","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2411.13093 , year=","venue":"arXiv (Cornell University)","work_id":"562846f0-01d3-4845-947d-9b1cd1003d84","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:aed0d271db0c36c7a233d7648000a78c941cd7dede842c7d7616e8b051f0251a","observation_id":"f0a909e8-7e1e-47a4-bdf8-799ecaa1a65a","resolution":{"observed_at":"2026-05-15T18:10:13.146835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"66daf31a-9a93-4fa4-b811-e942e7bd6e61","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:a9670c3fdb0b1ec122175a7129b445b73fe1ba50e0afebd605397577597bbb87","observation_id":"a3d7dae4-f278-46bc-ad08-e2d3849bc656","resolution":{"observed_at":"2026-05-15T18:10:13.461893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3-embedding: Multi-linguality, multi-functionality, multi-granularity text em- beddings through self-knowledge distillation","venue":null,"work_id":"8c1d43a8-fedc-4eec-ba92-9cb44c04fe51","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:2d3f686bc43bfaadb401ad2ed88a764d4cfd931589e366f268ef43399e611f47","observation_id":"a97c1720-f839-40f2-924c-2f4121c7565e","resolution":{"observed_at":"2026-05-15T18:10:13.477074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memgpt: Towards llms as operating systems","venue":null,"work_id":"dfec0fcb-0264-4d45-8c66-127d8e71bd80","year":2023},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:15ca79b0851728cdee3520f2fde62c0d214658820f4865ee59c34a290a857289","observation_id":"771debdc-c122-4e95-a4a7-a4e8c4991b56","resolution":{"observed_at":"2026-05-15T18:10:13.509851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hd-epic: A highly-detailed egocen- tric video dataset","venue":null,"work_id":"8fd1a965-f5b6-482e-8ba7-e48061bb3b18","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:858d29a9bcc50cbc0a015bfc3709c2f1fe28f0bc3c397819411760737e971ded","observation_id":"49364b86-735e-4834-baf8-9e4ec88862df","resolution":{"observed_at":"2026-05-15T18:10:13.451276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming long video understanding with large lan- guage models.Advances in Neural Information Pro- cessing Systems, 37:119336–119360","venue":null,"work_id":"e635a342-c197-4f2a-ab8f-35027192701c","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:ea5b72cf2a3d7adcc21541e3495aaec7f279f435837a4f7604b2985729ea8713","observation_id":"3bd30bc5-7c1e-4930-b98d-59144df894e2","resolution":{"observed_at":"2026-05-15T18:10:13.461129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fuzzy- trace theory: An interim synthesis.Learning and Individual Differences, 7(1):1–75","venue":null,"work_id":"b3ab6808-afe1-4fb8-8ba8-c086561baba6","year":1995},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:a49656eed69ec47f3cdc5771b141e8b7eccc31879a7f9a402d97a8a8275ab4a7","observation_id":"6a39f7bc-7546-4152-80e0-510cde6ab1da","resolution":{"observed_at":"2026-05-15T18:10:13.481345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.706411Z","title":"Vgent: Graph-based retrieval- reasoning-augmented generation for long video understanding","venue":null,"work_id":"16ab5eed-0d47-49e6-9ba9-e76dad920a11","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:a3b933cf565c26c149c3ef402457e9616424bff7fe1896662acffde3053ee9a3","observation_id":"6935991b-0208-474b-9d5b-a6bcf70e3bbe","resolution":{"observed_at":"2026-05-15T18:10:13.140006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:00.884013Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"b4595ce1-78bb-4b1c-9e50-46bc52d2ce77","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:05fdbd827c73338c7be0ba07bf9f8e108d8877d33406fd366f3570ffbd8492d9","observation_id":"0148f92c-dc6a-4ec8-9ff4-e9345b7b3c4c","resolution":{"observed_at":"2026-05-15T18:10:13.491010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:bf5b9b653d2c0b774842c930134d2b5e59e54a2835b083870d6c0dbe23fa8c3c","observation_id":"b3b003ad-ebba-447e-ab18-7af2c0aad524","resolution":{"observed_at":"2026-05-15T18:10:13.087757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-07T10:46:08.274157Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":"physics/0004057","doi":"10.48550/arxiv.physics/0004057","metadata_source":"pith","pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The information bottleneck method","venue":"physics.data-an","work_id":"72655a80-0724-45ad-a330-1f4ed7aa613b","year":2000},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:25d2e0cea01d25c888f2e15731cda87575cd5fbfa7929160af8827d4669cd166","observation_id":"cc9c67ac-c6d2-42bf-bf95-e3816e82a5b4","resolution":{"observed_at":"2026-05-15T18:10:13.125526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:06.793856+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:06.793856+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":"2304.14407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":"bd186832-fce9-4e7a-845b-19a5d5673de2","year":2023},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:a470d3b1626fd97f4c80d8a677736bbe5d9848ea88a106ecbc15bd6d2aa85ade","observation_id":"1f8f433f-4812-4bc4-8563-c4b538c5550d","resolution":{"observed_at":"2026-05-15T18:10:13.132631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:35fdb3965024ac8cff2fe976f2aa8688fb1e38ab6a83501e806ed1a54f5a0a4f","observation_id":"5e6b9451-beb0-4ed6-8a1f-14600b7a3fea","resolution":{"observed_at":"2026-05-15T18:10:13.074747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoagent: Long-form video under- standing with large language model as agent","venue":null,"work_id":"d943fe85-7322-4e03-a4dd-52d94bfba82f","year":null},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:90acd1c07cb5cfff4c10f1fda3f343e94ceb235d813524237ae85ace5caf8cec","observation_id":"3d023001-1c3d-4ded-b914-42f940f2a27b","resolution":{"observed_at":"2026-05-15T18:10:13.412290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.02889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:39:46.752891Z","title":"Longllava: Scaling multi-modal llms to 1000 images efficiently via hybrid architecture","venue":null,"work_id":"c93e268d-1703-46de-8123-15c73f06bc0b","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:cfe46e9f424bcc799ed43b8d6fbd96fa30d33819d55f9889a7455dd4546cca9d","observation_id":"849b962e-fa03-47a8-a029-0688a4c5f44b","resolution":{"observed_at":"2026-05-15T18:10:13.094597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":"5e425c9e-1993-4774-bbd6-4b81c7b3bfc3","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:b60048b81e4cced1b6a960f534d30c625afd3d1570cd490cc031908954022f5c","observation_id":"7cdf5f1f-6e6f-439f-a89b-abbc27e4c6a9","resolution":{"observed_at":"2026-05-15T18:10:13.465839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C-pack: Packed resources for general chinese embeddings","venue":null,"work_id":"666494fa-e860-4fe1-879c-35771725d2f3","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:55e26528b177104a5fe79ee8a0aff46e2b6060aaa004784348910b2c110739c1","observation_id":"6530a7df-536e-4c8b-a1f4-e3f07abfd18a","resolution":{"observed_at":"2026-05-15T18:10:13.451710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-08-10T14:00:59.359997Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:0fb565eaecad6ac88219c6e4a8a2773abac67151484ad05a9f4b4e4c2abf9abd","observation_id":"2a99e6f8-c524-448c-96a2-ce1119528069","resolution":{"observed_at":"2026-05-15T18:10:13.100889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12110","last_updated":"2025-10-08T01:46:37Z","snapshot_observed_at":"2026-08-03T02:27:06.991396Z","submitted_at":"2025-02-17T18:36:14Z","title":"A-MEM: Agentic Memory for LLM Agents","version":11},"cited_work":{"arxiv_id":"2502.12110","doi":"10.48550/arxiv.2502.12110","metadata_source":"pith","pith_arxiv_id":"2502.12110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A-MEM: Agentic Memory for LLM Agents","venue":"cs.CL","work_id":"3b98feb2-fdb1-479a-bbe4-2c298a4592e2","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2502.12110","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:97479bb9c1fd539cccd78af6d43197e509a4659c615b3e48ddd83feb5aaab809","observation_id":"1ba2968c-dcaa-4206-a256-cb8e7eee4cc9","resolution":{"observed_at":"2026-05-15T18:10:13.119772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19828","last_updated":"2026-01-14T14:21:21Z","snapshot_observed_at":"2026-07-06T22:19:28.487854Z","submitted_at":"2025-08-27T12:26:55Z","title":"Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2508.19828","doi":"10.48550/arxiv.2508.19828","metadata_source":"pith","pith_arxiv_id":"2508.19828","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning","venue":"cs.CL","work_id":"2a070440-2167-4398-be97-c2d4c3ee3541","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2508.19828","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:0c1382e9dc111b3b71349b9bdad74e959a196b7e43577c21079a76c866231b5e","observation_id":"5cab4dc2-71de-45ad-b4fd-c21a3270fe6e","resolution":{"observed_at":"2026-05-15T18:10:13.078382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:35.802766+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:35.802766+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:53f70f66d3eed613cde80e5ea3309d6d2619245878077fbe4ed392a2acf507f8","observation_id":"172309e8-90f8-42e5-8eea-cb96806110f7","resolution":{"observed_at":"2026-05-15T18:10:13.120845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":"2406.08085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-07-04T20:00:08.182505Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"f53e5fea-3444-480b-aa38-be98378c0ced","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:8c17a73900bfe6bf5d87295c0c18493839f97ffbf82e6a03c8f1731e887f8238","observation_id":"5bc8b24f-ac61-4f4b-a48e-e571ca4389d6","resolution":{"observed_at":"2026-05-15T18:10:13.107496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:798c06962bf9ba7130e30f16e6a706021eecb5af7fca8868a3ada491553d88a7","observation_id":"1862eb9f-6e6d-4eac-9e5b-43713013f906","resolution":{"observed_at":"2026-05-15T18:10:13.040656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:b5acb9f5ab7f95e7960ee9cc79a050a30a26ba6f3e04409787967e0e5a471e7c","observation_id":"fc7ef0be-1d40-4e91-b4a3-82756e7975b4","resolution":{"observed_at":"2026-05-15T18:10:13.114723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memorybank: Enhancing large language models with long-term memory","venue":null,"work_id":"b91a61c6-f67d-4751-879f-d6027f9a74a6","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:97f9ea0fd1288bd88c6fb3fe4cc7be8d1c5d9226aaee6f3353933d4f26a9bc9a","observation_id":"0abd9925-a65c-4c13-b7d5-788292e8eb20","resolution":{"observed_at":"2026-05-15T18:10:13.424386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":null,"work_id":"e4307443-42bf-4c8d-8055-13690a4f3bf2","year":2025},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:4739808d615d197c040fbe88ca57a77a001d8c1f4aa35f9132f2b1e6af48ff14","observation_id":"3435fd34-5232-4c8e-ad6e-a0f0247dce24","resolution":{"observed_at":"2026-05-15T18:10:13.398127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Select the best answer to the following multiple-choice question based on the video.\\n","venue":null,"work_id":"55ed5357-c43a-4691-88ca-58f9cc8dd5ea","year":null},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:ea2ebbe685f8bacc942544b227076e49f5aeef3215a0cc7533e48d9ac34f97a4","observation_id":"1f98cdf6-5093-482e-9e24-ce409a1251b8","resolution":{"observed_at":"2026-05-15T18:10:13.402824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":21,"verified_fuzzy":25},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 7 inbound Pith citation observations for arXiv:2603.01455."}