{"as_of":"2026-08-07T18:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:163356a009a9747e86f8988260945b19d13fc00dd6c1a28447e860f5c857f154","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:42:29.264825Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:03:26.782904Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:59:57.422464Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2509.00419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-07-04T15:59:57.422464Z","title":"Harsh Jhamtani and Taylor Berg-Kirkpatrick","venue":null,"work_id":"5e6f631c-5d69-4f40-8d4f-cb0d77ced906","year":2025},"citing_paper":{"arxiv_id":"2604.05887","last_updated":"2026-04-07T13:51:07Z","snapshot_observed_at":"2026-07-06T22:54:30.567988Z","submitted_at":"2026-04-07T13:51:07Z","title":"HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:58:45.374139Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2604.05887"},"observation_digest":"sha256:f6bd551fbaa1006c191b6545c316b3f49b72870ffe59a549b13b839d6e6cc03c","observation_id":"a3a4f5ed-3447-4948-8f42-5d316adb27df","resolution":{"observed_at":"2026-05-10T22:20:48.354550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2509.00419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-07-04T15:59:57.422464Z","title":"Harsh Jhamtani and Taylor Berg-Kirkpatrick","venue":null,"work_id":"5e6f631c-5d69-4f40-8d4f-cb0d77ced906","year":2025},"citing_paper":{"arxiv_id":"2605.28115","last_updated":"2026-05-27T08:09:44Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:09:44Z","title":"CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T12:12:51.867760Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2605.28115"},"observation_digest":"sha256:ae5aba4b87d49e9945e29f419be39615af337e3b28487408c99e0a52d90622e0","observation_id":"cfbce84e-0766-4d32-b12b-649646c1da17","resolution":{"observed_at":"2026-06-29T12:13:26.454047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2509.00419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-07-04T15:59:57.422464Z","title":"Harsh Jhamtani and Taylor Berg-Kirkpatrick","venue":null,"work_id":"5e6f631c-5d69-4f40-8d4f-cb0d77ced906","year":2025},"citing_paper":{"arxiv_id":"2606.24156","last_updated":"2026-06-23T05:24:50Z","snapshot_observed_at":"2026-07-06T23:58:44.541819Z","submitted_at":"2026-06-23T05:24:50Z","title":"Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:00.373247Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2606.24156"},"observation_digest":"sha256:b8f80541ba6e6aedc381f5e5d37580a43990b3947bdeca16f15bc409dc28085d","observation_id":"f36012ed-4480-4707-9ac7-e2c97e48ee7b","resolution":{"observed_at":"2026-07-04T15:59:56.765099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2509.00419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-07-04T15:59:57.422464Z","title":"Harsh Jhamtani and Taylor Berg-Kirkpatrick","venue":null,"work_id":"5e6f631c-5d69-4f40-8d4f-cb0d77ced906","year":2025},"citing_paper":{"arxiv_id":"2606.24165","last_updated":"2026-06-23T05:39:52Z","snapshot_observed_at":"2026-08-02T01:56:55.495306Z","submitted_at":"2026-06-23T05:39:52Z","title":"Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T01:04:20.802531Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2606.24165"},"observation_digest":"sha256:f933393f043850eae603352894764adb7b0d417b9b4705050f3e3d6ade47c270","observation_id":"be980c68-f51c-42f2-9eb3-a29cbae6d681","resolution":{"observed_at":"2026-07-04T15:59:57.423842Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-08-02T05:03:26.782904Z","title":"Lightvlm: Acceleraing large multimodal models with pyramid token merging and kv cache compression,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.782904Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:0e8d0e53448f5f369b086ff75dae07ae103962219a37de17dce4ee25bf0fa1bb","observation_id":"d13bbfb4-1f49-43db-b16c-80d33edd3730","resolution":{"observed_at":"2026-08-02T05:03:26.782904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00419/citation-record","integrity":"/paper/2509.00419/integrity","json":"/paper/2509.00419/citation-record.json","paper":"/paper/2509.00419"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:22.672491Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.672491Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:6599cbe88ebfd9ba04bf260cbae34abdb361fa5597d8dc7d04889e5f74c4e638","observation_id":"e39a8bf1-6a96-4633-a840-16d2d58e8397","resolution":{"observed_at":"2026-08-05T13:42:22.672491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:22.774072Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.774072Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:2369126d046f0fe1a793550e306a55e05e367d1473a21400d7373d58673a072f","observation_id":"e9af7304-6f1e-4b75-93f5-cf7be541e311","resolution":{"observed_at":"2026-08-05T13:42:22.774072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:38.266627Z","title":null,"venue":null,"work_id":"1078905f-d4d3-44fb-910e-9d8b63a31689","year":2022},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.832068Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:fda28e8111138849bb9a842c8db7920728402f56062216e2ce10a4e3224d62ac","observation_id":"3f5f2323-fbf7-48d4-b866-c3214d6797bf","resolution":{"observed_at":"2026-08-05T13:42:38.342321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10945","last_updated":"2024-12-25T01:27:01Z","snapshot_observed_at":"2026-07-06T19:03:35.394180Z","submitted_at":"2024-08-20T15:34:27Z","title":"HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10945","snapshot_observed_at":"2026-08-05T13:42:22.903167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.903167Z"},"links":{"cited_paper":"/paper/2408.10945","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:889723a5a088bc24cf40bf69710559fe36a7ae9208d19d8d99137890e4c13032","observation_id":"d7f06c1f-40ff-48c0-80e1-ca68a43e3c98","resolution":{"observed_at":"2026-08-05T13:42:22.903167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T13:42:22.989120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:22.989120Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:e163df32a2ecea272e4ce7c7d85f12f2eaecc9c27151b15f4b3e4feb8bfd0c5a","observation_id":"603fcc49-fa2b-4b00-8795-4c2462b8697c","resolution":{"observed_at":"2026-08-05T13:42:22.989120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:23.065410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.065410Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:ca7bb39170888ae7e7fa44e98638f1fcd8e2d80f243e72a5a27f945c245d59e7","observation_id":"347f759e-8492-48c5-84ef-6dfbb74b682a","resolution":{"observed_at":"2026-08-05T13:42:23.065410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T13:42:23.148844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.148844Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:29f9068ec1e72c708e3785b06f2fbdc0519179c226e6f0e2aa25be0aa849f44a","observation_id":"19f6daa0-b112-4d0b-8739-d3cb0e016320","resolution":{"observed_at":"2026-08-05T13:42:23.148844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:38.060679Z","title":null,"venue":null,"work_id":"1096ffeb-bdff-4875-ae8a-39b81788f095","year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.218377Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:25d5a555e789acdef3f2f4304e31b11f61f26f3898ed236f50603acf0416069a","observation_id":"df1e7d22-0ce9-428d-aadb-65a68c83b5fa","resolution":{"observed_at":"2026-08-05T13:42:38.139124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T13:42:23.334060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.334060Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:5ac1effc6c5b82bbde076c6df1a5a7dd279945d71d695b120013bc7f5d56f3f7","observation_id":"7dd90ed1-4f5f-402c-b270-bec831610849","resolution":{"observed_at":"2026-08-05T13:42:23.334060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T13:42:23.415022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.415022Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:3e67da9af1c90f811a303967699017faef68a6ca021381d82ce629f98adeebe6","observation_id":"b71f6f9e-8bbd-488c-af92-ebd5aa486989","resolution":{"observed_at":"2026-08-05T13:42:23.415022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T13:42:23.508694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.508694Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:cc44b73cbe3c165b4027419ed0d616151b9e1ce5e67105acc7536b56339c23d4","observation_id":"560f4c9c-079f-44b7-8539-577a27236f78","resolution":{"observed_at":"2026-08-05T13:42:23.508694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i16.33842","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:29.393482Z","title":null,"venue":null,"work_id":"ecdb49e3-7aa9-4539-b32c-01b8eff270d5","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.585796Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:d3119917ecb4df23b72f2833471b62076b590de6d9783fc139202e26b53214c4","observation_id":"f23f3775-03fd-4e32-a21e-5b146cf594ea","resolution":{"observed_at":"2026-08-05T13:42:29.439727Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:37.876007Z","title":null,"venue":null,"work_id":"4790d6bc-fafd-4f7b-88b7-88c5a215789b","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.648614Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:38e8b3270168e01a9da217afe141e6b1d6f1b770ec40d8451edc3b96b5c48b24","observation_id":"1147cb59-830a-408f-99b9-19c28faace18","resolution":{"observed_at":"2026-08-05T13:42:37.952475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10651","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:30.886779Z","title":null,"venue":null,"work_id":"883350e2-4e91-411d-806d-4f8783b2b430","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.704750Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:a23f83c9eb9e079b49cf8324da5e6b1f66cb1db1e29ddaf8d9d2b2432741ae61","observation_id":"71527a54-85a4-408a-a8cc-59a865b404be","resolution":{"observed_at":"2026-08-05T13:42:31.030779Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:37.641353Z","title":null,"venue":null,"work_id":"19e3c9da-9852-4010-bcd1-f3c675b7ee42","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.780641Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:4b5ea0bd8d2ba91f7d8a845c9a7dbee89b5750b4f3108a7c007bf08732c33cdc","observation_id":"a885e856-5489-4b10-a5b8-8f1246dbcfe6","resolution":{"observed_at":"2026-08-05T13:42:37.764141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:37.453382Z","title":null,"venue":null,"work_id":"5870a717-815d-4a12-88be-9c21abf480cb","year":2020},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.844900Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:321d7bacd186c8477ca461a0cf613fa3a47f8b47bba8aeccc20623211bc56894","observation_id":"ae53f67d-1f4c-43a2-b450-9aa43406ddc4","resolution":{"observed_at":"2026-08-05T13:42:37.533292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:37.220506Z","title":null,"venue":null,"work_id":"8ea301ee-f2d3-42e2-8dc1-9a54f0e4aae9","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.933695Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:3756e3908ca4a3e9827fb88cccbe999b25026234bf58c4d1a3a1b372321c166e","observation_id":"c74e6b7b-d87b-4c18-a689-7a8d5c6b64e9","resolution":{"observed_at":"2026-08-05T13:42:37.330147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.982938Z","title":null,"venue":null,"work_id":"a4d37b58-82e5-4ef7-b630-34a9035e68f9","year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.938646Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:f84e84a7650d2b85f9c8cc00618280550cda2e2589b0d3b722a0488a4d752f72","observation_id":"2dc21c2c-f757-4c8f-8ff8-2dacefe3fbdc","resolution":{"observed_at":"2026-08-05T13:42:37.092695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.776867Z","title":null,"venue":null,"work_id":"d46aa945-c7b1-4675-995b-a1d2fec25187","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.944156Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:f7f48a40580bdc9b7e3d83e0d66f84ac311340bec260db6af23ddd09f64dd695","observation_id":"15e204f8-d967-4db2-8f4e-5215cf798120","resolution":{"observed_at":"2026-08-05T13:42:36.854096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.539495Z","title":null,"venue":null,"work_id":"ec92238d-e7ea-4ae4-9c90-ce34a8d7346e","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:23.951604Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:73613cb4df801182877a33b439af0b6b73ef55a61cc7e1416c6a6f81b6be0443","observation_id":"88adabbc-f3bd-4964-881c-21c49781875d","resolution":{"observed_at":"2026-08-05T13:42:36.663296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-07T13:04:50.040909Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T13:42:24.024369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.024369Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:7465b19ae70a1ca0005ae395a93908ff5d5fcca9fc92d2b2f3d896d74596d89b","observation_id":"7942e703-e04c-4a86-9248-d90e23cb6765","resolution":{"observed_at":"2026-08-05T13:42:24.024369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:24.135702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.135702Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:ba2066650501b6c71f4af4249a17433eddb0051cbf5ac5be3e85762965a8f494","observation_id":"3a371c47-94e7-4010-9ec6-7bcc63c35797","resolution":{"observed_at":"2026-08-05T13:42:24.135702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07003","last_updated":"2021-06-11T20:00:20Z","snapshot_observed_at":"2026-07-06T10:04:21.217242Z","submitted_at":"2020-10-14T12:28:08Z","title":"Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07003","snapshot_observed_at":"2026-08-05T13:42:24.274676Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.274676Z"},"links":{"cited_paper":"/paper/2010.07003","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:69f646ad53a0cc16fd3ecb1cf18aad63262e2d2755fea583e6d7cacf80713e86","observation_id":"4d9b0595-6538-432c-8b88-2af5e8c6db83","resolution":{"observed_at":"2026-08-05T13:42:24.274676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.383498Z","title":null,"venue":null,"work_id":"76123102-5969-44fc-bac3-7de0c3549cd9","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.417422Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:d0b8b30554dbbac5b5e5b0037635e58ff79a7c32adb39e69c3a62d8dc507df1f","observation_id":"9184c06d-1e16-43a5-a5a6-8298c04848e3","resolution":{"observed_at":"2026-08-05T13:42:36.459732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06540","last_updated":"2021-12-13T10:24:54Z","snapshot_observed_at":"2026-07-06T12:18:03.877754Z","submitted_at":"2021-12-13T10:24:54Z","title":"A Study on Token Pruning for ColBERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06540","snapshot_observed_at":"2026-08-05T13:42:24.576796Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.576796Z"},"links":{"cited_paper":"/paper/2112.06540","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:98b925f8dba4ee281b6b6209db7ba9122a34c8c0d7e9260cdd85461f37cb8131","observation_id":"d544c8a8-2608-4435-bd7b-f86a3f2ebff6","resolution":{"observed_at":"2026-08-05T13:42:24.576796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T13:42:24.706806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.706806Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:9bd70d71993c5f2ca59756036e0908c9ef10f44ff62a93d16116f0227e5ddc4d","observation_id":"80d32214-cd9b-4680-a3e2-3236d9848557","resolution":{"observed_at":"2026-08-05T13:42:24.706806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:36.162917Z","title":null,"venue":null,"work_id":"5fe17606-19fe-49ad-8ac4-b7ea522f87ff","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:24.901234Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:39275c098739fd59920692dd569dfb1f0eadc1419d1e37b7c2277481c4b050a0","observation_id":"1fcfaf2a-5b8b-41b2-990d-0e07150b2d22","resolution":{"observed_at":"2026-08-05T13:42:36.283379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.900057Z","title":null,"venue":null,"work_id":"7ccd5491-1ed8-4d4d-8ef8-69a40967bfa8","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.089559Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:75b29c436ddbd3067195b3316d59d5a7b28c18affb6f7e3b7636816e270b8328","observation_id":"a4a0ee39-230b-4234-bb61-943f16198377","resolution":{"observed_at":"2026-08-05T13:42:35.997122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T13:42:25.233873Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.233873Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:2e6fb4a213c1060de0561cdda20e0f445fecf6d533e5441c1c759429c34b6288","observation_id":"64bdbd4b-cafd-471f-b876-bb7f4949788d","resolution":{"observed_at":"2026-08-05T13:42:25.233873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.710902Z","title":null,"venue":null,"work_id":"d0cf35c7-b9a1-4e44-8f8e-e42180bebbd3","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.414858Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:b48cb4b7c55e0b2c986b3da8672648a4b93e566b7a6831a487e3ba2c45c4355d","observation_id":"87b720a0-3bce-4fe3-9172-8b2ce2411744","resolution":{"observed_at":"2026-08-05T13:42:35.792606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.524266Z","title":null,"venue":null,"work_id":"85f46d5f-cd53-418e-a348-ea2174a7ea12","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.609037Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:fe57c0b94455d5f95ff9e43c8e55c7e005201664ed5fbc309762f8e4f01edc16","observation_id":"6c4ce98d-5f94-448c-8c52-98e5e06645e4","resolution":{"observed_at":"2026-08-05T13:42:35.620346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:25.812634Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.812634Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:25d7d75a4d7e82db0c485754f8582e9af46cc74a6487750c351e586f616a83df","observation_id":"8f897563-0faf-4608-9fef-cee0c1953d83","resolution":{"observed_at":"2026-08-05T13:42:25.812634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:25.955338Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:25.955338Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:5c97cf89405730fe5c4e2002ea99fefa6b043d93ee87c56539636d96f4344a6d","observation_id":"e3cfce5f-6fc0-463c-b5ae-ba57ba05aea9","resolution":{"observed_at":"2026-08-05T13:42:25.955338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.261545Z","title":null,"venue":null,"work_id":"7f8cb295-0102-40a6-9b6d-4d3150b533d3","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.130156Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:6c82cbe1c3433ddad46a3eab9fed6cd36d71d7ce48abdd3972a16546a43e30d2","observation_id":"df2cab8c-e828-45da-a04b-041ab567f309","resolution":{"observed_at":"2026-08-05T13:42:35.338419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:26.269777Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.269777Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:a86bda02b7b82caa4043da50879a8f7c65c7a2b43caca40eeb5b9a9a206e8b5e","observation_id":"b3f3b9b4-3496-4f5f-88e8-c0ad221b67bb","resolution":{"observed_at":"2026-08-05T13:42:26.269777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T13:42:26.378907Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.378907Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:7b5d9977e009ed14a83efc26d70ffb1f60efc604b3af3b9802b721e4030b8a54","observation_id":"8602b363-94c4-44e2-92b9-90a272b24cf9","resolution":{"observed_at":"2026-08-05T13:42:26.378907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:35.069520Z","title":null,"venue":null,"work_id":"acb33344-a2e8-4deb-b84f-845567a8cefb","year":2022},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.485956Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:97ef09ab1729da5effe8c11752229e41ee83f2997443cbf5db7937b2fbb9b388","observation_id":"8fff648c-754a-4a65-abf4-58b9a9a03746","resolution":{"observed_at":"2026-08-05T13:42:35.148319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:34.772472Z","title":null,"venue":null,"work_id":"cc913ad7-9b0b-48ae-8a7d-8a5c72779132","year":2017},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.592480Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:a44c644df9ec36debc979530eac720e5a3b7b6064bc6479b397898332d110c78","observation_id":"7c1019a9-df2d-4491-9132-b0c54f8e5909","resolution":{"observed_at":"2026-08-05T13:42:34.933892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:34.551439Z","title":null,"venue":null,"work_id":"9f0c6418-7282-49d4-ab14-a3bc00f97e50","year":2022},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.700562Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:9a07bef60ec62be2a99d8df629aa8afb43a67ec2ee9e5e8ebe57a9aa8de7a9af","observation_id":"54933ae2-6ad6-44e0-ac61-f8078488fb40","resolution":{"observed_at":"2026-08-05T13:42:34.637417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:34.298599Z","title":null,"venue":null,"work_id":"39d342bb-9fa8-4284-9587-921579e4ac49","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.834616Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:ff34a01aa62a91d34e05899933eeca935d751aa45147c12f3e6ab4d1724c16c2","observation_id":"572a5fd9-9bb5-413f-b21d-fc320bcca9a9","resolution":{"observed_at":"2026-08-05T13:42:34.408199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:34.072200Z","title":null,"venue":null,"work_id":"87ff280f-6b33-4711-abe4-103584cedccf","year":2017},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:26.935776Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:f4d899d63c04044a2f4afc49d7a1351bb64380bb93af13baa1cb7fd997eac780","observation_id":"268c6568-f2c4-4d78-b141-00cc5df95e19","resolution":{"observed_at":"2026-08-05T13:42:34.175479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.854224Z","title":null,"venue":null,"work_id":"6ec72725-15a2-4c2a-a4c4-f3273ecbb5a4","year":2021},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.038884Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:dfa133327225b01ec53e05d1a0760887b8b5547fa832603bc87c8be4a9fae422","observation_id":"6310c7f4-3ba8-4fc0-bcd0-e43273fb5e01","resolution":{"observed_at":"2026-08-05T13:42:33.957244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.672317Z","title":null,"venue":null,"work_id":"4d9dc86e-c48e-42cc-b930-6e4f9fc99f02","year":2021},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.115800Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:e59fc145d4cd5cfdc32567c9fc74e1644890afb012b61018a90671c5baeceadd","observation_id":"5a75df77-d674-49af-8aa5-1a7007c24541","resolution":{"observed_at":"2026-08-05T13:42:33.775286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:27.219802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.219802Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:c99778916abf679e90a54d0c285231891641cc0287027edefcca0b467742d809","observation_id":"1858da30-ad44-4644-b2d6-33a296c7664e","resolution":{"observed_at":"2026-08-05T13:42:27.219802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.435521Z","title":null,"venue":null,"work_id":"62409362-c77a-43cc-aa23-1d480de7229d","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.325490Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:2d3029cdd1e86eb036f257c1462c2562b1fbc82841d97305f738ee054e145a0c","observation_id":"e33b9e5b-8a14-45c9-91e5-185a5831f4fc","resolution":{"observed_at":"2026-08-05T13:42:33.550312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.315405Z","title":null,"venue":null,"work_id":"22d0479c-2e8a-401a-aced-6dffbdbc6664","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.462268Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:195b742aa336c91dc97115810087f921b8510630ee31825a5ea5b87801b0ee1e","observation_id":"5f53bc73-532b-48fd-a632-d703e01c71ba","resolution":{"observed_at":"2026-08-05T13:42:33.367520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:33.149369Z","title":null,"venue":null,"work_id":"a16f7c54-59a5-450d-bba8-f7c266696c8d","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.541723Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:77d04607efa5cfadd8deb1e0c7602cc2bdab11f69820170289a092e4ef0638a3","observation_id":"b94b5cbe-cc0b-4558-9749-fdc79c3181a6","resolution":{"observed_at":"2026-08-05T13:42:33.240837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-06T10:53:26.005728Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-05T13:42:27.635378Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.635378Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:b67f4c6a6e0a5db15dc7527df06da46ef73c223b692ac00cbf6e2b2e69c075e2","observation_id":"a5556458-4547-43b2-8622-19b6cc050ee1","resolution":{"observed_at":"2026-08-05T13:42:27.635378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T13:42:27.728036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.728036Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:9f668c0bd16d92cf472d539db25b66082d18ad44c56580105f8aaee1ac6f0c31","observation_id":"2891eb46-dd02-4ca6-83e6-12703098abad","resolution":{"observed_at":"2026-08-05T13:42:27.728036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:27.805437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.805437Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:9ad8bfe44ae9cee047ac14036efb962fd521e999b8f82678253cb595d31a7093","observation_id":"d0f5980a-123e-4b83-b2c3-a3d69785e456","resolution":{"observed_at":"2026-08-05T13:42:27.805437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.956877Z","title":null,"venue":null,"work_id":"a72a2c63-0a85-4c5f-9972-0d5208907060","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.886430Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:2ee0395b17a85c491a794c488845dedc0082f0057e2307e20b09b52ecc5c6579","observation_id":"f5d9b632-2d99-4c96-bc62-58df3fb18d29","resolution":{"observed_at":"2026-08-05T13:42:33.035275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-05T13:42:27.944783Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:27.944783Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:c5a3f11d35aef2a13871aa5b2cc54a77dacde983bd00cfc15a41d09802ba1d1a","observation_id":"10561fb1-d74c-4e84-a724-da5e72d258e5","resolution":{"observed_at":"2026-08-05T13:42:27.944783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.815451Z","title":null,"venue":null,"work_id":"da4532b8-87b7-49e1-afe3-635377188969","year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.044080Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:3571206f1dd22bbb907737a59ac2156cfef5851d12de3d87bbb6310e8198e109","observation_id":"45b5c767-8842-4af4-8e06-31814c83e787","resolution":{"observed_at":"2026-08-05T13:42:32.875298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T13:42:28.151533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.151533Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:7da258ab58c376fd16bbf8b111288ae2d4625e6529964b4d002cc43ecc67433d","observation_id":"bd5ad8e8-fc81-48ee-a34e-24501979196a","resolution":{"observed_at":"2026-08-05T13:42:28.151533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.670427Z","title":null,"venue":null,"work_id":"9d590c70-3a6b-4ceb-aac4-f2ff4975ccb4","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.208271Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:1cfac565874db6a4a4c2e39e193cd76742b87de2963cabc0991927b39c201fb8","observation_id":"3e564b3d-cf4c-499e-ac67-fe18c1b5b0d0","resolution":{"observed_at":"2026-08-05T13:42:32.740147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-05T13:42:28.293970Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.293970Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:18b29b0b97f77d02f8ff76197857e75db1b8494daa11935a6d8d9140aab0d908","observation_id":"89509a5e-4f84-4017-9308-07e483a219ee","resolution":{"observed_at":"2026-08-05T13:42:28.293970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:28.410082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.410082Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:4ea5271bfa40a1d83e6099f71a88c74c50af40481d8c4d5a965ee7791c6e1b11","observation_id":"049c161e-8a49-4b47-9290-ff795abedf9a","resolution":{"observed_at":"2026-08-05T13:42:28.410082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-05T13:42:28.502423Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.502423Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:5ec545738dc93e12ed2dd96c585c8f992ae7e680e1c6fb3c2285d1f0d39e972f","observation_id":"d6f26fe0-4e32-421e-a57d-cf143ef66f24","resolution":{"observed_at":"2026-08-05T13:42:28.502423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.509083Z","title":null,"venue":null,"work_id":"d8f4ae7e-4df1-443e-8779-362554739779","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.586105Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:e7cebd7272e2c777a3873373cea21ac9f09701c6bb39fac28e896737550a79e5","observation_id":"c6531b8d-3542-4a86-9833-35c90dc321a1","resolution":{"observed_at":"2026-08-05T13:42:32.576905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.274698Z","title":null,"venue":null,"work_id":"7b8f656f-a2da-4ee2-9f4b-5ca2eb3ac168","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.666125Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:62730a7e10e43ac04f23bb3d7af71fbb4952978f8f4146561b7af90ee3170894","observation_id":"2c558228-3dce-432e-9d48-c7a5414d3206","resolution":{"observed_at":"2026-08-05T13:42:32.417911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-05T13:42:28.758540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.758540Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:d660d8fafe2ba20270ac2ce6ba2f75453ec1db1c6311e6ca699d3f5892bf6f31","observation_id":"5538dd61-e472-4646-a6fe-73bfb96e193a","resolution":{"observed_at":"2026-08-05T13:42:28.758540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:32.016975Z","title":null,"venue":null,"work_id":"eddbccb0-4eb2-4a6c-b9c1-b0f164714048","year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.844360Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:972344e5420823d9d9e6665bfd6ed17ac7f157288c5e1b1e9cdee6a5ec548023","observation_id":"eb9953f2-7e5b-4906-b8aa-4cfbb8fb392a","resolution":{"observed_at":"2026-08-05T13:42:32.133485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-07-06T20:00:28.112838Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-05T13:42:28.922349Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:28.922349Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:76f8d487a2d9e621a3880fbd7923177af9f86a90a56658a85e4ef014e9cd1a49","observation_id":"a8b6add4-2c32-4340-9e76-eb965d4975ed","resolution":{"observed_at":"2026-08-05T13:42:28.922349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14439","last_updated":"2024-07-19T16:11:15Z","snapshot_observed_at":"2026-08-07T08:50:49.699503Z","submitted_at":"2024-07-19T16:11:15Z","title":"Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14439","snapshot_observed_at":"2026-08-05T13:42:29.008171Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:29.008171Z"},"links":{"cited_paper":"/paper/2407.14439","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:7f1fc20bb6b145a9e0e82c1ce1b1debd6b60afa350b29f1763068f63113e55f1","observation_id":"0d467945-0623-4172-9ce8-608ec0c12b99","resolution":{"observed_at":"2026-08-05T13:42:29.008171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:31.705141Z","title":null,"venue":null,"work_id":"db4aa04d-8161-47ba-8d6f-644124d9e8f4","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:29.103943Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:6fced36a3fdc0ff1e021368583663044d817020ac5fa93b89d2fb6d185f9a3e1","observation_id":"559511f1-0a75-4938-ab81-a3d6c7986e18","resolution":{"observed_at":"2026-08-05T13:42:31.870651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:42:31.354907Z","title":null,"venue":null,"work_id":"52276521-38ba-489a-beba-dbf0216efe9b","year":2025},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:29.180607Z"},"links":{"citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:a6b454c03863b2056eead705732c3985666e61e9eb49f2d3b35c4e0ea2666cec","observation_id":"5e0251c3-181a-43d3-8741-1daedf4f0dba","resolution":{"observed_at":"2026-08-05T13:42:31.511234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T13:42:29.264825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T13:42:29.264825Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2509.00419"},"observation_digest":"sha256:c9df83238e8ee3e93a0732ee2e5cb1a6ea488700bc333defb1aba9f3715b49b4","observation_id":"2f0c0531-01f2-4bf4-8299-2aec7fa82cd7","resolution":{"observed_at":"2026-08-05T13:42:29.264825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T13:42:21.010094Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":65,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 5 inbound Pith citation observations for arXiv:2509.00419."}