{"as_of":"2026-08-07T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d7523a6bf6cef8f624864bdf4a625c5a0483749f19923d81800e16af8f58b00","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:18:06.616164Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20842/citation-record","integrity":"/paper/2507.20842/integrity","json":"/paper/2507.20842/citation-record.json","paper":"/paper/2507.20842"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:00.011411Z","title":"HiRED: Attention-guided token dropping for efficient inference of high-resolution vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.011411Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:0c12f20e9f7b1b45d108853e829a510ec138acd2ff00b50a48c0b9edced2badd","observation_id":"9bf00e6c-7602-4633-96e4-f9a9d413c4b0","resolution":{"observed_at":"2026-08-06T13:18:00.011411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T13:18:00.053585Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.053585Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:fe0a2da66f039b42983fd333cddb61a328f917275dac36a9cb874610e4f77901","observation_id":"c1485921-bb5c-4034-9de7-180bcad8880c","resolution":{"observed_at":"2026-08-06T13:18:00.053585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T13:18:00.134131Z","title":"Qwen-VL: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.134131Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:367b43bc4f42d1bd6b1b9fb75658f630df434b29114905c9beb869fea020be47","observation_id":"87ea521d-1dbc-492e-9cda-e099ef20f5d9","resolution":{"observed_at":"2026-08-06T13:18:00.134131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:00.225142Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.225142Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:0401f8a177867a570d486e3cb72e13efe97bdef0d484c2aa4072d871323da837","observation_id":"ead1432d-477a-4e49-9bcb-f4c9afa33128","resolution":{"observed_at":"2026-08-06T13:18:00.225142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:00.280685Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.280685Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:092c190206ae3f7d8b6231dc756713c4de297d238d20d81e5583d9217cf728b9","observation_id":"999b5cec-07e7-4562-9256-9980b3894810","resolution":{"observed_at":"2026-08-06T13:18:00.280685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:00.380288Z","title":"Open-LLaV A-NeXT: An open- source implementation of LLaV A-NeXT series for facilitat- ing the large multi-modal model community","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.380288Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:718789923f1fac05f73cb54faefd64c581dd54f85e1ad6b207fdd10b863ff26a","observation_id":"a357e339-40d8-4090-b109-d7355d21abd4","resolution":{"observed_at":"2026-08-06T13:18:00.380288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.860752Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceler- ation for large vision-language models","venue":null,"work_id":"d0ae9100-1a81-4dd2-8e55-0c780011350f","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.452458Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:0631f0574022be5f6836710c3f13770b9a8abaf98363ed5b39a12b20e0b09c50","observation_id":"31abbaa4-7649-4f69-9f56-0f1ac3899f23","resolution":{"observed_at":"2026-08-06T13:18:08.864395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.849432Z","title":"How far are we to GPT- 4V? Closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":"08d4e00f-7432-4e04-be0e-5c3f9a11d114","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.540214Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:3f0a0a5f802e67c776c03465216e70971ea1d7ec9307900d960d45817b3d3318","observation_id":"b63ad6fe-d42f-4d92-8267-c952b4650498","resolution":{"observed_at":"2026-08-06T13:18:08.853260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.838130Z","title":"Intern VL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"b39791ba-3fa8-48a0-87cb-f5e34589de90","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.606313Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:5dc8638c4dfe6d1404cd32795680dcdd7ba8ac78b1cee4f750fa932e92a54a62","observation_id":"f1a7e27f-3eba-4793-9aaa-97f459c7bee0","resolution":{"observed_at":"2026-08-06T13:18:08.841852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.825703Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"a6400581-0ad7-4c9c-9781-bc0df607ab70","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.736571Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:109732e8bd80e47125f1636838dfe2da81816efe5c2daf1b2541e0ef93c14b32","observation_id":"5f33187f-e21e-4350-9a3b-7088eca57be7","resolution":{"observed_at":"2026-08-06T13:18:08.829581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.813917Z","title":"InstructBLIP: Towards general-purpose vision- language models with instruction tuning","venue":null,"work_id":"5999a9f9-15c0-4b66-bb7a-7eb2c932abbb","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.845969Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:5586936605efb7b806fae166d75ffff5b81e16041038d9d2d7c2662eb70c0b43","observation_id":"37646758-eeef-4934-a2ef-29c79e748467","resolution":{"observed_at":"2026-08-06T13:18:08.817783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.802707Z","title":"Transformer-XL: Attentive language models beyond a fixed-length context","venue":null,"work_id":"ae8756f9-1308-4dbe-850b-32fe60d9fd20","year":2019},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.931596Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:536b66bb0b871800723ff3ade27b96433eb1ae7d15836101efccd92c0cdbb687","observation_id":"0c6b303e-068b-47bf-b7c6-3d6146ff82f1","resolution":{"observed_at":"2026-08-06T13:18:08.806432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.790763Z","title":"Prune spatio-temporal to- kens by semantic-aware temporal accumulation","venue":null,"work_id":"4ec3380c-08e6-4876-b973-2c87ec24cbbe","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:00.996225Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:a1e2eb4c80efa4dee6c2896b73100bc4edc3cf03246b90a8d1c3389f6d22731a","observation_id":"5a9f1c54-b5cd-455c-9b18-fbe011776efb","resolution":{"observed_at":"2026-08-06T13:18:08.794124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17221","last_updated":"2024-01-30T18:09:11Z","snapshot_observed_at":"2026-07-06T17:22:37.193255Z","submitted_at":"2024-01-30T18:09:11Z","title":"MouSi: Poly-Visual-Expert Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17221","snapshot_observed_at":"2026-08-06T13:18:01.081840Z","title":"MouSi: Poly-visual-expert vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.081840Z"},"links":{"cited_paper":"/paper/2401.17221","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:e83f636a987e61233a4e6fbf24fa74589b696718e77f9bde15466589cbd63108","observation_id":"7fac3077-35de-432e-899d-6aaaa01bad56","resolution":{"observed_at":"2026-08-06T13:18:01.081840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T13:18:01.159137Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.159137Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:eb0385fd57904e7e828786e76aeb821e74bdb6fa2a6054679472cc832ff5ff60","observation_id":"67d42725-c1e2-4d6e-bd75-eaa9a483f1cd","resolution":{"observed_at":"2026-08-06T13:18:01.159137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.779455Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":"868c6a5c-3600-4b36-ab3a-e875fe8e1df7","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.245744Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:999747e2377b17bec5be72287e85f2c8bf8cb91b2d7ceb14d3e82d401a49415f","observation_id":"88619815-830c-4a39-a3b3-44a8887b3f14","resolution":{"observed_at":"2026-08-06T13:18:08.783034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:01.321659Z","title":"Re- thinking token reduction in MLLMs: Towards a unified paradigm for training-free acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.321659Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:7b1feb7469762a94c9b4b77853ddce9bd7665919a508f33e5cb3d6d1df7118d9","observation_id":"e7f6c151-3316-4943-9fc6-eb171a65499d","resolution":{"observed_at":"2026-08-06T13:18:01.321659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03105","last_updated":"2024-01-13T15:11:04Z","snapshot_observed_at":"2026-07-06T17:12:14.593202Z","submitted_at":"2024-01-06T02:02:34Z","title":"Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03105","snapshot_observed_at":"2026-08-06T13:18:01.418539Z","title":"In- corporating visual experts to resolve the information loss in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.418539Z"},"links":{"cited_paper":"/paper/2401.03105","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:f0e7d516a5a6f18fa83bd4b3e9b92a2b7f7722a7d9d835e073ad6aef0b35bcb8","observation_id":"b21e7469-2038-42d5-85b6-e5790f74686a","resolution":{"observed_at":"2026-08-06T13:18:01.418539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-07-06T19:31:40.352383Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-08-06T13:18:01.488615Z","title":"ZipVL: Efficient large vision-language models with dynamic token spar- sification and KV cache compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.488615Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:a9d28e643c936a136e5e46c3a809a361a22291f56313c53d21d7ea6d4b813c88","observation_id":"26d5b24b-0dec-42fb-960f-03fc79cf751c","resolution":{"observed_at":"2026-08-06T13:18:01.488615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:01.597860Z","title":"iLLaV A: An image is worth fewer than 1/3 input tokens in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.597860Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:503a90bfec565c77d4d3cf8e3f94103f30bb575c29d9460e09a3151d02f261b8","observation_id":"1bc995b1-b506-4ba3-8c1e-9a3d6fe5ede7","resolution":{"observed_at":"2026-08-06T13:18:01.597860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.769082Z","title":"Matryoshka query Trans- former for large vision-language models","venue":null,"work_id":"16fcec21-4a06-4067-8dcd-6eb81539504c","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.664723Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8c17e98406a3cf4b84aa998c39b3d817d64776ba73e7a84a1653beeb87a5afaa","observation_id":"3898d8c7-9120-4921-a83b-c31e29a5a7e6","resolution":{"observed_at":"2026-08-06T13:18:08.772607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.758331Z","title":"IVTP: Instruction-guided visual token pruning for large vision-language models","venue":null,"work_id":"8b9e4aa8-0e72-4455-b78a-df0de2f016df","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.730301Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:95efe46526ed91c916d1a104870cc93799eae4d76344fbae1fe47475303a2ac4","observation_id":"5e583f37-876a-4183-bdcd-00b3f57fe84d","resolution":{"observed_at":"2026-08-06T13:18:08.761920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.747516Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"0cf0c9d7-f730-4014-bf9c-add4b079bdf8","year":2019},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.830501Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8cad16bea4a05800a037e4a4228271e5057955ff81007639ae98f370a1805416","observation_id":"4842f778-bffd-4c00-becb-7104d57a6a65","resolution":{"observed_at":"2026-08-06T13:18:08.751293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-06T19:26:27.412366Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-06T13:18:01.907280Z","title":"From CLIP to DINO: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.907280Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:e0a0b3e4a815d83cacff069b30a15edf340f9375582df16d3e56ddfdcfe0fa61","observation_id":"31d9f30d-3254-4f1c-8878-c08df639758a","resolution":{"observed_at":"2026-08-06T13:18:01.907280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14164","last_updated":"2024-11-21T14:22:38Z","snapshot_observed_at":"2026-07-06T19:53:47.605701Z","submitted_at":"2024-11-21T14:22:38Z","title":"FoPru: Focal Pruning for Efficient Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14164","snapshot_observed_at":"2026-08-06T13:18:01.973663Z","title":"FoPru: Focal pruning for efficient large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.973663Z"},"links":{"cited_paper":"/paper/2411.14164","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:38cf57a7d322c3a3b5cfc3c47c86c71b9fcc31d625a8694a273154fc2c4bb995","observation_id":"41ffb6cd-4e62-4975-bb51-ac4ff2dec3bb","resolution":{"observed_at":"2026-08-06T13:18:01.973663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.736710Z","title":"Devils in middle layers of large vision- language models: Interpreting, detecting and mitigating ob- ject hallucinations via attention lens","venue":null,"work_id":"0312e3af-0790-44e0-9303-7a775e4d9abe","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.040705Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:2e870d4c4e99956134846c6ed4503d731904f8b5cf65f185359fea4c11dc7d0c","observation_id":"76f4f518-fae1-4b0b-b269-393b8a11e5a4","resolution":{"observed_at":"2026-08-06T13:18:08.740474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.726222Z","title":"BRA VE: Broadening the visual encoding of vision-language models","venue":null,"work_id":"0438cf2e-ebd7-4bc6-b222-50275c3a7759","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.136557Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:b476ecbf77a2be292806f4b5facfd6ee2f0eb498fe357b6c2a1472a0f05f31cd","observation_id":"a4427d5e-302e-4b23-ae12-c54ea29f5961","resolution":{"observed_at":"2026-08-06T13:18:08.729482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.715997Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"03020bac-5a1f-4586-922f-4fc8f8636895","year":2016},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.232705Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:92a23e1ee0d7f14cd05c5fb38ed4bdab9630eb19e93c0ba5359b10d90fd76ba2","observation_id":"8dd021e5-ca85-4eb9-b5f1-346cd0c4358e","resolution":{"observed_at":"2026-08-06T13:18:08.719364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.705690Z","title":"MoAI: Mixture of all intelligence for large language and vision models","venue":null,"work_id":"0803c025-65f4-44b5-8297-85e5a4e4c732","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.308242Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:5d0578da9c18290d63fc9bfdcfd5044b49be445e902c4f907f083c79cce797ec","observation_id":"cfcabdef-1f29-4320-ae73-b6344af3bff9","resolution":{"observed_at":"2026-08-06T13:18:08.709154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.694733Z","title":"Pix2Struct: Screenshot parsing as pretraining for visual lan- guage understanding","venue":null,"work_id":"bb9156d6-7807-47a1-abba-4e717289a3c8","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.410969Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:35bd9a9ff96e764058bbfdc3109e8202f69f1ec50e1b8d19bcc51aa8f0536392","observation_id":"55b7590d-b294-472b-a4b8-5a07d4faaf0f","resolution":{"observed_at":"2026-08-06T13:18:08.698366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.682184Z","title":"SEED-Bench: Benchmarking multi- modal large language models","venue":null,"work_id":"1c9a75b6-cfc0-4c98-93e8-0d5fe6288098","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.461864Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:c3cc7902ed142a332f444824a90e00db06a53cd7faa730878ce4a3afd2ebff6f","observation_id":"bd6385b9-6310-4559-b82c-97769486e6ed","resolution":{"observed_at":"2026-08-06T13:18:08.686313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-07-06T20:28:57.453439Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19036","snapshot_observed_at":"2026-08-06T13:18:02.510363Z","title":"RedundancyLens: Revealing and exploiting visual token processing redundancy for efficient decoder-only MLLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.510363Z"},"links":{"cited_paper":"/paper/2501.19036","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:64176ac3c7573ebf5d08804003f7b0a54e8c82cb8cf52a7f659dd1f840a9f29a","observation_id":"a1defa97-b381-48e2-abbd-47a45d5d425d","resolution":{"observed_at":"2026-08-06T13:18:02.510363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.671734Z","title":"TokenPacker: Efficient visual projector for multimodal LLM.International Journal of Computer Vision, pages 1–19, 2025","venue":null,"work_id":"e8808093-5140-404d-b0ce-3b4f1a182995","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.584449Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:86ed3e8a5b53d977405fcd090d763b0c4a353001cf291fe41d96272527b0df14","observation_id":"040ac8eb-4830-45eb-bd0d-516ac390e385","resolution":{"observed_at":"2026-08-06T13:18:08.675355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.661375Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"e728385c-f3cb-4893-a237-7862d892195e","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.667810Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:db50eaf75a8ee663aee48a3e40ff943af41289be769ee5cd784082ad9388ecf1","observation_id":"41ad1dc6-0ca1-4e89-b11a-e48559200bef","resolution":{"observed_at":"2026-08-06T13:18:08.664717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T13:18:02.711071Z","title":"Mini-Gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.711071Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:e73117d870547cc1d3f84f056d7b343078846cfded8c9e8671297d4615a211d4","observation_id":"cdad8285-6e6f-4c2a-9e95-6cca04aac393","resolution":{"observed_at":"2026-08-06T13:18:02.711071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.650243Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"002b4b10-edd4-4b5b-8ff0-8ebb692a2eec","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.795267Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d791543b6ff524c83b2a337961447a6f00e577deaf4d6351b7ee25e04d43f98f","observation_id":"3b6694fd-4a77-40fe-9369-c16178c0e4f6","resolution":{"observed_at":"2026-08-06T13:18:08.654102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.640291Z","title":"HRank: Filter pruning using high-rank feature map","venue":null,"work_id":"ffe5ea3f-5c7b-4a0a-8ff6-2e82c07a5fac","year":2020},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.859823Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:96b710af7d518295cc0c1886f5b110f79c1b41f8033c286e3790f1709bd92cb0","observation_id":"62166a73-9f04-4031-9caf-5f17fd56f6d5","resolution":{"observed_at":"2026-08-06T13:18:08.643503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.630311Z","title":"SPHINX: A mixer of weights, visual em- beddings and image scales for multi-modal large language models","venue":null,"work_id":"c26aab82-bfec-470f-8954-3033b4943b64","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:02.925986Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8472d472ec16beecd5fa05e97fd97bec06bd387071f5b5ab4a848732c6d2a011","observation_id":"6d34a01d-7111-4e9d-97c4-c004e9b98230","resolution":{"observed_at":"2026-08-06T13:18:08.633793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.620031Z","title":"Boosting multimodal large language models with visual to- kens withdrawal for rapid inference","venue":null,"work_id":"24688161-746f-4c94-addd-6db9b28d2d4a","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.013426Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:6bc5ac71a4aaa77c8ad6c16e518f34b35c17ffd0c31230956601e3b17f15920f","observation_id":"c7edf160-0946-44c9-beb1-fab7aefc1333","resolution":{"observed_at":"2026-08-06T13:18:08.623493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.609424Z","title":"Visual instruction tuning","venue":null,"work_id":"14afc57c-7e67-4e53-80c1-919d62388004","year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.129577Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:3bb1dc39ed802f59f7686bdaac715edea41045768a4822a395cc44afddf267ee","observation_id":"8ee48e26-ab84-46ec-8f53-0fbd3e941446","resolution":{"observed_at":"2026-08-06T13:18:08.612633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.598231Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"c57fa73b-d762-4c6c-a46b-7466512a22a6","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.211066Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d309a4c818cdcb82a6732bf1567bfda72878ddbf6ecea2eec4d43fedda635482","observation_id":"ca253b1e-7681-4ec9-9b34-a803633737dd","resolution":{"observed_at":"2026-08-06T13:18:08.601485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.588183Z","title":"LLaV A-NeXT: Im- proved reasoning, OCR, and world knowledge","venue":null,"work_id":"6c0da18d-1019-42db-a6bd-6310e46780f2","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.273922Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:e71371309f16430520ff40aa9e245c7e61f454cf8e208ed241c5f3f8e051e595","observation_id":"abbbc795-999e-4f68-8531-01db123ee236","resolution":{"observed_at":"2026-08-06T13:18:08.591311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.578367Z","title":"Prismer: A vision-language model with multi-task experts","venue":null,"work_id":"48532615-ee04-45a8-bd96-8fc0ccedfb4e","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.360116Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:c1a3eb6dfc569f5571b2fc83c1302ec99ac51aa55a0dc51daf594dc3929ca7c3","observation_id":"b5ddd117-2279-42ae-a3d2-fd28eafd8d09","resolution":{"observed_at":"2026-08-06T13:18:08.581568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-07-06T19:51:24.166504Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-06T13:18:03.452277Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.452277Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:1c105f19f7245fe770d617d5d3a8be74dc598a8c7c30a39f8bfbe0ef73a0f29d","observation_id":"d0eca418-d976-4faa-adc6-75a5568b58d2","resolution":{"observed_at":"2026-08-06T13:18:03.452277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-06T13:18:03.510688Z","title":"On the hidden mystery of OCR in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.510688Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d4e53a44d5a4e066308564d3d8719346fe5ea58d7c520643e11bf36972c957b3","observation_id":"bce14f18-8693-40b5-a6be-ebd619080353","resolution":{"observed_at":"2026-08-06T13:18:03.510688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.566951Z","title":"MMBench: Is your multi-modal model an all-around player? In Proceedings of the 18th European Conference on Computer Vision (ECCV), pages 216–233, 2024","venue":null,"work_id":"2c41df31-fabd-4ce7-a1f0-d860fef080be","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.599690Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:b01b574154153b579e0b040dcd341d4107b568b319998e6090033d0e91ac6519","observation_id":"480f02da-cf24-4459-a1fe-aa3824c592b7","resolution":{"observed_at":"2026-08-06T13:18:08.570794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.556530Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"aeb927ba-d1b3-49d3-9045-527706cb8131","year":2022},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.700886Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:9965c520ae3217fa3b1540d564c1f3daffd291591428e316dec91da2a307b660","observation_id":"cee4870b-154d-4b25-95d9-b48a0270594a","resolution":{"observed_at":"2026-08-06T13:18:08.559619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-06T13:18:03.786752Z","title":"DeepSeek-VL: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.786752Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:ebe2e3b297f999577988d457f1d2cf664e3125a1f29e0db763e5edbe0ccd16b0","observation_id":"ace58567-937f-457f-bebb-715a9d7d50e2","resolution":{"observed_at":"2026-08-06T13:18:03.786752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.545834Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"534ee5d9-19ca-4a8e-8b64-f307169286f8","year":2022},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.851817Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:78afd344eac73b00200341ad3f91df995b0b834ab5d3b65ea91c7bdb09d884b1","observation_id":"ae65ec97-940f-4ab8-b051-589240f5ab3f","resolution":{"observed_at":"2026-08-06T13:18:08.549553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.535574Z","title":"Feast your eyes: Mixture- of-resolution adaptation for multimodal large language mod- els","venue":null,"work_id":"0277dfc0-a267-4aee-92ea-825fa03a5be6","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.912455Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:57e15106ae5144e0c2a1eaeafb03bce1dd04314d216f30a2811216d363571971","observation_id":"2c83b4ec-4b18-47d4-b38c-59f88bd7146e","resolution":{"observed_at":"2026-08-06T13:18:08.539139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.524028Z","title":"OK-VQA: A visual question answer- ing benchmark requiring external knowledge","venue":null,"work_id":"20db7033-33d6-4ec7-aceb-1403aea1ce9c","year":2019},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.967417Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:362d9a51ced03505be1d9b3def943be9ea6c0a497845fe9da8c9816a58014938","observation_id":"70a081ae-ac1b-43fa-8d46-07caadfed91d","resolution":{"observed_at":"2026-08-06T13:18:08.527940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.511495Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"51f2b47c-7c3e-476b-9a49-6120ca8edd78","year":2022},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.032069Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8e3af08ff615edd8bda20e3b608f488224f7c8730cd07f15c357450ebeb125ff","observation_id":"0937d56c-abf6-49c9-85fb-0718abffb9c1","resolution":{"observed_at":"2026-08-06T13:18:08.515372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.500830Z","title":"DocVQA: A dataset for VQA on document images","venue":null,"work_id":"69855508-51a1-4b54-8438-81a772fce865","year":2021},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.097524Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:363a1f0e24f74aa554ca04a9320c581dbffcfe421f1275a6449b947ce2cf4bd3","observation_id":"7ab13193-4dec-45a0-a24b-f1aebadadae2","resolution":{"observed_at":"2026-08-06T13:18:08.504388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.490316Z","title":"MM1: methods, analysis and insights from multimodal LLM pre- training","venue":null,"work_id":"ebda0041-1338-4b27-bb12-2d94ab952603","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.196959Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8042d1b0576f49b30212551267699ca3332705bae1e4f5ffbf91884e49b0d858","observation_id":"5066e26c-01aa-49ca-a91f-0f801504a090","resolution":{"observed_at":"2026-08-06T13:18:08.493930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.479187Z","title":"DeepStack: Deeply stacking visual tokens is surprisingly simple and ef- fective for LMMs","venue":null,"work_id":"25b4d71a-db42-4067-99f4-0fd179ba7786","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.251891Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:3db997774d9b9dd74009b7cdf376e73e48aa2ee6655a175cfbafc02759326796","observation_id":"6da9200c-4623-4c24-bd9c-bdd68b00b26d","resolution":{"observed_at":"2026-08-06T13:18:08.482988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.467592Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a9418e26-217b-471d-911c-71f6c19221ca","year":2021},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.341414Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:ac60626ab316282dacef3350f59a825d1bffeac35d2ffd72980efa4441ec6f0b","observation_id":"1181e175-b624-4b44-8bda-bc0c2878e5cf","resolution":{"observed_at":"2026-08-06T13:18:08.471349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:04.431699Z","title":"LLaV A-PruMerge: Adaptive token reduc- tion for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.431699Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:30e5e10e2fc1e6f62f1adf96c6c60a8b5aa7ba2ce80098c939a3efd412a7ada9","observation_id":"6ae5eacd-d64e-4b0a-8573-1e8e45d967d9","resolution":{"observed_at":"2026-08-06T13:18:04.431699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.457353Z","title":"Eagle: Exploring the design space for multimodal LLMs with mixture of encoders","venue":null,"work_id":"a8c01d1a-4d22-4999-9721-b61fbaebbad0","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.492453Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:f26329a36f0da7a13e93fcb6da95063298fb90b1dcb521619da41cc0e96339c1","observation_id":"3e60f03f-2a83-4af4-a291-5bbf33ee083f","resolution":{"observed_at":"2026-08-06T13:18:08.460870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.447026Z","title":"Towards VQA models that can read","venue":null,"work_id":"ab93ee8d-94ea-4b5f-900b-beff7b00b584","year":2019},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.591655Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:8147721d4c21752f6fd671590ab2f9fa3b2c140df0c6e4f7d65f45eaee5a56e7","observation_id":"e706f53b-662e-4af2-abf9-bae93973a430","resolution":{"observed_at":"2026-08-06T13:18:08.450379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T13:18:04.652268Z","title":"EV A-CLIP: Improved training techniques for CLIP at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.652268Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:4f7cb7e72353f420aa067bd414f6964ae9b8bc559aed1bea9ba6b64a17fe740d","observation_id":"b0249041-ae47-478a-8c72-4f287eb73c4a","resolution":{"observed_at":"2026-08-06T13:18:04.652268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.435155Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs","venue":null,"work_id":"27003681-76f4-4a92-b851-ae9ade60c4d8","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.720209Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:1790b355f145643ea4efa8a68552dac3f740af078eb204a85d774bd1dadfcc8f","observation_id":"e013054e-98ce-486e-8c52-63808d777c61","resolution":{"observed_at":"2026-08-06T13:18:08.438994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.423825Z","title":"Eyes wide shut? exploring the vi- sual shortcomings of multimodal LLMs","venue":null,"work_id":"a6d927a3-883a-4761-9b1a-fcd22e1baa56","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.803313Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:097f43abbde3932b8ee1a8bed5ddba8591d618bf824a074c91a032c98946184a","observation_id":"fb96b329-82b9-4b0c-965c-452cf3350ee7","resolution":{"observed_at":"2026-08-06T13:18:08.427427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T13:18:04.867176Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.867176Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:eef96f36a0227168e192954eac629da2773094d9a76f9ab3cef61fa60a766adf","observation_id":"282b5c52-48b4-4e8c-881e-9ce32466a1d7","resolution":{"observed_at":"2026-08-06T13:18:04.867176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-03T19:45:14.759418Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05819","snapshot_observed_at":"2026-08-06T13:18:04.956498Z","title":"[CLS] token tells everything needed for training-free efficient MLLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:04.956498Z"},"links":{"cited_paper":"/paper/2412.05819","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:0959891237db4414c0148824d2b62793e29ab3e598cca18982e6ec60216c4dec","observation_id":"e9cfad62-f673-4087-bdbf-bcec45303e3c","resolution":{"observed_at":"2026-08-06T13:18:04.956498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02430","last_updated":"2025-04-10T12:10:28Z","snapshot_observed_at":"2026-08-03T16:41:57.537854Z","submitted_at":"2025-01-05T03:28:45Z","title":"FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02430","snapshot_observed_at":"2026-08-06T13:18:05.021161Z","title":"FOLDER: Accelerat- ing multi-modal large language models with enhanced per- formance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.021161Z"},"links":{"cited_paper":"/paper/2501.02430","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:dfc8b13f0c8831e80526e5b43f5def96a51abe109fdda15196ece650e562c7c4","observation_id":"d91cfad3-cda2-4078-8ccc-637e3f969956","resolution":{"observed_at":"2026-08-06T13:18:05.021161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.413134Z","title":"Vary: Scaling up the vision vocabulary for large vision-language model","venue":null,"work_id":"d2f64049-0728-492d-aa0b-e810de9ccd45","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.079387Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:e8bda5bba6d1c525f0125ec58af61e6075ea89aeac79309ec5ce22992c104676","observation_id":"9a0cabfe-691d-4cfa-8656-f7ba10c3efb5","resolution":{"observed_at":"2026-08-06T13:18:08.416656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-06T13:18:05.173548Z","title":"PyramidDrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.173548Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:e99ab569d8699b713cc6f3f6da891fb2ca28b94d741cb1d37c75614ebeb8bca7","observation_id":"8e692868-cfec-4a7c-88a0-1d30e254f151","resolution":{"observed_at":"2026-08-06T13:18:05.173548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.402435Z","title":"Mitigat- ing hallucination in large vision-language models via mod- ular attribution and intervention","venue":null,"work_id":"c73fd495-5278-44c0-b4f1-c430399c988e","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.264656Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:26186a39efbfea94a33c3c5c4da33b7d70a7996e59ff3db5180b589a2df8706e","observation_id":"5d4cf09f-6e98-4990-a85f-6589f2c41054","resolution":{"observed_at":"2026-08-06T13:18:08.406074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T13:18:05.305866Z","title":"DeCo: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.305866Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:66934240eba640d6416990cf288421088ad1a1a8d62da3f429dbaf7fe6aad449","observation_id":"77bc4401-8c03-49ac-8110-7207b35e9308","resolution":{"observed_at":"2026-08-06T13:18:05.305866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.390789Z","title":"mPLUG- Owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"329fa329-880b-48b8-b2c1-b3daf80d81cb","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.361829Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:56a62bf4d1030e486727842ea888ba97c3f4de7fb3271c7669ae3a159e9f3d7a","observation_id":"d637267a-2472-4098-a01c-724fea3ddf31","resolution":{"observed_at":"2026-08-06T13:18:08.395012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.379727Z","title":"Fit and prune: Fast and training-free visual token pruning for multi- modal large language models","venue":null,"work_id":"9bbf98fb-2b36-48e3-9d7f-bc7e3b484675","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.459651Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:fd0de388eb09cc465cbf32e0370ad3513d8248dea18da545f34dd9d8c76a7e24","observation_id":"4331c16f-9315-4166-b6d1-784332056de9","resolution":{"observed_at":"2026-08-06T13:18:08.383458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.367738Z","title":"ATP-LLaV A: Adaptive token pruning for large vision language models","venue":null,"work_id":"040c90d3-171e-4a80-a43d-f11292c23b3f","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.553886Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:f1ff049dc3ae69b7110a1e8e9887655ea324826fbf0894a0e6a5c63b6e23b585","observation_id":"adce2a7b-2be5-4439-a3e7-a01e4d4d0829","resolution":{"observed_at":"2026-08-06T13:18:08.372227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.287951Z","title":"V oCo-LLaMA: Towards vision compression with large language models","venue":null,"work_id":"f3890aec-b7b3-40c2-a776-ee9264544d66","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.613592Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:0de0ac502ef82cbd7273227c7af17f54ceeeec7e45b286fab579f74bde495a74","observation_id":"37c35d01-b84b-4c1d-a36b-98c03346ace0","resolution":{"observed_at":"2026-08-06T13:18:08.342800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:08.066955Z","title":"Lifting the veil on visual information flow in MLLMs: Unlocking pathways to faster inference","venue":null,"work_id":"7eca7026-941b-4048-a0c0-cf68382f6a07","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.707052Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:0ac0df3705f2e595574e1c71358183116d6089375123c2490358d78bba45cd48","observation_id":"841174f8-18ae-47fb-be48-393b559fb4a1","resolution":{"observed_at":"2026-08-06T13:18:08.184101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-07-06T20:00:28.112838Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-06T13:18:05.802359Z","title":"[CLS] attention is all you need for training-free visual token pruning: Make VLM inference faster","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.802359Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:292690ebcf5d4a39478a9b0dd4d7875f1e86467efde59aae9c0bca33b341df8e","observation_id":"18328f71-a4db-42db-a401-0e22267c7c09","resolution":{"observed_at":"2026-08-06T13:18:05.802359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:07.855805Z","title":"LLaV A-Mini: Efficient image and video large multimodal models with one vision token","venue":null,"work_id":"87badccc-ce4f-4052-8eda-4cd79f67ab37","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.877868Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:225937177368a469375074400b28338cc4e48b1eeb5dae0c42612e36bcf04cf0","observation_id":"20c3e7d9-921a-4bb0-8a53-73fcbf1558ff","resolution":{"observed_at":"2026-08-06T13:18:07.952000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-07T09:15:02.322742Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09968","snapshot_observed_at":"2026-08-06T13:18:05.927482Z","title":"Seeing clearly by layer two: Enhancing attention heads to alleviate hallucination in LVLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.927482Z"},"links":{"cited_paper":"/paper/2411.09968","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:7490c94baf2f84d7c12df836892e52de99276197960a82ff8e7e89e2763bcb66","observation_id":"bacc4ae4-e3ee-494c-9aba-71a237fc9cf9","resolution":{"observed_at":"2026-08-06T13:18:05.927482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:07.690909Z","title":"SparseVLM: Visual token sparsification for efficient vision- language model inference","venue":null,"work_id":"c3db20bd-5dfb-41af-99f7-624cdb1efa20","year":2025},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.027505Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:9b69e83f50d0daaf1c9771418e5add5bed359993248ff35e00f2d6a4542fd91d","observation_id":"6c1df209-b7b8-4371-b01c-df36f4f61cc0","resolution":{"observed_at":"2026-08-06T13:18:07.783244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06169","last_updated":"2024-11-30T05:32:51Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T16:13:24Z","title":"Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06169","snapshot_observed_at":"2026-08-06T13:18:06.117105Z","title":"Treat visual tokens as text? but your MLLM only needs fewer efforts to see","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.117105Z"},"links":{"cited_paper":"/paper/2410.06169","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:900f48e4f160952dd5b5b8eda3bd600a3783bf661baa2a248b3b2d26faabff7c","observation_id":"342ec6a2-1905-450e-b7f2-2146ea7721b6","resolution":{"observed_at":"2026-08-06T13:18:06.117105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00556","last_updated":"2024-12-08T04:41:32Z","snapshot_observed_at":"2026-07-06T19:59:28.832182Z","submitted_at":"2024-11-30T18:54:32Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","version":2},"cited_work":{"arxiv_id":"2412.00556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00556","snapshot_observed_at":"2026-08-06T13:18:06.796995Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","venue":"cs.CV","work_id":"5af86bac-23dd-4312-96e6-4d493afa70b0","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.236925Z"},"links":{"cited_paper":"/paper/2412.00556","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d573b96c1ad1eda9a18686a9943d603a185a61d24031550c333645c58e4f2128","observation_id":"3ceeb469-71fe-446b-85ce-77e1fbf36a68","resolution":{"observed_at":"2026-08-06T13:18:06.881928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-06T13:18:06.370053Z","title":"AIM: Adaptive inference of multi-modal LLMs via token merging and pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.370053Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:ac2b2b2d112bcdfc8ea91b00b0d9ce79233265151a8c2f74d8c0545aebeccc40","observation_id":"7d65a803-0200-4e6b-aa91-044e0e65175b","resolution":{"observed_at":"2026-08-06T13:18:06.370053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T13:18:06.501322Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.501322Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:bf7512e7a4031d28f2d0dfe7e19f95da23bf18065ee6d6feb42b6e397672f67c","observation_id":"b3bbd1c0-7f4e-49bb-aaaa-2dae09d258cf","resolution":{"observed_at":"2026-08-06T13:18:06.501322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14228","last_updated":"2024-11-21T15:37:52Z","snapshot_observed_at":"2026-07-06T19:53:47.605701Z","submitted_at":"2024-11-21T15:37:52Z","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14228","snapshot_observed_at":"2026-08-06T13:18:06.528428Z","title":"FocusLLaV A: A coarse-to-fine approach for effi- cient and effective visual token compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.528428Z"},"links":{"cited_paper":"/paper/2411.14228","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d9f898c5fd855451100bc4ec94c766d5e9656fbad09606bb09f7e5c829cd9fdf","observation_id":"01988274-4b3b-42ef-bd1b-1caf36fbd444","resolution":{"observed_at":"2026-08-06T13:18:06.528428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:18:07.542682Z","title":"MoV A: Adapting mixture of vision experts to multimodal context","venue":null,"work_id":"2f364566-7fdb-48e7-b6ac-412bf2929ad5","year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:06.616164Z"},"links":{"citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:3f6a3b2da154b668609147897d7f9a57e0988395ace897988c1cc8f03df228d3","observation_id":"f050d5af-14cf-4662-9620-6bcb4201c868","resolution":{"observed_at":"2026-08-06T13:18:07.614354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":51},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2507.20842."}