Pith. sign in

Paper Citation Record · LEDGER

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models

As of 7 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2507.20842.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.20842 v1

Coverage vector

measured 84 of 84 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T13:18:06.616164Z

measured 84 of 84 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

84 of 84 outbound references displayed

  • verified exact1
  • verified fuzzy51
  • unresolved32
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9bf00e6c-7602-4633-96e4-f9a9d413c4b0 · outbound

This paper cites HiRED: Attention-guided token dropping for efficient inference of high-resolution vision-language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models HiRED: Attention-guided token dropping for efficient inference of high-resolution vision-language models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:00.011411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:00.011411Z digest=sha256:0c12f20e9f7b1b45d108853e829a510ec138acd2ff00b50a48c0b9edced2badd

Observation c1485921-bb5c-4034-9de7-180bcad8880c · outbound

This paper cites Qwen Technical Report.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Qwen Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:00.053585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:00.053585Z digest=sha256:fe0a2da66f039b42983fd333cddb61a328f917275dac36a9cb874610e4f77901

Observation 87ea521d-1dbc-492e-9cda-e099ef20f5d9 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:00.134131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:00.134131Z digest=sha256:367b43bc4f42d1bd6b1b9fb75658f630df434b29114905c9beb869fea020be47

Observation ead1432d-477a-4e49-9bcb-f4c9afa33128 · outbound

This paper cites Language models are few-shot learners.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Language models are few-shot learners

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:00.225142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:00.225142Z digest=sha256:0401f8a177867a570d486e3cb72e13efe97bdef0d484c2aa4072d871323da837

Observation 999b5cec-07e7-4562-9256-9980b3894810 · outbound

This paper cites Matryoshka multimodal models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Matryoshka multimodal models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:00.280685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:00.280685Z digest=sha256:092c190206ae3f7d8b6231dc756713c4de297d238d20d81e5583d9217cf728b9

Observation a357e339-40d8-4090-b109-d7355d21abd4 · outbound

This paper cites Open-LLaV A-NeXT: An open- source implementation of LLaV A-NeXT series for facilitat- ing the large multi-modal model community.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Open-LLaV A-NeXT: An open- source implementation of LLaV A-NeXT series for facilitat- ing the large multi-modal model community

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:00.380288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:00.380288Z digest=sha256:718789923f1fac05f73cb54faefd64c581dd54f85e1ad6b207fdd10b863ff26a

Observation 31abbaa4-7649-4f69-9f56-0f1ac3899f23 · outbound

This paper cites An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceler- ation for large vision-language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceler- ation for large vision-language models

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.864395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:00.452458Z digest=sha256:0631f0574022be5f6836710c3f13770b9a8abaf98363ed5b39a12b20e0b09c50

Observation b63ad6fe-d42f-4d92-8267-c952b4650498 · outbound

This paper cites How far are we to GPT- 4V? Closing the gap to commercial multimodal models with open-source suites.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models How far are we to GPT- 4V? Closing the gap to commercial multimodal models with open-source suites

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.853260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:00.540214Z digest=sha256:3f0a0a5f802e67c776c03465216e70971ea1d7ec9307900d960d45817b3d3318

Observation f1a7e27f-3eba-4793-9aaa-97f459c7bee0 · outbound

This paper cites Intern VL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Intern VL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.841852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:00.606313Z digest=sha256:5dc8638c4dfe6d1404cd32795680dcdd7ba8ac78b1cee4f750fa932e92a54a62

Observation 5f33187f-e21e-4350-9a3b-7088eca57be7 · outbound

This paper cites Gonzalez, Ion Stoica, and Eric P.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Gonzalez, Ion Stoica, and Eric P

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.829581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:00.736571Z digest=sha256:109732e8bd80e47125f1636838dfe2da81816efe5c2daf1b2541e0ef93c14b32

Observation 37646758-eeef-4934-a2ef-29c79e748467 · outbound

This paper cites InstructBLIP: Towards general-purpose vision- language models with instruction tuning.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models InstructBLIP: Towards general-purpose vision- language models with instruction tuning

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.817783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:00.845969Z digest=sha256:5586936605efb7b806fae166d75ffff5b81e16041038d9d2d7c2662eb70c0b43

Observation 0c6b303e-068b-47bf-b7c6-3d6146ff82f1 · outbound

This paper cites Transformer-XL: Attentive language models beyond a fixed-length context.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Transformer-XL: Attentive language models beyond a fixed-length context

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.806432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:00.931596Z digest=sha256:536b66bb0b871800723ff3ade27b96433eb1ae7d15836101efccd92c0cdbb687

Observation 5a9f1c54-b5cd-455c-9b18-fbe011776efb · outbound

This paper cites Prune spatio-temporal to- kens by semantic-aware temporal accumulation.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Prune spatio-temporal to- kens by semantic-aware temporal accumulation

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.794124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:00.996225Z digest=sha256:a1e2eb4c80efa4dee6c2896b73100bc4edc3cf03246b90a8d1c3389f6d22731a

Observation 7fac3077-35de-432e-899d-6aaaa01bad56 · outbound

This paper cites MouSi: Poly-Visual-Expert Vision-Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models MouSi: Poly-Visual-Expert Vision-Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:01.081840Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:01.081840Z digest=sha256:e83f636a987e61233a4e6fbf24fa74589b696718e77f9bde15466589cbd63108

Observation 67d42725-c1e2-4d6e-bd75-eaa9a483f1cd · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:01.159137Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:01.159137Z digest=sha256:eb0385fd57904e7e828786e76aeb821e74bdb6fa2a6054679472cc832ff5ff60

Observation 88619815-830c-4a39-a3b3-44a8887b3f14 · outbound

This paper cites Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.783034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:01.245744Z digest=sha256:999747e2377b17bec5be72287e85f2c8bf8cb91b2d7ceb14d3e82d401a49415f

Observation e7f6c151-3316-4943-9fc6-eb171a65499d · outbound

This paper cites Re- thinking token reduction in MLLMs: Towards a unified paradigm for training-free acceleration.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Re- thinking token reduction in MLLMs: Towards a unified paradigm for training-free acceleration

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:01.321659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:01.321659Z digest=sha256:7b1feb7469762a94c9b4b77853ddce9bd7665919a508f33e5cb3d6d1df7118d9

Observation b21e7469-2038-42d5-85b6-e5790f74686a · outbound

This paper cites Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:01.418539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:01.418539Z digest=sha256:f0e7d516a5a6f18fa83bd4b3e9b92a2b7f7722a7d9d835e073ad6aef0b35bcb8

Observation 26d5b24b-0dec-42fb-960f-03fc79cf751c · outbound

This paper cites ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:01.488615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:01.488615Z digest=sha256:a9d28e643c936a136e5e46c3a809a361a22291f56313c53d21d7ea6d4b813c88

Observation 1bc995b1-b506-4ba3-8c1e-9a3d6fe5ede7 · outbound

This paper cites iLLaV A: An image is worth fewer than 1/3 input tokens in large multimodal models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models iLLaV A: An image is worth fewer than 1/3 input tokens in large multimodal models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:01.597860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:01.597860Z digest=sha256:503a90bfec565c77d4d3cf8e3f94103f30bb575c29d9460e09a3151d02f261b8

Observation 3898d8c7-9120-4921-a83b-c31e29a5a7e6 · outbound

This paper cites Matryoshka query Trans- former for large vision-language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Matryoshka query Trans- former for large vision-language models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.772607Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:01.664723Z digest=sha256:8c17e98406a3cf4b84aa998c39b3d817d64776ba73e7a84a1653beeb87a5afaa

Observation 5e583f37-876a-4183-bdcd-00b3f57fe84d · outbound

This paper cites IVTP: Instruction-guided visual token pruning for large vision-language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models IVTP: Instruction-guided visual token pruning for large vision-language models

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.761920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:01.730301Z digest=sha256:95efe46526ed91c916d1a104870cc93799eae4d76344fbae1fe47475303a2ac4

Observation 4842f778-bffd-4c00-becb-7104d57a6a65 · outbound

This paper cites GQA: A new dataset for real-world visual reasoning and compositional question answering.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models GQA: A new dataset for real-world visual reasoning and compositional question answering

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.751293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:01.830501Z digest=sha256:8cad16bea4a05800a037e4a4228271e5057955ff81007639ae98f370a1805416

Observation 31d9f30d-3254-4f1c-8878-c08df639758a · outbound

This paper cites From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:01.907280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:01.907280Z digest=sha256:e0a0b3e4a815d83cacff069b30a15edf340f9375582df16d3e56ddfdcfe0fa61

Observation 41ffb6cd-4e62-4975-bb51-ac4ff2dec3bb · outbound

This paper cites FoPru: Focal Pruning for Efficient Large Vision-Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models FoPru: Focal Pruning for Efficient Large Vision-Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:01.973663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:01.973663Z digest=sha256:38cf57a7d322c3a3b5cfc3c47c86c71b9fcc31d625a8694a273154fc2c4bb995

Observation 76f4f518-fae1-4b0b-b269-393b8a11e5a4 · outbound

This paper cites Devils in middle layers of large vision- language models: Interpreting, detecting and mitigating ob- ject hallucinations via attention lens.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Devils in middle layers of large vision- language models: Interpreting, detecting and mitigating ob- ject hallucinations via attention lens

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.740474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.040705Z digest=sha256:2e870d4c4e99956134846c6ed4503d731904f8b5cf65f185359fea4c11dc7d0c

Observation a4427d5e-302e-4b23-ae12-c54ea29f5961 · outbound

This paper cites BRA VE: Broadening the visual encoding of vision-language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models BRA VE: Broadening the visual encoding of vision-language models

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.729482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.136557Z digest=sha256:b476ecbf77a2be292806f4b5facfd6ee2f0eb498fe357b6c2a1472a0f05f31cd

Observation 8dd021e5-ca85-4eb9-b5f1-346cd0c4358e · outbound

This paper cites A diagram is worth a dozen images.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models A diagram is worth a dozen images

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.719364Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.232705Z digest=sha256:92a23e1ee0d7f14cd05c5fb38ed4bdab9630eb19e93c0ba5359b10d90fd76ba2

Observation cfcabdef-1f29-4320-ae73-b6344af3bff9 · outbound

This paper cites MoAI: Mixture of all intelligence for large language and vision models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models MoAI: Mixture of all intelligence for large language and vision models

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.709154Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.308242Z digest=sha256:5d0578da9c18290d63fc9bfdcfd5044b49be445e902c4f907f083c79cce797ec

Observation 55b7590d-b294-472b-a4b8-5a07d4faaf0f · outbound

This paper cites Pix2Struct: Screenshot parsing as pretraining for visual lan- guage understanding.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Pix2Struct: Screenshot parsing as pretraining for visual lan- guage understanding

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.698366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.410969Z digest=sha256:35bd9a9ff96e764058bbfdc3109e8202f69f1ec50e1b8d19bcc51aa8f0536392

Observation bd6385b9-6310-4559-b82c-97769486e6ed · outbound

This paper cites SEED-Bench: Benchmarking multi- modal large language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models SEED-Bench: Benchmarking multi- modal large language models

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.686313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.461864Z digest=sha256:c3cc7902ed142a332f444824a90e00db06a53cd7faa730878ce4a3afd2ebff6f

Observation a1defa97-b381-48e2-abbd-47a45d5d425d · outbound

This paper cites RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:02.510363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:02.510363Z digest=sha256:64176ac3c7573ebf5d08804003f7b0a54e8c82cb8cf52a7f659dd1f840a9f29a

Observation 040ac8eb-4830-45eb-bd0d-516ac390e385 · outbound

This paper cites TokenPacker: Efficient visual projector for multimodal LLM.International Journal of Computer Vision, pages 1–19, 2025.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models TokenPacker: Efficient visual projector for multimodal LLM.International Journal of Computer Vision, pages 1–19, 2025

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.675355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.584449Z digest=sha256:86ed3e8a5b53d977405fcd090d763b0c4a353001cf291fe41d96272527b0df14

Observation 41ad1dc6-0ca1-4e89-b11a-e48559200bef · outbound

This paper cites Evaluating object hallucination in large vision-language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Evaluating object hallucination in large vision-language models

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.664717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.667810Z digest=sha256:db50eaf75a8ee663aee48a3e40ff943af41289be769ee5cd784082ad9388ecf1

Observation cdad8285-6e6f-4c2a-9e95-6cca04aac393 · outbound

This paper cites Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:02.711071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:02.711071Z digest=sha256:e73117d870547cc1d3f84f056d7b343078846cfded8c9e8671297d4615a211d4

Observation 3b6694fd-4a77-40fe-9369-c16178c0e4f6 · outbound

This paper cites Mon- key: Image resolution and text label are important things for large multi-modal models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Mon- key: Image resolution and text label are important things for large multi-modal models

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.654102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.795267Z digest=sha256:d791543b6ff524c83b2a337961447a6f00e577deaf4d6351b7ee25e04d43f98f

Observation 62166a73-9f04-4031-9caf-5f17fd56f6d5 · outbound

This paper cites HRank: Filter pruning using high-rank feature map.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models HRank: Filter pruning using high-rank feature map

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.643503Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.859823Z digest=sha256:96b710af7d518295cc0c1886f5b110f79c1b41f8033c286e3790f1709bd92cb0

Observation 6d34a01d-7111-4e9d-97c4-c004e9b98230 · outbound

This paper cites SPHINX: A mixer of weights, visual em- beddings and image scales for multi-modal large language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models SPHINX: A mixer of weights, visual em- beddings and image scales for multi-modal large language models

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.633793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:02.925986Z digest=sha256:8472d472ec16beecd5fa05e97fd97bec06bd387071f5b5ab4a848732c6d2a011

Observation c7edf160-0946-44c9-beb1-fab7aefc1333 · outbound

This paper cites Boosting multimodal large language models with visual to- kens withdrawal for rapid inference.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Boosting multimodal large language models with visual to- kens withdrawal for rapid inference

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.623493Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.013426Z digest=sha256:6bc5ac71a4aaa77c8ad6c16e518f34b35c17ffd0c31230956601e3b17f15920f

Observation 8ee48e26-ab84-46ec-8f53-0fbd3e941446 · outbound

This paper cites Visual instruction tuning.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Visual instruction tuning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.612633Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.129577Z digest=sha256:3bb1dc39ed802f59f7686bdaac715edea41045768a4822a395cc44afddf267ee

Observation ca253b1e-7681-4ec9-9b34-a803633737dd · outbound

This paper cites Improved baselines with visual instruction tuning.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Improved baselines with visual instruction tuning

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.601485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.211066Z digest=sha256:d309a4c818cdcb82a6732bf1567bfda72878ddbf6ecea2eec4d43fedda635482

Observation abbbc795-999e-4f68-8531-01db123ee236 · outbound

This paper cites LLaV A-NeXT: Im- proved reasoning, OCR, and world knowledge.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models LLaV A-NeXT: Im- proved reasoning, OCR, and world knowledge

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.591311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.273922Z digest=sha256:e71371309f16430520ff40aa9e245c7e61f454cf8e208ed241c5f3f8e051e595

Observation b5ddd117-2279-42ae-a3d2-fd28eafd8d09 · outbound

This paper cites Prismer: A vision-language model with multi-task experts.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Prismer: A vision-language model with multi-task experts

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.581568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.360116Z digest=sha256:c1a3eb6dfc569f5571b2fc83c1302ec99ac51aa55a0dc51daf594dc3929ca7c3

Observation d0eca418-d976-4faa-adc6-75a5568b58d2 · outbound

This paper cites Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:03.452277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:03.452277Z digest=sha256:1c105f19f7245fe770d617d5d3a8be74dc598a8c7c30a39f8bfbe0ef73a0f29d

Observation bce14f18-8693-40b5-a6be-ebd619080353 · outbound

This paper cites OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:03.510688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:03.510688Z digest=sha256:d4e53a44d5a4e066308564d3d8719346fe5ea58d7c520643e11bf36972c957b3

Observation 480f02da-cf24-4459-a1fe-aa3824c592b7 · outbound

This paper cites MMBench: Is your multi-modal model an all-around player? In Proceedings of the 18th European Conference on Computer Vision (ECCV), pages 216–233, 2024.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models MMBench: Is your multi-modal model an all-around player? In Proceedings of the 18th European Conference on Computer Vision (ECCV), pages 216–233, 2024

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.570794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.599690Z digest=sha256:b01b574154153b579e0b040dcd341d4107b568b319998e6090033d0e91ac6519

Observation cee4870b-154d-4b25-95d9-b48a0270594a · outbound

This paper cites A ConvNet for the 2020s.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models A ConvNet for the 2020s

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.559619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.700886Z digest=sha256:9965c520ae3217fa3b1540d564c1f3daffd291591428e316dec91da2a307b660

Observation ace58567-937f-457f-bebb-715a9d7d50e2 · outbound

This paper cites DeepSeek-VL: Towards Real-World Vision-Language Understanding.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models DeepSeek-VL: Towards Real-World Vision-Language Understanding

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:03.786752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:03.786752Z digest=sha256:ebe2e3b297f999577988d457f1d2cf664e3125a1f29e0db763e5edbe0ccd16b0

Observation ae65ec97-940f-4ab8-b051-589240f5ab3f · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Learn to explain: Multimodal reasoning via thought chains for science question answering

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.549553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.851817Z digest=sha256:78afd344eac73b00200341ad3f91df995b0b834ab5d3b65ea91c7bdb09d884b1

Observation 2c83b4ec-4b18-47d4-b38c-59f88bd7146e · outbound

This paper cites Feast your eyes: Mixture- of-resolution adaptation for multimodal large language mod- els.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Feast your eyes: Mixture- of-resolution adaptation for multimodal large language mod- els

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.539139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.912455Z digest=sha256:57e15106ae5144e0c2a1eaeafb03bce1dd04314d216f30a2811216d363571971

Observation 70a081ae-ac1b-43fa-8d46-07caadfed91d · outbound

This paper cites OK-VQA: A visual question answer- ing benchmark requiring external knowledge.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models OK-VQA: A visual question answer- ing benchmark requiring external knowledge

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.527940Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:03.967417Z digest=sha256:362d9a51ced03505be1d9b3def943be9ea6c0a497845fe9da8c9816a58014938

Observation 0937d56c-abf6-49c9-85fb-0718abffb9c1 · outbound

This paper cites ChartQA: A benchmark for question answering about charts with visual and logical reasoning.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models ChartQA: A benchmark for question answering about charts with visual and logical reasoning

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.515372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.032069Z digest=sha256:8e3af08ff615edd8bda20e3b608f488224f7c8730cd07f15c357450ebeb125ff

Observation 7ab13193-4dec-45a0-a24b-f1aebadadae2 · outbound

This paper cites DocVQA: A dataset for VQA on document images.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models DocVQA: A dataset for VQA on document images

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.504388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.097524Z digest=sha256:363a1f0e24f74aa554ca04a9320c581dbffcfe421f1275a6449b947ce2cf4bd3

Observation 5066e26c-01aa-49ca-a91f-0f801504a090 · outbound

This paper cites MM1: methods, analysis and insights from multimodal LLM pre- training.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models MM1: methods, analysis and insights from multimodal LLM pre- training

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.493930Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.196959Z digest=sha256:8042d1b0576f49b30212551267699ca3332705bae1e4f5ffbf91884e49b0d858

Observation 6da9200c-4623-4c24-bd9c-bdd68b00b26d · outbound

This paper cites DeepStack: Deeply stacking visual tokens is surprisingly simple and ef- fective for LMMs.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models DeepStack: Deeply stacking visual tokens is surprisingly simple and ef- fective for LMMs

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.482988Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.251891Z digest=sha256:3db997774d9b9dd74009b7cdf376e73e48aa2ee6655a175cfbafc02759326796

Observation 1181e175-b624-4b44-8bda-bc0c2878e5cf · outbound

This paper cites Learning transferable visual models from natural language supervision.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Learning transferable visual models from natural language supervision

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.471349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.341414Z digest=sha256:ac60626ab316282dacef3350f59a825d1bffeac35d2ffd72980efa4441ec6f0b

Observation 6ae5eacd-d64e-4b0a-8573-1e8e45d967d9 · outbound

This paper cites LLaV A-PruMerge: Adaptive token reduc- tion for efficient large multimodal models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models LLaV A-PruMerge: Adaptive token reduc- tion for efficient large multimodal models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:04.431699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:04.431699Z digest=sha256:30e5e10e2fc1e6f62f1adf96c6c60a8b5aa7ba2ce80098c939a3efd412a7ada9

Observation 3e60f03f-2a83-4af4-a291-5bbf33ee083f · outbound

This paper cites Eagle: Exploring the design space for multimodal LLMs with mixture of encoders.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Eagle: Exploring the design space for multimodal LLMs with mixture of encoders

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.460870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.492453Z digest=sha256:f26329a36f0da7a13e93fcb6da95063298fb90b1dcb521619da41cc0e96339c1

Observation e706f53b-662e-4af2-abf9-bae93973a430 · outbound

This paper cites Towards VQA models that can read.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Towards VQA models that can read

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.450379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.591655Z digest=sha256:8147721d4c21752f6fd671590ab2f9fa3b2c140df0c6e4f7d65f45eaee5a56e7

Observation b0249041-ae47-478a-8c72-4f287eb73c4a · outbound

This paper cites EVA-CLIP: Improved Training Techniques for CLIP at Scale.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models EVA-CLIP: Improved Training Techniques for CLIP at Scale

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:04.652268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:04.652268Z digest=sha256:4f7cb7e72353f420aa067bd414f6964ae9b8bc559aed1bea9ba6b64a17fe740d

Observation e013054e-98ce-486e-8c52-63808d777c61 · outbound

This paper cites Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.438994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.720209Z digest=sha256:1790b355f145643ea4efa8a68552dac3f740af078eb204a85d774bd1dadfcc8f

Observation fb96b329-82b9-4b0c-965c-452cf3350ee7 · outbound

This paper cites Eyes wide shut? exploring the vi- sual shortcomings of multimodal LLMs.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Eyes wide shut? exploring the vi- sual shortcomings of multimodal LLMs

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.427427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:04.803313Z digest=sha256:097f43abbde3932b8ee1a8bed5ddba8591d618bf824a074c91a032c98946184a

Observation 282b5c52-48b4-4e8c-881e-9ce32466a1d7 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models LLaMA: Open and Efficient Foundation Language Models

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:04.867176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:04.867176Z digest=sha256:eef96f36a0227168e192954eac629da2773094d9a76f9ab3cef61fa60a766adf

Observation e9cfad62-f673-4087-bdbf-bcec45303e3c · outbound

This paper cites [CLS] Token Tells Everything Needed for Training-free Efficient MLLMs.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models [CLS] Token Tells Everything Needed for Training-free Efficient MLLMs

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:04.956498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:04.956498Z digest=sha256:0959891237db4414c0148824d2b62793e29ab3e598cca18982e6ec60216c4dec

Observation d91cfad3-cda2-4078-8ccc-637e3f969956 · outbound

This paper cites FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:05.021161Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:05.021161Z digest=sha256:dfc8b13f0c8831e80526e5b43f5def96a51abe109fdda15196ece650e562c7c4

Observation 9a0cabfe-691d-4cfa-8656-f7ba10c3efb5 · outbound

This paper cites Vary: Scaling up the vision vocabulary for large vision-language model.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Vary: Scaling up the vision vocabulary for large vision-language model

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.416656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:05.079387Z digest=sha256:e8bda5bba6d1c525f0125ec58af61e6075ea89aeac79309ec5ce22992c104676

Observation 8e692868-cfec-4a7c-88a0-1d30e254f151 · outbound

This paper cites PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:05.173548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:05.173548Z digest=sha256:e99ab569d8699b713cc6f3f6da891fb2ca28b94d741cb1d37c75614ebeb8bca7

Observation 5d4cf09f-6e98-4990-a85f-6589f2c41054 · outbound

This paper cites Mitigat- ing hallucination in large vision-language models via mod- ular attribution and intervention.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Mitigat- ing hallucination in large vision-language models via mod- ular attribution and intervention

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.406074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:05.264656Z digest=sha256:26186a39efbfea94a33c3c5c4da33b7d70a7996e59ff3db5180b589a2df8706e

Observation 77bc4401-8c03-49ac-8110-7207b35e9308 · outbound

This paper cites DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:05.305866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:05.305866Z digest=sha256:66934240eba640d6416990cf288421088ad1a1a8d62da3f429dbaf7fe6aad449

Observation d637267a-2472-4098-a01c-724fea3ddf31 · outbound

This paper cites mPLUG- Owl2: Revolutionizing multi-modal large language model with modality collaboration.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models mPLUG- Owl2: Revolutionizing multi-modal large language model with modality collaboration

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.395012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:05.361829Z digest=sha256:56a62bf4d1030e486727842ea888ba97c3f4de7fb3271c7669ae3a159e9f3d7a

Observation 4331c16f-9315-4166-b6d1-784332056de9 · outbound

This paper cites Fit and prune: Fast and training-free visual token pruning for multi- modal large language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Fit and prune: Fast and training-free visual token pruning for multi- modal large language models

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.383458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:05.459651Z digest=sha256:fd0de388eb09cc465cbf32e0370ad3513d8248dea18da545f34dd9d8c76a7e24

Observation adce2a7b-2be5-4439-a3e7-a01e4d4d0829 · outbound

This paper cites ATP-LLaV A: Adaptive token pruning for large vision language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models ATP-LLaV A: Adaptive token pruning for large vision language models

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.372227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:05.553886Z digest=sha256:f1ff049dc3ae69b7110a1e8e9887655ea324826fbf0894a0e6a5c63b6e23b585

Observation 37c35d01-b84b-4c1d-a36b-98c03346ace0 · outbound

This paper cites V oCo-LLaMA: Towards vision compression with large language models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models V oCo-LLaMA: Towards vision compression with large language models

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.342800Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:05.613592Z digest=sha256:0de0ac502ef82cbd7273227c7af17f54ceeeec7e45b286fab579f74bde495a74

Observation 841174f8-18ae-47fb-be48-393b559fb4a1 · outbound

This paper cites Lifting the veil on visual information flow in MLLMs: Unlocking pathways to faster inference.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Lifting the veil on visual information flow in MLLMs: Unlocking pathways to faster inference

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:08.184101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:05.707052Z digest=sha256:0ac0df3705f2e595574e1c71358183116d6089375123c2490358d78bba45cd48

Observation 18328f71-a4db-42db-a401-0e22267c7c09 · outbound

This paper cites Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:05.802359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:05.802359Z digest=sha256:292690ebcf5d4a39478a9b0dd4d7875f1e86467efde59aae9c0bca33b341df8e

Observation 20c3e7d9-921a-4bb0-8a53-73fcbf1558ff · outbound

This paper cites LLaV A-Mini: Efficient image and video large multimodal models with one vision token.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models LLaV A-Mini: Efficient image and video large multimodal models with one vision token

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:07.952000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:05.877868Z digest=sha256:225937177368a469375074400b28338cc4e48b1eeb5dae0c42612e36bcf04cf0

Observation bacc4ae4-e3ee-494c-9aba-71a237fc9cf9 · outbound

This paper cites Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:05.927482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:05.927482Z digest=sha256:7490c94baf2f84d7c12df836892e52de99276197960a82ff8e7e89e2763bcb66

Observation 6c1df209-b7b8-4371-b01c-df36f4f61cc0 · outbound

This paper cites SparseVLM: Visual token sparsification for efficient vision- language model inference.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models SparseVLM: Visual token sparsification for efficient vision- language model inference

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:07.783244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:06.027505Z digest=sha256:9b69e83f50d0daaf1c9771418e5add5bed359993248ff35e00f2d6a4542fd91d

Observation 342ec6a2-1905-450e-b7f2-2146ea7721b6 · outbound

This paper cites Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:06.117105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:06.117105Z digest=sha256:900f48e4f160952dd5b5b8eda3bd600a3783bf661baa2a248b3b2d26faabff7c

Observation 3ceeb469-71fe-446b-85ce-77e1fbf36a68 · outbound

This paper cites Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-08-06T13:18:06.881928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:06.236925Z digest=sha256:d573b96c1ad1eda9a18686a9943d603a185a61d24031550c333645c58e4f2128

Observation 7d65a803-0200-4e6b-aa91-044e0e65175b · outbound

This paper cites AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:06.370053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:06.370053Z digest=sha256:ac2b2b2d112bcdfc8ea91b00b0d9ce79233265151a8c2f74d8c0545aebeccc40

Observation b3bbd1c0-7f4e-49bb-aaaa-2dae09d258cf · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:06.501322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:06.501322Z digest=sha256:bf7512e7a4031d28f2d0dfe7e19f95da23bf18065ee6d6feb42b6e397672f67c

Observation 01988274-4b3b-42ef-bd1b-1caf36fbd444 · outbound

This paper cites FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:06.528428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:06.528428Z digest=sha256:d9f898c5fd855451100bc4ec94c766d5e9656fbad09606bb09f7e5c829cd9fdf

Observation f050d5af-14cf-4662-9620-6bcb4201c868 · outbound

This paper cites MoV A: Adapting mixture of vision experts to multimodal context.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models MoV A: Adapting mixture of vision experts to multimodal context

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T13:18:07.614354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T13:18:06.616164Z digest=sha256:3f6a3b2da154b668609147897d7f9a57e0988395ace897988c1cc8f03df228d3

Pith citing papers

No inbound Pith citation observations are available.