Pith. sign in

Paper Citation Record · LEDGER

Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2411.10803.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.10803 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 25 of 25 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:43:02.340523Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T14:09:53.785860Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 9f142b27-cac9-4666-a592-a5452ab23db9 · inbound

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models cites this paper.

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-23T00:02:17.821582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-22T23:58:57.819555Z digest=sha256:c15f4d94b96be9910c0ae7e7a492b3e64b6f95050998bb3f50fb9e6cec4357fc

Observation 6ba2346a-6f98-45c9-a41c-80c1c81e0659 · inbound

Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models cites this paper.

Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T13:43:02.340523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:43:02.340523Z digest=sha256:5e48541005816f51d7754a170b1560c8cb1e06aeaeab7a0b589152a66fe8a88a

Observation 6b97be4f-8fef-4016-847b-682b060c615b · inbound

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs cites this paper.

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T12:06:25.772527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:06:25.772527Z digest=sha256:25eb135a8d43535e8bb8ada9a4f3a4794673454149c68f48375e7d832bf19b4c

Observation 731567cb-7de2-446a-b222-3b662f87a2da · inbound

Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs cites this paper.

Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T04:20:31.753984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:20:31.753984Z digest=sha256:7dd26a07f36247adbfc04c09ff7d7b6e1bd4ed3f8ec007be5f4da681da439edf

Observation 762b43ab-b672-4b1b-b4ac-cbd32c5250f7 · inbound

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models cites this paper.

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T00:42:53.668156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:42:53.668156Z digest=sha256:f3e2d5f1a8b8cdb6ca261ae91e3be17e526691424624d0ac7725290ef55afa41

Observation a8c4a900-5f2d-47c0-821f-41283f54c042 · inbound

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs cites this paper.

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T22:24:29.549834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:24:29.549834Z digest=sha256:d2dc538539456bac0dbb72d8f75366d162a1ebb1ae7279d97d4840446a9f1402

Observation d0eca418-d976-4faa-adc6-75a5568b58d2 · inbound

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models cites this paper.

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T13:18:03.452277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T13:18:03.452277Z digest=sha256:1c105f19f7245fe770d617d5d3a8be74dc598a8c7c30a39f8bfbe0ef73a0f29d

Observation 3ddc02e1-1c64-435e-a3f3-29e50eaa25fb · inbound

Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models cites this paper.

Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T05:51:15.987225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:51:15.987225Z digest=sha256:14a0511742cc550193d41aad36c2bed0790b1adebebe35e6ffa5f977c4c711c3

Observation dcff0bad-9c40-47ae-9458-c26b0d523365 · inbound

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression cites this paper.

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-21T15:10:16.490773Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-21T15:09:25.818449Z digest=sha256:a92284e735ed55bac8a517aa4e828d85b5d70288f8f8b7f2518c7a40a974b7c1

Observation a264c7a1-7d9c-4008-99ed-4e807bc9dd5a · inbound

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models cites this paper.

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T02:57:46.086957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T02:57:46.086957Z digest=sha256:3db338d5d606aaa581ac1b2e50b2c694609e43c4cf56c0daed47a74612c4e68d

Observation c04c2190-6cf4-4248-a223-772acb2fbd56 · inbound

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models cites this paper.

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-15T18:26:26.920542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-15T18:25:21.621268Z digest=sha256:5391752f656d74e328afe400d424a495f19497f803e380511c4745ec71db5acd

Observation 9d97cbca-ed4a-4607-b337-de37b2c26d8e · inbound

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs cites this paper.

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:41:04.436181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T15:23:08.671342Z digest=sha256:281192b08bc55ff9a176ce2e9dd643c3bc7a799027c05215d0b94c631d3fadae

Observation e536b025-dadf-432c-896c-4eeb897aa608 · inbound

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling cites this paper.

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-10T07:01:49.121922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T07:00:36.870817Z digest=sha256:8f215205089f7f8161393acdf4c31a33da8a4300981f24a176593478e76c27c3

Observation e35a6860-e50e-4911-b3a9-e07247782165 · inbound

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing cites this paper.

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-20T14:58:24.845055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-20T14:53:57.376715Z digest=sha256:3d86b304dedb7d0d6e6cf32abc7c9ee83cd0a02f1f32a15e5003fc0c86bc1689

Observation 2adc0b12-fb7d-4065-999e-67083037bda7 · inbound

Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference cites this paper.

Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:43:23.798277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-20T07:43:18.828740Z digest=sha256:7e28e25fb9302144d386375b32bf7ea10b37c8d6d086712e3306c3846674df2c

Observation 5eaa3acb-9858-4fa4-8e60-b1bc9710040d · inbound

EarlyTom: Early Token Compression Completes Fast Video Understanding cites this paper.

EarlyTom: Early Token Compression Completes Fast Video Understanding Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:23:15.629708Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-29T08:16:02.536341Z digest=sha256:15c6dbcb0e5e563c9bbbd678a48ea3b0448875ce4b475a2193e6bf7d9e1f6ebd

Observation 7b92e2ef-7f1f-4dde-83e9-3d2bcd497210 · inbound

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding cites this paper.

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-06-29T08:23:15.866979Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-29T08:13:42.526597Z digest=sha256:83cbaa4a626c8c79fbfef4a9360d1cd6ded2673bd4ee9f934e509554badaa554

Observation 4c9a07ee-aa4e-4607-95e9-d6b945e612eb · inbound

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models cites this paper.

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-07-03T11:28:04.147290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-27T09:35:24.118536Z digest=sha256:ea0d306376b3015db69c427942aaf1b98a2759558d35ea86f36ece7ce6bd7a59

Observation 78b96a77-ebe3-4938-adc2-b267a4e911e4 · inbound

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference cites this paper.

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 52

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T14:09:53.787431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-26T04:24:38.917137Z digest=sha256:d8a4ba876b67bc5544f69bd3bc952b41f58871e40cf207fad6b03c3765c7d167

Observation c222cc31-d96b-440e-80bd-170880e2e2bd · inbound

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs cites this paper.

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 22

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T10:15:44.621408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-07-01T05:41:04.184461Z digest=sha256:81f469519cc6e2460cadb99abdc4f56bf21c26de1b523ff6683f7f8584611d8f

Observation 13493d25-1882-4ac2-9c22-5251d778b29b · inbound

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models cites this paper.

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T05:03:26.664752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T05:03:26.664752Z digest=sha256:1dab3b29ec961d032ddcd4d48631f6df361702859d479817ebde7341f8a22b45

Observation 2cac17e1-2c7a-41fb-9ea6-fe26463ff5d8 · inbound

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference cites this paper.

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T03:42:14.989028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T03:42:14.989028Z digest=sha256:1ead007c69d7821647759283abfc679f1624aa2b8c6a3082be3d35d349ee097b

Observation 6d05624f-a8bc-480b-9d30-1829bd76b99e · inbound

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models cites this paper.

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T01:26:50.559182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T01:26:50.559182Z digest=sha256:6ac9c7ee3506418b80aaabdd276bb808f509c631e0b9ab2a7428bc02e85ecb14

Observation 56ac6f38-9978-46a6-aff6-7293d6157dac · inbound

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs cites this paper.

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T17:23:16.283827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T17:23:16.283827Z digest=sha256:87c6c690f46b7518a32a35d501c058ea0f5edcf669e3597b22c4f912a8827f66

Observation a8bd15c3-4ac0-4d71-9160-9ad85923ffd8 · inbound

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models cites this paper.

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T16:41:28.857602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:41:28.857602Z digest=sha256:115fbacfefd0e7d578e6b4524e175b6cdc8a1fcf685b496cfac98ad8fc751832