{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fcf28e41f124f86a7eac9d58896b953dbb294e1a0c7962c172c584db7e52143a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:43:02.340523Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:09:53.785860Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T23:58:57.819555Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2503.14075"},"observation_digest":"sha256:8f36477ce723d378d95765d6118a2a9f69a8aed8f5e9653999c3130d32d5d7af","observation_id":"9f142b27-cac9-4666-a592-a5452ab23db9","resolution":{"observed_at":"2026-05-23T00:02:17.821582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T13:43:02.340523Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.340523Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:c389f425e3544f5db8ebca07839f986033b3d979653c1372ddd6427887d5bcfb","observation_id":"6ba2346a-6f98-45c9-a41c-80c1c81e0659","resolution":{"observed_at":"2026-08-07T13:43:02.340523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T12:06:25.772527Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model.arXiv preprint arXiv:2411.10803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00577","last_updated":"2025-05-31T14:22:40Z","snapshot_observed_at":"2026-08-07T22:33:33.136985Z","submitted_at":"2025-05-31T14:22:40Z","title":"Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.772527Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.00577"},"observation_digest":"sha256:a489ff6730f38d622f98df5bc158f5499bd5136060900a7b09956fceaaa22ef4","observation_id":"6b97be4f-8fef-4016-847b-682b060c615b","resolution":{"observed_at":"2026-08-07T12:06:25.772527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T04:20:31.753984Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.753984Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:c36d32e0a5d84edaab0017fe0f68e431fb6dace059ea9872d41e24d78b968581","observation_id":"731567cb-7de2-446a-b222-3b662f87a2da","resolution":{"observed_at":"2026-08-07T04:20:31.753984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T00:42:53.668156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T05:10:49.720289Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.668156Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:de5d1b0243ae98c3e87c7e2d6700cc578c765d6c5d494421afe40eac8d45c208","observation_id":"762b43ab-b672-4b1b-b4ac-cbd32c5250f7","resolution":{"observed_at":"2026-08-07T00:42:53.668156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-06T22:24:29.549834Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model.arXiv preprint arXiv:2411.10803,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-07T08:24:31.697101Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:29.549834Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:afde3073e1e540542bde29b598be7e70318c16bd25a5ba38a4e69ef4ff89fe5f","observation_id":"a8c4a900-5f2d-47c0-821f-41283f54c042","resolution":{"observed_at":"2026-08-06T22:24:29.549834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-06T13:18:03.452277Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-07T09:17:15.026471Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:03.452277Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:6e0cdadeceadfaca122b2dc8cfe87aa671488a4de372354f0186ac9e48382adc","observation_id":"d0eca418-d976-4faa-adc6-75a5568b58d2","resolution":{"observed_at":"2026-08-06T13:18:03.452277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-06T05:51:15.987225Z","title":"arXiv preprint arXiv:2411.10803 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01236","last_updated":"2025-08-02T07:22:08Z","snapshot_observed_at":"2026-08-07T10:22:34.344208Z","submitted_at":"2025-08-02T07:22:08Z","title":"Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T05:51:15.987225Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2508.01236"},"observation_digest":"sha256:85ad62eb74cf2b0f2738d1038fc1c76b4ecfc0d844c16e1d11077fc4599a000a","observation_id":"3ddc02e1-1c64-435e-a3f3-29e50eaa25fb","resolution":{"observed_at":"2026-08-06T05:51:15.987225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:473c3cbc2205f41d90eb0842844f32392debbff4cfca270dc66b701f96f3db12","observation_id":"dcff0bad-9c40-47ae-9458-c26b0d523365","resolution":{"observed_at":"2026-05-21T15:10:16.490773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-03T02:57:46.086957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09431","last_updated":"2026-05-24T12:21:22Z","snapshot_observed_at":"2026-08-03T02:56:43.461670Z","submitted_at":"2026-02-10T05:51:02Z","title":"Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T02:57:46.086957Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2602.09431"},"observation_digest":"sha256:be6cd734d31cb03deb08ed5b30f15856e9cafef9db270f8f29c1623ce69f5f4f","observation_id":"a264c7a1-7d9c-4008-99ed-4e807bc9dd5a","resolution":{"observed_at":"2026-08-03T02:57:46.086957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-07T14:16:18.120869Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:d99af22aaae126ee6f096dffbd8d5f50e82bbe0de0479c3ba9693b80bf260505","observation_id":"c04c2190-6cf4-4248-a223-772acb2fbd56","resolution":{"observed_at":"2026-05-15T18:26:26.920542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:bdb631659113f920b6751a5c1011f8b60ba1f98313e34a0e82bbcf61dfde343b","observation_id":"9d97cbca-ed4a-4607-b337-de37b2c26d8e","resolution":{"observed_at":"2026-05-11T10:41:04.436181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2604.17087","last_updated":"2026-04-18T17:52:02Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T17:52:02Z","title":"EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T07:00:36.870817Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2604.17087"},"observation_digest":"sha256:ebae04ad2391f67a63eb6bf1426193cf30746666543825dfdcde4411335224c7","observation_id":"e536b025-dadf-432c-896c-4eeb897aa608","resolution":{"observed_at":"2026-05-10T07:01:49.121922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2605.17447","last_updated":"2026-05-17T13:39:47Z","snapshot_observed_at":"2026-08-02T22:21:28.317441Z","submitted_at":"2026-05-17T13:39:47Z","title":"FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:57.376715Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2605.17447"},"observation_digest":"sha256:783b32218ec093a6729af356c416e9e5314de050fcd1139f171df9e8230530ed","observation_id":"e35a6860-e50e-4911-b3a9-e07247782165","resolution":{"observed_at":"2026-05-20T14:58:24.845055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2605.19218","last_updated":"2026-05-19T00:45:00Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-19T00:45:00Z","title":"Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T07:43:18.828740Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2605.19218"},"observation_digest":"sha256:4d809f9c6b45a953b1acdd720bb5c01c291b195eebc8e1f4ce30db32e8e63bb7","observation_id":"2adc0b12-fb7d-4065-999e-67083037bda7","resolution":{"observed_at":"2026-05-20T07:43:23.798277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2605.30010","last_updated":"2026-05-28T14:36:44Z","snapshot_observed_at":"2026-08-02T23:58:30.012302Z","submitted_at":"2026-05-28T14:36:44Z","title":"EarlyTom: Early Token Compression Completes Fast Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T08:16:02.536341Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2605.30010"},"observation_digest":"sha256:107a22f6a41b7512524a7460d270dd0a791381e793fc8ac4e228c262ba70218b","observation_id":"5eaa3acb-9858-4fa4-8e60-b1bc9710040d","resolution":{"observed_at":"2026-06-29T08:23:15.629708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2605.30126","last_updated":"2026-05-28T15:57:31Z","snapshot_observed_at":"2026-08-03T03:31:55.994242Z","submitted_at":"2026-05-28T15:57:31Z","title":"PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-29T08:13:42.526597Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2605.30126"},"observation_digest":"sha256:abc3131ff57ff237f2d57881927c3ea267d99ba662f7c360fe3452c2087c0b45","observation_id":"7b92e2ef-7f1f-4dde-83e9-3d2bcd497210","resolution":{"observed_at":"2026-06-29T08:23:15.866979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2606.12412","last_updated":"2026-06-10T17:59:57Z","snapshot_observed_at":"2026-08-03T05:45:43.148184Z","submitted_at":"2026-06-10T17:59:57Z","title":"Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:24.118536Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2606.12412"},"observation_digest":"sha256:8315e326b86c99774259d6bd5ed82edd4793f3c304815357c246dcae3f7a04cf","observation_id":"4c9a07ee-aa4e-4607-95e9-d6b945e612eb","resolution":{"observed_at":"2026-07-03T11:28:04.147290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2606.27161","last_updated":"2026-06-25T15:29:37Z","snapshot_observed_at":"2026-08-04T02:05:59.242279Z","submitted_at":"2026-06-25T15:29:37Z","title":"TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-26T04:24:38.917137Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2606.27161"},"observation_digest":"sha256:a3a7af52eac78ae1271e0dced950a03a5e1bebd4412f63e3f7369ffca2f99d24","observation_id":"78b96a77-ebe3-4938-adc2-b267a4e911e4","resolution":{"observed_at":"2026-07-04T14:09:53.787431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2606.31383","last_updated":"2026-06-30T09:11:50Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:11:50Z","title":"MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T05:41:04.184461Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2606.31383"},"observation_digest":"sha256:4d5d0ec0c9d1eedaf3cdd0bef42420e5f9ddffe53bb99323dd5d8aa84539dbd4","observation_id":"c222cc31-d96b-440e-80bd-170880e2e2bd","resolution":{"observed_at":"2026-07-01T10:15:44.621408Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-02T05:03:26.664752Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.664752Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:d12971a095e8964092ccceb0df50fcc9b1a87fc97700dc7fa440d0995b413ddb","observation_id":"13493d25-1882-4ac2-9c22-5251d778b29b","resolution":{"observed_at":"2026-08-02T05:03:26.664752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-02T03:42:14.989028Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-02T03:42:13.590177Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.989028Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:9ae3a3449cd0c90a054f56da06f253cebd777041488fa60efb5311fc1b35960d","observation_id":"2cac17e1-2c7a-41fb-9ea6-fe26463ff5d8","resolution":{"observed_at":"2026-08-02T03:42:14.989028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-01T01:26:50.559182Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25818","last_updated":"2026-07-28T15:01:02Z","snapshot_observed_at":"2026-08-02T18:28:59.293276Z","submitted_at":"2026-07-28T15:01:02Z","title":"SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T01:26:50.559182Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.25818"},"observation_digest":"sha256:bb4c3993c0e027270927f4e403eb626f1777ce2a4bc4525f1761dfeec832ffea","observation_id":"6d05624f-a8bc-480b-9d30-1829bd76b99e","resolution":{"observed_at":"2026-08-01T01:26:50.559182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-04T17:23:16.283827Z","title":"arXiv preprint arXiv:2411.10803 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01979","last_updated":"2026-08-03T09:42:34Z","snapshot_observed_at":"2026-08-07T05:46:19.803929Z","submitted_at":"2026-08-03T09:42:34Z","title":"ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T17:23:16.283827Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2608.01979"},"observation_digest":"sha256:85ca563ccb03fe9c6111f25f24ef5686fe34bdaa3e0c337d42457aa895a8f5fa","observation_id":"56ac6f38-9978-46a6-aff6-7293d6157dac","resolution":{"observed_at":"2026-08-04T17:23:16.283827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-05T16:41:28.857602Z","title":"Multi- stage vision token dropping: Towards efficient multimodal large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03580","last_updated":"2026-08-04T12:34:46Z","snapshot_observed_at":"2026-08-07T23:12:07.697923Z","submitted_at":"2026-08-04T12:34:46Z","title":"SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:28.857602Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2608.03580"},"observation_digest":"sha256:4aac584a053c15a443725cca413ecd70a19c399e4b48192dfab136f97c9409a0","observation_id":"a8bd15c3-4ac0-4d71-9160-9ad85923ffd8","resolution":{"observed_at":"2026-08-05T16:41:28.857602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10803/citation-record","integrity":"/paper/2411.10803/integrity","json":"/paper/2411.10803/citation-record.json","paper":"/paper/2411.10803"},"outbound":[],"paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2411.10803."}