{"as_of":"2026-08-18T20:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66b2ace1106b903209ad5f2499bd7e2aeaf425cd805f2a76402baa5f36dfc3bb","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:18:16.483944Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01985/citation-record","integrity":"/paper/2608.01985/integrity","json":"/paper/2608.01985/citation-record.json","paper":"/paper/2608.01985"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.075499Z","title":"Vita: An efficient video- to-text algorithm using vlm for rag-based video analysis system","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.075499Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:5a2ec396254813067fda69d573d045b8f46693f6161c96f44f54272c75061d47","observation_id":"e7ab9233-bfbc-4318-8d35-fd2e31bf2dbc","resolution":{"observed_at":"2026-08-04T17:18:16.075499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.080649Z","title":"Fastvlm: Efficient vision encoding for vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.080649Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:d884ddc4a0aaccc18f4af70b7855fe1ae657daa4f372d21000d772b074643a9c","observation_id":"d3ce09f4-19d3-44b2-a558-6d085b77a783","resolution":{"observed_at":"2026-08-04T17:18:16.080649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.085035Z","title":"Mmtok: Multimodal coverage maximization for efficient inference of vlms.ICLR, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.085035Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:9d00be02645036057fd46ffee76d74a2d9493b6fd27f3485a6ecfaa07ad8fba5","observation_id":"4166294a-5acf-4fa6-99ae-9a7d18aa5fc9","resolution":{"observed_at":"2026-08-04T17:18:16.085035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.090562Z","title":"See what matters: Differentiable grid sample pruning for generalizable vision-language-action model.ICML, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.090562Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:599959c8149b231beb792993bca824e03005ede10f33c56fa40e7ed2e9a18f12","observation_id":"e90af430-255c-4837-953d-3a601f785bc2","resolution":{"observed_at":"2026-08-04T17:18:16.090562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11549","last_updated":"2025-03-14T16:12:23Z","snapshot_observed_at":"2026-08-16T12:49:57.297223Z","submitted_at":"2025-03-14T16:12:23Z","title":"Similarity-Aware Token Pruning: Your VLM but Faster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11549","snapshot_observed_at":"2026-08-04T17:18:16.095066Z","title":"Similarity-aware token pruning: Your vlm but faster.arXiv preprint arXiv:2503.11549, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.095066Z"},"links":{"cited_paper":"/paper/2503.11549","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:ce64e47cb60ce8118fe7f121744d7d135b04b1952c03f0085a88b6dc6ff034ec","observation_id":"acbe806f-1b20-4e4b-a766-b8adb443d60e","resolution":{"observed_at":"2026-08-04T17:18:16.095066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11176","last_updated":"2025-08-15T03:02:36Z","snapshot_observed_at":"2026-08-15T14:30:34.349044Z","submitted_at":"2025-08-15T03:02:36Z","title":"Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11176","snapshot_observed_at":"2026-08-04T17:18:16.100395Z","title":"Fine-grained vlm fine-tuning via latent hierarchical adapter learning.arXiv preprint arXiv:2508.11176, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.100395Z"},"links":{"cited_paper":"/paper/2508.11176","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:8e0eeefc0c98fefa528006dfeba5a3bf51fb1f29c47ffd7e27c872da25643ded","observation_id":"d2c9e02d-8997-4270-a005-044f4beb58a4","resolution":{"observed_at":"2026-08-04T17:18:16.100395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14204","last_updated":"2025-01-24T03:20:37Z","snapshot_observed_at":"2026-08-18T12:38:55.053933Z","submitted_at":"2025-01-24T03:20:37Z","title":"Dynamic Token Reduction during Generation for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14204","snapshot_observed_at":"2026-08-04T17:18:16.105663Z","title":"Dynamic token reduction during generation for vision language models.arXiv preprint arXiv:2501.14204, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.105663Z"},"links":{"cited_paper":"/paper/2501.14204","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:b2e17d80e0ce8a39322970c5aea58096a8ebb2a71407be7ba6c34c3ae6bf7e49","observation_id":"905fd507-6e98-444c-8906-6eb1d3ab4734","resolution":{"observed_at":"2026-08-04T17:18:16.105663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.110570Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.110570Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:e4dcc02db9efc8e1dddc28af7627cf25ad443b71cdc76a676710dde420b43938","observation_id":"c393f4d7-e95b-4437-a5f1-19d52bfed842","resolution":{"observed_at":"2026-08-04T17:18:16.110570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.114879Z","title":"Differentiable top-k operator with optimal transport","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.114879Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:5336b2e8c39e933ccd60cc259283108465dc0ddf38782d7e37beedb078e6219c","observation_id":"40883bdc-2878-49e1-ae16-8f73ae319b5a","resolution":{"observed_at":"2026-08-04T17:18:16.114879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.119664Z","title":"A survey of token compression for efficient multimodal large language models.Transactions on Machine Learning Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.119664Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:afb28c999df069947f3faf1414e0ab47e0f43355c8c52be62c2f4d54423b94c5","observation_id":"057b4bcc-8af9-440c-83f9-bdb8d32af8ba","resolution":{"observed_at":"2026-08-04T17:18:16.119664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.123814Z","title":"Towards efficient multimodal large language models: A survey on token compression","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.123814Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:3928e8070aad1e30547f8974ea2320f5260bab4a2fab7ef16f293e382b09234c","observation_id":"50b6c6b7-b07c-4c3e-b87c-5dceba29503f","resolution":{"observed_at":"2026-08-04T17:18:16.123814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.128248Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.128248Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:f12fbc4b5541dfaeb17c671acc48ba20cf6dddd28952391851546a4dbf595467","observation_id":"b57ef01e-7837-4369-9f93-f9d4290d1dc2","resolution":{"observed_at":"2026-08-04T17:18:16.128248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.132384Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference.ICML, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.132384Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:4abd93badb66b0f0fdd8d29f959eb0b547506eac214d1db89349ab430e460d4f","observation_id":"904491f9-3a2b-40b7-b3e9-3dcd2eef9d85","resolution":{"observed_at":"2026-08-04T17:18:16.132384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.136191Z","title":"[CLS] attention is all you need for training-free visual token pruning: Make VLM inference faster, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.136191Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:175edbc20261afda430414f8dd50f8b0b387c57732fa3d9ef48ac6a7b107839a","observation_id":"f5b458d1-1faa-410b-b560-2b95be2ef930","resolution":{"observed_at":"2026-08-04T17:18:16.136191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.140082Z","title":"Boosting multimodal large language models with visual tokens withdrawal for rapid inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.140082Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:21a71c414528ed2ff70989ef643157c610a01d3824c95e4a887b922b2565d02b","observation_id":"567d0701-0550-4c25-ac22-178d0978c75f","resolution":{"observed_at":"2026-08-04T17:18:16.140082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.143972Z","title":"Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.143972Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:49a3d5e8fc19f8814e78361b56f010d97faba67195f5c5c375a50894f9096ede","observation_id":"b62e1afa-de98-4fef-a22e-1cc05a4b98fb","resolution":{"observed_at":"2026-08-04T17:18:16.143972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.148073Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction.CVPR, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.148073Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:dcf77dadecbdba3c58625da782a24a5649c6ce54fd907eccfd2d35f1a7455614","observation_id":"f52590df-372e-4c61-bc58-92d0deb26c18","resolution":{"observed_at":"2026-08-04T17:18:16.148073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.152289Z","title":"Topv: Compatible token pruning with inference time optimization for fast and low-memory multimodal vision language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.152289Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:8b1a564be2f6294b6e50e64c24ac0da9ad501bb2a2555e1ec19077baf8e94395","observation_id":"fb91a094-963a-43d1-8e3f-ebff4fd974d6","resolution":{"observed_at":"2026-08-04T17:18:16.152289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.157900Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.157900Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:5f01219bab141cf71343e32d85762c741fb07f2a991acc69178e5f4f0733a8e0","observation_id":"0f2524a2-2331-42fd-af77-321f5d3640a0","resolution":{"observed_at":"2026-08-04T17:18:16.157900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.162973Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.162973Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:93a53f80fc946734da1c817d04e1fee307acda293e6fd775630bada870b7bc1e","observation_id":"91d7aa5b-c0c3-47d7-a564-13e1f6ed011c","resolution":{"observed_at":"2026-08-04T17:18:16.162973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.167162Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.167162Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:3e6a0c0acef9d9eaff0bdc33238d1e365f93aff3fc6222b5bc84e9def8c36035","observation_id":"b0ab578a-2df7-4c35-ae57-67216ea087e0","resolution":{"observed_at":"2026-08-04T17:18:16.167162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.171242Z","title":"Fit and prune: Fast and training-free visual token pruning for multi-modal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.171242Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:837793fc71bb66d0d2adc33582b096da63b831bcacb8c50959aee34fabd0b12b","observation_id":"5fd8de38-6e94-4640-be2b-08b0f483585b","resolution":{"observed_at":"2026-08-04T17:18:16.171242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.175607Z","title":"Feather the throttle: Revisiting visual token pruning for vision-language model acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.175607Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:6d4181eb24def1606026c6c1de421a464713f3a22da99748bfdedb2ccb7cfb35","observation_id":"b635af1d-7e5c-49e8-ba33-ef790553ec37","resolution":{"observed_at":"2026-08-04T17:18:16.175607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.179792Z","title":"Divprune: Diversity-based visual token pruning for large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.179792Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:13d0674a30174f95cd0b0e0b69469247a1c1142a6c1de4d5803077e50d538c12","observation_id":"cd64416d-93eb-44b9-a497-e18fc75e2572","resolution":{"observed_at":"2026-08-04T17:18:16.179792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.183933Z","title":"important tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.183933Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:4d306444c788815e51233c896ae3ccf2a30b98f1e40629ed0aa1d95b418ace7d","observation_id":"d5824d6e-28be-41e8-9dbb-92409379ad42","resolution":{"observed_at":"2026-08-04T17:18:16.183933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.188152Z","title":"highlighted tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.188152Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:dbe8b3730be42d29406ea64cd08fbff7185a5fad79316e7ad69ea9aa0060d5e4","observation_id":"042cfef7-0ded-4af9-81d1-b825465f6119","resolution":{"observed_at":"2026-08-04T17:18:16.188152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.192539Z","title":"Balanced token pruning: Accelerating vision language models beyond local optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.192539Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:09ad437e0ae6d2bca4ab0eccd828aef233bf46651b8ff83873e41f0675d0955f","observation_id":"5c96544f-5311-41da-8d7b-43b2ed3ad803","resolution":{"observed_at":"2026-08-04T17:18:16.192539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.196666Z","title":"Prune redundancy, preserve essence: Vision token compression in vlms via synergistic importance-diversity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.196666Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:99d65e04837f7e349a7496aaa13efc526b0930afc5df03f33b1d21d745de889d","observation_id":"ee8db22d-d8b8-47ce-b797-417edbe7122f","resolution":{"observed_at":"2026-08-04T17:18:16.196666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.200549Z","title":"Vlm-pruner: Buffering for spatial sparsity in an efficient vlm centrifugal token pruning paradigm.CVPR 2026, 2025","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.200549Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:13437dc710f6e79bb8b082ecbdf96e634d8ef3bfd6eea6271b3f89d4b4890ec4","observation_id":"ede9d203-fe93-453d-b06f-ae74c47f3483","resolution":{"observed_at":"2026-08-04T17:18:16.200549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.204798Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.204798Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:c420fc3d0ec5080b8c69419e3d0a40c75749095c565e84f0a50963e5d4a1b335","observation_id":"dc4a4d78-3159-41fb-845a-70bb30ddb92f","resolution":{"observed_at":"2026-08-04T17:18:16.204798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.209493Z","title":"AgilePruner: An empirical study of attention and diversity for adaptive visual token pruning in large vision-language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.209493Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:c30dd7155f80b84d837ef12332dae3758d7d324aae9c04de6e12fb8c39b3ebe7","observation_id":"2f487fb9-d7d1-4453-9b40-355601e8689d","resolution":{"observed_at":"2026-08-04T17:18:16.209493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.213721Z","title":"Learnpruner: Rethinking attention-based token pruning in vision language models.ICLR 2026, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.213721Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:fc669de527e5d26fb82ddc14331f5ee7bc7393541ba551431a349c87fe1ac885","observation_id":"6982661e-f6f2-496d-9c99-29a6b44e1794","resolution":{"observed_at":"2026-08-04T17:18:16.213721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.217842Z","title":"Object-centric vision token pruning for vision language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.217842Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:a55f492a27fc2b04b25b690ba960cecf9e452646b4905e6c0d1962468b9b27fc","observation_id":"cea724cb-c098-4da6-ba4a-9a8dd3b6c84f","resolution":{"observed_at":"2026-08-04T17:18:16.217842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.221737Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification.Advances in neural information processing systems, 34:13937–13949, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.221737Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:8464d5194689bedb0da4badff1c645cb9e4f58c1e6149b95c8d2fc14ee88931a","observation_id":"8b6a9edf-49e6-4116-b3cc-940a1dad2ede","resolution":{"observed_at":"2026-08-04T17:18:16.221737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.226036Z","title":"ATP-LLaV A: Adaptive token pruning for large vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.226036Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:9e6d297775c21cbf0fa8ff6f8fc7f2ab10e02d9e53d4d6845e4858a9814fddaa","observation_id":"2a91c95d-cd33-4c76-9f76-ac65b56dce80","resolution":{"observed_at":"2026-08-04T17:18:16.226036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.231051Z","title":"Dynamic-llava: Efficient multimodal large language models via dynamic vision-language context sparsification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.231051Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:88d5a166785e07b6ce9287cd7c91f8b680679f7cb039ddecf2eddea4fed9a464","observation_id":"4c89d468-262d-4d3f-a191-e44559ef87c4","resolution":{"observed_at":"2026-08-04T17:18:16.231051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.235350Z","title":"The better you learn, the smarter you prune: Towards efficient vision-language-action models via differentiable token pruning.arXiv preprint arXiv:2509.12594, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.235350Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:2f478550706ffd2c5297c3965f2d45d5dc862f3dc437058d33e9f30b104026a0","observation_id":"566bbb66-4186-4c11-a886-59ffb8d82118","resolution":{"observed_at":"2026-08-04T17:18:16.235350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.239354Z","title":"Shiva-dit: Residual-based differentiable top-k selection for efficient diffusion transformers.arXiv preprint arXiv:2602.05605, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.239354Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:496836f93492f8fab58aa879cc6d1c3c45717698d492901364ca357b0c419a8c","observation_id":"40dc70a4-6a5b-48f7-935f-22f13dd64cb6","resolution":{"observed_at":"2026-08-04T17:18:16.239354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.243733Z","title":"Growing a multi-head twig via distillation and reinforcement learning to accelerate large vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.243733Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:1935e872a3106a9d8927191df8966e0652c3a5ebfe72abf90d4f2a9587bd4deb","observation_id":"3c496993-3fd2-41f1-842b-e378aac603b3","resolution":{"observed_at":"2026-08-04T17:18:16.243733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.247657Z","title":"Top-rl: Task-optimized progressive token pruning with reinforcement learning for vision language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.247657Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:ea3a9c817edad4435ef3653e0e8915606b1511e4f0d1c1ff569378fe077677fb","observation_id":"f62e263a-da1f-4626-b3f2-7ae0d99ef6ee","resolution":{"observed_at":"2026-08-04T17:18:16.247657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.251926Z","title":"Improving discrete optimisation via decoupled straight-through gumbel-softmax.arXiv preprint arXiv:2410.13331, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.251926Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:14bf6b5dc997ef53daca79ff7b831b41b462f93515c76051cd43c30de0ae47e4","observation_id":"7c9f9c71-7c4a-442e-b68a-e32e0cb1c9b4","resolution":{"observed_at":"2026-08-04T17:18:16.251926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.256293Z","title":"Bias-variance tradeoffs in single-sample binary gradient estimators","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.256293Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:d1c117b07f3749fefbc3a7ec9c3958cecc08c2c72b4a54a79ef6bc578796dc29","observation_id":"8a6de864-4960-4d41-895a-c957b9d45d6d","resolution":{"observed_at":"2026-08-04T17:18:16.256293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.260740Z","title":"Bednarczyk, Igor T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.260740Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:1a332f58c70fa5c285a46f9cead47a9c2bf9af612f040b8eeddd343aacc9a488","observation_id":"6594bf2f-6e95-4257-8338-823e4b6b363d","resolution":{"observed_at":"2026-08-04T17:18:16.260740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.265570Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.265570Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:a3a245224cba6344a0023256c06e6c33618017d5fdafd3bbe3ad02efee8bce21","observation_id":"afd329fb-3ddd-4dfc-9803-f7aecc41c10e","resolution":{"observed_at":"2026-08-04T17:18:16.265570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.269978Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.269978Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:bd06b86b194416e210c2b47743c3048219ceed2c210465e1deb03e3ac94c9f25","observation_id":"8e80635c-b9e1-4224-8e3d-db4e854108db","resolution":{"observed_at":"2026-08-04T17:18:16.269978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.274379Z","title":"Imagenet-1k-vl-enriched, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.274379Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:82c9547e06b0db4cf4a166e1c8588dff8f211ef0e3c8d380a9aef7ead8ff7a68","observation_id":"172eb3dc-0660-4eae-a0ca-ad1a1923f2b9","resolution":{"observed_at":"2026-08-04T17:18:16.274379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.279245Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.279245Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:6fe7236bf284d5017d40ba8e38f7587ff7a29ac8c80e74e85fefc356bf484f6d","observation_id":"69fb3582-d08b-485d-ab6c-903f163041dc","resolution":{"observed_at":"2026-08-04T17:18:16.279245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.283933Z","title":"p-mod: Building mixture-of-depths mllms via progressive ratio decay","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.283933Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:f3b51a2b8a5714d53bb932eb2302bb8f3bb375b41927dadb04ea2a86f1114633","observation_id":"1d1b5490-b840-4020-baa1-da6e85c58010","resolution":{"observed_at":"2026-08-04T17:18:16.283933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01548","last_updated":"2025-08-03T02:15:43Z","snapshot_observed_at":"2026-08-08T11:58:42.307183Z","submitted_at":"2025-08-03T02:15:43Z","title":"A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01548","snapshot_observed_at":"2026-08-04T17:18:16.288134Z","title":"A glimpse to compress: Dynamic visual token pruning for large vision-language models.arXiv preprint arXiv:2508.01548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.288134Z"},"links":{"cited_paper":"/paper/2508.01548","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:3f18341ad90adf56f8ee459375a0f68f6496f6bfc8f66925a08412e00f1f42cc","observation_id":"c4cc4923-512c-4583-95b4-c5a364e58971","resolution":{"observed_at":"2026-08-04T17:18:16.288134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.292542Z","title":"Gqa: A new dataset for real-world visual reasoning and com- positional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.292542Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:f5546c9a7f2cce4660dbd41e86a32a62349f6ef53b7806ad704803de40e953b1","observation_id":"342df929-1caa-4963-8aea-17c7990cae19","resolution":{"observed_at":"2026-08-04T17:18:16.292542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.296595Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.296595Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:c5160c3ec98bf6963647fd45c29e39d04d4886bd7c573b0671ab6b962cef3f77","observation_id":"6958d870-ec55-4214-a0da-253bca53f93a","resolution":{"observed_at":"2026-08-04T17:18:16.296595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.300832Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.NeurIPS, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.300832Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:142f553b7c7b99e6d5eded666759298488b031ce6444a3153561cf15508049f5","observation_id":"93fec619-b46a-45ae-ade3-af1e62543a64","resolution":{"observed_at":"2026-08-04T17:18:16.300832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.305236Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.305236Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:19296e12c9d52ac53ed7af6af5aab8414e99a5418229935d1abd1ae8a1f575fe","observation_id":"d4835a83-2807-488f-8fd8-a2da84d10d71","resolution":{"observed_at":"2026-08-04T17:18:16.305236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.309536Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.309536Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:a51aec315f4f50e39de11416ac468ae86ab3700538d8153237bc9b753823cf14","observation_id":"82a47b83-0c0a-4363-a71b-fd74527e2400","resolution":{"observed_at":"2026-08-04T17:18:16.309536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.313617Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.313617Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:6ef32542b2914270a4b6b4d4418d83f723b6865264f95830ebb8a2488f6bcb71","observation_id":"64d1d17c-4049-4dbc-a5eb-57f9f7b2e1a8","resolution":{"observed_at":"2026-08-04T17:18:16.313617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.317590Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.317590Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:61271b78c8e869cd33fe9f2c5d8a1aebafc485278217e578d3f2ac90a4364c56","observation_id":"59093d5d-4da8-4ca8-82f6-ba0b68560495","resolution":{"observed_at":"2026-08-04T17:18:16.317590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.321611Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.321611Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:37098fa44093d5dea735beba37438f2a3e8160b45c20097e233479b1d2f0a417","observation_id":"b5a6b520-ecc8-46ab-86f2-64269be89ced","resolution":{"observed_at":"2026-08-04T17:18:16.321611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.325714Z","title":"Vizwiz: nearly real-time answers to visual questions","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.325714Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:d84ba9f7f8cc05a1fd501251f4b14cc966a2fa4b072965472da2ea7d44dd3191","observation_id":"9ad26a32-b6f4-4283-95a9-b963857175a9","resolution":{"observed_at":"2026-08-04T17:18:16.325714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.329882Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.329882Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:2bf7a87046485e2e11394ab9244ed31b02a6e86b1b164200c0ad9a8201f6d61f","observation_id":"628468e6-30c2-4d04-a1f5-935cca520ca4","resolution":{"observed_at":"2026-08-04T17:18:16.329882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.334149Z","title":"One leaf reveals the season: Occlusion-based contrastive learning with semantic-aware views for efficient visual representation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.334149Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:6165eae3659fa1b3274004540ad8e6518965cc126b0ec678d951249f0ae169ff","observation_id":"83ea1c63-54c8-4b4d-91b9-301e17795949","resolution":{"observed_at":"2026-08-04T17:18:16.334149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.338005Z","title":"Fewer tokens, greater scaling: Self-adaptive visual bases for efficient and expansive representation learning.arXiv preprint arXiv:2511.19515, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.338005Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:dffed290b6576d3907a2698f9e8e405a1aa871629ecbd62080577e292993150a","observation_id":"961a322c-f753-413b-b980-4aa903efa50f","resolution":{"observed_at":"2026-08-04T17:18:16.338005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.341788Z","title":"Scalar: Spatial- concept alignment for robust vision in harsh open world.Pattern Recognition, page 113203, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.341788Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:1b334f672a1d75a0eccd769cd132256c1a25f6a7d1c00b751582dc90ebd72209","observation_id":"c39d067b-87ac-4f66-b702-68cb6f656cbb","resolution":{"observed_at":"2026-08-04T17:18:16.341788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.345884Z","title":"Segmentation and vascular vectorization for coronary artery by geometry-based cascaded neural network.IEEE Transactions on Medical Imaging, 44(1):259–269, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.345884Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:62d9b4672c034828f1664132b597b7d7e8fe319982a33c174608d749754a8cb0","observation_id":"97e502d0-413b-4056-a63c-1bed66599ee8","resolution":{"observed_at":"2026-08-04T17:18:16.345884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.349722Z","title":"Geometry-based end-to-end segmentation of coronary artery in computed tomography angiography","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.349722Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:6281f28d63378d7a02d84a502f6b39700374c3991991e1a2fbba053cead0e53e","observation_id":"3b2835cc-cf58-46d2-9594-71b991ff6731","resolution":{"observed_at":"2026-08-04T17:18:16.349722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.353864Z","title":"Tc-ssa: Token compression via semantic slot aggregation for gigapixel pathology reasoning.MICCAI, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.353864Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:2f7743bcfd7dc880ffa05ae8658cf1ba33864cbba0283912ed7dfc2883954f54","observation_id":"a626a9f0-5b9c-4957-9b0c-95931ce84b7c","resolution":{"observed_at":"2026-08-04T17:18:16.353864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.357948Z","title":"Multimodal model for computational pathology: Representation learning and image compression.arXiv preprint arXiv:2603.18660, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.357948Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:158d88b068b896e4394b6955cc19b8ca067c1d308fdb5ef686913166b3d549cd","observation_id":"1eb1fb18-dfb0-43d9-b281-8b73de82113a","resolution":{"observed_at":"2026-08-04T17:18:16.357948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.364815Z","title":"A unified multi-task framework enables interpretable chest radiograph analysis.Med, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.364815Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:069b0214336a83727639f43e2e05ce7084edfe6200a46411e0e39696ccc82e03","observation_id":"ee1efc6c-30f7-47e1-b734-37e530d55dfc","resolution":{"observed_at":"2026-08-04T17:18:16.364815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01092","last_updated":"2024-03-04T04:28:11Z","snapshot_observed_at":"2026-08-16T14:46:37.050701Z","submitted_at":"2023-11-02T08:55:48Z","title":"Learning A Multi-Task Transformer Via Unified And Customized Instruction Tuning For Chest Radiograph Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01092","snapshot_observed_at":"2026-08-04T17:18:16.378524Z","title":"Learning a multi-task transformer via unified and customized instruction tuning for chest radiograph interpretation.arXiv preprint arXiv:2311.01092, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.378524Z"},"links":{"cited_paper":"/paper/2311.01092","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:b4fa23c2aaf3384ea6c2373850397e44ed9d7dfedad267eab0c2829f61d1711c","observation_id":"a3f8721b-d7d0-499e-997c-427e537ca456","resolution":{"observed_at":"2026-08-04T17:18:16.378524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19684","last_updated":"2024-09-29T12:23:10Z","snapshot_observed_at":"2026-08-16T13:14:23.748632Z","submitted_at":"2024-09-29T12:23:10Z","title":"MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19684","snapshot_observed_at":"2026-08-04T17:18:16.391750Z","title":"Medvilam: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation.arXiv preprint arXiv:2409.19684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.391750Z"},"links":{"cited_paper":"/paper/2409.19684","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:4f3a3fac62718cedec4e597a458b3cc35b44c776c6af88fa1a61e38a84391980","observation_id":"d41fddf2-6438-4ff3-b61f-5f0f148e643f","resolution":{"observed_at":"2026-08-04T17:18:16.391750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08861","last_updated":"2024-10-11T14:41:27Z","snapshot_observed_at":"2026-08-18T08:53:57.383083Z","submitted_at":"2024-10-11T14:41:27Z","title":"A foundation model for generalizable disease diagnosis in chest X-ray images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08861","snapshot_observed_at":"2026-08-04T17:18:16.403344Z","title":"A foundation model for generalizable disease diagnosis in chest x-ray images.arXiv preprint arXiv:2410.08861, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.403344Z"},"links":{"cited_paper":"/paper/2410.08861","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:03e7aee442587509db95bb8d8852638d32256eadc9b47ff036ddc7f24bc549f0","observation_id":"5536d433-9bb5-41ee-a85e-075c1ecd6abf","resolution":{"observed_at":"2026-08-04T17:18:16.403344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.416481Z","title":"Efficient chest x-ray representation learning via semantic-partitioned contrastive learning.arXiv preprint arXiv:2603.07113, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.416481Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:2022ccccfe52bafd3fde18a7df8772f2b8e3d023b8fd9a2b767e7b6e93c75765","observation_id":"97405340-88b9-44d9-81e1-9057ee867f48","resolution":{"observed_at":"2026-08-04T17:18:16.416481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28051","last_updated":"2026-05-27T06:52:08Z","snapshot_observed_at":"2026-08-13T06:30:59.814052Z","submitted_at":"2026-05-27T06:52:08Z","title":"Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28051","snapshot_observed_at":"2026-08-04T17:18:16.429922Z","title":"Beyond surrogate gradients: Fully differentiable token pruning for vision-language models.arXiv preprint arXiv:2605.28051, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.429922Z"},"links":{"cited_paper":"/paper/2605.28051","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:0b88590f804d6b8c790b1f17682d33cb5e3466c53187b65b813e3afd67d41eb4","observation_id":"f64d019e-460b-4717-aea4-576551b0ad72","resolution":{"observed_at":"2026-08-04T17:18:16.429922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.442868Z","title":"The model knows which tokens matter:automatic token selection via noise gating.arXiv preprint arXiv:2603.07135, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.442868Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:c0160731b01c92e8fec07f75386b787311519e008fdc33e367fb0f4a7cc06b59","observation_id":"e90a018c-61c8-42d4-87db-cee1c59df241","resolution":{"observed_at":"2026-08-04T17:18:16.442868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.453946Z","title":"Stepwise token selection for efficient multimodal large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.453946Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:7c4f8219a897af6f95d02562a7cc133c4b68a1abd1abaef7cc52f70e763a5a40","observation_id":"08fd9115-9ea6-4bed-8564-90304362f42f","resolution":{"observed_at":"2026-08-04T17:18:16.453946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08641","last_updated":"2026-06-07T14:07:28Z","snapshot_observed_at":"2026-08-08T15:14:14.147192Z","submitted_at":"2026-06-07T14:07:28Z","title":"Learnable Token Sparsification for Efficient Gigapixel Whole Slide Image Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08641","snapshot_observed_at":"2026-08-04T17:18:16.464036Z","title":"Learnable token sparsification for efficient gigapixel whole slide image reasoning.arXiv preprint arXiv:2606.08641, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.464036Z"},"links":{"cited_paper":"/paper/2606.08641","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:88debe080725d9634a09dfbe36fb2de8d7ecaa6bd4a7af05e86cd6502f0d4b0d","observation_id":"5edc7764-fe6a-43ef-acb6-fc0a5df35b62","resolution":{"observed_at":"2026-08-04T17:18:16.464036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.23631","last_updated":"2026-07-26T12:36:16Z","snapshot_observed_at":"2026-08-17T00:47:10.585446Z","submitted_at":"2026-07-26T12:36:16Z","title":"PathSelect: Sequential Token Selection for Whole Slide Pathology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.23631","snapshot_observed_at":"2026-08-04T17:18:16.474432Z","title":"Pathselect: Sequential token selection for whole slide pathology.arXiv preprint arXiv:2607.23631, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.474432Z"},"links":{"cited_paper":"/paper/2607.23631","citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:d05f429bd8ed66861dff84f91852ff69c50200bc0d0088b255b6834e074014a6","observation_id":"00836b36-0e4f-4756-8dee-4246054c7f18","resolution":{"observed_at":"2026-08-04T17:18:16.474432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:18:16.483944Z","title":"Zerosense: How vision matters in long context compression.arXiv preprint arXiv:2603.11846, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T17:18:16.483944Z"},"links":{"citing_paper":"/paper/2608.01985"},"observation_digest":"sha256:989bdfef3a087ce5cff7da88676006f30fbc87f6acba54f9c25df05e51cea6e8","observation_id":"ec54d142-b6f8-4007-959e-9f7bdd02d711","resolution":{"observed_at":"2026-08-04T17:18:16.483944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01985","last_updated":"2026-08-03T09:46:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:51:18.997802Z","submitted_at":"2026-08-03T09:46:32Z","title":"DiffPrune: differentiable information throttling for token pruning in vision-language models"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2608.01985."}