{"as_of":"2026-08-08T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c4c8711d4a921ac714b5476bcc93164c53e31f1d687cddade1ae922efde5594","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:03:30.238634Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13500/citation-record","integrity":"/paper/2607.13500/integrity","json":"/paper/2607.13500/citation-record.json","paper":"/paper/2607.13500"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T05:03:24.436267Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.436267Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f3dfeb1937629e898301567d39cb4e73b4c7f82574644c12ad63729c03edab42","observation_id":"f4ab3642-ce73-454d-b2c0-611e1b14a6c4","resolution":{"observed_at":"2026-08-02T05:03:24.436267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:24.536860Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.536860Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:5e77db9a4d292cfd207da1481958b34006a43a56ed923e5ebdf481e2e8fda3ac","observation_id":"c9847a69-a0ba-41e3-afb5-90c2ec4a0642","resolution":{"observed_at":"2026-08-02T05:03:24.536860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T05:03:24.689482Z","title":"Qwen2- VL:enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.689482Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:e88af65330689757645246927fce6afddf3be0a7d3c1fc536eaf8ea57dae64ea","observation_id":"226cf9b0-c893-49a1-bc4f-2e0510e1024a","resolution":{"observed_at":"2026-08-02T05:03:24.689482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:24.814141Z","title":"BLIP- 2:bootstrapping language-image pre-training with frozen 11 image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.814141Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:bd03c13c7bb81017498e07d572feab21f66f36145ffb813f60502d3d97dfc41e","observation_id":"ea241e75-2bb5-4ef9-b833-a0bc3a062b41","resolution":{"observed_at":"2026-08-02T05:03:24.814141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:24.897278Z","title":"Cost-efficient and secure federated learning for edge computing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:24.897278Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:4e8f1f87d2025bbf7dfeb57c47291f1288dae64dd50758f08deb80f7524de21f","observation_id":"9b2ade47-0381-4662-9bb0-0a2d01c718ef","resolution":{"observed_at":"2026-08-02T05:03:24.897278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.037156Z","title":"To- wards online privacy-preserving computation offloading in mobile edge computing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.037156Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:56dc23954dc8b0a933448723b51d8dbf9d2264c2c88140aa3817e1f1fb64056c","observation_id":"0dbdf4ac-b3dd-40f0-9467-1989ec35030a","resolution":{"observed_at":"2026-08-02T05:03:25.037156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24773","last_updated":"2025-08-20T08:08:03Z","snapshot_observed_at":"2026-08-07T17:34:11.678905Z","submitted_at":"2025-05-30T16:35:32Z","title":"AFLoRA: Adaptive Federated Fine-Tuning of Large Language Models with Resource-Aware Low-Rank Adaption","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24773","snapshot_observed_at":"2026-08-02T05:03:25.152278Z","title":"Aflora: Adap- tive federated fine-tuning of large language models with resource-aware low-rank adaption,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.152278Z"},"links":{"cited_paper":"/paper/2505.24773","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:10ac76754c024483c9ebdb01c10e853b1bb1e8dbd9e480e64e6925b04a1f83a1","observation_id":"c110d243-9905-40b3-a029-e4f09786feb6","resolution":{"observed_at":"2026-08-02T05:03:25.152278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.325447Z","title":"Towards efficient edge learning for large models in heterogeneous resource-limited environments,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.325447Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:14313ea23c333fbfe1fe10b2ab12f9378a20e953cad0f85b8751f8fafab84ad0","observation_id":"54509875-4356-453a-92fd-965ad18dd9bd","resolution":{"observed_at":"2026-08-02T05:03:25.325447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.434759Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.434759Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:53f31c8dec3cd29f26a25fdce45204353988d1114462643d7d9c1ab1d938b573","observation_id":"62585956-b6f2-4224-b033-c57ae6dbf983","resolution":{"observed_at":"2026-08-02T05:03:25.434759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.501494Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.501494Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:7eef700383a81c41694e3459de35ba4e14238896ce9b53419200ae5ac438b312","observation_id":"1e4c373d-8840-48a8-b27f-9bdcb9d49091","resolution":{"observed_at":"2026-08-02T05:03:25.501494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.611352Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.611352Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:81c21e67981d3bad3ac55593daf2c016e627f9e4fe1e0856f447adacb7949a64","observation_id":"b0e52ff1-b723-42a7-a6ba-b6613a029b58","resolution":{"observed_at":"2026-08-02T05:03:25.611352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.794944Z","title":"Tap-vits: Task-adaptive pruning for on- device deployment of vision transformers,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.794944Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:a1deb05fb1a6829b476df8429687539d73735390dfdcf4411a30ef6fe4112779","observation_id":"b3c0b6c8-aa10-4928-92c3-7aefb0c0232c","resolution":{"observed_at":"2026-08-02T05:03:25.794944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:25.924755Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision- language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:25.924755Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:fcc17c7a033f39faf84588b368d200fb6a0a1dabc8abb7c13e182113d992344b","observation_id":"4d088e23-6195-4a16-bcc8-5d894330ded2","resolution":{"observed_at":"2026-08-02T05:03:25.924755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.059229Z","title":"VScan: Rethinking visual token reduction for efficient large vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.059229Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:44ecce330f4dc6d0db6c0be87559481aad26716b17de5c38b6ef56261510ca64","observation_id":"f5b2543d-5b97-41a7-82d5-84b2e311bc4e","resolution":{"observed_at":"2026-08-02T05:03:26.059229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.144959Z","title":"Adaptinfer: Adaptive token pruning for vision-language model inference with dynamical text guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.144959Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:acf671c68df55f1316fd663ccbb4d97cc33ca2423ac84cb5f6753c2f9b59a5f9","observation_id":"064b0bc9-7083-443c-8844-053fe9866142","resolution":{"observed_at":"2026-08-02T05:03:26.144959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.344745Z","title":"Variation-aware vision token dropping for faster large vision-language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.344745Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:d814dd2e5c49550d6c5369f0965b804d9cf725b08f7bda6b9d46b8a4e1842daf","observation_id":"7fc6fe26-451d-44fc-84b4-94e73926579c","resolution":{"observed_at":"2026-08-02T05:03:26.344745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.444741Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.444741Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:cf134aa17bd9dee7fd80c2ea7d66058b013b56714e6d7b2e0e231b300aaac21a","observation_id":"b7a58740-0054-4df7-bbdd-43b100638dd8","resolution":{"observed_at":"2026-08-02T05:03:26.444741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.552698Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyra- mid visual redundancy reduction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.552698Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:525b7efdb9440756bff8a75d6d3252f613fe2fa1d7cf7ed49c66ac630380853e","observation_id":"6e3d6150-0858-4287-b4a9-ec64c80658be","resolution":{"observed_at":"2026-08-02T05:03:26.552698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-02T05:03:26.664752Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.664752Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:d12971a095e8964092ccceb0df50fcc9b1a87fc97700dc7fa440d0995b413ddb","observation_id":"13493d25-1882-4ac2-9c22-5251d778b29b","resolution":{"observed_at":"2026-08-02T05:03:26.664752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00419","last_updated":"2025-08-30T08:57:53Z","snapshot_observed_at":"2026-08-08T00:44:37.664755Z","submitted_at":"2025-08-30T08:57:53Z","title":"LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00419","snapshot_observed_at":"2026-08-02T05:03:26.782904Z","title":"Lightvlm: Acceleraing large multimodal models with pyramid token merging and kv cache compression,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.782904Z"},"links":{"cited_paper":"/paper/2509.00419","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:024e11b6da2b355ddef43ef33052025c8bca40ee8b6fed2a0d4b5200d387e535","observation_id":"d13bbfb4-1f49-43db-b16c-80d33edd3730","resolution":{"observed_at":"2026-08-02T05:03:26.782904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.870445Z","title":"Visionzip: Longer is better but not necessary in vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.870445Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f237a86010f1ab09d080d03cde6269af6921df6a65601fdbfe8b8664d61c3d78","observation_id":"0ff3eba6-3f51-43f7-a7fb-97b6a2b91979","resolution":{"observed_at":"2026-08-02T05:03:26.870445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:26.948681Z","title":"Beyond text-visual attention: Exploiting visual cues for effective token pruning in vlms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:26.948681Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:8b9750d3288f3e8d1098dc63694049032a89a5a309cf41769de2b5b727624b88","observation_id":"b084ba45-397d-4a07-89af-fc30c640744a","resolution":{"observed_at":"2026-08-02T05:03:26.948681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.092271Z","title":"Flashat- tention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.092271Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:bba54f2eff2c78e74c28dfdb104087c07f0db00c88631ac09175178063ddeeac","observation_id":"546ee96d-be61-4ad7-84d2-45d3f3cbd165","resolution":{"observed_at":"2026-08-02T05:03:27.092271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.234826Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.234826Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:43222b7ee6726654534a62d4f3635517347bc9fb2580cbd02c4362744aecf1c4","observation_id":"2deb5366-dbe8-4b57-bbb0-61b467999fb5","resolution":{"observed_at":"2026-08-02T05:03:27.234826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.403994Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.403994Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:28007606028a3bf08a02834b46608c8545cd88b7bee647f53e4ab717ec30444e","observation_id":"cc87243f-39eb-46ac-bcda-da8422f6b7ce","resolution":{"observed_at":"2026-08-02T05:03:27.403994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.538342Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.538342Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:8af0fb1ca08af13e9bd452a1ea462eb9ed42cbc45f440e5b961303c76f93f961","observation_id":"59915c0f-7492-4139-8a10-0ad3127b019b","resolution":{"observed_at":"2026-08-02T05:03:27.538342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11549","last_updated":"2025-03-14T16:12:23Z","snapshot_observed_at":"2026-08-07T17:03:30.811010Z","submitted_at":"2025-03-14T16:12:23Z","title":"Similarity-Aware Token Pruning: Your VLM but Faster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11549","snapshot_observed_at":"2026-08-02T05:03:27.630859Z","title":"Similarity-aware token pruning: Your vlm but faster,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.630859Z"},"links":{"cited_paper":"/paper/2503.11549","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:44b41c73f8c87af1f2611447113c861d1b042bb271fff7f11ec8ceee776e3a2c","observation_id":"9774a8cb-bf6f-4697-814e-07c4097cb51e","resolution":{"observed_at":"2026-08-02T05:03:27.630859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17040","last_updated":"2025-05-10T22:42:28Z","snapshot_observed_at":"2026-08-07T15:59:46.382695Z","submitted_at":"2025-04-23T18:38:18Z","title":"DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17040","snapshot_observed_at":"2026-08-02T05:03:27.729468Z","title":"Dymu: Dynamic merging and virtual unmerg- ing for efficient vlms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.729468Z"},"links":{"cited_paper":"/paper/2504.17040","citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:28db199382f6028a96a6d2a9d806d70f8f1d9f5b3cd3e7f7041fb0dc10fcda4b","observation_id":"22517f44-5ec4-418c-aa52-cf96dcdb49a2","resolution":{"observed_at":"2026-08-02T05:03:27.729468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.825305Z","title":"Holitom: Holistic token merging for fast video large language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.825305Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:815b75b93a1d14b1b12387124f30912923a90d1fcb8db39f1661ded17d6c2046","observation_id":"3d64b4bf-0c8f-4592-af83-ac3c21952221","resolution":{"observed_at":"2026-08-02T05:03:27.825305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:27.926783Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:27.926783Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:5062f2956e9ef18802c4d9d17ee91fff311e47d225fd34097031e26965ac03b1","observation_id":"5205495b-aa63-4cf8-b571-2f04b3603e2c","resolution":{"observed_at":"2026-08-02T05:03:27.926783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.013830Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and- language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.013830Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:81ab518414c01ae9e22445c4afbbd5b2a8e05afa12863fa063b976410309080e","observation_id":"87784a5b-205f-46f8-b004-c1470cc9e687","resolution":{"observed_at":"2026-08-02T05:03:28.013830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.121689Z","title":"Uniter: Universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.121689Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:283834adc020255e7bbb2e331001accbfb58e080bb1ab4cdb826822c1a6149f0","observation_id":"be0da18c-1d61-449f-9964-be0b68b85197","resolution":{"observed_at":"2026-08-02T05:03:28.121689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.226288Z","title":"Vflowopt: A token pruning framework for lmms with visual information flow-guided optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.226288Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:3a5e2dedd8d43018ef36a6afe24e75b1c3f7b3fac07e0a637363bb5f24bd260f","observation_id":"d8089c62-c843-492d-ad37-af8967cc2be0","resolution":{"observed_at":"2026-08-02T05:03:28.226288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.371847Z","title":"Hidrop: Hierarchical vision token reduction in mllms via late injection, concave pyramid pruning, and early exit,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.371847Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:1da8f2d55db0a47d2bb9c852b0c9b07913050836efbef4804e0bc4c28274a4bf","observation_id":"6dd0f4b1-427a-4618-b40c-39e40a799b4a","resolution":{"observed_at":"2026-08-02T05:03:28.371847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.468713Z","title":"Todre: Visual token pruning via diversity and task awareness for efficient large vision- language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.468713Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:d6989a27d0b000477e5c4c32960f7d1c842a983d8d7b220eb467e398bdab0709","observation_id":"4e8aa322-7b15-44e8-bcba-029479783c31","resolution":{"observed_at":"2026-08-02T05:03:28.468713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.594759Z","title":"Tamp: Token-adaptive layerwise pruning in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.594759Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:a517f25fd31f63d7bd174e4e153481f9e698e9c691d2b7d12246a6df850c8677","observation_id":"c635a1e2-7d3a-4d3b-8cb3-6c77aa6b9dab","resolution":{"observed_at":"2026-08-02T05:03:28.594759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.694745Z","title":"Swiftvlm: Efficient vision-language model inference via cross-layer token bypass,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.694745Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:65103658b546587e9f02ecad5681f22acbfa9a42f8de0500cd1d9a4cf6d22a12","observation_id":"c19994dd-9808-4d3f-8bd0-6836fccd94db","resolution":{"observed_at":"2026-08-02T05:03:28.694745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.821960Z","title":"Fit and prune: Fast and training-free visual token pruning for multi-modal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.821960Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:c6b3b01f6e519994974d48340401ddca55b484ed8841c5c66c1a18d47c9c2561","observation_id":"132bf8bb-d0dd-40d9-96a0-259f560bd421","resolution":{"observed_at":"2026-08-02T05:03:28.821960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:28.915880Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:28.915880Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:c468e2ec5ea5980274de18bf4f2a7936d6ce6af189a47dcdf8ef6a7b9a00b4c5","observation_id":"f5b61b77-33b6-4232-bd3b-dfeaa1c807e6","resolution":{"observed_at":"2026-08-02T05:03:28.915880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.080528Z","title":"Lvpruning: An effective yet simple language- guided vision token pruning approach for multi-modal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.080528Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:157f89b5a388b79893763b071c71d5a5781bb76179c8db02fe92f83961f729f0","observation_id":"cda51eae-d9b7-4f65-9f58-6e8067fb0f7a","resolution":{"observed_at":"2026-08-02T05:03:29.080528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.165018Z","title":"Matryoshka multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.165018Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f2a66eb351c459cf84bc48df2f6916e94520842d6772126ed060ebcc652f6859","observation_id":"1edaa9e9-2c2a-4a06-bcef-5a0127102bd0","resolution":{"observed_at":"2026-08-02T05:03:29.165018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.310156Z","title":"Matryoshka query transformer for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.310156Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:ca4b8d45d998b1839b141e880851c61612d376aa8a78b49c2ad76e699776050d","observation_id":"a558b01d-b723-454a-b8f6-6bbf7e44ee96","resolution":{"observed_at":"2026-08-02T05:03:29.310156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.446041Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.446041Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:f1c7d06fe58cb0d0fb32d58d814146c372a9f111a16a1fba2ae05c824dbea6d1","observation_id":"089ab825-792e-428a-9c62-f70ae9564a87","resolution":{"observed_at":"2026-08-02T05:03:29.446041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.497826Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.497826Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:69fb2125ee1d381b2fa5ce28b61726d23e2f475742dd2757e98e58674533727e","observation_id":"3626fb5f-c1ba-4f9a-8255-a056036adf9c","resolution":{"observed_at":"2026-08-02T05:03:29.497826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.612676Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.612676Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:39e51fca588f6a15b0fec67ad6e2799811eff2d0cbc1f9f9a5864e09599ab1db","observation_id":"d2bec4f0-55dc-4e30-8613-937675819682","resolution":{"observed_at":"2026-08-02T05:03:29.612676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.779055Z","title":"Towards vqa models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.779055Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:05f3726a3aa3a77de933834bbe1af533a00e0658c474e9f28c19c76687843a02","observation_id":"b00ddbee-7c28-4e7f-ae45-562ce7929f69","resolution":{"observed_at":"2026-08-02T05:03:29.779055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:29.912039Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:29.912039Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:77b07449026bb912a0846f659a9957fa3eaf22e8b0094957a72e2cfb15b38c0b","observation_id":"773bc19c-4e06-4a80-a624-ee3a1a702f9c","resolution":{"observed_at":"2026-08-02T05:03:29.912039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:30.032616Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:30.032616Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:43a63ccfd7ccf43f7b7597f8ab349765adc97018a139cd9d926ff30e965253b6","observation_id":"ddf231ed-aef2-4a71-b883-5cee9fa5a70d","resolution":{"observed_at":"2026-08-02T05:03:30.032616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:30.141140Z","title":"Qwen2.5-vl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:30.141140Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:1f6c77c7824fb99b4802e8dd3d48e78ba57d1e9dd29aa1f5cf1b311c65220616","observation_id":"b11c6af6-3425-4468-a3a1-a874fad95616","resolution":{"observed_at":"2026-08-02T05:03:30.141140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:03:30.238634Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:03:30.238634Z"},"links":{"citing_paper":"/paper/2607.13500"},"observation_digest":"sha256:50e5793b4983b4454e60b70e82a7f440f1cfa108a1472e1cbb444e1aae2fc6f8","observation_id":"71ae835d-ec1b-4842-9824-74af18c345bd","resolution":{"observed_at":"2026-08-02T05:03:30.238634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13500","last_updated":"2026-07-15T06:55:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:02:26.978919Z","submitted_at":"2026-07-15T06:55:08Z","title":"Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2607.13500."}