{"as_of":"2026-08-10T14:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:715563fe9a096ebf990d3a509e0bdcd41f07a662ac17277420bd4c2909c79224","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:30:14.535753Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06411/citation-record","integrity":"/paper/2608.06411/integrity","json":"/paper/2608.06411/citation-record.json","paper":"/paper/2608.06411"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-10T04:30:14.184628Z","title":"arXiv preprint arXiv:2502.13923 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.184628Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:ba39806940c20bba67d4bf464361751f4a65c7977e87a4a70063174eaf8cfda8","observation_id":"d3fefcc0-c1e5-49a9-8b02-7fb1be112d50","resolution":{"observed_at":"2026-08-10T04:30:14.184628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-10T04:30:14.189388Z","title":"arXiv preprint arXiv:2504.10479 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.189388Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:91ff7ad6a7c47ff367326633808d8fbc50fe4641d18c87c5650da9fb423ad9e8","observation_id":"5bf4cec4-7fbf-4622-8715-6616263e904a","resolution":{"observed_at":"2026-08-10T04:30:14.189388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.193471Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.193471Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:628b30ea0c96b9322023fdf6fee12aa8b9375ba282907ef99e3e93c7babb6790","observation_id":"6613c666-b789-4a1d-ab34-393cc274f899","resolution":{"observed_at":"2026-08-10T04:30:14.193471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.197067Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.197067Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:7a230c059ea5c0954f32c7f1342f257679c8b9f0325eb5d6d5a0e376234f12d4","observation_id":"c552ff0a-8265-45dc-a260-ef63ec3ca58b","resolution":{"observed_at":"2026-08-10T04:30:14.197067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.200763Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.200763Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:cfe07981788ed4cf30ccc571b6bd591475a942195ba4ab83fd70defe4bbcbf43","observation_id":"9216dc4a-716e-4300-a6a9-785c5b82ebb1","resolution":{"observed_at":"2026-08-10T04:30:14.200763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.204559Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.204559Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:79c9ba76899135ed6bcb57607a09650f25949055442a597b4e47db258a0ea118","observation_id":"7f200349-2f41-498c-bbb6-00669a2110fe","resolution":{"observed_at":"2026-08-10T04:30:14.204559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.208606Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.208606Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:b1755c2ebf6e44b13ec8bd5f0ef3562acd90ae38bf4cd2a3f09d7589046376ee","observation_id":"655ff2fc-a489-418d-8f29-ccdc15ad5dab","resolution":{"observed_at":"2026-08-10T04:30:14.208606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.211519Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.211519Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:7d295f48b8e1ff5987ee33814d85fcb9112f74169861d14695423a6df9005ab8","observation_id":"788c189a-8fd3-4e98-b920-0f4319ec14bc","resolution":{"observed_at":"2026-08-10T04:30:14.211519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.214635Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.214635Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:28e955f5cce10d3bd419787a8cb897a50edcec585140b0341a0556ed95c04b49","observation_id":"36222e3f-701e-4743-b392-5722206979a5","resolution":{"observed_at":"2026-08-10T04:30:14.214635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.217581Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.217581Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:cb7fac5ac647f1738c9e03fb9e625afe6a20a10a9e44406958e6bf5359bffd69","observation_id":"caa82ddf-0c37-421f-a9fc-9152b55e2ff1","resolution":{"observed_at":"2026-08-10T04:30:14.217581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T04:30:14.220359Z","title":"arXiv preprint arXiv:2308.12966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.220359Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:5ec156c7e0395ad677fbfc02089e0a4119dcce64c83ecd17b835385a5cd42f8d","observation_id":"456cabf5-7ad3-4338-a54b-94098b316d52","resolution":{"observed_at":"2026-08-10T04:30:14.220359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-10T04:30:14.223732Z","title":"arXiv preprint arXiv:2404.16821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.223732Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c3c96c6ccb7913cf66b71a10f91f22c4170a9c3a35f0cc5fbb6fe9eb8b75b1d3","observation_id":"4a5433c3-b826-4b3f-8dd8-2695fc491d56","resolution":{"observed_at":"2026-08-10T04:30:14.223732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T04:30:14.227340Z","title":"arXiv preprint arXiv:2312.11805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.227340Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:dce592463d1609b4d34fa87f7d43bec393bccafeb10563c51b8ea678e0787e29","observation_id":"e3ed016b-e8d6-4909-8094-f1906e58ba7d","resolution":{"observed_at":"2026-08-10T04:30:14.227340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T04:30:14.230915Z","title":"arXiv preprint arXiv:2403.05530 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.230915Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:a827743b8a41543d6a07c71030807a1dbacdc9f89a8828cf7a42ddf0193dda6b","observation_id":"498c2365-7b92-4d8d-a347-8476b14d3987","resolution":{"observed_at":"2026-08-10T04:30:14.230915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.234665Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.234665Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:dfd52579752fd7e292fc08a88a9eb9a10e86b3a96f17295a976504ebed2d1fd6","observation_id":"83c95443-0f89-4b8f-b099-9c4efeda70fe","resolution":{"observed_at":"2026-08-10T04:30:14.234665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-10T04:30:14.237915Z","title":"arXiv preprint arXiv:2210.09461 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.237915Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:a426d6a289e2ebb9492ad369d17254f7646fa38fa99ef38e04b13e54063762ab","observation_id":"04fcfba3-a3aa-4fc8-be22-c34dbc4866f3","resolution":{"observed_at":"2026-08-10T04:30:14.237915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-10T04:30:14.241516Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.241516Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:a2b802bca4723842deda82bb4f5e19d2fee9e4b2ffa18f46c9857936c0ddb691","observation_id":"daddbc57-a323-435e-9fb5-7d783b1be326","resolution":{"observed_at":"2026-08-10T04:30:14.241516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.244923Z","title":"arXiv preprint arXiv:2403.15388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.244923Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:8c7a1eb5645d3e2f824affbfa83ae3eb857a79cdc0fd151c3c7c16ca2ff08080","observation_id":"d0f3ba0b-a1e1-49bf-ac40-98a4e7670049","resolution":{"observed_at":"2026-08-10T04:30:14.244923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.248316Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.248316Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:6beae73e4cfe31e778ea791514bee1e0e5a9c60d9320184efa299e24ac661a70","observation_id":"4cd2cbfe-3851-4f2f-9a68-ff4bc8485b30","resolution":{"observed_at":"2026-08-10T04:30:14.248316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-10T04:30:14.251891Z","title":"arXiv preprint arXiv:2312.16886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.251891Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:2eb9d802dbb0e1a13abdf84fe5e9b42b174514f13e15b7ef1623d298a9898edc","observation_id":"c2530b53-5a83-4dd9-9946-b4b97b816b33","resolution":{"observed_at":"2026-08-10T04:30:14.251891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-10T04:30:14.255625Z","title":"arXiv preprint arXiv:2407.02392 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.255625Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:7b1332d870aa2549f1d94f32f87ba7a7fd6de9937601b39158efccd5d28a6f1b","observation_id":"3c74d0f9-56b4-442e-91c8-51e2e8a3ec73","resolution":{"observed_at":"2026-08-10T04:30:14.255625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.259308Z","title":"arXiv preprint arXiv:2411.17686 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.259308Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c2735603f8565b8211eda4fb6e37842c5e1dea9ac9cee9408382f0a378d78cbc","observation_id":"5c9d12e3-3039-410b-b995-177db0a4e534","resolution":{"observed_at":"2026-08-10T04:30:14.259308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T04:30:14.263104Z","title":"arXiv preprint arXiv:2307.09288 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.263104Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:2638318a94a1abc70a900bb24768f6c330ddc2933ceb646ed3036053a44a5d38","observation_id":"b05b1e3c-ad65-4f76-a39e-be00825a9b60","resolution":{"observed_at":"2026-08-10T04:30:14.263104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T04:30:14.266859Z","title":"arXiv preprint arXiv:2309.16609 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.266859Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:970eb142c2c28a65eea9f21abc9868e8cd6f4fb9f6d7f43ad24eefd471cff9b2","observation_id":"73fd6f05-f54a-4edf-a71b-92ff8ec78783","resolution":{"observed_at":"2026-08-10T04:30:14.266859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T04:30:14.270569Z","title":"arXiv preprint arXiv:2403.18814 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.270569Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:ee3520d21484ac6136fb5e3a93e29b42637de2b8c5b75445d37377ebdaaa2027","observation_id":"6ed976d5-52fa-4f87-b350-6d6483148a3a","resolution":{"observed_at":"2026-08-10T04:30:14.270569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-10T04:30:14.274367Z","title":"arXiv preprint arXiv:2501.03895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.274367Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:291fbddda72086904fc8fd2f56013b5542d4c095f24b8918cdde6aa46c88a433","observation_id":"100f7f4a-5ab0-4897-aeac-f15ce15c3ddc","resolution":{"observed_at":"2026-08-10T04:30:14.274367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.278391Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.278391Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:8dd0fb14a3af58866719142a8570ff8f675872bbc5637e2c2eb66ad73de4b2bc","observation_id":"51982df7-5667-4d16-8a10-81e67ee8acb4","resolution":{"observed_at":"2026-08-10T04:30:14.278391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.281720Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.281720Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:d7ab1d2481386c2fca5a74b6cd73718279e8150402e56dbce34b65f7583d5a60","observation_id":"5bc6395f-69e3-4fb0-b1e5-d9efa37ef0cf","resolution":{"observed_at":"2026-08-10T04:30:14.281720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-08T00:45:04.947316Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-10T04:30:14.285282Z","title":"arXiv preprint arXiv:2412.01818 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.285282Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:7bb83b9eac5a22712d9ae04d5f16c021642a72377713cb3c46272e0ef2011fdd","observation_id":"6164b773-31a9-42e1-a6bc-7d14aa21dccc","resolution":{"observed_at":"2026-08-10T04:30:14.285282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-10T04:30:14.288837Z","title":"arXiv preprint arXiv:2410.04417 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.288837Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:035935f4f48c2070de44ced070faebf67d040d729c96b046f7d4e8e793bbfa33","observation_id":"e270aa12-acc4-49a4-8290-05c05ff6845a","resolution":{"observed_at":"2026-08-10T04:30:14.288837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-10T04:30:14.292670Z","title":"arXiv preprint arXiv:2411.10803 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.292670Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:21369fe2ece09917b2b1f71eb285d3e06447cf0c4c080ee0e2b890ce1e093312","observation_id":"b888b749-faa7-4be3-b08e-3024b0e967d0","resolution":{"observed_at":"2026-08-10T04:30:14.292670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00447","last_updated":"2024-11-30T11:42:35Z","snapshot_observed_at":"2026-08-09T22:02:40.535467Z","submitted_at":"2024-11-30T11:42:35Z","title":"ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00447","snapshot_observed_at":"2026-08-10T04:30:14.296106Z","title":"arXiv preprint arXiv:2412.00447 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.296106Z"},"links":{"cited_paper":"/paper/2412.00447","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:ce9ced03bf5f5fbd85a5580692b42cb6caaa482bda549f6a74aa16dbdde72fac","observation_id":"5f172363-a22b-4c8d-b29a-583864f922bb","resolution":{"observed_at":"2026-08-10T04:30:14.296106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-10T07:41:21.476174Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-10T04:30:14.299362Z","title":"arXiv preprint arXiv:2410.14072 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.299362Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:1f75c46c073ad6ec174ef126328ffd361a724e449b05542d6541b88e03f4a6a3","observation_id":"f7e6a82c-d1ad-4b30-9c0c-272f3de478b9","resolution":{"observed_at":"2026-08-10T04:30:14.299362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-10T04:30:14.302724Z","title":"arXiv preprint arXiv:2403.17297 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.302724Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:352ae92e557362e9d336e5e931bd8f9d07e479113a585e9d0557f8e72c4108e2","observation_id":"608d509a-bded-40cb-8ee1-8cb0781c9a7d","resolution":{"observed_at":"2026-08-10T04:30:14.302724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.305742Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.305742Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:945ee378905b284750325d366e287e44466c9a8d6164c8c59b833d40772dd1d1","observation_id":"92b9e655-b4f4-4e0a-9a03-f79c0a52089d","resolution":{"observed_at":"2026-08-10T04:30:14.305742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.308686Z","title":"WACV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.308686Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:572ea7a89a4295fb6cbc0d652484943d737f83fbfb2b96a182af191f055b287e","observation_id":"aaa4e496-0e8a-42c7-b286-2b822f85099c","resolution":{"observed_at":"2026-08-10T04:30:14.308686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.312135Z","title":"WACV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.312135Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:327d61ca9cf80cdbbc93630a767ea08dae32c057809426827b2b1d55f6790ee6","observation_id":"5cb99119-9302-4632-ba03-ef4f6964d551","resolution":{"observed_at":"2026-08-10T04:30:14.312135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-10T04:30:14.315460Z","title":"arXiv preprint arXiv:2203.10244 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.315460Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:e456920faaced6acc0b96153ea07c8b3c12652a6196775351c3910702c60e523","observation_id":"678ccdbd-6575-4c75-9c72-c3410921ded0","resolution":{"observed_at":"2026-08-10T04:30:14.315460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.319438Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.319438Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:43cc74beb7d684700f326442b824d8b5ad77a66c9ed015cf3f014e6b8405f26b","observation_id":"9567cdd9-78a5-40e5-b775-3c853645e88b","resolution":{"observed_at":"2026-08-10T04:30:14.319438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.322726Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.322726Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:82d50d300f6dce80ad611ce57abce00c8cc43430c3ed3ca36b895016f5dd34b7","observation_id":"8060f9d7-21bd-49d3-b775-04767abd0b3a","resolution":{"observed_at":"2026-08-10T04:30:14.322726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.326019Z","title":"EMNLP , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.326019Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:785a162328f6793e63fb7704efecf975855f260a518347f52fb0d98a97c5739a","observation_id":"c9bd4578-b93d-4a31-a85d-2ccab01855f4","resolution":{"observed_at":"2026-08-10T04:30:14.326019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.329346Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.329346Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:5901be8e5b293ab481de104ea4aba2477391d69aebc8334717e68562a07a1114","observation_id":"27495724-e151-41ce-b800-bc8f69d17a57","resolution":{"observed_at":"2026-08-10T04:30:14.329346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-10T04:30:14.332660Z","title":"arXiv preprint arXiv:2402.03766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.332660Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:18aa4619eb90b78af57ea0f2ff18509c2769b3bd2ceb7a4144ba46e77e67249d","observation_id":"3c74206c-3482-49aa-93da-85f0681ee83f","resolution":{"observed_at":"2026-08-10T04:30:14.332660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.336324Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.336324Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:f94e9319866806e5f65131f4f16d3c807d5788b30a5063f2fb41feba099a847b","observation_id":"8b16f436-314e-4cb7-879a-1c7375f87e85","resolution":{"observed_at":"2026-08-10T04:30:14.336324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.339687Z","title":"arXiv e-prints , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.339687Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:fe93b477bc2a2963ef55e3f80191da2acbce20323f841cb3500e6f499c242854","observation_id":"c8e980ba-49ac-46a2-9ef9-9724a899f10d","resolution":{"observed_at":"2026-08-10T04:30:14.339687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.343274Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.343274Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:fffa92ec58897a690a412b9232f9384ae5ec4b2261991a42c0f29d4449d88589","observation_id":"cc095e69-dfcf-4ff8-96bd-0af283339d9e","resolution":{"observed_at":"2026-08-10T04:30:14.343274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-10T04:30:14.347023Z","title":"arXiv preprint arXiv:2307.02499 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.347023Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:aa2cd9374f604ea12c9943a609d7faf0e9a9d297a6422674dc994f8df944ed4f","observation_id":"d44975fa-5d17-40c0-a7a4-11d836af12bf","resolution":{"observed_at":"2026-08-10T04:30:14.347023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-10T04:30:14.350680Z","title":"arXiv preprint arXiv:2406.08487 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.350680Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:83e148351c68a901cc042ec680311e75c7cb0f6803c4ef392aa1ea6df256a363","observation_id":"0a18acc9-376b-4343-b92c-c026baf70eed","resolution":{"observed_at":"2026-08-10T04:30:14.350680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.354396Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.354396Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:3f1bb5e3f0993afa30b24e5bd4559ce6c892fe3365b33476bbf036c452f3e1fb","observation_id":"20e53230-899e-417f-92db-a8dfd19d0703","resolution":{"observed_at":"2026-08-10T04:30:14.354396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.357716Z","title":"ECCV , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.357716Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:7b6ebeb8eb547488a82e1d8ff016a81676895e4aef08118aa8c95deb5f9b1b25","observation_id":"d406f4c0-480d-4dd0-8802-74a953a56716","resolution":{"observed_at":"2026-08-10T04:30:14.357716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T04:30:14.360982Z","title":"arXiv preprint arXiv:2304.10592 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.360982Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c11ad36eaa0675c79d80bbdea178d00dba5864743d61ee441660a49447776cdb","observation_id":"ef15e32c-ce71-4f94-aa36-064ccacaabc5","resolution":{"observed_at":"2026-08-10T04:30:14.360982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.364525Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.364525Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c6db9978e4291c9c6766b9fe64d3ced9495de151ae6c1abdcd93e78c347fe9ec","observation_id":"18ef600a-d58c-4cbe-8cdb-1238e205f75b","resolution":{"observed_at":"2026-08-10T04:30:14.364525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10994","last_updated":"2024-12-17T02:05:27Z","snapshot_observed_at":"2026-07-06T19:16:36.688367Z","submitted_at":"2024-09-17T08:56:27Z","title":"Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10994","snapshot_observed_at":"2026-08-10T04:30:14.367925Z","title":"arXiv preprint arXiv:2409.10994 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.367925Z"},"links":{"cited_paper":"/paper/2409.10994","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9680e12a467bd028d73042881dfc97a5e3f89b0c2a775605783339d74e2e2b4f","observation_id":"5bbe1032-10e0-43e0-96f6-cb7127e9fa02","resolution":{"observed_at":"2026-08-10T04:30:14.367925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09564","last_updated":"2024-09-20T14:51:18Z","snapshot_observed_at":"2026-07-06T19:15:29.988880Z","submitted_at":"2024-09-15T00:38:34Z","title":"TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings","version":2},"cited_work":{"arxiv_id":"2409.09564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09564","snapshot_observed_at":"2026-08-10T04:30:15.160107Z","title":"TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings","venue":"cs.CV","work_id":"e3bf1087-29f2-4dcf-b6c9-6820541a8ec0","year":2024},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.371579Z"},"links":{"cited_paper":"/paper/2409.09564","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:00168a2d2bb794fa4e9f7d578ec0c57ead30b433d5ff2a08ff3b43e4c7ed10ea","observation_id":"57db35f6-fe3e-49e7-a9fd-989fbf4a5cde","resolution":{"observed_at":"2026-08-10T04:30:15.167292Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14228","last_updated":"2024-11-21T15:37:52Z","snapshot_observed_at":"2026-07-06T19:53:47.605701Z","submitted_at":"2024-11-21T15:37:52Z","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14228","snapshot_observed_at":"2026-08-10T04:30:14.375574Z","title":"arXiv preprint arXiv:2411.14228 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.375574Z"},"links":{"cited_paper":"/paper/2411.14228","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9553a5a9f946c93adebe07426565e8cb36cade666a018af2eb09e6934904a360","observation_id":"c4bfe39b-061b-4146-86c4-abc0b20949bd","resolution":{"observed_at":"2026-08-10T04:30:14.375574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T04:30:14.379313Z","title":"arXiv preprint arXiv:2403.05525 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.379313Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:e740124706aca87566a5db48cff914cbd521b6c65ed50ffa166b1bbf37b8d5a2","observation_id":"72812fb3-2681-4c41-b044-677deb2ad573","resolution":{"observed_at":"2026-08-10T04:30:14.379313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.382832Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.382832Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:3ff9005fa5528c97dd0428cb42e7756562f604083aa4bc3d2a6a959e40bf605f","observation_id":"b7c065a8-5ccc-4a65-a1a6-4ab6c37f6b8f","resolution":{"observed_at":"2026-08-10T04:30:14.382832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T04:30:14.386155Z","title":"arXiv preprint arXiv:2010.11929 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.386155Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:b25780c11270fc1c4524d13ea6414ceceb7f362b70b939dcbf1e643f34743187","observation_id":"19a85498-d981-42e3-8a41-06ba36b4a12c","resolution":{"observed_at":"2026-08-10T04:30:14.386155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.852459Z","title":"NeurIPS , year=","venue":null,"work_id":"0ebd5f7a-6674-4636-a9bd-f4aca548f8dc","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.390028Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:55e1325ae6b3627fafdb1ba5d2d46c4ec52a5def1de7dbc4404c7b29c95d39f2","observation_id":"868f1a82-2656-424b-b0a5-40c2d9dde5d3","resolution":{"observed_at":"2026-08-10T04:30:15.856172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T04:30:14.393401Z","title":"arXiv preprint arXiv:2409.12191 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.393401Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:9e0799831424a39b3a2d95f3953595bbd6a415930228625bcdc7486da6422ba5","observation_id":"709f01b0-9b09-40de-bf1b-d9a8590fbc55","resolution":{"observed_at":"2026-08-10T04:30:14.393401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.841663Z","title":"ICML , pages=","venue":null,"work_id":"05d26e70-29c4-47de-9199-e9754c1f36c9","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.396351Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:3ee299bda5d8a6e68d4fb937eab9889f58d8b55532b7cd4c466e1f65e78ee341","observation_id":"444a931e-74ea-4114-b2aa-e45f19f5938f","resolution":{"observed_at":"2026-08-10T04:30:15.845287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-10T04:30:14.399358Z","title":"arXiv preprint arXiv:2412.10302 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.399358Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:718e0c75248e902bc7311071fbcc94627a4d3b84281e9a35e35127e5235f46d5","observation_id":"d3efd223-49a3-4e6d-b047-506a4b0bddac","resolution":{"observed_at":"2026-08-10T04:30:14.399358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.829591Z","title":"ACM Transactions on Database Systems (TODS) , pages=","venue":null,"work_id":"f818377f-7dc8-4056-940c-3369b04ab79b","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.403709Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:0fc8f9e60be75c6b11afe93098a4d8dc3e06fc939d186c1c9864f47b36f6ba02","observation_id":"035b1fdb-dc96-40b6-aa2e-e4ddf1c81ea2","resolution":{"observed_at":"2026-08-10T04:30:15.834253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T04:30:14.406724Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.406724Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:b99dac581e22a1f39c40133b59b1a9838408c3fcecbe897676f4ce770dd21c06","observation_id":"6adf513c-42ee-4652-8ca4-90b192613326","resolution":{"observed_at":"2026-08-10T04:30:14.406724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-10T04:30:14.409858Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.409858Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:52925aef657bae22bfdea8a8745692ef6f41ee761c9235c9891032c6bb1cbb6a","observation_id":"b8db08b1-f786-44c5-981b-5861db570550","resolution":{"observed_at":"2026-08-10T04:30:14.409858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.414203Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.414203Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:2b86bcfe1c999b4c342598ffedc95aa66b0eac30ba55fc027188aa0e3a3d48b1","observation_id":"2d548e17-b98a-459e-b572-53109317b777","resolution":{"observed_at":"2026-08-10T04:30:14.414203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T04:30:14.417640Z","title":"arXiv preprint arXiv:2407.07895 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.417640Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:f00e78a09f532651c742883d0ef82541bb7abef7f892d8fbf810fce6836d65f1","observation_id":"4717ca4d-4ce6-4747-b553-94e6f052838b","resolution":{"observed_at":"2026-08-10T04:30:14.417640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.421428Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.421428Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:96f526c40c54a44f27e717d72503dc4e28b0cbf28ff9571a98cc72827d2da2c6","observation_id":"7d630164-4544-449e-8ca2-cd2eb7387854","resolution":{"observed_at":"2026-08-10T04:30:14.421428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.424914Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.424914Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:b17119dff8e2ed11f09f9652db7819580022f2ce17f8a4a67ccd17f3817bf933","observation_id":"2bc0c6ba-b6c3-4fb4-a600-100a0fafb2da","resolution":{"observed_at":"2026-08-10T04:30:14.424914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.796460Z","title":"NeurIPS , year=","venue":null,"work_id":"e2ccd65e-23ae-4d8b-83d4-7ebaa8c9007a","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.428501Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:86a78711c7a464292b999b1e869812ce0ad068539572cce395faa06894845f8c","observation_id":"db8c182a-0f84-47e2-98b8-c2c81904cb62","resolution":{"observed_at":"2026-08-10T04:30:15.800164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-10T04:30:14.432345Z","title":"arXiv preprint arXiv:2307.16125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.432345Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:566b682a991eaf3b694f5a16f8cc7c13ac8d79830989b42c09c4e2dba621c018","observation_id":"457f16e9-e01a-42bd-a39e-d79d004b12fc","resolution":{"observed_at":"2026-08-10T04:30:14.432345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T04:30:14.436166Z","title":"arXiv preprint arXiv:2306.13394 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.436166Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:89cd7347ea4db575d171ef0a484dce129d1b20c9df990fdff2fc521b25732696","observation_id":"e148b1e9-b912-4325-bbd0-0e0adafa7149","resolution":{"observed_at":"2026-08-10T04:30:14.436166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.784402Z","title":"ICCV , year=","venue":null,"work_id":"19834ced-71f2-440c-8616-424e653ac1ac","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.440011Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:a4e9ef549ed3c4456a8785440e82084d9a74596be8cd9b91b9ec3ca1730338fe","observation_id":"4f4ca747-1fac-483b-b8cc-40afb9b37933","resolution":{"observed_at":"2026-08-10T04:30:15.788679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19628","last_updated":"2025-07-25T10:41:09Z","snapshot_observed_at":"2026-07-06T19:58:52.773265Z","submitted_at":"2024-11-29T11:24:23Z","title":"Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19628","snapshot_observed_at":"2026-08-10T04:30:14.443529Z","title":"arXiv preprint arXiv:2411.19628 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.443529Z"},"links":{"cited_paper":"/paper/2411.19628","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:dfa45dde72487dec3f66a230d78ba209f4c77f103f0aceea807393fd7086099e","observation_id":"289f2c93-275c-42ca-99dd-849180301cb3","resolution":{"observed_at":"2026-08-10T04:30:14.443529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-10T04:30:14.447236Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.447236Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:543dbf7b598205682591cbb7207b404afde395ecd9e8d10cf88bb6cf1288d71b","observation_id":"e7414c56-1099-4ff0-8fe4-97423e1612eb","resolution":{"observed_at":"2026-08-10T04:30:14.447236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T04:30:14.450759Z","title":"arXiv preprint arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.450759Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:74081433e43a6b74f1b493dc59928f9a3d6b56662594963f73f12930ccebc389","observation_id":"34ee7d7b-0e4d-426e-92b7-98060254abd8","resolution":{"observed_at":"2026-08-10T04:30:14.450759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.772125Z","title":"CVPR , year=","venue":null,"work_id":"1fbd2696-2dd0-4e74-8dbd-e110a5f93dc7","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.454179Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:58fdb134011d54a269e16d59526e10cf81b0f045618e07ab2ff523031c983a84","observation_id":"04c5c2e7-9d73-4d01-9880-688927c997e7","resolution":{"observed_at":"2026-08-10T04:30:15.775868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.761831Z","title":"AAAI , year=","venue":null,"work_id":"bb1fc262-cdd3-463a-86fc-a787432cd3cf","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.457768Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:3234c0e84fb2059ecbef03e5b81e5762c30e08788f32fe8e109d1abfa23e3429","observation_id":"b7787d07-583c-4a18-81f7-f54d3e940750","resolution":{"observed_at":"2026-08-10T04:30:15.765249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.751041Z","title":"ECCV , year=","venue":null,"work_id":"4f9417bf-ca8f-4f5e-a3ac-520089bbbc49","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.461441Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:4717d96d68bef5c4a9585a1fd646831b2ad1361e1622ecb9bb0f1a04001b4f29","observation_id":"3ec38fa5-dacd-434a-b02d-69faf847e68e","resolution":{"observed_at":"2026-08-10T04:30:15.754472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.739725Z","title":"NeurIPS , year=","venue":null,"work_id":"d31269ea-872b-4998-8e9f-1ccf2f3414c3","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.464845Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:dbbc176214255e22d5f65a93171ac62a3c880026b6610399f57ef2f6fe096e26","observation_id":"40a305b0-f104-48b5-866b-d91e4a27bc00","resolution":{"observed_at":"2026-08-10T04:30:15.743459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.727583Z","title":"CVPR , year=","venue":null,"work_id":"9aaebb11-2eee-4e9e-ae73-10b1b0e86a99","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.468161Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:bf5f2cffae288877366366c690a769ae357433306bbfe9e6c55ed6496fc74ef3","observation_id":"f66abced-ddcb-4954-8520-3e15de978fef","resolution":{"observed_at":"2026-08-10T04:30:15.731968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-10T04:30:14.471570Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.471570Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:31882e9256e82cc4c5e9365335449fe70c48aeb7192351e38d6819aeba867030","observation_id":"caa523ce-41c7-476e-a371-1ba415be5e77","resolution":{"observed_at":"2026-08-10T04:30:14.471570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21307","last_updated":"2025-03-27T09:31:35Z","snapshot_observed_at":"2026-08-07T16:33:24.689717Z","submitted_at":"2025-03-27T09:31:35Z","title":"InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21307","snapshot_observed_at":"2026-08-10T04:30:14.475211Z","title":"arXiv preprint arXiv:2503.21307 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.475211Z"},"links":{"cited_paper":"/paper/2503.21307","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:dea4b6cd58b26fc838d49b0f3736269b91011a2f24929e7e0e2d0467aa3319d6","observation_id":"3e278458-c443-4484-aac3-85b23c675074","resolution":{"observed_at":"2026-08-10T04:30:14.475211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.478903Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.478903Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:45f2d76e2640fd376a9c276282392516bddd19aca826c85248b2f7d22c016ff4","observation_id":"f3da428c-2a7a-49f5-ad92-2ef1b917e3e8","resolution":{"observed_at":"2026-08-10T04:30:14.478903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T04:30:14.482592Z","title":"arXiv preprint arXiv:2302.13971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.482592Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:d163bf47d5c1ab61af0cfa58a2ce20bfe9213507c7acc564167d467000f12dfb","observation_id":"33aaf4d2-def7-4a77-8995-12df540f570b","resolution":{"observed_at":"2026-08-10T04:30:14.482592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-10T04:30:14.486359Z","title":"arXiv preprint arXiv:2412.19437 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.486359Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:7cc0a494c966890c0524c47f6fe3550f2616a90cc978db194a6e712cf0ddc8a3","observation_id":"019cdcc6-3c79-4eb6-aa13-02a89bf8fe65","resolution":{"observed_at":"2026-08-10T04:30:14.486359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-10T04:30:14.490105Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.490105Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:97e0e72d195478e81c56cb345c49b1db04f1bc656dae446dd691a0401cb78bd6","observation_id":"a9fe5aea-29c6-4dcd-8398-07cc5861b1cb","resolution":{"observed_at":"2026-08-10T04:30:14.490105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.708429Z","title":"AAAI , year=","venue":null,"work_id":"85c21d14-1108-46ac-826f-3b2cead8c829","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.493811Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:de1cb8fa70855d01574ff24927e7d25dd7276cd7e8dbef84dda136785e60365b","observation_id":"4d21e384-dc0c-4128-b777-d704c90f14bb","resolution":{"observed_at":"2026-08-10T04:30:15.712087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.497187Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.497187Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:b714339833a9c62c2613ad7c4c7f8d38910de89d9619bbe0cbb2da55430c0f4a","observation_id":"044e74ac-68f1-45b6-b553-57d2505b46b7","resolution":{"observed_at":"2026-08-10T04:30:14.497187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.500265Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.500265Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:6523cb19e98513372f853318dd32ad1c84a419f066368a7bd086587e75dcf529","observation_id":"f2c659c3-613d-410a-a1eb-09ec16f00ad9","resolution":{"observed_at":"2026-08-10T04:30:14.500265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-08-10T10:34:53.296935Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-10T04:30:14.503529Z","title":"arXiv preprint arXiv:2307.02628 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.503529Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:d9f0900cf532a57907f85572c95dbd2f8d359e532dbce16a19cdd530dfb271f3","observation_id":"c403b17c-df75-49e6-a8f4-2bb4ad3f6767","resolution":{"observed_at":"2026-08-10T04:30:14.503529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-10T04:30:14.506806Z","title":"arXiv preprint arXiv:2506.04179 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.506806Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:8c048445d24c802ebd2290af41df16334a1a6f061560d6b88b99547628c049df","observation_id":"8ec82576-f1d4-4563-a1ce-99ee577f7eab","resolution":{"observed_at":"2026-08-10T04:30:14.506806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-10T04:30:14.510251Z","title":"arXiv preprint arXiv:2404.02258 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.510251Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:e321489c3ed18332b98566d0aeb10825fdc9403c4ac11f156f617df996f9fe9f","observation_id":"204158c3-e71a-4351-8031-9963114faf95","resolution":{"observed_at":"2026-08-10T04:30:14.510251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.682909Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"90cc6c80-0d10-4c6e-895c-a7988e883294","year":2025},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.513961Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:04af9fec43424183653c5343f943db34f7de79353d492531ebd494df6da4366a","observation_id":"41a5184a-a68f-454e-a9cd-4422249b0d01","resolution":{"observed_at":"2026-08-10T04:30:15.686593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03043","snapshot_observed_at":"2026-08-10T04:30:14.517712Z","title":"arXiv preprint arXiv:2512.03043 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.517712Z"},"links":{"cited_paper":"/paper/2512.03043","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:b9007e0854210d9fe72711a900161bbaef8c4a93d27e01ca5a53dbae4c1df571","observation_id":"09aec212-b394-4a0a-ab5a-ec21b1b564b9","resolution":{"observed_at":"2026-08-10T04:30:14.517712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23950","last_updated":"2026-04-27T01:56:59Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T01:56:59Z","title":"LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23950","snapshot_observed_at":"2026-08-10T04:30:14.521293Z","title":"arXiv preprint arXiv:2604.23950 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.521293Z"},"links":{"cited_paper":"/paper/2604.23950","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:f41feb2fe3f9ad33d676310c118a07b352803d1ac69c2e8eb91656b9c801d9f8","observation_id":"b8dbd646-f81e-45ae-9aed-dae7da1668b8","resolution":{"observed_at":"2026-08-10T04:30:14.521293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.525086Z","title":"arXiv preprint arXiv:2601.22674 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.525086Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:392075e7861d808193aa2a44c147f52dce54731b309bcb33d338b9715c24b1a1","observation_id":"f5d1790a-cddf-444e-b41d-4f6533f24bba","resolution":{"observed_at":"2026-08-10T04:30:14.525086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.670761Z","title":"AAAI , pages=","venue":null,"work_id":"63b6d757-d720-4bf4-8f8e-b7d3351df09f","year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.528582Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:82be0d9d99a557a2d29be9bf9c5ae8b163122d6909263bf08e5ce57c0c4ba506","observation_id":"e7b0d891-b32c-481b-b396-e3e10cc6872e","resolution":{"observed_at":"2026-08-10T04:30:15.675107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:15.658756Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , year=","venue":null,"work_id":"45a56fa5-b7f2-451e-8b9c-6a6afaffc0a7","year":2025},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.531924Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:317cb2e2e3f4941ab77c4a8f777030928acb9d61e911952efaf073e9cdb177fa","observation_id":"13f1b919-3589-4789-9d9a-62e60ffdf5f7","resolution":{"observed_at":"2026-08-10T04:30:15.662753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:30:14.535753Z","title":"arXiv preprint arXiv:2602.23699 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.535753Z"},"links":{"citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:c552b97f1d112e51fc40498710d681eabbfc250d765b38a327f949a83b76ab5a","observation_id":"f250d59f-7c12-45d5-ac2b-c74a27ad96b2","resolution":{"observed_at":"2026-08-10T04:30:14.535753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T14:09:45.703367Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":85,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 0 inbound Pith citation observations for arXiv:2608.06411."}