{"as_of":"2026-08-08T14:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:135296f5861a7d8d59a1aee6d5f9395d63de03f770117e0d3bc6459e7f1ecc00","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:20:33.522423Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:11:49.179772Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:59:57.457886Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-06T15:38:45.462835Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15428","last_updated":"2025-07-21T09:27:45Z","snapshot_observed_at":"2026-08-08T00:47:00.490358Z","submitted_at":"2025-07-21T09:27:45Z","title":"EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:38:45.462835Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2507.15428"},"observation_digest":"sha256:7a3e94d84b5b41d529138c3f819ab87e1774a62f1deeff769806325e8ae3ec6a","observation_id":"00c809f9-844e-4f80-8722-f6bc21ce394c","resolution":{"observed_at":"2026-08-06T15:38:45.462835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-06T05:37:35.450623Z","title":"Beyond attention or similarity: Maximizing conditional diversity for token pruning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01548","last_updated":"2025-08-03T02:15:43Z","snapshot_observed_at":"2026-08-08T11:58:42.307183Z","submitted_at":"2025-08-03T02:15:43Z","title":"A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:37:35.450623Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2508.01548"},"observation_digest":"sha256:7a5c1880cf72fa4ff409fb18db2654a2c62e7d1828c2cfc294c1f41fbbb2c93a","observation_id":"d6e1b3bf-d94e-4c4b-959d-e59484535d8d","resolution":{"observed_at":"2026-08-06T05:37:35.450623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-03T16:27:34.271065Z","title":"Beyond attention or similarity: Maximizing conditional diversity for token pruning in mllms.arXiv preprint arXiv:2506.10967, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13660","last_updated":"2026-07-03T09:12:21Z","snapshot_observed_at":"2026-08-07T10:25:19.472041Z","submitted_at":"2025-12-15T18:52:43Z","title":"Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics","version":4},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-08-03T16:27:34.271065Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2512.13660"},"observation_digest":"sha256:7e296ce80aa315ee0e66208fc673b35ba749dff0ec3086ac958eb9c08ea775b0","observation_id":"fb5cc1b2-a8b6-494d-ace8-c05441757435","resolution":{"observed_at":"2026-08-03T16:27:34.271065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2604.07812","last_updated":"2026-04-09T05:09:22Z","snapshot_observed_at":"2026-08-02T06:27:25.025040Z","submitted_at":"2026-04-09T05:09:22Z","title":"HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T17:20:19.653806Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2604.07812"},"observation_digest":"sha256:e646a9a41bd84915268aca276630875c1b4154315f3dc19c14edfe680980fc9e","observation_id":"2867c7e5-692b-4aee-9976-eee272cbf749","resolution":{"observed_at":"2026-05-11T07:01:05.867186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2604.20937","last_updated":"2026-06-19T12:00:35Z","snapshot_observed_at":"2026-08-02T23:37:34.955988Z","submitted_at":"2026-04-22T13:28:53Z","title":"Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T00:43:44.921189Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2604.20937"},"observation_digest":"sha256:1d7c4a8c1b2574b37992e81791f2cad7446b39155a0e90ac6bfb8598b6755acc","observation_id":"b952a8a0-3d83-4f70-b36c-5b1ea2f0bffe","resolution":{"observed_at":"2026-05-10T00:44:48.417048Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2605.00392","last_updated":"2026-05-21T12:40:15Z","snapshot_observed_at":"2026-08-02T11:25:36.071129Z","submitted_at":"2026-05-01T04:30:16Z","title":"RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-09T19:49:28.591419Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2605.00392"},"observation_digest":"sha256:2c98604bc6d2abcc0940690e4a985c0f73b2b8c72ceebf4975fa55d223cf9250","observation_id":"5e597c98-ab8b-4547-8774-cd44bd08c998","resolution":{"observed_at":"2026-05-11T15:31:08.455532Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2605.00392","last_updated":"2026-05-21T12:40:15Z","snapshot_observed_at":"2026-08-02T11:25:36.071129Z","submitted_at":"2026-05-01T04:30:16Z","title":"RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T03:16:31.918225Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2605.00392"},"observation_digest":"sha256:885638aaa74a67e504082b189ca2e9794210f67ae2365d8be5aa98746c7e1bb5","observation_id":"23d1383c-d06e-4817-b8b6-88c678f3ea48","resolution":{"observed_at":"2026-05-12T03:21:19.376132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2605.00392","last_updated":"2026-05-21T12:40:15Z","snapshot_observed_at":"2026-08-02T11:25:36.071129Z","submitted_at":"2026-05-01T04:30:16Z","title":"RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T10:28:15.293381Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2605.00392"},"observation_digest":"sha256:e101b44037c7626c7ca4d263a00df0d6c00458c6a715cd15c2363ebd2ca58b2f","observation_id":"3490a9f9-7ee5-4a16-8cbe-0a9c697dee77","resolution":{"observed_at":"2026-05-22T10:31:25.772099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2605.20950","last_updated":"2026-05-20T09:37:53Z","snapshot_observed_at":"2026-07-06T23:31:27.989406Z","submitted_at":"2026-05-20T09:37:53Z","title":"Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-21T05:20:55.448430Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2605.20950"},"observation_digest":"sha256:92dd8dd70511365e8508edc8f526134293d2509aa3121ee8d25cd1c286f529c6","observation_id":"c50d254f-c09e-4cd1-872d-b44ea1beec21","resolution":{"observed_at":"2026-05-21T05:23:58.587932Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T08:40:10.152344Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:8ab87abed90df2ec552bda58e512d6d3bf9bcf928fe917a4a7e869a6d124806f","observation_id":"70eb3121-3269-4247-8ead-97d6e6805ba0","resolution":{"observed_at":"2026-06-29T08:43:14.998270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-02T12:54:43.228543Z","title":"arXiv preprint arXiv:2506.10967 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T12:54:43.228543Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:4ff909872d8dbab29eeff8b976efb215392569de320900c009bea64dd14dbd6e","observation_id":"bb008883-066e-4558-af78-5629603e4af6","resolution":{"observed_at":"2026-08-02T12:54:43.228543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2606.02482","last_updated":"2026-06-29T07:37:14Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T16:52:11Z","title":"X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T15:06:22.102725Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2606.02482"},"observation_digest":"sha256:859276bcd53891d090fb1c5d0f40d4a4567f38a74314067640fd95c3273b09fc","observation_id":"fda3f518-4f09-46cc-95a7-8aa849d3982e","resolution":{"observed_at":"2026-07-01T22:46:18.963802Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2606.02482","last_updated":"2026-06-29T07:37:14Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T16:52:11Z","title":"X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T10:42:37.401221Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2606.02482"},"observation_digest":"sha256:9f63834955ffcd035af82bf58e872d17a5187de15c85102fb55ec9666496ab29","observation_id":"edbc6b09-c160-4a09-9a4a-b6b3f11b6fc7","resolution":{"observed_at":"2026-06-30T10:44:36.407579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2606.03075","last_updated":"2026-06-02T03:06:17Z","snapshot_observed_at":"2026-08-08T11:43:35.310412Z","submitted_at":"2026-06-02T03:06:17Z","title":"TGV-KV: Text-Grounded KV Eviction for Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T11:04:54.171291Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2606.03075"},"observation_digest":"sha256:e997b03b0f113fb28854ccd914bb042bbf9f0750bcffee6f9478fe6bf7b30de1","observation_id":"722a29f6-c5a9-4c48-847a-f1da057ebcbd","resolution":{"observed_at":"2026-07-02T02:16:26.715894Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2606.24165","last_updated":"2026-06-23T05:39:52Z","snapshot_observed_at":"2026-08-02T01:56:55.495306Z","submitted_at":"2026-06-23T05:39:52Z","title":"Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-26T01:04:20.802531Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2606.24165"},"observation_digest":"sha256:d111ddf6e281ac09ec78b8dcef6d700229277df9a20306848641fd486ff6e8ab","observation_id":"e6a61e6e-7b9c-428d-a4cc-5f379bf31ec5","resolution":{"observed_at":"2026-07-04T15:59:57.459369Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2606.27161","last_updated":"2026-06-25T15:29:37Z","snapshot_observed_at":"2026-08-04T02:05:59.242279Z","submitted_at":"2026-06-25T15:29:37Z","title":"TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-26T04:24:38.917137Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2606.27161"},"observation_digest":"sha256:0167c20156bae56b5f337284fc8105fdbbe2deef15531be5247af9eb5c23c492","observation_id":"3d777fc8-3027-41a4-9912-24a5f4ce079e","resolution":{"observed_at":"2026-07-04T14:09:53.798585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.10967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-04T15:59:57.457886Z","title":"highlighted tokens","venue":null,"work_id":"dbda8776-3002-4cb8-89f7-201e2aeafaab","year":2025},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:e67723bb3a9f1bcfa7b120b3c0504d8f684ba878c792983e2e230863456907af","observation_id":"e7538e8f-8d90-4758-9d8c-e24379874ebc","resolution":{"observed_at":"2026-07-03T14:48:32.406972Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Beyond attention or similarity: Maximizing conditional diversity for token prun- ing in mllms.arXiv preprint arXiv:2506.10967, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:4554ab3be0077fd93bd46209c744469360031cb21b4e3965add6ea8123176c6f","observation_id":"af6ec779-02cc-4cd9-9823-eff642eca4cb","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-01T22:32:25.110039Z","title":"arXiv preprint arXiv:2506.10967 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-08T07:33:00.302384Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T22:32:25.110039Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:ecdd3e17732acc071d00e51451f6d93457f013d3239563e60536a81225632f29","observation_id":"f15b7aa2-54f0-49dc-a303-7d5f893e19aa","resolution":{"observed_at":"2026-08-01T22:32:25.110039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-04T04:21:09.449182Z","title":"arXiv preprint arXiv:2506.10967 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15732","last_updated":"2026-08-03T00:43:08Z","snapshot_observed_at":"2026-08-08T07:33:00.302384Z","submitted_at":"2026-07-17T08:13:01Z","title":"IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T04:21:09.449182Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.15732"},"observation_digest":"sha256:215dd9cf5215ce49eeafcab45a53bbf96f45a279ef6d60fc40ca0e01fef69a86","observation_id":"ab72c83f-49fb-468a-906a-74a8aca1be14","resolution":{"observed_at":"2026-08-04T04:21:09.449182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-01T03:50:32.506198Z","title":"arXiv preprint arXiv:2506.10967 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23046","last_updated":"2026-07-25T05:08:22Z","snapshot_observed_at":"2026-08-05T23:06:05.708340Z","submitted_at":"2026-07-25T05:08:22Z","title":"Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T03:50:32.506198Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.23046"},"observation_digest":"sha256:188cd6cd40cd67d63e4687a231b3671f58ac5638719ce529823552d36cd51a53","observation_id":"1d712359-c0ab-48d8-8081-4f12ab56b5ef","resolution":{"observed_at":"2026-08-01T03:50:32.506198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-31T23:59:18.339215Z","title":"Beyond attention or similarity: Maximizing conditional diversity for token pruning in mllms.arXiv preprint arXiv:2506.10967,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T23:59:18.339215Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:d269b22c44efefa4d6b72744b149595c7a14601dae47bbf9eb91689b0b042de6","observation_id":"787a3619-c726-44eb-b279-9170356085bd","resolution":{"observed_at":"2026-07-31T23:59:18.339215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-04T04:01:48.622068Z","title":"Beyond attention or similarity: Maximizing conditional diversity for token pruning in mllms.arXiv preprint arXiv:2506.10967,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.622068Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:6c66e9cd64381751f7fd51f489522068779ddf0be97ba2a5ff9accff02a8e6b6","observation_id":"c940e4a4-e27a-4e34-b139-3498d8d14cc3","resolution":{"observed_at":"2026-08-04T04:01:48.622068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-01T01:26:50.833164Z","title":"Beyond attention or similarity: Maximizing conditional diversity for token pruning in mllms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25818","last_updated":"2026-07-28T15:01:02Z","snapshot_observed_at":"2026-08-02T18:28:59.293276Z","submitted_at":"2026-07-28T15:01:02Z","title":"SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T01:26:50.833164Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.25818"},"observation_digest":"sha256:063a23e414a46f47ee9505dd729980130127d00a3ffc588b160fa9a43cc815e1","observation_id":"d99230ee-52b9-41a9-911f-f0300818985a","resolution":{"observed_at":"2026-08-01T01:26:50.833164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-04T13:43:57.677655Z","title":"arXiv preprint arXiv:2506.10967 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-08T14:10:55.623410Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-04T13:43:57.677655Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:80f24d7cf6626e85b26f96ba7be85c5171c3a304edb2e5749ad9de92a7a317fa","observation_id":"814f8c48-6d41-4d5d-8183-f3ad966214e2","resolution":{"observed_at":"2026-08-04T13:43:57.677655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-07T00:11:49.179772Z","title":"arXiv preprint arXiv:2506.10967 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-08T14:10:55.623410Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T00:11:49.179772Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:80a1e12e47b7c49a8d7eabe0cceba6130679a580ddc68bb6a785e28c89df1b01","observation_id":"b32330f0-3ef6-43b0-a933-40627f1db851","resolution":{"observed_at":"2026-08-07T00:11:49.179772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-08-05T18:36:14.731592Z","title":"arXiv preprint arXiv:2506.10967 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03471","last_updated":"2026-08-04T11:07:19Z","snapshot_observed_at":"2026-08-07T23:11:58.146829Z","submitted_at":"2026-08-04T11:07:19Z","title":"Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T18:36:14.731592Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2608.03471"},"observation_digest":"sha256:cddcfdc6c57b5d26b1a2d7fbadebb470c92b3b53a051737a16da661566701cfb","observation_id":"9355748a-d097-48c7-a5bc-667d093bcbcd","resolution":{"observed_at":"2026-08-05T18:36:14.731592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10967/citation-record","integrity":"/paper/2506.10967/integrity","json":"/paper/2506.10967/citation-record.json","paper":"/paper/2506.10967"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.02175","last_updated":"2025-04-01T19:02:04Z","snapshot_observed_at":"2026-08-08T00:42:49.320305Z","submitted_at":"2025-03-04T01:33:14Z","title":"DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02175","snapshot_observed_at":"2026-08-07T04:20:30.500266Z","title":"Divprune: Diversity-based visual token pruning for large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:30.500266Z"},"links":{"cited_paper":"/paper/2503.02175","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:ab45fbb16a2e50dc2d0d47cd49c9d5452401460d8253b5cc19dd1e44950c3abf","observation_id":"d9580dc0-9e63-41c9-860c-842923ee40f6","resolution":{"observed_at":"2026-08-07T04:20:30.500266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:35.147377Z","title":"Tri Dao, Dan Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"72168ae0-6bf4-430d-8848-5de014ef12dc","year":2023},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:30.843591Z"},"links":{"citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:6eb4365c916e68155fe9925e8cafcf3bd9145cd86698f726158970194c68cb1a","observation_id":"e25074c2-8e0b-46be-a3d5-4b0e7c0947ca","resolution":{"observed_at":"2026-08-07T04:20:35.249313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T04:20:31.095679Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.095679Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:21b0f94c868b752ecdc21b6e3003d77cfb5a5e9ea4c282b2083266b86064d61d","observation_id":"bda22afa-70e1-4b24-b976-6ab55fef2e88","resolution":{"observed_at":"2026-08-07T04:20:31.095679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T04:20:31.290255Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.290255Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:a38a91e78d13b7af599f288be14fb16ffd16b1f030819884715a82ad4c409cc7","observation_id":"75faae6a-b724-4b8b-abd7-d58a1dbf889b","resolution":{"observed_at":"2026-08-07T04:20:31.290255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:31.400104Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.400104Z"},"links":{"citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:04f152d78cfa040f7c28e6f3e2edd955d5c09daa9d90069a28d5db3d6a0eb463","observation_id":"cb6f6bb3-cb43-4549-877f-ce54049d6d93","resolution":{"observed_at":"2026-08-07T04:20:31.400104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T04:20:31.581672Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.581672Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:5bcd6628e421f75a52479cfbfd30545ce57360d2651665da1b5c299fc4bdc498","observation_id":"0b5a60a5-a5be-480d-9837-88bf333bfa83","resolution":{"observed_at":"2026-08-07T04:20:31.581672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:34.822515Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"0695631b-9e3e-4cc5-ac06-33ddba495793","year":2014},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.664718Z"},"links":{"citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:b91ef07ece6428b80a376663490de815c5195ef47df397588759617db5a01ec8","observation_id":"880c77ef-a514-40ae-8dac-e2ee90fdcceb","resolution":{"observed_at":"2026-08-07T04:20:34.975202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T04:20:31.753984Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.753984Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:c36d32e0a5d84edaab0017fe0f68e431fb6dace059ea9872d41e24d78b968581","observation_id":"731567cb-7de2-446a-b222-3b662f87a2da","resolution":{"observed_at":"2026-08-07T04:20:31.753984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T04:20:31.837013Z","title":"Feast your eyes: Mixture- of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.837013Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:4f50471480e1f717b11b7d848608c415e1cb399d8f5d0ccc3074c8fab4d67f1d","observation_id":"f46ba898-242d-4dcc-a67e-660f1cd1d0a9","resolution":{"observed_at":"2026-08-07T04:20:31.837013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10994","last_updated":"2024-12-17T02:05:27Z","snapshot_observed_at":"2026-07-06T19:16:36.688367Z","submitted_at":"2024-09-17T08:56:27Z","title":"Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10994","snapshot_observed_at":"2026-08-07T04:20:32.068161Z","title":"Less is more: A simple yet effective token reduction method for efficient multi-modal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.068161Z"},"links":{"cited_paper":"/paper/2409.10994","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:1cdbba11e39beda5b83819aaa89d65f4e10abf1f16e9d6c5e821bba69e54bc8c","observation_id":"c8783900-4263-4e24-8bf3-dfdd7c03543e","resolution":{"observed_at":"2026-08-07T04:20:32.068161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T04:20:32.245624Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.245624Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:66a3725897c9fd513a8ef3cdad8d21a7dfc77c1f73729f70dc9af86b46234cd3","observation_id":"5d13ddfd-0112-46ce-bfb0-8a3a9baa8099","resolution":{"observed_at":"2026-08-07T04:20:32.245624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:20:32.325718Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.325718Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:af37e82c3fc855b4083439ae8b4f3de87012c63b94cbf5f94d3288963266c984","observation_id":"b416dba4-3258-4a0e-ae97-07e441622bd0","resolution":{"observed_at":"2026-08-07T04:20:32.325718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11501","last_updated":"2025-05-29T09:18:35Z","snapshot_observed_at":"2026-08-07T18:13:30.730921Z","submitted_at":"2025-02-17T07:05:36Z","title":"Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11501","snapshot_observed_at":"2026-08-07T04:20:32.526592Z","title":"Token pruning in multimodal large language models: Are we solving the right problem? arXiv preprint arXiv:2502.11501, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.526592Z"},"links":{"cited_paper":"/paper/2502.11501","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:44f8a7b40f93697652e2cbbdfe2445e823b3db9dcce974cf3267b6c41bb42c88","observation_id":"e2fd1dc9-808b-4d11-be3a-44643dea61ac","resolution":{"observed_at":"2026-08-07T04:20:32.526592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-07T04:20:32.613673Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.613673Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:3defdbd94bccd0609e6d02ee5c9cad4f858ff0e7cd0bed40a6a2a0a910ffb986","observation_id":"5a32adc7-b150-4ae5-b10a-6b9661ed0910","resolution":{"observed_at":"2026-08-07T04:20:32.613673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:20:32.701129Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.701129Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:426edf58d1531e5668ed25b9505fca4ace1c33e96e9ac4589d6b7b565bf2d4f9","observation_id":"c735d4a5-be86-430e-9d94-702ab8595c14","resolution":{"observed_at":"2026-08-07T04:20:32.701129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T04:20:32.927138Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.927138Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:f19282195cef39d0ce33c7f3cbbb8b855705c687aaa03b1ce5daee6afc4bf69f","observation_id":"be676b47-8fa3-4528-acab-1b7fa509bc28","resolution":{"observed_at":"2026-08-07T04:20:32.927138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T04:20:33.004390Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.004390Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:905c444326f5893b677b661e1fa83c0c501b82b6a5eadbd508086d94e9e83ba7","observation_id":"fc8edb99-3740-495f-8468-1737e9cc18aa","resolution":{"observed_at":"2026-08-07T04:20:33.004390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T04:20:33.079691Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.079691Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:f69861c066142d874b29db8e712be66b054b1b726318ff900e5703ee9dd11da8","observation_id":"26b7f326-3691-4767-a429-eddfeaa91aef","resolution":{"observed_at":"2026-08-07T04:20:33.079691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-07T04:20:33.148022Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.148022Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:10db7602144ef2eabb128ebfef543a571733fb3adb3fde424b81aee1f0c5ec2f","observation_id":"fe9d77f7-1109-4755-be87-518e9ba954a8","resolution":{"observed_at":"2026-08-07T04:20:33.148022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:20:33.229755Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.229755Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:661d54d7f293a04b451951ace4b82653d3364b61bf6a708298e8baa51b73be12","observation_id":"a8344eeb-4409-476e-8514-35f8472891fe","resolution":{"observed_at":"2026-08-07T04:20:33.229755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:34.523542Z","title":"Appendix B provides some details of the experimental setup, including information about model architectures, evaluation benchmarks, comparison methods and implemen- tation","venue":null,"work_id":"059d52f8-545e-4720-87e2-a2d88186053b","year":2018},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.317956Z"},"links":{"citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:50dc8af066172469bf4eb6ef6fab84c78c13e49fcc85d47418752ba7788e7055","observation_id":"c2123e3a-1bd5-40af-9385-258fcf6886da","resolution":{"observed_at":"2026-08-07T04:20:34.643823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:34.352997Z","title":"Therefore, the greedy algorithm runs in O(nm2) time","venue":null,"work_id":"79272ed5-2e92-4430-b8a9-556a176d7a9e","year":2021},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.433526Z"},"links":{"citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:9e9063e3c95b4f1c8309ebfe94d591cb1362aa69d37e5b8e0f712642ebacf7a2","observation_id":"ac6f7c56-d168-4c80-b242-6bc6aaf2d9a3","resolution":{"observed_at":"2026-08-07T04:20:34.442063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:34.212324Z","title":null,"venue":null,"work_id":"776923a6-510f-43e1-859e-05b35c03a836","year":2024},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.522423Z"},"links":{"citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:78a1c4ced8362d893e10f3add8f3b2b2e4e11d024ce6b0e62848deb1cb7df733","observation_id":"82d897ab-868b-4802-9c48-46acc1b2dfde","resolution":{"observed_at":"2026-08-07T04:20:34.277604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T04:20:31.906806Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":1975,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.906806Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:b797879aa3bfe92f47bffd0266bc9e9c3cfbd2b0cc20925c66db41add71eb0cc","observation_id":"80118ccd-ae30-4541-b8f9-194c876cf8b5","resolution":{"observed_at":"2026-08-07T04:20:31.906806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:20:31.510710Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.510710Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:418a171dcfe34367ba48e581f22821655516155c554a609dd1734c3c9816622d","observation_id":"6e0c639a-dbd6-4e51-b060-7be707b167b8","resolution":{"observed_at":"2026-08-07T04:20:31.510710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T04:20:30.562632Z","title":"Qwen technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:30.562632Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:244329093834cc632003118ce9df31a3ddb41e93a4b10c61f8fe4bbed377835a","observation_id":"9b2a4f8a-0bb3-4df5-b1a9-9275074cf3d4","resolution":{"observed_at":"2026-08-07T04:20:30.562632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T04:20:32.413526Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.413526Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:a30808e575310930b1dd20c4c67bfed82aeec16929f4966180cc6df86b33e9db","observation_id":"9fccbff3-c235-473c-827c-647ccd7a1c5a","resolution":{"observed_at":"2026-08-07T04:20:32.413526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T04:20:30.765313Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:30.765313Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:13e8de1506e3614f3481719580d319c20ba7f800d044798686b543796c47310f","observation_id":"38da4126-715b-4717-a507-f8506b4447bf","resolution":{"observed_at":"2026-08-07T04:20:30.765313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11549","last_updated":"2025-03-14T16:12:23Z","snapshot_observed_at":"2026-08-07T17:03:30.811010Z","submitted_at":"2025-03-14T16:12:23Z","title":"Similarity-Aware Token Pruning: Your VLM but Faster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11549","snapshot_observed_at":"2026-08-07T04:20:31.175344Z","title":"Similarity-aware token pruning: Your vlm but faster","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.175344Z"},"links":{"cited_paper":"/paper/2503.11549","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:98d806d538220aefb2ff43d9660997734aa51b2a67cb81d44f17903b2c877882","observation_id":"8e4ee5fe-b3d4-4fb5-864d-64b5088904fe","resolution":{"observed_at":"2026-08-07T04:20:31.175344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:31.982439Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:31.982439Z"},"links":{"citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:8c67cc1f12f7c4f14550bd931c1b4f914d860996d0318ce74490d0909272e053","observation_id":"2895cc3f-6db3-47f7-999b-8ece88d84bc0","resolution":{"observed_at":"2026-08-07T04:20:31.982439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T04:20:30.949286Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:30.949286Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:f753e208146549f1374473d3091827e1ce329248d4136de8d6c90d3ee5950bfc","observation_id":"b7ffd2ae-9a9a-4e15-bd0c-5f1fa2a75316","resolution":{"observed_at":"2026-08-07T04:20:30.949286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:20:30.635629Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:30.635629Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:bd4606cd4a10cdfd242687276ed2a8742177d7b3c386c109e5340b1586b4a53b","observation_id":"480d693e-9f13-40e3-96a6-4f0a64979a92","resolution":{"observed_at":"2026-08-07T04:20:30.635629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:32.151078Z","title":"Mdp3: A training-free approach for list-wise frame selection in video-llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:32.151078Z"},"links":{"citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:b3394f7656eb66874a550734229adedfc9215f20fa01bff9b2b9b024980add0c","observation_id":"8c99589e-8e7b-40ab-8eb9-0c9b25a35eea","resolution":{"observed_at":"2026-08-07T04:20:32.151078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-07T04:20:30.698008Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:30.698008Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:21d3626c5f4584629285cb444f02b61161f1f90badcf3c7a4737391b7115b081","observation_id":"fd123cd7-c6c9-4391-93fb-7314899df7ac","resolution":{"observed_at":"2026-08-07T04:20:30.698008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 27 inbound Pith citation observations for arXiv:2506.10967."}