{"as_of":"2026-08-04T22:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d5227639f998952e676bcf38bd016f472d5450bfd6ab3b441950394d2d6d364","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:19:57.764281Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.20439/citation-record","integrity":"/paper/2511.20439/integrity","json":"/paper/2511.20439/citation-record.json","paper":"/paper/2511.20439"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T20:19:57.638438Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.638438Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:b3504fb06a135f057806633c224e02d79b03ba32804713ba856cc8df397a9e11","observation_id":"7bdb75b9-0d88-489e-adf9-e36e7ed32e77","resolution":{"observed_at":"2026-08-03T20:19:57.638438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.643279Z","title":"Invariant Slot Attention: Object Discovery with Slot- Centric Reference Frames","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.643279Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:6946dcb8d380750541ad2a590e2229ef5cd7fc8c7352e828f789878e4747dfe3","observation_id":"4f0d3d5d-0777-4283-9fe4-89b8b9592b11","resolution":{"observed_at":"2026-08-03T20:19:57.643279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.647003Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.647003Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:17d0dd431b244289439487d851f1129de2cb33178234a7258110435a5b9db2eb","observation_id":"76d49dd9-2e87-49fb-a2ea-e98103c4d516","resolution":{"observed_at":"2026-08-03T20:19:57.647003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.650849Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.650849Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:81ebb9813e2a6baa01474e0c92258fba50793fb27b04297378178ff3d430dcdf","observation_id":"a3efce13-acb8-4973-aafb-ba9f97e94bbf","resolution":{"observed_at":"2026-08-03T20:19:57.650849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.654488Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.654488Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:4de23f226ab8dc67fd0d9338bc8dba5d7381d9a0e98b8cf55b0e66f16bec113c","observation_id":"e8217cb1-0a4a-49f7-9ed5-c678a3b68b78","resolution":{"observed_at":"2026-08-03T20:19:57.654488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.657702Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.657702Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:a9580fd49bc14c8da0cfba19c8f90d0a8601ecb43ffc16eb2e38907e7cfa11e3","observation_id":"31db8585-1472-4072-b029-37f2c5229368","resolution":{"observed_at":"2026-08-03T20:19:57.657702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.661068Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.661068Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:fd587d3f498b84c0bf2d8f63b154482a3ee086ff1deb9ffcc899d14b078f9598","observation_id":"609920c9-3a26-4a6e-a95e-ef91aa253854","resolution":{"observed_at":"2026-08-03T20:19:57.661068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.664289Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.664289Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:7329b4b413f7f586070da03d58650e5a3201de25c88994364fe4263b38c7be61","observation_id":"663eec7e-fe31-49d6-a943-7b3e1687816f","resolution":{"observed_at":"2026-08-03T20:19:57.664289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.667395Z","title":"Improving Object-centric Learning with Query Optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.667395Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:ba1e980231c0ec8ac9dbf341e1d62d24440105e5a3dc510335f73139eb5d519a","observation_id":"54797207-daea-4a8f-ab57-2a0b46532e1f","resolution":{"observed_at":"2026-08-03T20:19:57.667395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.670107Z","title":"Spot: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive Transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.670107Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:159af2116f115ee1499d63528e51d2f3253b2ffd2e6a194e205df154637d15ff","observation_id":"e1d3a1af-e38b-4fa0-9683-b2c3d9861204","resolution":{"observed_at":"2026-08-03T20:19:57.670107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.673071Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.673071Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:c085169b71dbf34a57aefc0038b3354bf5ac4c804115b415af064f25641840bf","observation_id":"29e27677-42f9-4bd0-a46a-886eb9446861","resolution":{"observed_at":"2026-08-03T20:19:57.673071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-03T20:19:57.675843Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.675843Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:0843eb6d14d27fd81edc32d92830959f3ae6ffeb6e0b923b1bf6238be2c0541e","observation_id":"9f61697f-ab6b-404a-8f56-d7c1bd16f01a","resolution":{"observed_at":"2026-08-03T20:19:57.675843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-03T20:19:57.679008Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models.arXiv preprint arXiv:2403.18814,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.679008Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:92557cdcfb97115b92464ac106b1320bcc7a5a38d08bd80c0a9d1febb31e948d","observation_id":"8648c6b5-3eec-4c1d-ba4a-0156d6f1239a","resolution":{"observed_at":"2026-08-03T20:19:57.679008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.682081Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.682081Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:06b0f5c17cb4d2125a95395a66fce5eb6d5d70dd9ef9edfee9b75ee5c2062284","observation_id":"781f2851-0b89-49b7-af6b-9cdee1c13a93","resolution":{"observed_at":"2026-08-03T20:19:57.682081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.685000Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.685000Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:f88615e7c2a7ac886909080eeee809393fa19bfeb573531acdf9400610f4f939","observation_id":"fc242561-69c5-40b5-9219-65e5fd4cfde7","resolution":{"observed_at":"2026-08-03T20:19:57.685000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.687748Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.687748Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:6b9b395bc4c7f45a0e876a027cd04d13d9bfddb3dd35ce873cbaaa53f2370afd","observation_id":"d675fbc9-106a-4e70-b47b-0b320e632b6d","resolution":{"observed_at":"2026-08-03T20:19:57.687748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00553","last_updated":"2026-04-20T01:01:28Z","snapshot_observed_at":"2026-08-02T05:49:04.586461Z","submitted_at":"2025-08-01T11:48:11Z","title":"HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00553","snapshot_observed_at":"2026-08-03T20:19:57.690392Z","title":"Hiprune: Training-free visual token pruning via hierarchical attention in vision-language models.arXiv preprint arXiv:2508.00553, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.690392Z"},"links":{"cited_paper":"/paper/2508.00553","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:f90b69b3ab9593e5e8b96431740092aa487100dc7364935e6551ed8bb7da25bc","observation_id":"2701cd67-e999-4c85-95a1-d10392917ddd","resolution":{"observed_at":"2026-08-03T20:19:57.690392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.693646Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.693646Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:960392d70fd6626483e8f4b070af9ad209c0f4aa6cc602e3aa197a14ab118225","observation_id":"15fe81ce-0ad1-4070-b11a-0052199e36e1","resolution":{"observed_at":"2026-08-03T20:19:57.693646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.696316Z","title":"Object- centric learning with slot attention.Advances in neural in- formation processing systems, 33:11525–11538, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.696316Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:e1a8c1d1f71b8ede75f23b190225cf6471e0fdc6678a37368a7c298d10540422","observation_id":"ff3236da-a8f7-46d3-88c0-312359f14136","resolution":{"observed_at":"2026-08-03T20:19:57.696316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.699067Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.699067Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:cc9efbea6a4eb4e25f8e17e33516b2299627c38855fcf1a5862c6c4263384bcb","observation_id":"87a856d0-8a55-40b1-ae5f-547db0fc364b","resolution":{"observed_at":"2026-08-03T20:19:57.699067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.702079Z","title":"Temporally consistent object-centric learning by contrasting slots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.702079Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:c286714d8890479bf58f8ba27a95a7fecb20d747ea18acb8b271ee97cf0318e9","observation_id":"44d11a48-ed1b-4212-8026-ed04f7018e8b","resolution":{"observed_at":"2026-08-03T20:19:57.702079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.704723Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.704723Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:2f34a8ba78f4db6dc746ea5e17ff10caf94f88e927c705fd90b4f301ef69c325","observation_id":"cfb0f784-a140-4f1c-9729-15bada9374dd","resolution":{"observed_at":"2026-08-03T20:19:57.704723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.708009Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.708009Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:c2fce9247d7d13e2ccacd50a3619f1fe4bf6c02666b3aa3e7ee41c0403093c61","observation_id":"a99ef534-51d8-492f-af74-ebadcf5362c6","resolution":{"observed_at":"2026-08-03T20:19:57.708009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.711377Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.711377Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:259c49b470f583851558fc32bf09b98e6f0b9363145fc51a814e85f00330075e","observation_id":"bd5e67b3-50e3-4a13-bdc5-4586ec7cc3b9","resolution":{"observed_at":"2026-08-03T20:19:57.711377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.714392Z","title":"Less is more: A sim- ple yet effective token reduction method for efficient multi- modal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.714392Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:66394f61665bab90bbf6bf766d3e04d94e4f0b438a59963d9033ce594d5fee38","observation_id":"e037fa8f-5851-4b95-ad99-51695ad72b50","resolution":{"observed_at":"2026-08-03T20:19:57.714392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.717592Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.717592Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:f0418a98e9b60c04b84be448a9b19e9c883358d9d06dbac479350e0824924224","observation_id":"12614eef-ba43-45c0-a693-6ef5fa328563","resolution":{"observed_at":"2026-08-03T20:19:57.717592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T20:19:57.721567Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.721567Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:7ca86aaa21b0915869b855bfde3de7b966b4c1a30d1775ae760e8a55c5512340","observation_id":"8744c380-d06b-41a7-81a0-c22e11551ea8","resolution":{"observed_at":"2026-08-03T20:19:57.721567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.727020Z","title":"SlotDiffusion: Object-Centric Generative Mod- eling with Diffusion Models.Advances in Neural Informa- tion Processing Systems, 36:50932–50958, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.727020Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:569d60d6392e6e4c46f301a6ebe9bb570e978a8954a018f96ffdfe5ac02ca5d3","observation_id":"ad154c0f-9850-42c5-bdce-09a2c25ee2a1","resolution":{"observed_at":"2026-08-03T20:19:57.727020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.731279Z","title":"Conical visual concentration for efficient large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.731279Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:4f6a457ff87b4bc8e1471223d4709a296b7cbf48c298995b35a539f9a45c829e","observation_id":"61340193-c238-4791-8e28-0eb470e7efe9","resolution":{"observed_at":"2026-08-03T20:19:57.731279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.734872Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.734872Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:0f4a6b03f3340792203e89bd1884dc9446fb95c52064ce6e4acd6f5be384e2de","observation_id":"c0f215aa-3b7b-4206-b922-b7aaca170ec1","resolution":{"observed_at":"2026-08-03T20:19:57.734872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.738313Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.738313Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:7e574a7f948db28e81012e4ee73623e9894d7773b88982397bf984363dab34fe","observation_id":"501c6f9c-7aad-4093-845b-4ac155d10106","resolution":{"observed_at":"2026-08-03T20:19:57.738313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.741594Z","title":"Object-Centric Learning for Real-World Videos by Pre- dicting Temporal Feature Similarities.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.741594Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:8c2dcfaaf38c6a5608b67301cc4acbbd92b420128c660df6ece45bdb05782bee","observation_id":"84f066d8-5d1c-4deb-a718-97079d7bd7df","resolution":{"observed_at":"2026-08-03T20:19:57.741594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.744475Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.744475Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:17d28d52591c843f4776da05edc8a6fe7cb6124b9bd99c8e136c514d3610dd65","observation_id":"22b0e0e0-5ed3-4dbe-863b-fbb411463446","resolution":{"observed_at":"2026-08-03T20:19:57.744475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.747622Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.747622Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:876a48f8f8b62c91c29e682effe8eaa0722a170b92f95b4628fdafe5fd9ed440","observation_id":"41fcc725-f991-4930-89b4-fe565ca1e56d","resolution":{"observed_at":"2026-08-03T20:19:57.747622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.751167Z","title":"Predicting video slot attention queries from random slot-feature pairs.arXiv preprint arXiv:2508.22772, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.751167Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:eb173f37ef41bd2c9108cad297541ae98af79bb16b4de33825763dcb4879d081","observation_id":"e4d2496a-9011-448c-bea4-4daf8586d8d1","resolution":{"observed_at":"2026-08-03T20:19:57.751167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.754330Z","title":"Vector-Quantized Vision Foundation Model for Object-Centric Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.754330Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:52f6d8b734aa86401f0c317670945eaebb5992caa5def96344a89d9bb43f6d30","observation_id":"15f17c84-6894-4ad7-a2af-1e1a4649d094","resolution":{"observed_at":"2026-08-03T20:19:57.754330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05417","last_updated":"2026-05-27T15:27:53Z","snapshot_observed_at":"2026-07-06T22:09:23.364568Z","submitted_at":"2025-08-07T14:09:33Z","title":"Smoothing Slot Attention Iterations and Recurrences","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05417","snapshot_observed_at":"2026-08-03T20:19:57.757841Z","title":"Smoothing Slot Attention Iterations and Recur- rences.arXiv:2508.05417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.757841Z"},"links":{"cited_paper":"/paper/2508.05417","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:450472b41a86e71946669a385c9faee5906fb1f7adb99a5025239d265cc62b8c","observation_id":"66de32da-b792-4fa5-97a9-c7195582385b","resolution":{"observed_at":"2026-08-03T20:19:57.757841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:19:57.761323Z","title":"Slot Attention with Re-Initialization and Self-Distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.761323Z"},"links":{"citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:95f46b9b8f16354ee334beb439a2f06de65259962b6c488678351ab9cb51674c","observation_id":"cc776f21-cf19-4a1e-a9fb-260e27c90d8d","resolution":{"observed_at":"2026-08-03T20:19:57.761323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-03T20:19:57.764281Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:19:57.764281Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2511.20439"},"observation_digest":"sha256:7b8b2b323a1beb1ee2878886766d4182c34ec4a0c5706900811f2a1235f661f9","observation_id":"8dea26c4-5443-416e-9183-a419fbf7c9e1","resolution":{"observed_at":"2026-08-03T20:19:57.764281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.20439","last_updated":"2026-05-27T10:21:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T20:19:56.948215Z","submitted_at":"2025-11-25T16:12:32Z","title":"Object-Centric Vision Token Pruning for Vision Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2511.20439."}