{"as_of":"2026-08-06T16:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e7bf232d9524e20d48e42f8b28fdf2feeae8e8ba1ff64b6194509ffb3107270","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T19:15:13.205594Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.13375/citation-record","integrity":"/paper/2605.13375/integrity","json":"/paper/2605.13375/citation-record.json","paper":"/paper/2605.13375"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:26:26.008128Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"4819f738-f69f-49dd-8bed-404f647de63a","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:b268e23aac5bd5623b25b20ca58435d2f9346ac90f8b82a7e7120b19a77eb91c","observation_id":"c517aff6-f6d2-4768-929b-ed4bf980772d","resolution":{"observed_at":"2026-05-15T19:51:34.117329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:e803830a515c5dc11959999041fc2864b6ee645e8515aff546b313cb1787d512","observation_id":"8cff7443-81f2-4ae9-a985-b13d792f7200","resolution":{"observed_at":"2026-05-14T19:17:50.756941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"1191d1e0-5e80-4225-a064-e1c04d70e44d","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:d13a74204885227917ee667adc713de8dfc81b039f0c204ca3028424f7bd4be1","observation_id":"d83dc8ba-3a99-492a-9398-c1c3c92df709","resolution":{"observed_at":"2026-05-15T19:51:34.121890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems","venue":null,"work_id":"93eddd32-4e1d-4fb1-aa72-53eb41f6d1f2","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:e4aeff0aa2dca47196a4949d2a913b3109a5559f1dcf32dacd685a6ea9a1a248","observation_id":"e23d07a7-28ae-4173-a89c-86cf1e426026","resolution":{"observed_at":"2026-05-15T19:51:34.126711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:56668d78c669c01ef8f0f78c177cf7b112c91216131764e43d7c8e82f91df48e","observation_id":"27be793a-9cc5-4b91-88c6-9813ead50fc1","resolution":{"observed_at":"2026-05-14T19:17:50.749786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:4c78f8b208221e78d8f5e7ceaf44f8b42ee947c96167074da0ccb4f9adba3bac","observation_id":"7e907cc3-cd78-41d9-acc3-44c064633476","resolution":{"observed_at":"2026-05-14T19:17:50.762418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:42168eb1a0ca80b8821109999647aad82f2d00f32f4d871401cdabe457c8f75c","observation_id":"14720828-cb05-44e2-a3d0-8bf9473d259c","resolution":{"observed_at":"2026-05-14T19:17:50.768044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:064cbbeaade7ca2d40e3b1e922c4225b58c2e3e9e6f4580287c81427794dc1ae","observation_id":"ba6c2b71-a99f-41a4-a12d-708ff2c80317","resolution":{"observed_at":"2026-05-14T19:17:50.785305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12212","last_updated":"2025-06-01T05:57:00Z","snapshot_observed_at":"2026-08-04T14:57:25.024448Z","submitted_at":"2025-05-18T03:10:00Z","title":"Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning","version":3},"cited_work":{"arxiv_id":"2505.12212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12212","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data whisperer: Efficient data selection for task- specific llm fine-tuning via few-shot in-context learning","venue":null,"work_id":"27c496e5-6e11-4db3-b983-8b96cb787e51","year":2025},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2505.12212","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:c717edebdde8a07fcc79a6876f2b13d22d11ef36b711ba00b5db206e10ba922f","observation_id":"62663dba-f79a-442d-b3fa-bbb6a665b7db","resolution":{"observed_at":"2026-05-14T19:17:50.819402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding.Arxiv e-prints, pages arXiv–2403","venue":null,"work_id":"4684fe61-bf38-49ec-a2f1-74e424e613f5","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:c7c00b310a59ba54292e411436621e128b1e681ff8354c03cca10baf4311d0d4","observation_id":"f37c86b6-fbc2-4b30-a1a2-112474976abd","resolution":{"observed_at":"2026-05-15T19:31:33.511181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":"2401.06805","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-07-04T09:59:44.777709Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning","venue":null,"work_id":"f8488283-5738-4b2a-9d3e-86913e913cdb","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:a9ba4cb4e0a7ab72a4bc1ac8d8360f0ae1994414e1bd433354c52e272ee29d4b","observation_id":"d98ab346-77fb-4b13-9544-93c49b75b348","resolution":{"observed_at":"2026-05-14T19:17:50.811951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.690179Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"115823a2-8918-4227-8872-3d0a36ff07a9","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:ff5f4597e195c28b5a72da79a084f0484cf4b63b155417013dc41262b9a9ffee","observation_id":"97efd2c1-4cd3-4cf7-98d8-60f29608211d","resolution":{"observed_at":"2026-05-15T19:51:34.017253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.459543Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"19dbc933-eff7-47da-894e-0cb819f498b9","year":2025},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:7cf9cdb9926db7a93deccba018c9b4ef4583f844ded19cf6912c21a86665ec9d","observation_id":"942b7986-1252-47f9-8b46-db1d21578ef7","resolution":{"observed_at":"2026-05-15T19:51:34.045910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":"2403.18814","doi":"10.48550/arxiv.2403.18814","metadata_source":"pith","pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","venue":"cs.CV","work_id":"70d699a8-f265-4862-b60f-3b62ca85f6d8","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:12e6c5a56f91fbad18df87c5fc5b9ccd0974666f39042bdb579428ca281d8291","observation_id":"9e041039-bc6a-4e0d-a90d-44ec21f78f2f","resolution":{"observed_at":"2026-05-17T07:44:47.683285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.17432","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T19:16:01.292273Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 1207–1216","venue":null,"work_id":"ed4332e5-301f-4911-a5d9-cb08ea33992a","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:3759f4e4848bb1f832a9eb932bf13531c9768861c3d15916a2e67c451b3f9058","observation_id":"42f656de-bbed-48e0-af1e-38644ace1ebc","resolution":{"observed_at":"2026-05-14T19:17:50.798831Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.15388","doi":"10.48550/arxiv.2403.15388","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"6da9a077-fa9e-4020-bdb4-f30c9ebb0fc8","year":2026},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:817ddc436c52add1f2dbcce87806b0efdd327a4c8b15b6f1240fbd92b8d8d849","observation_id":"8a55e99f-20c1-41ae-bdf9-fa694754708a","resolution":{"observed_at":"2026-05-14T19:17:50.792438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:13:58.895009Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"cff41906-a618-4bf0-929e-0d9e32c02c32","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:5cd23660576401423691d830b59c101e7c17d5473fea135172386173c2e6db8f","observation_id":"cf81fa2d-4e0e-4663-8e9d-6d135465d057","resolution":{"observed_at":"2026-05-15T19:51:34.093017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":"89edb758-0aed-45f5-80e9-fff2aea5ce18","year":2025},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:7c6d56e45c00a1ae6cd6c8e0f1841ea8351635253105578d1d93577b3cdf45d4","observation_id":"2876ae61-2a2e-4ddd-8fc3-e6edf48d55dc","resolution":{"observed_at":"2026-05-15T19:51:34.087782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"af1ae900-f884-4cb0-bebd-85d3b20d6230","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:2512fe73b24913854058265007145f85d39fd8c9c6accbb02c2f8830212d0e84","observation_id":"fafd32d3-7b06-4cb4-8b3d-f098384652b7","resolution":{"observed_at":"2026-05-15T19:51:34.041341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large vision language models","venue":null,"work_id":"84b0a09b-2c31-4ce6-ac8d-3e9906c2db0d","year":2025},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:2ed9208bc9f18744b8517b2a30d3dd85f2315b52042708734cbc876525fca9f8","observation_id":"001e77ed-87ee-41e7-a706-7678085aa48c","resolution":{"observed_at":"2026-05-15T19:51:34.032076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":"ed0310f2-a278-47ca-9cbe-926dcbcb681f","year":2021},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:336fc9eaa2ef362ad632f1b584365bc2d2173f4679d8b5df9ae6ec0e0fcb0846","observation_id":"406b3d0f-0746-4229-ac86-6b0547434ea0","resolution":{"observed_at":"2026-05-15T19:31:33.520559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smarttrim: Adaptive tokens and attention pruning for efficient vision-language models","venue":null,"work_id":"fc744ecc-87c5-4806-ba0b-8bc0f1cdaa82","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:bf73315f6a4bcd415c483c14d31cb2536866582104063cfbe3ca6acbf6bec5ff","observation_id":"b294bdee-7fdc-4773-9b5b-15ac212bfd8e","resolution":{"observed_at":"2026-05-15T19:31:33.524662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionselector: End-to-end learnable visual token compression for efficient multimodal llms","venue":null,"work_id":"078ddf97-df86-4fc3-a0fa-510f678d6355","year":2025},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:c438249db6abe609162bc57e75136a12acca53386d657f611b6617bee0887dfd","observation_id":"1f8081c2-751a-483a-bc72-76116d8f089b","resolution":{"observed_at":"2026-05-15T19:51:34.082831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient multi-modal large language models via progressive consistency distillation","venue":null,"work_id":"021a9107-6d74-4328-b2ad-d52fd337c101","year":2025},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:a99d46be929b742d9c85cf021778e68855187ec5055d0330c49f540b82b10bd2","observation_id":"16e4cb1c-cbaf-48ed-9bd7-0fa66784b4e2","resolution":{"observed_at":"2026-05-15T19:51:34.107841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:05:06.906857Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"1d5e287a-508f-4461-95e8-a66570a35d55","year":2021},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:c77bdd3641138c446c5a8a9c3cc296a3432491f4939f6c8a188978a45599a80f","observation_id":"2977d013-112d-4498-b2e5-6dfc73ffaa3d","resolution":{"observed_at":"2026-05-15T19:51:34.073062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"a67353e0-6103-4875-87ce-e221ba375a25","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:9fbfb08285da007cdce7428a9ae4383b11faed7972399ae1912816c7ecc82f88","observation_id":"232a81b5-dff8-4c7f-adb9-9021a270e528","resolution":{"observed_at":"2026-05-15T19:51:34.036573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.744861Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"a84f281e-7f3f-4b95-9aaf-e3ba559cbf78","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:0046622ae0a90a8b1df6a6c39759dccb1293236ea894a056b207aaf72bb3b49f","observation_id":"4e1e9b15-5537-4968-aa6f-ab794d2ab01d","resolution":{"observed_at":"2026-05-15T19:51:34.022689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:93473ce7cc0be5299cfcb7b5d3384071c1e80c785470dbe6f752d60c51707f2c","observation_id":"d6234653-aa1e-496f-9d94-a5d7c58ec71b","resolution":{"observed_at":"2026-05-14T19:17:50.780093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:c26b933c081ff653cfd4a8bbc225c43188adb62ec36916ebf61d2ef98e8d9f7c","observation_id":"204b7347-2110-4eb7-bbdc-7a15872115fd","resolution":{"observed_at":"2026-05-14T19:17:50.824171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:47c9a733894085347e60fc01c0c573751f3835a3776c27128241d90a128fbbda","observation_id":"2894c32c-03d0-45ff-8cf1-628b324c22d6","resolution":{"observed_at":"2026-05-14T19:17:50.774101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"87919a4d-c85d-4321-96cb-28ffe524b619","year":2017},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:82716a4504dd8e0917a95ef56a805f2b955045e5ba21ba018442723b4d52a04d","observation_id":"5e7a0828-266f-44f0-981e-5f06a324a12e","resolution":{"observed_at":"2026-05-15T19:51:34.027652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14401","last_updated":"2025-03-24T15:08:16Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:30:11Z","title":"Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding","version":2},"cited_work":{"arxiv_id":"2411.14401","doi":"10.48550/arxiv.2411.14401","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14401","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Beyond training: Dynamic token merging for zero-shot video understanding","venue":null,"work_id":"a3a4fa36-935c-4dea-aab1-02302ea41103","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2411.14401","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:97b3f0c6ac353393b956e1da0f158e959f084bb2eaf5384a3965b0d02c37fb4c","observation_id":"01acc121-5f1e-419a-bd97-6bb4d4ed9dca","resolution":{"observed_at":"2026-05-14T19:17:50.839649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"ee2af07b-33f8-4849-ad81-81b6e33c5577","year":2017},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:3089412eb65dc124b78f8c766b6dec01308dd49a19a195afb16a8b7138334662","observation_id":"06aa54cb-1a7a-4416-aa69-5b7e6356ad6d","resolution":{"observed_at":"2026-05-15T19:51:34.112409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":"b0771cca-30e1-4cea-9736-8612e3b3c58a","year":2025},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:596ad4f14b5ca1bea3f7ecf9eeefb41b06c6e4f4760dfe6e0668c1b67043a1cf","observation_id":"63ef317b-ac85-4a25-ac83-29ad5f54fa58","resolution":{"observed_at":"2026-05-15T19:31:33.528814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:5bb87940f266065b4f6401c802f2fe530f34820ee14a6856dd8eeb7f854139b2","observation_id":"01623c75-8ef5-4c04-a3f4-4c736f1406e4","resolution":{"observed_at":"2026-05-14T19:17:50.844426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:a72c1596c0bf0e237fa76445eb4814e80783decec89e9772a4099d3894e6b4f2","observation_id":"8929df7f-efb7-4e82-98ee-24b299109575","resolution":{"observed_at":"2026-05-14T19:17:50.804755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521","venue":null,"work_id":"dfd4b743-1c77-4d63-9d16-19cc35c9dd3a","year":2022},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:24ec5fab635ae1e0f09d25bcf4e93352fb781b57beadf391e3239aa848a9fe2b","observation_id":"cf90a508-84b8-4496-83ce-544465813af4","resolution":{"observed_at":"2026-05-15T19:51:34.098008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.844600Z","title":"Towards vqa models that can read","venue":null,"work_id":"33f55abe-fe38-483c-a026-05c983a173d2","year":2019},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:6cd57843423076f40e5665d218bfa8d4f63beb6d9f749e399eb3bea633186926","observation_id":"cf64293f-0f2b-4f7b-b18f-67484eccb2ca","resolution":{"observed_at":"2026-05-15T19:51:34.102959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.734242Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"267d76bf-96fe-4408-81fc-0e04005d4092","year":2016},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:75dee91712b608f886a8cdc48ddc245dcceca2d14f6ec9e27257b9c88316e304","observation_id":"bf289a30-9e9a-4147-a3fe-367855a28437","resolution":{"observed_at":"2026-05-15T19:51:34.065991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"3badbc7e-ba62-4686-ac73-7bf28043bfd1","year":2019},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:4c600a5d1581c156d07a334b610661d59e840f7ae80e0a7b5301de95b477466a","observation_id":"2835d0ef-7f8f-4f45-b5f1-9a2361fad672","resolution":{"observed_at":"2026-05-15T19:51:34.077728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:7d5ab1d700b501ae798ca87ed473786079917fa5c8cfe9c68cb54ce54d0e317a","observation_id":"cf4eb7f7-0569-4c19-88f2-f3548d869dde","resolution":{"observed_at":"2026-05-14T19:17:50.833919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102","venue":null,"work_id":"f26e1f1b-9998-481d-9067-61e7ebab5b32","year":2024},"citing_paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T19:15:13.205594Z"},"links":{"citing_paper":"/paper/2605.13375"},"observation_digest":"sha256:bb42bb8b3928bdea686cb12b703992ce30b378fcfbe4d7f957517beaf97a81cb","observation_id":"8b473c9e-256e-4ab2-ad61-0ae7543b54bb","resolution":{"observed_at":"2026-05-15T19:31:33.515784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13375","last_updated":"2026-05-13T11:32:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T03:38:06.980857Z","submitted_at":"2026-05-13T11:32:03Z","title":"GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":25},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2605.13375."}