{"as_of":"2026-08-09T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad5cf7ac8625dac3e34850a73a72ec9cd8f2df1728334815544af05706df9dcf","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:42:16.353153Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16326/citation-record","integrity":"/paper/2607.16326/integrity","json":"/paper/2607.16326/citation-record.json","paper":"/paper/2607.16326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:13.962870Z","title":"A survey of state of the art large vision language models: Benchmark evaluations and challenges,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:13.962870Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:ca53a6766c0438692fadcd25c8156b3461618e8e2e7d1e34cda4cb4fb692f05e","observation_id":"22e10980-24c3-4109-b9ec-fe6d9a67ee10","resolution":{"observed_at":"2026-08-02T03:42:13.962870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.029230Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.029230Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:db4d1011a67f454ec577c74f4f789cedc882658a404f12e28945a6609e3ce755","observation_id":"a2e7303d-8d63-4d0b-a2ec-b2d66a03a22c","resolution":{"observed_at":"2026-08-02T03:42:14.029230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.088093Z","title":"[cls] attention is all you need for training-free visual token pruning: Make vlm inference faster,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.088093Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:564d09166d47e3cf0089e4cd94a366cd984fab32a56cc17bf0060991f5eab74d","observation_id":"ffc841a0-501a-4e7a-8a12-df7467060223","resolution":{"observed_at":"2026-08-02T03:42:14.088093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-08-08T00:45:20.646947Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-08-02T03:42:14.167493Z","title":"Stop looking for important tokens in multimodal language models: Duplication matters more,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.167493Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:e4f4d9b2c383635514ad7439c4a2c1ee098e8c38927be4670e8dd9d034486a90","observation_id":"cb80ec59-6fda-4a39-a281-9eb459c21c3f","resolution":{"observed_at":"2026-08-02T03:42:14.167493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.225585Z","title":"Visionzip: Longer is better but not necessary in vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.225585Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:a7cdc6202f527269284371accba790eee7967cb910afe2cd10b52379157bcce7","observation_id":"fcb18766-f096-4f16-9ae0-344f2ddf65fd","resolution":{"observed_at":"2026-08-02T03:42:14.225585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.268413Z","title":"Divprune: Diversity- based visual token pruning for large multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.268413Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:002b650206bf25bc9cf95b193847928362d9b5449aa4b46c889fabc32558ba95","observation_id":"a3f840ac-ea02-43e2-9cf5-8fcc758c8011","resolution":{"observed_at":"2026-08-02T03:42:14.268413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.328001Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.328001Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:4928f02293dcb386ebd964367993833ab6890187dc67d90acf2c9a3f062cf024","observation_id":"b2747e3b-6ba8-4f41-84f1-43088a6a4d92","resolution":{"observed_at":"2026-08-02T03:42:14.328001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.387140Z","title":"Which experimental design is better suited for vqa tasks?: Eye tracking study on cognitive load, performance, and gaze allocations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.387140Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:86e83a0e09d5775357faaddea9ab765285082ccf3472c7b40562af7e6418838a","observation_id":"deb8fc81-c2ea-47af-a648-ca7099b13bd2","resolution":{"observed_at":"2026-08-02T03:42:14.387140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.451408Z","title":"Making the invisible visible: Verbal but not visual cues enhance visual detection,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.451408Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:068d1133a7c5a51f4f29d09bf93e32d791f28081e253050fe98eecf6a2373fda","observation_id":"cf119c7b-0c1e-4101-8c49-904514bb2413","resolution":{"observed_at":"2026-08-02T03:42:14.451408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.510468Z","title":"Beyond text-visual attention: Exploiting visual cues for effective token pruning in vlms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.510468Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:0fcd0ca5f16f3dfa77f3a1d1355c5ee4662ca17eb8d631ae00e93b8ee81408d6","observation_id":"84348696-6677-4790-919f-ea30c9956231","resolution":{"observed_at":"2026-08-02T03:42:14.510468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-02T03:42:14.568395Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.568395Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:a0e219a2f07f9b168fbec22fcbfb6811d84164a7ccff82a8568ef2ef2e826719","observation_id":"afcfed36-0ac4-44ac-8e3d-7e56bab9427b","resolution":{"observed_at":"2026-08-02T03:42:14.568395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.614845Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.614845Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:88e0349bac5837b7fdb6c890f8271aa7caee9c2c6667b9c157571e0d32646253","observation_id":"a87a12c8-fe66-4e61-b471-5a5b9fb3f6f8","resolution":{"observed_at":"2026-08-02T03:42:14.614845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.672964Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.672964Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:8fb3a13aa6e780d9f803d1a5ab470292f9b7a71662d2814ce2d53f41a93dd99d","observation_id":"0f349ea5-b27c-4a40-aabb-1980a500fb4f","resolution":{"observed_at":"2026-08-02T03:42:14.672964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.747206Z","title":"A-vl: Adaptive attention for large vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.747206Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:cf5bdade862a47f4a45cae70b7c1cdf1ba04f225931573b39945f5cc6dbf8219","observation_id":"4b78eb07-ce38-47e4-906f-82d0d86ed7e6","resolution":{"observed_at":"2026-08-02T03:42:14.747206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.810397Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.810397Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:65a8699fb39c7225874912202a340edaf1b1c883a0d069565800e65926005821","observation_id":"43bb17fe-eb23-4fad-ba9e-8ac6e71a801b","resolution":{"observed_at":"2026-08-02T03:42:14.810397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.869453Z","title":"Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.869453Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:2a243614092dc6822a0a68c974a0ace39425e7ceca5322c5119432b4d43fd2a2","observation_id":"a6c1fd54-da0e-4dc4-85b6-278d6826381c","resolution":{"observed_at":"2026-08-02T03:42:14.869453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-02T03:42:14.917470Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.917470Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:6aee8023c8ebd263a738c2cb35ed4cfaa8e51649048a12de7bbebed4b1b65e1a","observation_id":"7e8570fb-3b5f-477d-a0d0-4f7da959d9b4","resolution":{"observed_at":"2026-08-02T03:42:14.917470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.968369Z","title":"Token merging: Your vit but faster,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.968369Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:949644bdd75919374d240fa6c31b69031cbb5c712f79bbc3076efe775ec07f79","observation_id":"e70aee6f-94b2-4f0e-893a-450614b14839","resolution":{"observed_at":"2026-08-02T03:42:14.968369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:14.973153Z","title":"Less is more: A simple yet effective token reduction method for efficient multi-modal llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.973153Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:ea68a73ffb13b0a50ea0c95db2f6a24258446902c6b92f278df0c1a76a266417","observation_id":"9be3d9bc-25e7-4233-9703-6ef794af667e","resolution":{"observed_at":"2026-08-02T03:42:14.973153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-02T03:42:14.989028Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:14.989028Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:1292df55b69046e4905359cdee3a4a5cd1647cf75ecd6010c9e01e5a0758af33","observation_id":"2cac17e1-2c7a-41fb-9ea6-fe26463ff5d8","resolution":{"observed_at":"2026-08-02T03:42:14.989028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.064940Z","title":"en core web sm: spacy english small model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.064940Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:3fdcf9ca5f9777af42daffcc2d839f2134823c47373a5a2c3a496347325e589d","observation_id":"eb6895fa-9c7e-47b1-948a-5c12c1dfccec","resolution":{"observed_at":"2026-08-02T03:42:15.064940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.224141Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.224141Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:18e3f6748baad1e17c08e0ff1ccbf1edfc714b9db5f23528d366c6d611ee1fa6","observation_id":"aa5edcd7-3e17-4763-95cc-a265e3619c42","resolution":{"observed_at":"2026-08-02T03:42:15.224141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.385887Z","title":"Vizwiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.385887Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:3a66bb8bcd6d636c04ae768de5429e965605669232e1b22bc5b1c0b3a1e35dc7","observation_id":"6ee3588a-2ed4-48ec-a572-b6008311a5bb","resolution":{"observed_at":"2026-08-02T03:42:15.385887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.538454Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.538454Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:a37d0ceac9abfeb56cf4279aac16876cb9cc3076c9e90da52b75aebafecaaa12","observation_id":"0b291d16-1ac2-4445-9add-45ac222e2926","resolution":{"observed_at":"2026-08-02T03:42:15.538454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.652552Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.652552Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:cb1f893a4d9c017161c77fa6cd67cdbfd3c4cce5fa8f3e86208383c6a7b5f029","observation_id":"e23e9de6-19a2-423b-9be8-701099206de4","resolution":{"observed_at":"2026-08-02T03:42:15.652552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.811440Z","title":"Towards vqa models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.811440Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:b01036105cf1f2064efd98a01562ced024d3b082b13ecba3b5baf8b14258ab51","observation_id":"6ac73fdb-ead5-4f4c-a603-1df1de942469","resolution":{"observed_at":"2026-08-02T03:42:15.811440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:15.972178Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:15.972178Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:9022209122928749695838e827e5540b75b1a2f58dfab82d580ef3dd8ba21d20","observation_id":"a0dc2b26-e124-494d-8b8a-f0c40c015cc9","resolution":{"observed_at":"2026-08-02T03:42:15.972178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-02T03:42:16.140370Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:16.140370Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:39100f9fe0cd1b462c23bd5b49f67533a625c51e5cb7f3834658ac246cf07ab8","observation_id":"cf4a3d85-1401-493d-9782-227dffb6d8ee","resolution":{"observed_at":"2026-08-02T03:42:16.140370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:16.307600Z","title":"Mmbench: Is your multi-modal model an all-around player?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:16.307600Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:7ad2ec552f2b6d7d5623952679e6390839e7878a483eecc75f7d611a117d7fbf","observation_id":"9ccc400f-956c-4576-9587-b505246e1706","resolution":{"observed_at":"2026-08-02T03:42:16.307600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:42:16.353153Z","title":"Mm-vet: evaluating large multimodal models for integrated capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:42:16.353153Z"},"links":{"citing_paper":"/paper/2607.16326"},"observation_digest":"sha256:d05a73cfc00e3d2452224ae0ddb990c71a3840614722c6bfc16e076a4d7d0001","observation_id":"6462f743-c873-4b9f-8e30-c2f19f1637fd","resolution":{"observed_at":"2026-08-02T03:42:16.353153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16326","last_updated":"2026-07-15T13:11:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:00:20.619618Z","submitted_at":"2026-07-15T13:11:26Z","title":"CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2607.16326."}