{"as_of":"2026-08-08T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f0ea28acba8234e10800b36ff7abfe38b07c3d3822e66909e5f70c88da70cb3","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:19:02.848690Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03649/citation-record","integrity":"/paper/2608.03649/integrity","json":"/paper/2608.03649/citation-record.json","paper":"/paper/2608.03649"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T15:19:02.785738Z","title":"Qwen2.5-VL technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.785738Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:cce4ed4946b13f445e50c2621b522b1fa9e3d7a672f46c8c6d80160c8d74a7ec","observation_id":"a9ac022f-09d5-4619-ada0-72b387edb7e8","resolution":{"observed_at":"2026-08-05T15:19:02.785738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00837","last_updated":"2017-05-15T17:58:49Z","snapshot_observed_at":"2026-07-06T05:21:10.284182Z","submitted_at":"2016-12-02T20:57:07Z","title":"Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00837","snapshot_observed_at":"2026-08-05T15:19:02.790931Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.790931Z"},"links":{"cited_paper":"/paper/1612.00837","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:1ae68f8827fc57df253faea25fbd622509f3d765fb8af3a744f926b3c072589c","observation_id":"12a72b7e-cfe8-4a6d-a7f5-4f4b45bf6057","resolution":{"observed_at":"2026-08-05T15:19:02.790931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.102","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:03.161578Z","title":"CARES : Context-aware resolution selector for VLM s","venue":null,"work_id":"6a4a95d5-a257-46f3-8a48-6496214a8568","year":2026},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.799318Z"},"links":{"citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:f6011745a6f939f702ecc826e97ea0071ebc8a31eb9a3527c964d34d0e8c7c82","observation_id":"c58f92f9-2a10-4044-b4dd-ae0044801909","resolution":{"observed_at":"2026-08-05T15:19:03.166692Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-05T15:19:02.805044Z","title":"TokenPacker : Efficient visual projector for multimodal LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.805044Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:6954b559e678144abd5e4283d4ddb844b8c47ef405ced7b61a8688d3010af87b","observation_id":"a842a616-3f4c-4e81-9abb-82e1759158ba","resolution":{"observed_at":"2026-08-05T15:19:02.805044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.28610","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:03.120176Z","title":"ResAdapt : Adaptive resolution for efficient multimodal reasoning","venue":null,"work_id":"6da29514-8cfc-425d-a81e-91fc8bffdc15","year":2026},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.810877Z"},"links":{"citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:0d71b9ea25ccccd6b2ddbebaa9eddab2e45de957ca5b7b69374ba013942d0371","observation_id":"8b1fc09e-7b6b-41d9-9f83-aa2e0de2ad58","resolution":{"observed_at":"2026-08-05T15:19:03.130483Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:03.336820Z","title":"AdaptVision : Efficient vision-language models via adaptive visual acquisition","venue":null,"work_id":"645e0d05-88af-4c0f-afe1-52131bb3d548","year":2026},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.815910Z"},"links":{"citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:93abfb96af396628cbfdd7ad554341462e91411cfa1338bddababa85aa660751","observation_id":"cbff600b-51cf-4dc4-b64e-65e8b4e056c8","resolution":{"observed_at":"2026-08-05T15:19:03.342589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T15:19:02.822062Z","title":"ChartQA : A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.822062Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:decc3e465b971eeb210a33e56f28a8cb94dce3e806324824a1f776eeee23fbf8","observation_id":"4b7b91bc-e4f1-478f-b1b8-e9ffb00a8c82","resolution":{"observed_at":"2026-08-05T15:19:02.822062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:02.827885Z","title":"LLaVA-PruMerge : Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.827885Z"},"links":{"citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:1200885cb8668d05f354e58239badf1052ec1403b2a5305da71c523fd7f0889c","observation_id":"477b4d13-068d-49db-ad08-8707a305e08d","resolution":{"observed_at":"2026-08-05T15:19:02.827885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:02.833221Z","title":"Towards VQA models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.833221Z"},"links":{"citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:2f88b1030704d4301a54d304369974e898827d7934a12bb4556af8381d6ab9c4","observation_id":"40a67815-76bc-4e7b-9c45-59bb231065ae","resolution":{"observed_at":"2026-08-05T15:19:02.833221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10197","last_updated":"2024-12-25T04:30:16Z","snapshot_observed_at":"2026-07-06T19:16:01.172484Z","submitted_at":"2024-09-16T11:43:19Z","title":"Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10197","snapshot_observed_at":"2026-08-05T15:19:02.837652Z","title":"Fit and prune: Fast and training-free visual token pruning for multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.837652Z"},"links":{"cited_paper":"/paper/2409.10197","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:e01caec3bc556bfbbf32e48c673fbaf3654d225e2bbc877a73564fca9fcd6fb2","observation_id":"03fcfec7-111b-4c18-8d98-5ee76158c127","resolution":{"observed_at":"2026-08-05T15:19:02.837652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-08T00:45:04.947316Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-05T15:19:02.843428Z","title":"[CLS] attention is all you need for training-free visual token pruning: Make VLM inference faster","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.843428Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:100598642d305c0c7674cfb4f525299d1cf0d231d3f6664757649c808517a7a8","observation_id":"b8e56e5f-2d4b-4c0a-ba66-b94aabab9a82","resolution":{"observed_at":"2026-08-05T15:19:02.843428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-05T15:19:02.848690Z","title":"SparseVLM : Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.848690Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:10739b20e088f9dad2421350b42ce97d863aea4c8e495789bb49e96584449aea","observation_id":"4a8e9594-1b6f-4d93-94d8-584de078c6d5","resolution":{"observed_at":"2026-08-05T15:19:02.848690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:06:38.251380Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2608.03649."}