{"as_of":"2026-08-09T12:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67a286d4bdf1328fc9f09a93e2ffeab142bc10f342b2cc44d2cd4e018c37d967","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:09:38.969249Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:15:58.111384Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.10548","snapshot_observed_at":"2026-07-13T00:15:58.111384Z","title":"emnlp-main.793/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.23913","last_updated":"2026-04-09T03:33:08Z","snapshot_observed_at":"2026-08-02T21:30:41.447004Z","submitted_at":"2026-04-09T03:33:08Z","title":"Can LoRA Fusion Support Cross-Domain Tasks in Cloud-Edge Collaboration?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T00:15:58.111384Z"},"links":{"cited_paper":"/paper/2512.10548","citing_paper":"/paper/2605.23913"},"observation_digest":"sha256:1b437a7ef1def065dd8acdee12fc69d4e5c2d4a9352e7ad022850402c6d9cc6d","observation_id":"fa65d30c-7fb7-470b-95d6-9e823029c87d","resolution":{"observed_at":"2026-07-13T00:15:58.111384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.10548/citation-record","integrity":"/paper/2512.10548/integrity","json":"/paper/2512.10548/citation-record.json","paper":"/paper/2512.10548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T17:09:31.969501Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:31.969501Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:972478ea02a2734db76f9664c148200a1067f650bb21e6e684139d2c0e7bc6e1","observation_id":"5f32fe38-422a-4bc1-9057-a9cef7fd7d38","resolution":{"observed_at":"2026-08-03T17:09:31.969501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.124176Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.124176Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:f7c3ae4741ec9b5c5ef075153d28631271704a0a35db77ed8cf2a7f0413ad90d","observation_id":"e5e7e21f-8336-429d-9e68-3334dfe51165","resolution":{"observed_at":"2026-08-03T17:09:32.124176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.253101Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.253101Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:5bfc90cddec006c70f4505560970594f166f5c39e57ea1cab0104f91df8ead34","observation_id":"06fd9171-731a-4be9-b22d-45c42578b975","resolution":{"observed_at":"2026-08-03T17:09:32.253101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T17:09:32.364961Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.364961Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:4c98ad9408c1daa08408c30dae79f039704a82632f68f143b7cdb657db227310","observation_id":"98031748-f8f0-4cb4-8c1a-d4615879ced4","resolution":{"observed_at":"2026-08-03T17:09:32.364961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.516659Z","title":"Hallucination of multimodal large language models: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.516659Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:5854d9c03a712aaa8b7cc7b054aa547cc4bbaaa2cc2f524aa19f50fd76c62ab5","observation_id":"0f600248-06ad-45f3-8739-0fa3a07e4d5a","resolution":{"observed_at":"2026-08-03T17:09:32.516659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.630525Z","title":"Geopqa: Bridging the visual perception gap in mllms for geometric reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.630525Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:3d75497b0790f6a82fe16d78a6eb56c13bb8c38e7033e595ca3bb7e2c6b71e50","observation_id":"cc41d65e-3770-4a33-987a-68cb1b75de11","resolution":{"observed_at":"2026-08-03T17:09:32.630525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.756479Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.756479Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:22b2ebc207de8c50f95fd348e6e236853c3f33ac63c570853472eb1cd2de666e","observation_id":"f19e051c-5c62-4334-8c69-0282bd17e0c3","resolution":{"observed_at":"2026-08-03T17:09:32.756479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:32.914509Z","title":"Nacl: A general and effective kv cache eviction framework for llms at inference time, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:32.914509Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:fba82811c9906ebba7a13a2b1272a8362e73ca3a1d96cd5428b6ed1413df506d","observation_id":"d6d70d8b-6a42-4d6c-aacb-1020432feb1f","resolution":{"observed_at":"2026-08-03T17:09:32.914509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.033914Z","title":"Inner thinking transformer: Lever- aging dynamic depth scaling to foster adaptive internal think- ing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.033914Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:e0dda24f476796a757076f46d5f98c1610dc6b09c2c9ca726672a58d97dd6de4","observation_id":"415163b8-b131-49aa-b806-ec6dac56b0f9","resolution":{"observed_at":"2026-08-03T17:09:33.033914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.154299Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.154299Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:8f319013deb4260ed425dc2877a16bb0042032e6dc41f0086e60679313c4dcd1","observation_id":"132056ad-50ea-4d42-9024-82dddab03ac2","resolution":{"observed_at":"2026-08-03T17:09:33.154299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.283044Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.283044Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:bdf936acf7ba3c9e6e45fcee98c7dc56a4ea26254227716a43f2662ac469bcca","observation_id":"76eac7fa-b439-4f1e-adf3-e55ada39e82a","resolution":{"observed_at":"2026-08-03T17:09:33.283044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.398979Z","title":"Atlas: Mapping attention’s location and size to probe five modes of serial and parallel search.Attention, Perception, & Psychophysics, 86(6):1938–1962, 2024","venue":null,"work_id":null,"year":1938},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.398979Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:57f0bdd6f796bed4e5bd497769fe0f2238bc74fa528bea61653dbce55a71552c","observation_id":"a29e3834-45fb-4375-8824-f45b17b54b14","resolution":{"observed_at":"2026-08-03T17:09:33.398979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.555242Z","title":"Image super-resolution using deep convolutional net- works.IEEE transactions on pattern analysis and machine intelligence, 38(2):295–307, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.555242Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:79df43e2880dcc6347f94386cca05a60c2229962278e26138ef743402978a734","observation_id":"ed9dac77-1ad7-410a-848f-e63800e634cc","resolution":{"observed_at":"2026-08-03T17:09:33.555242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.660599Z","title":"Acceler- ating the super-resolution convolutional neural network","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.660599Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:a435abf377d82783dae4c2066f7ede3dbc8a60c83e3e7f65b0de79e92335121f","observation_id":"225a961d-d473-4f67-acc4-d3a208aaeed5","resolution":{"observed_at":"2026-08-03T17:09:33.660599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:33.746918Z","title":"Multi-modal hal- lucination control by visual information grounding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.746918Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:829e77a8349eb1bc467bf6abee864c4b7a63097160b6d11494c72da5f4054ab3","observation_id":"6ac304ad-c02f-4cbc-a3a3-d9701695e2d6","resolution":{"observed_at":"2026-08-03T17:09:33.746918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09351","last_updated":"2025-06-11T03:05:24Z","snapshot_observed_at":"2026-08-09T05:26:14.069417Z","submitted_at":"2025-06-11T03:05:24Z","title":"DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09351","snapshot_observed_at":"2026-08-03T17:09:33.923627Z","title":"Dive into moe: Diversity-enhanced reconstruction of large language mod- els from dense into mixture-of-experts.arXiv preprint arXiv:2506.09351, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:33.923627Z"},"links":{"cited_paper":"/paper/2506.09351","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:65564f599dfba8cc2401f40345dfc116c09e100a871c487134c503870bcc247a","observation_id":"c15a0393-fed7-4933-8ab4-c68253dc1815","resolution":{"observed_at":"2026-08-03T17:09:33.923627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.073705Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.073705Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:5ee5cdb93272e119ae44c0e91a185b7969dff59ef655ac3f69368a07dce96b20","observation_id":"d04eaf8d-4385-4bde-aa91-7c5edb3840bc","resolution":{"observed_at":"2026-08-03T17:09:34.073705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.244703Z","title":"Tracking the will to attend: Cortical activity indexes self-generated, voluntary shifts of attention.Attention, Perception, & Psy- chophysics, 78(7):2176–2184, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.244703Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:e6b4487e617a8685bc45c929d4a44fae808558b42cf37f109d3d647335d38d9d","observation_id":"8ea7cf24-597e-4089-aa6b-7b1d31388ee5","resolution":{"observed_at":"2026-08-03T17:09:34.244703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.426101Z","title":"Beamlora: Beam-constraint low-rank adap- tation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.426101Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:dc34cd281463fce04b4a37c681deaabf21e706041b557e67f508b07e0a6ed82f","observation_id":"26d508e5-4d87-448e-927d-efc006131837","resolution":{"observed_at":"2026-08-03T17:09:34.426101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.507754Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.507754Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:140deaa67a8dca7083a8b737815f67d08dc77257a9ecc893add1284d90f4b687","observation_id":"f18c14b3-1ee4-4bcc-88c7-13c64e9d650d","resolution":{"observed_at":"2026-08-03T17:09:34.507754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.700795Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.700795Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:60d75a6eaf8f41d751f61d7a87dbb35d5d1c268c325ac8aa107947f72160cb37","observation_id":"cd0fdf4e-338d-489c-9b9b-911e6d7c33d1","resolution":{"observed_at":"2026-08-03T17:09:34.700795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:34.887592Z","title":"Hallucination augmented contrastive learning for multimodal large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:34.887592Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:57968ee0fe58bc58fd8626e8e712a1b292cbe7634b5ac373016f28f854ce6701","observation_id":"57913d8a-3348-4335-b498-5364c074a75c","resolution":{"observed_at":"2026-08-03T17:09:34.887592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.029874Z","title":"Cortical mechanisms for shifting and hold- ing visuospatial attention.Cerebral cortex, 18(1):114–125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.029874Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:fa476e816c77f013f184f78e4fe68055532defbeba6dd64da3f900ebabf5929f","observation_id":"3d7c207d-cb2d-42d1-a6d0-27320cf6055e","resolution":{"observed_at":"2026-08-03T17:09:35.029874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.187960Z","title":"Accurate image super-resolution using very deep convolutional net- works","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.187960Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:47ae9348dba7d9d813ccf1fb45abacd843eb4d3d8a6c4dedf1a98f25e9a812b4","observation_id":"8df33330-5259-4fed-bac0-3ba32b12bcdc","resolution":{"observed_at":"2026-08-03T17:09:35.187960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.331706Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123(1):32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.331706Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:8e294ac25bf3803431e9a7ced431d0d4508edfc53958fcda7511c709d6438e14","observation_id":"bb761497-fc53-491e-ac5c-fced096a0003","resolution":{"observed_at":"2026-08-03T17:09:35.331706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T17:09:35.462066Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.462066Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:81e1e7b392fb81d0f6729bda8b3dfdbd827d11f5200f1d24ead82d3cf8e4da6c","observation_id":"6c64248e-1ef1-4283-96f7-4f6d05e4eb20","resolution":{"observed_at":"2026-08-03T17:09:35.462066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.645936Z","title":"Dyfo: A training-free dynamic focus visual search for enhancing lmms in fine-grained visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.645936Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:3bc336c0e7ec1a55193ea4f37b67bbdb361af89fb0d7b967508f5edd0a7c3030","observation_id":"ba5dbffd-f91d-4d93-9d2c-da234d9df531","resolution":{"observed_at":"2026-08-03T17:09:35.645936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:35.790140Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.790140Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:c2338ec75f8ee5a8b143dc18df27d0888d83ff9bc9b0c3c60e07b8d045e69ec2","observation_id":"8ae0dc74-3ea3-484f-a6f7-c87df8108fa0","resolution":{"observed_at":"2026-08-03T17:09:35.790140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-03T17:09:35.981648Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:35.981648Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:adbb7d640f448bd3676acfe04f3f44581a8ee78c3b42c251dd40866c73f9fd44","observation_id":"c4cd6922-8f0c-40f3-9f69-f5992716d92e","resolution":{"observed_at":"2026-08-03T17:09:35.981648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.135377Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.135377Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:502539be4b6e2da9ef7c7a491c382daef614d6f893f5614bec7e29048a4a5758","observation_id":"b88d4203-8a5c-47a8-b28a-b9da0dce8b4d","resolution":{"observed_at":"2026-08-03T17:09:36.135377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.260287Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.260287Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:4e4e5f36fe2e2401f9ac8967d494b2a3a93073597e941b24889e63aa7cda2ee7","observation_id":"263bf065-c9b1-4704-87cc-d0fdd74c2cdb","resolution":{"observed_at":"2026-08-03T17:09:36.260287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.441445Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.441445Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:59078d6ec61d8b098c57af7ec422d22500572da0f1c51849852cf44ac94e1f45","observation_id":"bf27882a-4faf-48c9-91f4-f0d0a73e5fb0","resolution":{"observed_at":"2026-08-03T17:09:36.441445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.559709Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.559709Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:2c76bbaa352ffadce34323197395ea3ae578f01bd58afa7110ec0e733ca4b8c4","observation_id":"c24e4044-c131-42e5-8cf8-0d76a396a91b","resolution":{"observed_at":"2026-08-03T17:09:36.559709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.675881Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.675881Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:d19acda4e2ac3d974dd3148894df24f2b69abd73841e5c8e6b06fe980ce7cbcf","observation_id":"faba4aad-1c8f-4096-bcf6-b7274439f3bd","resolution":{"observed_at":"2026-08-03T17:09:36.675881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.738767Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.738767Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:2d64bfe6c3655e8c095b01d6da1fb3a2284e8b7f75f786570cbb251137a59b04","observation_id":"114edba4-7afe-4b80-883b-69254ee70302","resolution":{"observed_at":"2026-08-03T17:09:36.738767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.859880Z","title":"Neuronal mechanisms of visual atten- tion.Annual review of vision science, 1(1):373–391, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.859880Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:74e86abff8a7aeb57b51b95389d07e656caa6aefcb3317206887f919b4494317","observation_id":"1b184aa7-8a20-44d6-a001-f40884234dbb","resolution":{"observed_at":"2026-08-03T17:09:36.859880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:36.974350Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:36.974350Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:7ad800deb2cdf308395a6845d691d0a0e31e2fad7db2c5453a2175bd5c5a0474","observation_id":"98f33d94-5808-4029-8137-268054a72f27","resolution":{"observed_at":"2026-08-03T17:09:36.974350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:37.107535Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.107535Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:4859e7a2ac3d456a07627a3452ff54c72c81449e5b9eb34cba2e5f444e0d8718","observation_id":"ce4b50ba-1971-473a-9dc8-5acc4e0474ef","resolution":{"observed_at":"2026-08-03T17:09:37.107535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:37.236417Z","title":"Deepspeed: System optimizations enable train- ing deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.236417Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:8a99b3432cd00d71c905b33a6d6fa25620839457be5dcaffaf42e7c128be9a5c","observation_id":"ec8c6013-d94d-44a2-aadc-f06a26411e2b","resolution":{"observed_at":"2026-08-03T17:09:37.236417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:37.399420Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.399420Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:6b15189c8bad3fdbb6b37e085dbd861c0af217da0217ced67277cccd9749e7db","observation_id":"ac8345c7-e171-4208-a687-284a42c9e5ae","resolution":{"observed_at":"2026-08-03T17:09:37.399420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-03T17:09:37.581401Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.581401Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:ff75101ed1a0fa96ac0abe3df245e483938f350802d0ddf9ba99696c0f2bbf41","observation_id":"d6c710be-23b8-4ffa-9a21-abb42453bfef","resolution":{"observed_at":"2026-08-03T17:09:37.581401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:37.702564Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.702564Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:d10a7ba31cb6ae5d51b9347f4303842c6f68c98898ade1f49b17d59c7e16576e","observation_id":"11c66680-208d-422b-8114-03d3941c5080","resolution":{"observed_at":"2026-08-03T17:09:37.702564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23317","last_updated":"2024-10-29T20:04:34Z","snapshot_observed_at":"2026-08-02T02:59:04.120462Z","submitted_at":"2024-10-29T20:04:34Z","title":"VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23317","snapshot_observed_at":"2026-08-03T17:09:37.841750Z","title":"Vl-cache: Sparsity and modality-aware kv cache com- pression for vision-language model inference acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:37.841750Z"},"links":{"cited_paper":"/paper/2410.23317","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:07a7ba7be049efc531bf5ba1da11c7c3668f99bc4c85fb1610428d161b830f6e","observation_id":"5640b0b4-4a97-406b-bbbe-6fce424be439","resolution":{"observed_at":"2026-08-03T17:09:37.841750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:38.025746Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.025746Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:788d7f7e1d7f5d82f46cd64f3451bb9e5e08af89c50702d0771c8a260833f9c4","observation_id":"2ec4e44d-88e9-4bb4-b788-08e4eeea8147","resolution":{"observed_at":"2026-08-03T17:09:38.025746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-07T15:14:57.062481Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-03T17:09:38.165356Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023.URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.165356Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:a99e419a4de872c9c7f65a9c3f1b5ac6e756eba7a88f57664011f66ae5c80237","observation_id":"978dc477-32ba-4afb-8e4c-f600cbfa318b","resolution":{"observed_at":"2026-08-03T17:09:38.165356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:38.306215Z","title":"Grounded chain-of-thought for multimodal large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.306215Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:3759f8102277b9164870fd30d5252f2b1067760ed2e409e20b682939b2ae8a41","observation_id":"8c8e008f-e00e-404c-a8af-c2ad5d00a78a","resolution":{"observed_at":"2026-08-03T17:09:38.306215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-03T17:09:38.421930Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction.arXiv preprint arXiv:2410.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.421930Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:720e5418d815d8862cecd4c87bcbe5c654489e66bac75ec34de51eb9fc69748d","observation_id":"6635180d-9c07-4ea3-8288-e28d31e73a4d","resolution":{"observed_at":"2026-08-03T17:09:38.421930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:38.563170Z","title":"Fit and prune: Fast and training-free visual token pruning for multi- modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.563170Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:7b2dd3a78b85337cb3b0026b0c35f699a46f694275dcdbbf5f2b15f0fdba97bc","observation_id":"8331d809-d8a9-4c1d-87c5-82b7ec5e5952","resolution":{"observed_at":"2026-08-03T17:09:38.563170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17425","last_updated":"2025-02-24T18:56:12Z","snapshot_observed_at":"2026-08-07T17:52:18.653123Z","submitted_at":"2025-02-24T18:56:12Z","title":"Introducing Visual Perception Token into Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17425","snapshot_observed_at":"2026-08-03T17:09:38.749150Z","title":"Introducing vi- sual perception token into multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.749150Z"},"links":{"cited_paper":"/paper/2502.17425","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:66ecec4b1dba2c7e558baa601761207df035dce6ea483656be0eb826429ac4cc","observation_id":"5a86ab97-3722-41b1-92e4-34065fbedba8","resolution":{"observed_at":"2026-08-03T17:09:38.749150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-03T17:09:38.835314Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.835314Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:ca7899ae48f7dd6c6567c2dc443ad750fcf406101a67e9851d5f7e8597772d33","observation_id":"1c6baefc-31dc-4d52-91ae-aa6d452ffafe","resolution":{"observed_at":"2026-08-03T17:09:38.835314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-08-07T17:52:20.236795Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-08-03T17:09:38.897509Z","title":"Mllms know where to look: Training-free per- ception of small visual details with multimodal llms.arXiv preprint arXiv:2502.17422, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.897509Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:591ecf40985e8e0ce9769cb53ae4236ad7dca63645786112e2b03fa3f34ab00a","observation_id":"52371a29-5dbb-4375-95d8-72bfd611be92","resolution":{"observed_at":"2026-08-03T17:09:38.897509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:09:38.969249Z","title":"Open eyes, then reason: Fine-grained visual mathematical understanding in mllms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.969249Z"},"links":{"citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:c19362db79e0b89b41443e5b545c5e387fe36c425af76f68f83eabd0030576da","observation_id":"d0cae116-48b6-49e8-9be2-be8c25934b68","resolution":{"observed_at":"2026-08-03T17:09:38.969249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:23:04.267396Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2512.10548."}