{"as_of":"2026-08-07T08:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab00aa7945d789949e1f0178e44a50dc00676d1baa972c6b88d58a8f3fadae88","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:02:43.614624Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04726/citation-record","integrity":"/paper/2608.04726/integrity","json":"/paper/2608.04726/citation-record.json","paper":"/paper/2608.04726"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-06T18:02:43.554226Z","title":"InProceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 4178–4188","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.554226Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:2bfc4ec215a38d141d0eaf7feec02dd7263e352671eaaff72be7e7e963b8f108","observation_id":"7a482709-b5dd-4cb3-a056-9dfd3d727272","resolution":{"observed_at":"2026-08-06T18:02:43.554226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.563621Z","title":"Li, B.; Zhang, Y.; Guo, D.; Zhang, R.; Li, F.; Zhang, H.; Zhang, K.; Zhang, P.; Li, Y.; Liu, Z.; and Li, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.563621Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:0bcf34d28b917a8fba9d413b640f9fddf5236ecde9bbfeb1ec1c9fd08a097fd7","observation_id":"db58b1e2-504e-4452-9dae-b83961accf95","resolution":{"observed_at":"2026-08-06T18:02:43.563621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.567634Z","title":"Lin, H.; Liu, Z.; Zhu, Y.; Qin, C.; Lin, J.; Shang, X.; He, C.; Zhang, W.; and Wu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.567634Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:a56902619134813f2a677b37196ad4896a49cb999d52b773cc7432d5143b9c77","observation_id":"9133902b-5ab7-40d2-9911-fdede827cc13","resolution":{"observed_at":"2026-08-06T18:02:43.567634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.572158Z","title":"arXiv preprint arXiv:2601.21821","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.572158Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:1eafb16e6308604217632d8a4c1420a2dbde0cc142ace49e09e2097a55120a61","observation_id":"073a3ff1-8751-4f9b-9003-9930983f4ffa","resolution":{"observed_at":"2026-08-06T18:02:43.572158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-08-03T04:31:17.019218Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04802","snapshot_observed_at":"2026-08-06T18:02:43.576081Z","title":"Lu, P.; Bansal, H.; Xia, T.; Liu, J.; Li, C.; Hajishirzi, H.; Cheng, H.; Chang, K.-W.; Galley, M.; and Gao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.576081Z"},"links":{"cited_paper":"/paper/2602.04802","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:ffd67184e6c3f1b7afb7decdc4a221d54508d2b80a489c6ab40614997383e029","observation_id":"5082ee0b-8a44-460d-9ebe-fc329006bb18","resolution":{"observed_at":"2026-08-06T18:02:43.576081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10433","last_updated":"2025-08-14T08:15:41Z","snapshot_observed_at":"2026-08-06T10:43:25.687071Z","submitted_at":"2025-08-14T08:15:41Z","title":"We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10433","snapshot_observed_at":"2026-08-06T18:02:43.584703Z","title":"Wang, K.; Pan, J.; Shi, W.; Lu, Z.; Ren, H.; Zhou, A.; Zhan, M.; and Li, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.584703Z"},"links":{"cited_paper":"/paper/2508.10433","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:2c84d6f90fc370861747cf6d97298bcfb7bef80f875f9e7a9260a6dd54c7a291","observation_id":"e4571943-360e-4046-9080-7be6d136e523","resolution":{"observed_at":"2026-08-06T18:02:43.584703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-06T20:06:25.553030Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03483","snapshot_observed_at":"2026-08-06T18:02:43.598214Z","title":"arXiv preprint arXiv:2507.03483","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.598214Z"},"links":{"cited_paper":"/paper/2507.03483","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:47e427cccf3e43c439721bcfa2f047ff418739b1cd7cfe3a6e76e1f3131ce64e","observation_id":"182f00bc-48d2-4ba2-9971-1b52146dab92","resolution":{"observed_at":"2026-08-06T18:02:43.598214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.602554Z","title":"Zheng, C.; Liu, S.; Li, M.; Chen, X.-H.; Yu, B.; Gao, C.; Dang, K.; Liu, Y.; Men, R.; Yang, A.; Zhou, J.; and Lin, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.602554Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:703c4f9ae989b5d81fa58a98a4643136b5e28dbffd68590544e67de426ed38f3","observation_id":"fcdee749-e364-4976-8046-a77cfebff434","resolution":{"observed_at":"2026-08-06T18:02:43.602554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-06T18:02:43.606491Z","title":"Zheng, Z.; Yang, M.; Hong, J.; Zhao, C.; Xu, G.; Yang, L.; Shen, C.; and Yu, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.606491Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:4a6a3623f14f9adf4861e2c95a0c4bfbe020586b8a3f751380e3ee1562808c7a","observation_id":"62e59df4-17db-4dd9-b4fb-0c5a31f7e731","resolution":{"observed_at":"2026-08-06T18:02:43.606491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T18:02:43.610661Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vi- sion and Pattern Recognition, 16793–16803","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.610661Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:24228b1ca936352fc01a7b33bde5235a2848af6de10aa4b55731da73c67e2105","observation_id":"393aa8f8-c4fc-49da-9c84-44ecef1a648a","resolution":{"observed_at":"2026-08-06T18:02:43.610661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:44.315267Z","title":"InInternational Conference on Learning Representations","venue":null,"work_id":"1d49fcae-01d5-414d-a21c-c7ac09390f1e","year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.614624Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:3b45dd494c6002fe7ec7e262ed8f6bec1cda16d55be05e90889b275b8c59dc72","observation_id":"fa9de672-90ac-483d-bee0-3e604dfe204a","resolution":{"observed_at":"2026-08-06T18:02:44.323648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T18:02:43.588950Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.588950Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:81537b80ea6cbf23221326775de045e44ee070b1c583dde3740082d4f392be8c","observation_id":"1780b0e9-a7ba-4a10-923c-93daf34ea924","resolution":{"observed_at":"2026-08-06T18:02:43.588950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-06T18:02:43.558955Z","title":"InAdvances in Neural Information Processing Systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.558955Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:262ae6e2dcbca6f4cc7aee5b878e408f28e23a7191b2dca5b04044ba228cb38a","observation_id":"f4a02599-d57b-4a32-83b1-4d2d1094bfc0","resolution":{"observed_at":"2026-08-06T18:02:43.558955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T18:02:43.580389Z","title":"Meng, F.; Du, L.; Liu, Z.; Zhou, Z.; Lu, Q.; Fu, D.; Han, T.; Shi,B.;Wang,W.;He,J.;Zhang,K.;Luo,P.;Qiao,Y.;Zhang, Q.;andShao,W.2025","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.580389Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:2096d0ef6f5d9379f8259c830a75feb2eb426f3b4eba1c4b558ceb84627176bf","observation_id":"7f726666-04ca-4bbe-834b-124876c1cfb1","resolution":{"observed_at":"2026-08-06T18:02:43.580389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T18:02:43.593744Z","title":"arXiv preprint arXiv:2412.10302","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.593744Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:66b0d7601517f2a50186710115613ef715e051ef2ffbf91b576d2e94f0608a3f","observation_id":"7b70000d-798d-4848-b40c-80934cbca12a","resolution":{"observed_at":"2026-08-06T18:02:43.593744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.545297Z","title":"Assran,M.;Duval,Q.;Misra,I.;Bojanowski,P.;Vincent,P.; Rabbat,M.;LeCun,Y.;andBallas,N.2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.545297Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:8a19208f2dfbf3b13555788a09b16435ee0be03540651a2f82cb2efa4708ff8e","observation_id":"43834796-eb56-4b6b-85e4-d0ba82abc155","resolution":{"observed_at":"2026-08-06T18:02:43.545297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:02:43.549873Z","title":"arXiv preprint arXiv:2602.09483","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T18:02:43.549873Z"},"links":{"citing_paper":"/paper/2608.04726"},"observation_digest":"sha256:c2d748ef2e00db52a9c282e1253cc6c0637063b7ed5f5a8af1c982f938493dd2","observation_id":"7e1ffec3-0e69-4bff-89f1-4d1b2d5f4022","resolution":{"observed_at":"2026-08-06T18:02:43.549873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04726","last_updated":"2026-08-05T11:46:15Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T08:07:13.391679Z","submitted_at":"2026-08-05T11:46:15Z","title":"When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2608.04726."}