{"as_of":"2026-08-14T23:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:002a4932b63625b314ff7b38fd2dee9ac1196296b21fa6a6bf4d09e3d089f255","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:17:03.098852Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:12:03.512804Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:20:07.268611Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:0579a9b5fceffb527f8fbb270e966cd90edecd66bde4ac08d756c6d70673c8a8","observation_id":"e425596d-f5a0-4bab-adea-2f6a8358a6e1","resolution":{"observed_at":"2026-05-15T17:18:53.182630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-07T14:12:03.512804Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-13T21:02:05.551264Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:03.512804Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:c074ca54dfe85ed76594ec53b4803ce452bd1864d376f7f3e3f6b85d16c3b787","observation_id":"77c84b54-142c-4262-9e70-9a820e655541","resolution":{"observed_at":"2026-08-07T14:12:03.512804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:ff91f4cf1b26b0b2f0522175f51b2c0ce5da0689960ae7d3d87dd9a0c05ad6eb","observation_id":"53ea2b8a-629e-4183-9890-b255564e406e","resolution":{"observed_at":"2026-05-22T01:05:52.119661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-07T04:40:07.980626Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-13T03:53:07.121957Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:07.980626Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2506.10128"},"observation_digest":"sha256:ba4228bdbf1a36c4182adca94c9e709b31eb1e72f35ad626a2bb286d19780784","observation_id":"22bcc49e-abe1-4239-a509-8b6c2363d5ac","resolution":{"observed_at":"2026-08-07T04:40:07.980626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-06T22:33:12.123031Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21393","last_updated":"2025-06-26T15:41:34Z","snapshot_observed_at":"2026-08-08T00:40:29.382352Z","submitted_at":"2025-06-26T15:41:34Z","title":"TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:33:12.123031Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2506.21393"},"observation_digest":"sha256:88116377211e126284aa373b4c26fa9b69e1a7bd8bda92cf80e6755d8525851c","observation_id":"9bc20143-f1e1-43d1-bd7f-deb87faafb28","resolution":{"observed_at":"2026-08-06T22:33:12.123031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-06T13:23:30.018055Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-14T23:16:41.496277Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T13:23:30.018055Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2507.20766"},"observation_digest":"sha256:8b82c1034ba90040d5e4a217050c1366c5f624016971b7c85dca0be930080456","observation_id":"be5a5374-0176-4028-a3ab-e3510564f0d7","resolution":{"observed_at":"2026-08-06T13:23:30.018055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-06T00:03:27.768763Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:27.768763Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:54787d1a7f3ba4d2eab1d64a82c9bf1890861c7a246a8417afd97fcb11d73439","observation_id":"cbc72a80-308f-4e3c-b271-e62f4bef7e53","resolution":{"observed_at":"2026-08-06T00:03:27.768763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-05T20:28:54.709175Z","title":"Fu et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-13T23:10:52.614750Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:54.709175Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:71da0e046202177072b5720e26f03504507a7a6ec43a251f2c0c5fe0b85d46cb","observation_id":"ad25cc20-36be-4892-b653-c9ffa711c9c5","resolution":{"observed_at":"2026-08-05T20:28:54.709175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2509.07966","last_updated":"2026-04-21T15:48:38Z","snapshot_observed_at":"2026-08-11T10:55:52.729104Z","submitted_at":"2025-09-09T17:52:26Z","title":"Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-18T17:37:31.837022Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2509.07966"},"observation_digest":"sha256:c8134c90510278d186aaeef3711ff8ea93a72513d653b68faab70b0ebbe5cf4d","observation_id":"9e9a0b5b-0735-4ee7-9491-a579f047b008","resolution":{"observed_at":"2026-05-18T17:42:47.613443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2509.20912","last_updated":"2026-05-21T02:54:31Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:58:10Z","title":"DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T22:35:36.136639Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2509.20912"},"observation_digest":"sha256:ae53909e970171ab64eb98a2834723670a78435cecd1936b3547612b29d558f8","observation_id":"998508ec-f91f-4376-ac1b-79235175a383","resolution":{"observed_at":"2026-05-21T22:35:42.672254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2509.20912","last_updated":"2026-05-21T02:54:31Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:58:10Z","title":"DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T13:36:06.229352Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2509.20912"},"observation_digest":"sha256:489ba4a126e4d728aa729028d7e25a6ee623ddd352a5b6b2e3fa8f212c3b5917","observation_id":"f37e4270-47d3-4738-ae3b-4ba2172e483d","resolution":{"observed_at":"2026-05-22T13:36:35.981987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-08-10T21:20:13.670725Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:43f09154342b6d7e91a9e576620f9eb3e275e344ddcd2167a426edda3d183fa0","observation_id":"8a1e917d-b360-4c8a-abcc-d04eaf46d0a8","resolution":{"observed_at":"2026-05-15T18:41:30.372775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2512.08980","last_updated":"2026-04-03T08:53:56Z","snapshot_observed_at":"2026-08-11T15:59:42.240087Z","submitted_at":"2025-12-05T10:02:38Z","title":"Training Multi-Image Vision Agents via End2End Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T00:59:28.618477Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2512.08980"},"observation_digest":"sha256:bc0c6e539515db02378ea051173b956a749cb0572b1f79e084bce03c836eb474","observation_id":"219fe1a3-7932-4d13-b87d-31de3c9157f6","resolution":{"observed_at":"2026-05-17T01:01:24.319646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T23:02:28.588225Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2512.12623"},"observation_digest":"sha256:636b0f5f4498f86052ba4d8b474b7f96328f8ed01a63c1155c0ec86d9c345647","observation_id":"03055f22-2501-4018-be04-b3f9247b503c","resolution":{"observed_at":"2026-05-16T23:03:38.937182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-13T16:55:20.099628Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27493","last_updated":"2026-06-06T05:46:49Z","snapshot_observed_at":"2026-08-14T15:36:29.644851Z","submitted_at":"2026-03-29T03:18:42Z","title":"Fully Spiking Neural Networks with Target Awareness for Energy-Efficient UAV Tracking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T16:55:20.099628Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2603.27493"},"observation_digest":"sha256:2e3eb25164dfcd3f057d1d60bc51796ca28517dd146f9147141b28a241767f9f","observation_id":"b0158267-52e2-4167-bac1-f521860f18d4","resolution":{"observed_at":"2026-07-13T16:55:20.099628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2603.27494","last_updated":"2026-04-13T08:50:29Z","snapshot_observed_at":"2026-08-14T09:54:54.084523Z","submitted_at":"2026-03-29T03:18:57Z","title":"Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T21:35:12.859669Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2603.27494"},"observation_digest":"sha256:4ca7c9bb241848d69249802051c0f378ecbce4acc1979fe26f212acae3e5dc46","observation_id":"3904687a-9598-41e6-9b8f-70d966161ec2","resolution":{"observed_at":"2026-05-14T21:38:00.966585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2604.03660","last_updated":"2026-04-04T09:26:09Z","snapshot_observed_at":"2026-08-13T17:28:58.893586Z","submitted_at":"2026-04-04T09:26:09Z","title":"TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T17:20:28.036531Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2604.03660"},"observation_digest":"sha256:4218268fad60001fcd01eda28e3b93170ca4d77c8cc11030cb06ba0c48147b9b","observation_id":"1ee1dbbd-ac54-421e-b3d6-e99745b3c56d","resolution":{"observed_at":"2026-05-13T17:23:02.410245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2604.07518","last_updated":"2026-04-08T18:52:27Z","snapshot_observed_at":"2026-08-11T06:45:22.438370Z","submitted_at":"2026-04-08T18:52:27Z","title":"Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:33.231488Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2604.07518"},"observation_digest":"sha256:f4a279c3ccdc2c13ec7f37c56aef19c20c442093a50ef4b7e2ba4d85a8c3ec66","observation_id":"117371bc-87f1-486e-a6d4-b5027cdfda2b","resolution":{"observed_at":"2026-05-11T07:21:00.745050Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2604.09757","last_updated":"2026-07-19T04:58:08Z","snapshot_observed_at":"2026-08-14T07:00:07.053522Z","submitted_at":"2026-04-10T16:03:03Z","title":"MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:03:14.408704Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2604.09757"},"observation_digest":"sha256:6fef767dbdfe52d6fd0f51ffe4ef06199aca7dc6d3f147da6b273545fe23b8e0","observation_id":"0ef29106-7f0d-4c59-9e7a-af3a3bb4a19c","resolution":{"observed_at":"2026-05-11T05:35:59.528033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-08-02T16:33:55.457196Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.09757","last_updated":"2026-07-19T04:58:08Z","snapshot_observed_at":"2026-08-14T07:00:07.053522Z","submitted_at":"2026-04-10T16:03:03Z","title":"MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T16:33:55.457196Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2604.09757"},"observation_digest":"sha256:506b1a180e95d9f8ca2d2280a0259b21a98a19c9cea7e99a1e8644ac768f84d9","observation_id":"4c4725e2-eccb-4442-92bb-9d091f470937","resolution":{"observed_at":"2026-08-02T16:33:55.457196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:63a9c425ae34b5c48e69add0132a89c7491c1f42b09064d347de60a68ea4eeb8","observation_id":"f704a458-45c9-43e1-8da5-c1b1fe9776f4","resolution":{"observed_at":"2026-05-11T21:46:12.382365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T10:58:01.621488Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:c6eab5ed137e13272b1e9a0ac556ff7ab24d195cdaef44086a91bf8010169d8e","observation_id":"dff89b1a-891e-48ca-b7e3-46cb9a7a0c52","resolution":{"observed_at":"2026-05-20T10:58:13.403120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:28:21.605646Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:29345ff5598d02f330b0d3c3f80ec02418db1f3ef52a298b952d84e6ff3a51c0","observation_id":"f1b918f8-0771-4b8f-aeca-509014fe7a7c","resolution":{"observed_at":"2026-06-30T18:35:00.655979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:708198e9863a4e4d54972ee9cd831a85f3150e4bcd44303bd8c14c888bc7ed27","observation_id":"c0f0b526-4d84-449c-935b-dc8265e2006d","resolution":{"observed_at":"2026-06-29T23:14:02.204792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:fa6e084227fe5f882f1e4fd9a84c9c5b9b115d119ddddaf451fbf5fd3c2648c7","observation_id":"d66e4bf6-435c-4712-bc60-d69a1260106f","resolution":{"observed_at":"2026-06-28T19:52:36.103666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2606.04046","last_updated":"2026-06-02T07:50:56Z","snapshot_observed_at":"2026-08-13T01:57:32.886259Z","submitted_at":"2026-06-02T07:50:56Z","title":"Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:41.952330Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2606.04046"},"observation_digest":"sha256:95a15ae351e7fbd50438f5cb84d1783d8e39250aabd02d942af9fe3c0a10634e","observation_id":"34188065-5041-4a10-9a42-0215a8c9592f","resolution":{"observed_at":"2026-07-02T02:56:29.290692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2606.24233","last_updated":"2026-06-23T07:22:22Z","snapshot_observed_at":"2026-08-14T03:48:01.087852Z","submitted_at":"2026-06-23T07:22:22Z","title":"Latent Visual States for Efficient Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T00:38:11.619574Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2606.24233"},"observation_digest":"sha256:d0266af9ff2fc1bea2c2823301a6869fbc84e51fd1439415e59c49dc6e0f9baf","observation_id":"39696f71-5678-4cc6-9ead-75adaa80cd11","resolution":{"observed_at":"2026-07-04T16:29:57.273422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-13T00:44:31.615672Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:cb4e0222bd7ae970b13ad5a54efb853d58dfd6c416c3d1e49d8dbcadc338b3f5","observation_id":"ad5ce396-1ef0-4591-b632-ed4e207cee02","resolution":{"observed_at":"2026-07-04T19:20:07.270404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":"2501.05452","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-04T19:20:07.268611Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452","venue":null,"work_id":"05d227cf-e8a1-4bf7-811f-4749bb245838","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-08-13T03:40:06.714401Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:fcfd4148d272233b21afcb7610c5ede5a409aea60cdfb4a36a19f94543d5b50a","observation_id":"caddb4f2-0306-4499-9eee-e6e140c10e32","resolution":{"observed_at":"2026-07-04T15:09:55.247997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-31T14:08:11.175717Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding.arXiv preprint arXiv:2501.05452,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28225","last_updated":"2026-07-30T13:58:08Z","snapshot_observed_at":"2026-08-10T22:27:14.951869Z","submitted_at":"2026-07-30T13:58:08Z","title":"FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T14:08:11.175717Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2607.28225"},"observation_digest":"sha256:443f3d6f02e472c710dcc703448af05cd60660b9e1c39de5690f6624e34c45b3","observation_id":"8fa4e668-6590-46fe-9b7c-0c84de0cd499","resolution":{"observed_at":"2026-07-31T14:08:11.175717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05452","snapshot_observed_at":"2026-07-31T02:56:56.445550Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-10T13:40:32.070762Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:56.445550Z"},"links":{"cited_paper":"/paper/2501.05452","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:3d686326440cdac7677cf587eb039d9a88f829abd268798326755e1a42d62229","observation_id":"84d35572-6fcf-4aa5-89c6-796679fd1500","resolution":{"observed_at":"2026-07-31T02:56:56.445550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05452/citation-record","integrity":"/paper/2501.05452/integrity","json":"/paper/2501.05452/citation-record.json","paper":"/paper/2501.05452"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T21:17:02.953637Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.953637Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:b49429e93332705430b4b0db7847e1d9be561afa16095163bdfe3afe89092bfb","observation_id":"551b367e-c72b-4d5c-9396-fea8378b5a6a","resolution":{"observed_at":"2026-08-10T21:17:02.953637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.498812Z","title":"Vip- llava: Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":"391a3365-f85e-4943-bdcd-6dece8092ec5","year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.958604Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:02d7d2d192359831a249857470b3bea681559baa480bab3ba0cb2d1af3c7a9c3","observation_id":"890e7e32-0475-4032-b9ab-f5dd97917b89","resolution":{"observed_at":"2026-08-10T21:17:03.502169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.489193Z","title":"Bigtable: A distributed storage system for structured data","venue":null,"work_id":"1a75bba5-ca5e-46e5-8c12-fda784c09d3a","year":2008},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.962854Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:f52849d3b90d806816fb68e2d25436d1378f5ff5b8d3ae517427dfd43180851a","observation_id":"ae235e4b-6838-4c9c-b6bc-a9ca53e6c85f","resolution":{"observed_at":"2026-08-10T21:17:03.492745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02164","last_updated":"2020-06-14T19:14:22Z","snapshot_observed_at":"2026-08-14T04:55:53.397142Z","submitted_at":"2019-09-05T00:25:17Z","title":"TabFact: A Large-scale Dataset for Table-based Fact Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02164","snapshot_observed_at":"2026-08-10T21:17:02.966682Z","title":"Tabfact: A large-scale dataset for table-based fact verification","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.966682Z"},"links":{"cited_paper":"/paper/1909.02164","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:eb2285131c3469064b5497b1b8c0f9a6be595284a58ab1d604cd93755bb77c4b","observation_id":"1bc0f498-95fd-4cfc-9191-e03ed9842b63","resolution":{"observed_at":"2026-08-10T21:17:02.966682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07347","last_updated":"2021-05-11T23:29:14Z","snapshot_observed_at":"2026-08-14T07:34:38.154594Z","submitted_at":"2020-04-15T21:18:15Z","title":"HybridQA: A Dataset of Multi-Hop Question Answering over Tabular and Textual Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07347","snapshot_observed_at":"2026-08-10T21:17:02.970923Z","title":"Hybridqa: A dataset of multi-hop question answering over tabular and textual data","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.970923Z"},"links":{"cited_paper":"/paper/2004.07347","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:e60a486bda37cebf884e1f6a5e1cc78b257448e72726aa006def667b078ff590","observation_id":"f35a8280-5f57-40c7-be88-2dc5ef7ac549","resolution":{"observed_at":"2026-08-10T21:17:02.970923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.479273Z","title":"Visual chain- of-thought prompting for knowledge-based visual reasoning","venue":null,"work_id":"ea09bd3b-d04a-4eba-919d-7aef4617e22e","year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.975049Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:4e2a8b7eda5dc9aba05e5916540fbc9007ab9213ec5ed0371dc7d8e717039045","observation_id":"129445eb-5a02-45ef-b9d8-25ca240451ea","resolution":{"observed_at":"2026-08-10T21:17:03.483174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.469544Z","title":"Selective attention and the organization of visual information","venue":null,"work_id":"a9f349ae-67ed-40a7-86e7-e9c702bd0f5b","year":1984},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.979467Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:2ad930194ced4e2380118f44f37be14ea86a779d2a9dde7279ff6ef6dc9f148f","observation_id":"752f8bec-c5f1-4de5-ac7e-268977014af5","resolution":{"observed_at":"2026-08-10T21:17:03.473231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-10T21:17:02.983278Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.983278Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:54634f117b3c1cfdae7eaa2b3c45172049b8df1876f3c5531f4dace3eec8b005","observation_id":"fd405925-dcba-4488-a58c-c3c3c3f77105","resolution":{"observed_at":"2026-08-10T21:17:02.983278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.458567Z","title":"The cambridge structural database","venue":null,"work_id":"192ef880-80f5-4849-90e4-f8b144dcd257","year":2016},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.987743Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:cc8110e6b73574f2c3311ff5ae96bd52e70878575cb2a7914a8c4be044170d7d","observation_id":"48de0c73-444f-4ae3-9837-37c80ec70877","resolution":{"observed_at":"2026-08-10T21:17:03.462479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.447366Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":"7efaa34e-c614-497b-88ee-ed0222b7cea2","year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.991201Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:04ed48092ee450fb681c3283e8c6be4e852e306b4b9e3a76a8f0c80b7a6e4474","observation_id":"12fe13e4-b780-485f-bd09-0cacd42b10c9","resolution":{"observed_at":"2026-08-10T21:17:03.451440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16483","last_updated":"2023-11-27T15:20:23Z","snapshot_observed_at":"2026-08-13T05:16:57.408767Z","submitted_at":"2023-11-27T15:20:23Z","title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16483","snapshot_observed_at":"2026-08-10T21:17:02.994917Z","title":"Chartllama: A mul- timodal llm for chart understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.994917Z"},"links":{"cited_paper":"/paper/2311.16483","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:35e6ae3f85f678aef5123807525a44dc4bce9bf49d4099281be4139c09b5a8f5","observation_id":"aba33c52-2cba-43ff-8195-ce4c1902d980","resolution":{"observed_at":"2026-08-10T21:17:02.994917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.436385Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"6a4872da-cf1d-497f-b4e0-e19361c698e9","year":2022},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:02.999001Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:93bc6bbfb8ffe926d78aa946c35e9feae25c40189adf33bba842876aa3332be1","observation_id":"c03a0a0e-a2ae-40c3-b22c-1bdda52436ff","resolution":{"observed_at":"2026-08-10T21:17:03.440185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-14T17:55:53.596756Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-10T21:17:03.002283Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multi- modal language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.002283Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:222fb8c550f4f41a55d580b1b0be072a0eebe65d5c406d8830c9eb7dc04cc803","observation_id":"6accc76a-4a80-4525-a1cb-aae5763a6e31","resolution":{"observed_at":"2026-08-10T21:17:03.002283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.425404Z","title":"Selective attention","venue":null,"work_id":"59972212-d648-4c9b-8d38-cbb08fafab7e","year":1986},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.006282Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:f174461ada14fdc168fc28def52a0d115d8281ed680a3c39c8d6fc03dd30043c","observation_id":"2e4d4111-8e2e-4203-b519-db631c3aa707","resolution":{"observed_at":"2026-08-10T21:17:03.429560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.415368Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":"5ca2e9b8-d250-4045-be19-2251ea38ebd8","year":2018},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.009484Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:b42c9c9c5482723beb5f2c1a38e6f1e1e7210ce2e820b92bacbfe74f5baa77f8","observation_id":"5a1c74f1-a1ed-437f-8949-5ad9bc45fd2b","resolution":{"observed_at":"2026-08-10T21:17:03.419064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19205","last_updated":"2024-04-30T02:05:18Z","snapshot_observed_at":"2026-08-13T00:18:58.750970Z","submitted_at":"2024-04-30T02:05:18Z","title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19205","snapshot_observed_at":"2026-08-10T21:17:03.012678Z","title":"Tablevqa- bench: A visual question answering benchmark on multiple table domains","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.012678Z"},"links":{"cited_paper":"/paper/2404.19205","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:54a56202aa87884084918b21e8eaf3861baf6e88b7326b270f3f580fab42fed1","observation_id":"10d939ae-e693-44ef-a778-5f7e649cadc1","resolution":{"observed_at":"2026-08-10T21:17:03.012678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04767","last_updated":"2023-07-10T17:59:40Z","snapshot_observed_at":"2026-08-13T10:58:49.544613Z","submitted_at":"2023-07-10T17:59:40Z","title":"Semantic-SAM: Segment and Recognize Anything at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04767","snapshot_observed_at":"2026-08-10T21:17:03.016060Z","title":"Semantic-sam: Segment and recognize anything at any granu- larity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.016060Z"},"links":{"cited_paper":"/paper/2307.04767","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:4c9f1a6ead4898f8c1b0d0290d7fb3622b0dd4a36f8c3f66f4997873fd0d7425","observation_id":"fe7bad8c-76f4-4d13-b236-24af8e57085e","resolution":{"observed_at":"2026-08-10T21:17:03.016060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09662","last_updated":"2023-05-23T18:21:27Z","snapshot_observed_at":"2026-08-13T19:46:22.091811Z","submitted_at":"2022-12-19T17:44:54Z","title":"MatCha: Enhancing Visual Language Pretraining with Math Reasoning and Chart Derendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09662","snapshot_observed_at":"2026-08-10T21:17:03.019352Z","title":"Matcha: Enhancing visual language pretraining with math reasoning and chart derender- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.019352Z"},"links":{"cited_paper":"/paper/2212.09662","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:7413cf51edcb9b47502a10df9043c8a9b3d905ce6bdff7b50b3881cf9841253f","observation_id":"fd6835a0-9c66-440e-b350-7582cd28631e","resolution":{"observed_at":"2026-08-10T21:17:03.019352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.404147Z","title":"Deplot: One- shot visual language reasoning by plot-to-table translation","venue":null,"work_id":"aff7f7d5-5847-4ff3-aec7-92cd77d4b527","year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.023415Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:78af27c48711b2c217ef1cd66a11f3289eb1fe720cff80c090402cc174d3a975","observation_id":"71447ef2-9335-42e7-9fa4-9212da114fbc","resolution":{"observed_at":"2026-08-10T21:17:03.407477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.395689Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"feb2b7ca-6557-4402-8be7-eedac807adf1","year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.026969Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:c13780989d27801de7718e3a0d5a326f8ba0543a44bdb770dfaf64ba4e60167d","observation_id":"4a436c11-afc5-4582-88d6-53512bb7049b","resolution":{"observed_at":"2026-08-10T21:17:03.398857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-08-13T05:29:05.048863Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-10T21:17:03.030625Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.030625Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:3ca8d431d11bac0b52bbbe0eaff4bde739628471870e5428ee2dababd7d3e193","observation_id":"22f212fe-bd87-48cc-bd6a-979246823546","resolution":{"observed_at":"2026-08-10T21:17:03.030625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T21:17:03.034408Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.034408Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:76e4d824b2ac5a43a0f964e30e8e77d51f0a788b5e67fe05145a905a97ac6510","observation_id":"36634454-de3a-4607-9329-e070e89430c8","resolution":{"observed_at":"2026-08-10T21:17:03.034408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.385575Z","title":"Ocrbench: On the hidden mystery of ocr in large multimodal models, 2024","venue":null,"work_id":"41983269-4d91-4e95-ad53-7cf2ff57699c","year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.038132Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:c9a2ac83d0610d5601af10750b4191104ab229c9c2bda8f7b3be6c37336a05f5","observation_id":"8d041773-43db-41e4-a747-21eae5fc0896","resolution":{"observed_at":"2026-08-10T21:17:03.389605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-10T21:17:03.041529Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.041529Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:a0e8f096c51399ea14ac18afa01fe9d1ca3bb4965582a0964a5f5e79653ec2f6","observation_id":"b31274e7-bc60-47e9-9fb3-865ffedb965a","resolution":{"observed_at":"2026-08-10T21:17:03.041529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14761","last_updated":"2023-10-10T23:39:25Z","snapshot_observed_at":"2026-08-13T11:34:52.161537Z","submitted_at":"2023-05-24T06:11:17Z","title":"UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14761","snapshot_observed_at":"2026-08-10T21:17:03.045109Z","title":"Unichart: A universal vision- language pretrained model for chart comprehension and rea- soning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.045109Z"},"links":{"cited_paper":"/paper/2305.14761","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:dbf15f8f8fd6620ff70e17d00c572822a56bf64d4692ba8edfece915a89089f3","observation_id":"a5664581-51f7-4884-9d9c-5a0593773aab","resolution":{"observed_at":"2026-08-10T21:17:03.045109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.052101Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.052101Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:654f256300dce6eaa72f9f852a396f6fcad02630563daae17bcb179501c5be04","observation_id":"434f9a2e-c558-4962-8fc9-049fdb0a98f2","resolution":{"observed_at":"2026-08-10T21:17:03.052101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.00305","last_updated":"2015-08-03T02:53:01Z","snapshot_observed_at":"2026-08-14T22:37:58.869559Z","submitted_at":"2015-08-03T02:53:01Z","title":"Compositional Semantic Parsing on Semi-Structured Tables","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.00305","snapshot_observed_at":"2026-08-10T21:17:03.055546Z","title":"Compositional se- mantic parsing on semi-structured tables","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.055546Z"},"links":{"cited_paper":"/paper/1508.00305","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:3ff7d85fa0f42e06c6bd91fd71580701792fa623b8e7140cfacd873455f95d4f","observation_id":"eaab08c5-a119-467b-be8f-8388fc6fce3a","resolution":{"observed_at":"2026-08-10T21:17:03.055546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.368793Z","title":"Space and selective attention","venue":null,"work_id":"d921e0fd-eae4-4ee4-a1b3-3f0c182b2ec0","year":1994},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.059260Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:fd6a30876dca2fb85d16e3c3abc28d2d08477a76ee08650016e4807dedad5359","observation_id":"228911d1-b60e-4c00-8ea7-d7b70e3c56c7","resolution":{"observed_at":"2026-08-10T21:17:03.372547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.358324Z","title":"Visual cot: Advancing multi-modal language models with a comprehen- sive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"dfd0e78c-41fc-4166-87fe-6d109a98b042","year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.062714Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:98011183797c46b3a7c8bcf04dc498bbb14ae1a6999293951dc53ee810f98357","observation_id":"0b96053f-5827-4957-a6b3-d76a212ded52","resolution":{"observed_at":"2026-08-10T21:17:03.361969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.348098Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"ba1899f2-f15b-476f-ae5c-54f66bd5ce15","year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.066204Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:481c3a8c8774ac50bbbae284114f00f5d890f30958bdb99fa353b117a45cd273","observation_id":"2b3046a8-7b7c-4207-a61f-eaf32d4fbaf7","resolution":{"observed_at":"2026-08-10T21:17:03.351996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.338326Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"71b9e9bb-b2be-4215-85dd-0a7381b4cb83","year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.069392Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:56463ea361bc44ae90e463a8f30989f11a43f205f185c505f8738b0176f36d2b","observation_id":"96b638de-b646-417e-a14a-a74937bfeef9","resolution":{"observed_at":"2026-08-10T21:17:03.341854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T21:17:03.072991Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.072991Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:4d75b35732b9a7bb0603f5afceda03ceb709ed5c051c0551c7c8aae284df8aab","observation_id":"c1588615-5afe-4728-8fb3-8b12e9b238c5","resolution":{"observed_at":"2026-08-10T21:17:03.072991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-08-12T23:34:16.774520Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-08-10T21:17:03.076817Z","title":"Charxiv: Charting gaps in realis- tic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.076817Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:d1d23caa67c84265eee079a8023fa703eb080a2f9302a862c7987da87552ff3f","observation_id":"3db01fd5-aa86-43e9-b497-7b07c4661d31","resolution":{"observed_at":"2026-08-10T21:17:03.076817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.327542Z","title":"Chain-of- thought prompting elicits reasoning in large language models","venue":null,"work_id":"fcf8add4-510d-4785-8714-66f7d29ff257","year":2022},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.080711Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:24242624264ab13c5610f5b264d1daed215f0e1d6e3f604c846c854b2a814240","observation_id":"7019453c-5e3c-4b32-8505-c6115d5c482c","resolution":{"observed_at":"2026-08-10T21:17:03.331103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16375","last_updated":"2025-01-20T00:29:19Z","snapshot_observed_at":"2026-08-13T00:22:32.993708Z","submitted_at":"2024-04-25T07:29:17Z","title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16375","snapshot_observed_at":"2026-08-10T21:17:03.083937Z","title":"List items one by one: A new data source and learning paradigm for multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.083937Z"},"links":{"cited_paper":"/paper/2404.16375","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:fa7beac4c2077a4e50be51d181369266bca343b0f3944e8f93df56667bd20a1e","observation_id":"fc8289f2-9294-4a24-b9b1-bbdda74fc2e5","resolution":{"observed_at":"2026-08-10T21:17:03.083937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-10T21:17:03.087965Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.087965Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:26d7836bddafe03c2f7cc47912568ae0c5a4610c5705d50f2a8a3d72d134bd38","observation_id":"f8ca0e2e-60f4-44c2-9e1a-ab94a3e89909","resolution":{"observed_at":"2026-08-10T21:17:03.087965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:17:03.314997Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"2733a371-f888-4d32-b16e-d49578943655","year":2024},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.091608Z"},"links":{"citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:d34309893d28ac611154902b8ed092875b6046d80033392f3eebb757e3ecdb00","observation_id":"8aad3ddb-f5d3-4ee6-bb04-eeae1003bac4","resolution":{"observed_at":"2026-08-10T21:17:03.320375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-10T21:17:03.094988Z","title":"Multimodal chain-of-thought rea- soning in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.094988Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:5823f0152aecee5a2fc6b26035edb25806b34b9e32970b4be8fd62533c5f2efd","observation_id":"8e309efd-9dba-4b97-92e4-195337ba7a2c","resolution":{"observed_at":"2026-08-10T21:17:03.094988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.07624","last_updated":"2021-06-01T05:38:50Z","snapshot_observed_at":"2026-08-13T19:22:06.237553Z","submitted_at":"2021-05-17T06:12:06Z","title":"TAT-QA: A Question Answering Benchmark on a Hybrid of Tabular and Textual Content in Finance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.07624","snapshot_observed_at":"2026-08-10T21:17:03.098852Z","title":"id\": \"train-two_col_103562","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:17:03.098852Z"},"links":{"cited_paper":"/paper/2105.07624","citing_paper":"/paper/2501.05452"},"observation_digest":"sha256:76ac17280e7d3f9f02067a9f242abd66e5d9a7ba550bea1a2edf3e103ef58435","observation_id":"a46cecd2-4a68-4e7f-983e-da1af320d80a","resolution":{"observed_at":"2026-08-10T21:17:03.098852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.05452","last_updated":"2025-01-09T18:59:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T07:11:49.232521Z","submitted_at":"2025-01-09T18:59:58Z","title":"ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 31 inbound Pith citation observations for arXiv:2501.05452."}