{"as_of":"2026-08-07T10:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5465b3e918f0cbe8ef268bc1ce7e4ffd23f5c6e5aaf50efd41c6583804ba509","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:32:16.446676Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.04514/citation-record","integrity":"/paper/2510.04514/integrity","json":"/paper/2510.04514/citation-record.json","paper":"/paper/2510.04514"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:16.076536Z","title":"• Normalize both answers carefully by checking both the <groundtruth answer> and <predicted answer>values in context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:16.076536Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:ff180c0f6911764a1ce15e6781d5bf708c0dc7b9f58b694ad642f4864263d3e9","observation_id":"60ef1053-64f9-478a-996a-ed69c7de5f2d","resolution":{"observed_at":"2026-08-04T11:32:16.076536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:16.197258Z","title":"ground_truth_filtered","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:16.197258Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:3dc52ca25ca2436dff2d7f3df094147973c7a81b42c5f3fc53d69b7ea9299c18","observation_id":"fe88b479-d16b-4cc0-aa09-2ef8d1fc4873","resolution":{"observed_at":"2026-08-04T11:32:16.197258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:16.446676Z","title":"How much higher is X than Y?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:16.446676Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:a98f0bdc479710971f22ddcf6c7bbea2357512ad28dcadb2a70f9a33bc26f488","observation_id":"2d2c7b92-dfaf-4ef0-8d19-ae06ade311f6","resolution":{"observed_at":"2026-08-04T11:32:16.446676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-04T11:32:14.675403Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:14.675403Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:96584c323199d65d741fa01895b8f902194709c1f9f16b3fba9f86c039e637b8","observation_id":"d7c817ed-9b54-469a-930d-4fa99cd3cb0f","resolution":{"observed_at":"2026-08-04T11:32:14.675403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-04T11:32:14.892848Z","title":"InInternational conference on ma- chine learning, pages 19730–19742","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:14.892848Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:79a7b592ff6ce62db1f5d290bd008e67760977378c45470b0f43e5a4f3e0502f","observation_id":"fdceb79e-7fb5-4a9b-9560-81c34931c085","resolution":{"observed_at":"2026-08-04T11:32:14.892848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-04T11:32:14.983970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:14.983970Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:f1be614953062e3254ce2bcf3c4cd6fc2277a3224dbdc2cc9f49570e75fb10de","observation_id":"fcee366a-7990-4787-8542-9bed575f0004","resolution":{"observed_at":"2026-08-04T11:32:14.983970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-07-06T17:59:00.124173Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-04T11:32:15.101569Z","title":"arXiv preprint arXiv:2404.07972","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.101569Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:3b826171d28bf4f6b95b4eb2c6c0367db9e06201f98b9a9b2629b6636d1effa8","observation_id":"07be4d4d-cc99-4fee-9539-94cc41f6ed51","resolution":{"observed_at":"2026-08-04T11:32:15.101569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-04T11:32:15.178796Z","title":"Preprint, arXiv:2408.04840","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.178796Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:693afcea5f6bdf3b2c24d5eca3a6722f939669bf3b8bcf19560476606fdd50b7","observation_id":"a095ebf5-ebae-4d08-af40-75a0eb04acbe","resolution":{"observed_at":"2026-08-04T11:32:15.178796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-04T11:32:15.292166Z","title":"thinking with images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.292166Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:8624ce5d55703d46821377b32fbde186cbdabde2974c7742775e62a91d8e58d4","observation_id":"5d46db7c-a6ee-4af3-9dd8-e3c451bd7ffb","resolution":{"observed_at":"2026-08-04T11:32:15.292166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:15.405966Z","title":"What is the value of India in 2021?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.405966Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:31bbf604f0b2d8a1173c3cf0f5168d3efd6c7f6975e98e5ca2b813e272b4c7fd","observation_id":"e9cef323-f9b7-46b6-b53b-a8834caf2566","resolution":{"observed_at":"2026-08-04T11:32:15.405966Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:15.923468Z","title":"in thousands","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.923468Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:09162c2833882b2517551aacb5b7db2d7c4d26182120e8bb38902ce36dd2a647","observation_id":"48ab2163-39e2-4acb-8237-c2e57d82b855","resolution":{"observed_at":"2026-08-04T11:32:15.923468Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:16.279348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:16.279348Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:00018542c30c52669670d9a1b28144054592ecbec3150a0bc301720299a74da3","observation_id":"0421bbad-3ea9-4f79-a6db-165245af6cf1","resolution":{"observed_at":"2026-08-04T11:32:16.279348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:16.377453Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:16.377453Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:f95e2fb733b5a87c3df2f284fe197d868205f48e821e5cd83d79bc1becf55b6a","observation_id":"dad9b0ea-790e-4c3f-9fe9-aa35b7fa9af1","resolution":{"observed_at":"2026-08-04T11:32:16.377453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:15.794019Z","title":"For segmentation tasks, we use the Segment Anything (ViT-H) (Kirillov et al.,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.794019Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:0fe8d4e6c009cccbe42af65a4fe0e3410a7e4e913beec58b9f379000dd9e1d0d","observation_id":"97be4076-f69b-424e-9617-5991f95549aa","resolution":{"observed_at":"2026-08-04T11:32:15.794019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:15.614374Z","title":"(b) Chart-specific Tools Localized the X-axis and applied pixel-to-value interpolation to compute the median from the left and right parts of the detected box of interest","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.614374Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:29de3beeb3d5a70179bdf79b7c43ee386e8e6e451373f62cb048d1d394d1af73","observation_id":"3b86e36d-fb5c-41d9-9acd-983ca0ce1de1","resolution":{"observed_at":"2026-08-04T11:32:15.614374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:15.480923Z","title":"The tools that utilize EasyOCR are the same as above","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.480923Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:1689d1e39b38aadfe5527a144ad2af2b1db921338343ab2a010214e28de91803","observation_id":"bbd06f16-89e3-4c17-9bf5-751bb1300e9e","resolution":{"observed_at":"2026-08-04T11:32:15.480923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:14.377050Z","title":"Wenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:14.377050Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:b63f317772bf564a9a33fb6d698a97d2af5a5c54366d41ee0511bfa7eba545f5","observation_id":"a96229d3-480b-4d31-9e3c-eafbbaf8dd64","resolution":{"observed_at":"2026-08-04T11:32:14.377050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-04T11:32:14.531541Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:14.531541Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:a57b2d4f24a132003b81207afbb7d973da8a477e21ace3b168e8d885fa9c7587","observation_id":"332aad73-b969-46c7-9c8e-e681d7075fdb","resolution":{"observed_at":"2026-08-04T11:32:14.531541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-04T11:32:14.317722Z","title":"https://openai.com/index/ gpt-4o-mini-advancing-cost-efficient-intelligence/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:14.317722Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:f68ed8af52f40104340aebec8034ddd3e4eedd687188a53c49e978fff33c141d","observation_id":"e51e3b83-539a-4c3f-9990-228ba536ca0d","resolution":{"observed_at":"2026-08-04T11:32:14.317722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-04T11:32:14.796214Z","title":"InICASSP 2025-2025 IEEE International Confer- ence on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:14.796214Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:1b82384b2ec366bd2e09cfcd7373d80acbbd7f30675dc5cdd5efa10a383b78e2","observation_id":"7dd154c6-d455-4066-8564-f221c43666c4","resolution":{"observed_at":"2026-08-04T11:32:14.796214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:32:15.690901Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering","version":3},"reference_index":2409,"source":"pdf_text","source_observed_at":"2026-08-04T11:32:15.690901Z"},"links":{"citing_paper":"/paper/2510.04514"},"observation_digest":"sha256:367616aa5c7e231bd0860c65e29e52817aa7f7b6d54850fc566964db3844c4f4","observation_id":"92625edb-977d-4237-b0a9-dd6fee19e61e","resolution":{"observed_at":"2026-08-04T11:32:15.690901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.04514","last_updated":"2026-06-08T20:02:58Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-04T11:32:07.464063Z","submitted_at":"2025-10-06T06:05:36Z","title":"ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2510.04514."}