{"as_of":"2026-08-03T06:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05bc52e14cebc1ad5a220ea2dc45eb80d22ed620a46bd0a83c497228a2f27730","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T16:45:17.022062Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:12:23.659005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-30T12:16:12.909640Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04172","snapshot_observed_at":"2026-08-01T16:12:23.659005Z","title":"2604.04172 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18091","last_updated":"2026-07-20T15:55:33Z","snapshot_observed_at":"2026-08-01T23:55:28.672150Z","submitted_at":"2026-07-20T15:55:33Z","title":"SciForma: Structure-Faithful Generation of Scientific Diagrams","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T16:12:23.659005Z"},"links":{"cited_paper":"/paper/2604.04172","citing_paper":"/paper/2607.18091"},"observation_digest":"sha256:271e74e9cfd68af7ab12c9e8980025d36be949d5f8c9bdda7e88310e49a98454","observation_id":"079c2a9e-6acc-4a07-b591-945fb24f61b2","resolution":{"observed_at":"2026-08-01T16:12:23.659005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04172","snapshot_observed_at":"2026-07-30T12:14:15.738599Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27066","last_updated":"2026-07-29T15:54:14Z","snapshot_observed_at":"2026-08-02T20:23:45.400141Z","submitted_at":"2026-07-29T15:54:14Z","title":"SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-30T12:14:15.738599Z"},"links":{"cited_paper":"/paper/2604.04172","citing_paper":"/paper/2607.27066"},"observation_digest":"sha256:8a05cb8e91307b570fd3a701fc00b6fc881cb8d229c348a660c54b77bd7a0201","observation_id":"87fa53f8-e43c-4cdb-ae0d-e5e9fbe6fa81","resolution":{"observed_at":"2026-07-30T12:14:15.738599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2604.04172","doi":"10.48550/arxiv.2604.04172","metadata_source":"pith","pith_arxiv_id":"2604.04172","snapshot_observed_at":"2026-07-30T12:16:12.909640Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","venue":"cs.CV","work_id":"08f9841d-4147-4072-81ae-ff4360ee90c7","year":2026},"citing_paper":{"arxiv_id":"2607.27084","last_updated":"2026-07-29T16:07:44Z","snapshot_observed_at":"2026-08-02T19:22:42.901203Z","submitted_at":"2026-07-29T16:07:44Z","title":"SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-30T11:37:27.095506Z"},"links":{"cited_paper":"/paper/2604.04172","citing_paper":"/paper/2607.27084"},"observation_digest":"sha256:bc67ccf605c84a519e1f9532c0d8c622f2ee71cad8d89fefe71df4dac8a94f8c","observation_id":"39b48dcb-1e7a-4f9f-9980-a454bbd1f682","resolution":{"observed_at":"2026-07-30T11:41:21.736732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.04172/citation-record","integrity":"/paper/2604.04172/integrity","json":"/paper/2604.04172/citation-record.json","paper":"/paper/2604.04172"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ec9b45a-a643-4af1-bf51-e112f919154c","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:8154ad76202af319e40986e7c7722ae97547504ca2e67e4663483a4f47c89b2a","observation_id":"3aad4050-c983-46f0-9cdb-2582f8018c3e","resolution":{"observed_at":"2026-05-14T05:58:14.872301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22126","last_updated":"2025-05-28T08:51:01Z","snapshot_observed_at":"2026-07-06T21:32:04.296403Z","submitted_at":"2025-05-28T08:51:01Z","title":"SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model","version":1},"cited_work":{"arxiv_id":"2505.22126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22126","snapshot_observed_at":"2026-07-02T11:46:55.839322Z","title":"Kevin Zhou, and Kaipeng Zhang","venue":null,"work_id":"43e02442-5122-48a1-be81-16fc71c72268","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2505.22126","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:59cb37186c21ec1e7659e2f0f0ee70fa7e76ab694b405cd6cc26a900cdfcbb49","observation_id":"29923d39-5047-4c56-a629-c4fddb464879","resolution":{"observed_at":"2026-05-13T16:48:03.127435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02850","last_updated":"2019-06-07T00:54:53Z","snapshot_observed_at":"2026-07-06T07:58:36.769011Z","submitted_at":"2019-06-07T00:54:53Z","title":"Figure Captioning with Reasoning and Sequence-Level Training","version":1},"cited_work":{"arxiv_id":"1906.02850","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.02850","snapshot_observed_at":"2026-06-30T16:14:53.334933Z","title":"Figure Captioning with Reasoning and Sequence-Level Training","venue":"cs.CV","work_id":"ae960383-ec22-4612-960a-6cd13c80f9cb","year":2019},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/1906.02850","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:fc57457ef1c54999b6c6e7e528fa64b1143f6184b4d31842d1c4d97fdca51aaa","observation_id":"637a6ca9-398d-4514-b9a2-aa414119ae6e","resolution":{"observed_at":"2026-05-13T16:48:03.153640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bbbb119a-820b-4645-8e82-422123e764fe","year":2020},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:0ebc7f75604c9bf1af50289ad634bce13a6d958fba09692f6d165cdba4cb73a9","observation_id":"3c45bc01-ce71-4cf9-90a9-a5378ebe2afe","resolution":{"observed_at":"2026-05-14T05:58:14.856423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05134","last_updated":"2024-01-02T21:18:48Z","snapshot_observed_at":"2026-07-06T15:52:32.458556Z","submitted_at":"2023-07-11T09:23:05Z","title":"TIAM -- A Metric for Evaluating Alignment in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2307.05134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.05134","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4538bf4f-7614-4922-bced-4456d07cb8ee","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2307.05134","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:95feacf5863561a8b42ae0ad6421eee77904f85690f03288ee31bb6cd5c3cd47","observation_id":"4906e079-76c2-4fdb-bc59-428e16635311","resolution":{"observed_at":"2026-05-13T16:48:03.134881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e97dcc8-54a0-4c9b-9722-44d185d709ab","year":2020},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:bd3c328a001b207c166fbc6e648b67e154bd2c51c2ec3dbcfe3780fe9f08a681","observation_id":"9ac896bd-787d-49b9-8aa1-0384152d2871","resolution":{"observed_at":"2026-05-14T05:58:14.853550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11624","last_updated":"2021-10-25T04:37:30Z","snapshot_observed_at":"2026-07-06T12:00:35.868258Z","submitted_at":"2021-10-22T07:10:41Z","title":"SciCap: Generating Captions for Scientific Figures","version":2},"cited_work":{"arxiv_id":"2110.11624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.11624","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lee Giles, and Ting-Hao 'Kenneth' Huang","venue":null,"work_id":"82d87897-c2ab-4e8b-b33f-59fc10ce7f4f","year":2021},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2110.11624","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:ce6e18fad1acdf22f44beedb0fd18d5cfb1addf881ac580717d9165782748c53","observation_id":"aa87a366-a820-4db3-9be1-bdd36d720a5b","resolution":{"observed_at":"2026-05-13T16:48:03.157019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18248","last_updated":"2024-01-09T12:07:02Z","snapshot_observed_at":"2026-07-06T16:54:49.541291Z","submitted_at":"2023-11-30T04:43:26Z","title":"mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2311.18248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18248","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug-paperowl: Scientific diagram analysis with the multimodal large language model","venue":null,"work_id":"a6bd674a-2faa-4e10-80b4-9b6a60880d3a","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2311.18248","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:cb73dc2f068f9d48b4c59605420d5c243005696e6d8d8fe0ddec4f02240d3830","observation_id":"1a8df55f-d682-43a3-9150-19411977c5c1","resolution":{"observed_at":"2026-05-13T16:48:03.131525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:3b744d627142c5fb278e5ef6ebee80aa8d40f3de98af801155effdc57e56e1b1","observation_id":"1a663a3f-b1ac-4b2e-aa3d-8ca67ed77482","resolution":{"observed_at":"2026-05-13T16:48:03.142195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"91e8064f-5ea8-4162-83fb-79711f659570","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:6c8b2199bf9f50def26b0ec630ed6681e8f7e2c9e41f5517da9bebf4451f1d4c","observation_id":"6ea16a10-3e8f-4df2-98b2-5816654ae642","resolution":{"observed_at":"2026-05-14T05:58:14.859100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08163","last_updated":"2018-03-29T17:42:15Z","snapshot_observed_at":"2026-07-06T06:20:08.332666Z","submitted_at":"2018-01-24T19:47:04Z","title":"DVQA: Understanding Data Visualizations via Question Answering","version":2},"cited_work":{"arxiv_id":"1801.08163","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.08163","snapshot_observed_at":"2026-06-29T13:33:28.154174Z","title":"DVQA: Understanding Data Visualizations via Question Answering","venue":"cs.CV","work_id":"ba6e6b4b-f25c-4f15-97c2-eacce3bc7aef","year":2018},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/1801.08163","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:5890d878aad97ee2b22eb319c881f2364bd0652a2500a9598547fcf5692304c5","observation_id":"f9e1b439-4b0a-440e-8fe7-509dc4e9a0e0","resolution":{"observed_at":"2026-05-13T16:48:03.145919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-07-06T06:05:06.881551Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":"1710.07300","doi":"10.48550/arxiv.1710.07300","metadata_source":"pith","pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","venue":"cs.CV","work_id":"aa4d846d-b19b-47d6-b5c3-1f61acf0a6a0","year":2017},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:7d09812a4e14c4d2b009549d4cb6f6447f27aa2d283ffa41b38036782400dff8","observation_id":"57e0cd0d-85d4-4dc5-8cb7-eb0fa457a6e5","resolution":{"observed_at":"2026-05-13T16:48:03.120684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b8fadf54-9f06-4f5e-baf4-e4fd3790d440","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:2bb028b84cd0be8ec311f687c6dfba1924460f3166d8f07bf99b3562caf48366","observation_id":"36d86ebd-6a76-4eb8-bf23-5d56f63093bb","resolution":{"observed_at":"2026-05-14T05:58:14.894565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-07-06T17:37:52.514730Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.00231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-07-03T20:48:56.198380Z","title":"Multimodal arxiv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":"4af8a742-b9ce-48eb-99e6-35eb96332561","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:a333822a2dd2499f9000dd44a33f979cb4b9cdab3326894a85e048f4d29ef427","observation_id":"5ab9584a-fef9-4d1f-ba7b-4957d8e3abe5","resolution":{"observed_at":"2026-05-13T16:48:03.177074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04903","last_updated":"2025-02-20T05:57:34Z","snapshot_observed_at":"2026-07-06T18:42:14.020553Z","submitted_at":"2024-07-06T00:40:53Z","title":"MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding","version":3},"cited_work":{"arxiv_id":"2407.04903","doi":"10.48550/arxiv.2407.04903","metadata_source":"pith","pith_arxiv_id":"2407.04903","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Wilson, Woosang Lim, and William Yang Wang","venue":"cs.CL","work_id":"c3fad474-8ba8-487e-8bbb-d493d804b738","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2407.04903","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:d538d10ec14238c2856abbd7f246f0529304f0bfd25067318448237b049da742","observation_id":"4241a15d-582b-4c18-aafa-a8dd0b191c77","resolution":{"observed_at":"2026-05-13T16:48:03.187477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15997","last_updated":"2024-07-03T05:21:02Z","snapshot_observed_at":"2026-07-06T17:08:04.891015Z","submitted_at":"2023-12-26T11:01:36Z","title":"Aligning Large Language Models with Human Preferences through Representation Engineering","version":3},"cited_work":{"arxiv_id":"2312.15997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15997","snapshot_observed_at":"2026-07-02T02:06:27.143564Z","title":"Aligning large language models with human preferences through representation engineering","venue":null,"work_id":"5e4d0410-875d-4941-8f20-e4cf0c3829fb","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2312.15997","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:83a975e987ffc6aeabb49d5fa04397b08a7b5f18427948184a32fde2a61316bd","observation_id":"728949d0-95c7-4b12-8945-2e66611f446e","resolution":{"observed_at":"2026-05-13T16:48:03.173387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0c92a2d0-e051-443c-8b13-160a3342d276","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:2fcd8578416bf347fd0be62cc0d2c4c2d7ef7d7a8ca79c6dc36d2e579c1195f5","observation_id":"a68b9895-21cb-4fc4-bbda-60bd4415c2d0","resolution":{"observed_at":"2026-05-14T05:58:14.889617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8f7cf6dc-c5a5-438b-8a64-83a68a8fa1f8","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:b6338dee4cdac3273dddb406f12a0dddea250affeaa130939fa40802870a9259","observation_id":"c1c364f7-8a10-4067-b9ba-964d218cacd4","resolution":{"observed_at":"2026-05-14T05:58:14.904571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":"2112.10741","doi":"10.48550/arxiv.2112.10741","metadata_source":"pith","pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","venue":"cs.CV","work_id":"34430d19-7919-48ce-88a5-17b3bfe2192e","year":2021},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:cac5d2bec7827352f1f7772f80fd9584af92693015610bfba2e5172bff7a11dc","observation_id":"bd49d785-8948-4577-a935-5beb3f527ee1","resolution":{"observed_at":"2026-05-13T16:48:03.160299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:26.23702+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:e50adf78ae816f676d9df56f4039eae20d8fdb1f4c6345a1be823f79b64c3dd7","observation_id":"f1cfd909-86c2-4065-8e3c-e448d9621a5c","resolution":{"observed_at":"2026-05-13T16:48:03.169996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07847894-fc69-4732-9007-1013f7898f79","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:011773a0849a607be77383787a1037fbe2a6ce4ecbbad153ba32ab5ba99aedde","observation_id":"8d6ccf26-197f-4b07-a06d-602920319e59","resolution":{"observed_at":"2026-05-14T05:58:14.902116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0e27ab7-a8eb-4f0b-8576-c409c40950c8","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:5909e2627bed64f0e3bb37693e227159038ddcf79c79ba5b452fc7b90aa044b2","observation_id":"670a2808-f012-4078-851e-45ada37ec5d8","resolution":{"observed_at":"2026-05-14T05:58:14.897160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"71848786-c32e-4780-8ed6-9c5f0e314254","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:1cc2768f715284972c678dbf49e991fa4b7d3a1f41b7dd9cf2c5ca105e21b63e","observation_id":"ffe3a154-5aaf-4027-80b5-847567de1cfd","resolution":{"observed_at":"2026-05-14T05:58:14.899686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08807","last_updated":"2024-12-05T17:52:49Z","snapshot_observed_at":"2026-07-31T04:21:45.523568Z","submitted_at":"2024-05-14T17:54:17Z","title":"SciFIBench: Benchmarking Large Multimodal Models for Scientific Figure Interpretation","version":2},"cited_work":{"arxiv_id":"2405.08807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08807","snapshot_observed_at":"2026-07-02T12:26:56.360033Z","title":"arXiv preprint arXiv:2405.08807 , year=","venue":null,"work_id":"b09aef61-37b9-4692-893f-7d979ff10ae1","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2405.08807","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:366d6965be7700dfce2d6211b8f562926a006295f1e9b541dfc81cbb2ff341d3","observation_id":"6a1702af-bec8-460d-b80e-41888bc8672b","resolution":{"observed_at":"2026-05-13T16:48:03.163678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11556","last_updated":"2025-05-31T14:41:26Z","snapshot_observed_at":"2026-07-06T17:04:50.608413Z","submitted_at":"2023-12-17T08:07:32Z","title":"StarVector: Generating Scalable Vector Graphics Code from Images and Text","version":4},"cited_work":{"arxiv_id":"2312.11556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11556","snapshot_observed_at":"2026-06-30T13:54:43.813926Z","title":"Starvector: Generating scalable vector graphics code from images","venue":null,"work_id":"db6e9d70-04e5-49a6-ab05-2a102712f4d1","year":2025},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2312.11556","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:ac28c57131f8668abfcb213f9127be45629b3bfa31d0a1de53f93958233fbf00","observation_id":"99457d57-9e9b-488e-9493-2aa71d9cee3b","resolution":{"observed_at":"2026-05-13T16:48:03.166902Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11248","last_updated":"2022-10-21T18:32:27Z","snapshot_observed_at":"2026-07-06T14:08:14.508004Z","submitted_at":"2022-10-19T16:37:48Z","title":"OCR-VQGAN: Taming Text-within-Image Generation","version":2},"cited_work":{"arxiv_id":"2210.11248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.11248","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rodriguez, David Vazquez, Issam Laradji, Marco Pedersoli, and Pau Rodriguez","venue":null,"work_id":"d193b395-c5c9-4dd4-9d3a-3ab19e18c996","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2210.11248","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:9b52d96f2c50bedb34c7c15cf4464961993b9a284a80d4eff08e300d6444cccd","observation_id":"87f3003e-6cf7-43a5-9a1f-829d500ca49d","resolution":{"observed_at":"2026-05-13T16:48:03.180740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00800","last_updated":"2023-12-17T08:24:37Z","snapshot_observed_at":"2026-07-31T04:16:40.953192Z","submitted_at":"2023-06-01T15:28:41Z","title":"FigGen: Text to Scientific Figure Generation","version":3},"cited_work":{"arxiv_id":"2306.00800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.00800","snapshot_observed_at":"2026-07-04T16:39:58.010484Z","title":"Rodríguez, David Vázquez, Issam H","venue":null,"work_id":"e56d61e7-c6d9-4d43-a83c-04ce8fae95f3","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2306.00800","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:fc2cec402dcd1c41779e15d6eda7af9e87521b0796d6a8cf7b85530a6ae7e7b1","observation_id":"a2666c8e-65e4-4d7e-bc8c-bf595c51b326","resolution":{"observed_at":"2026-05-13T16:48:03.184022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:10:46.144703Z","title":null,"venue":null,"work_id":"5a4c80e0-3a6e-41cb-a841-d81932d46635","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:b2e42ee81794e576dabd63abf245e37466b26092529eff9c5ebe916241efb11d","observation_id":"8fcb09b1-f074-4784-a7d7-675820ef6211","resolution":{"observed_at":"2026-05-14T05:58:14.891982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:9f7eaf6ff070c45ea21a4d306240678f161b343002d0fb152b6e978400ac62c5","observation_id":"77b4005e-1dd4-46f5-b1b1-8be724f3edf7","resolution":{"observed_at":"2026-05-13T16:48:03.149583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"257c416a-d221-43b9-ade2-e4856f8d19ad","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:ba3be824f5a8b09af39af5f12538b401fe53db56277a88f6fc9368cc2135a62f","observation_id":"a725aeec-e143-4fca-a19f-070a6fa01b0b","resolution":{"observed_at":"2026-05-14T05:58:14.867052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"032e4deb-ff2e-4c5e-8702-ccd51e9aba78","year":2016},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:b5dd5d6b1d4e431b6df08981978d5594c02ceaba0c343f6b82fc6b0676ef9eca","observation_id":"8aeb5649-b9f0-406c-a534-cf6ff8eb1f1b","resolution":{"observed_at":"2026-05-14T05:58:14.861534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"be97f597-9cd2-4192-98bd-eacd600627d2","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:26390a292ff8f9171fbeb8ce6d73fee737ba48909c44775fbed0e487c630ac4e","observation_id":"841567f4-5b03-4a87-a5bf-e8314b9bf0e4","resolution":{"observed_at":"2026-05-14T05:58:14.884429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5a8858b0-67d0-4759-b382-3a5c3d0967ed","year":2015},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:5195c9dd201ca112ae3e5bf6ff5c742e78e01a663aa35a6cee3c4bcf692307e8","observation_id":"a2252e7b-776c-41c1-a6b9-0db6ed906358","resolution":{"observed_at":"2026-05-14T05:58:14.875150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-07-06T18:37:26.588451Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2406.18521","doi":"10.48550/arxiv.2406.18521","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":"c9b18bcb-4462-48c9-be76-491ad33d4809","year":2024},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:de2f4aaf10c64b78a567e8eaf83d9a403d205b0487dc4ae3341e7d837404bcfc","observation_id":"6d1625b7-d971-470e-97a3-00b0d46a3d21","resolution":{"observed_at":"2026-05-13T16:48:03.138494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad362c25-0f39-4695-adab-7b2d120cdcb6","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:6cbaa5013e226b97ed2dce2c209039480755e17995879218f3df23086905d324","observation_id":"e977d784-24ad-476a-aef0-f7058ec1b1fd","resolution":{"observed_at":"2026-05-14T05:58:14.887186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5335c57a-44fb-409b-abdf-242244c2032f","year":2022},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:a118dfdb246890490deaaf93aec5919b5e0ad9ac3764d27a7f3b8c8c51f9a89b","observation_id":"2098109e-c795-4eb8-a2f0-e990eeeb7b7c","resolution":{"observed_at":"2026-05-14T05:58:14.869763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03491","last_updated":"2023-06-06T08:16:16Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:16:16Z","title":"SciCap+: A Knowledge Augmented Dataset to Study the Challenges of Scientific Figure Captioning","version":1},"cited_work":{"arxiv_id":"2306.03491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03491","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c9b7cc20-5c25-4d22-81f1-0d0c3e87d8e5","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"cited_paper":"/paper/2306.03491","citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:377a8f1797d6b3efebb62c718392eab13e4b6a27fb22058be92ff194fb748399","observation_id":"73f37f0d-40e9-4022-b32b-978c601e84b5","resolution":{"observed_at":"2026-05-13T16:48:03.123892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2de0083e-afc3-4c26-915a-298ca79ccb79","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:8282e149c761ebefb110a746ad44f5bb211be92602c6b99a102112debcbfafa5","observation_id":"0b982cf7-55e5-4ecf-82bd-c1a2c83e607e","resolution":{"observed_at":"2026-05-14T05:58:14.864256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0141ebc1-dfa2-40ce-85d4-00bd41b5acc7","year":2023},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:11256dfd86bf4553d141bec4d71e731c7ac248b8fd13a2af028e688fd71d0b9c","observation_id":"d9f239f0-318a-4107-9de3-8ec44bafc90b","resolution":{"observed_at":"2026-05-14T05:58:14.877915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.23265","doi":"10.48550/arxiv.2601.23265","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"You are an expert on translating academic writing to visual specification","venue":null,"work_id":"020b32b3-5122-41a2-b48d-a6492ea7b850","year":2026},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:be14ee6829cfd96246a8cff52849c685ca6889ae693a26142510dee9b31dc551","observation_id":"83ad4aca-ed07-4ca4-be35-c520170bfa20","resolution":{"observed_at":"2026-05-13T16:48:03.115963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.044126Z","title":"Autoﬁgure: Generating and reﬁning publication-ready scientiﬁc illustrations","venue":null,"work_id":"5a2a44a6-6889-42aa-ab9b-34d8c7e30821","year":2026},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:088b3fe04ea459a8b5680da71f6f80a01760a0570d2d5199f820b8faf6864b79","observation_id":"2487533b-bfc4-4ebc-8995-757631700859","resolution":{"observed_at":"2026-05-13T16:48:03.111073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.938856Z","title":"online\" 'onlinestring :=","venue":null,"work_id":"38c07273-5071-4bbb-b2af-067af11becc7","year":null},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:9143ce668767769f6ffb35f8c6cbe720dcf7b0d2fe373c430f9691da1a4895d5","observation_id":"aaddee79-f288-4f75-8b22-6b81650df147","resolution":{"observed_at":"2026-05-14T05:58:14.881515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.963345Z","title":"write newline","venue":null,"work_id":"b6ace3ad-bd44-4a95-86ee-c7b73bd4cda2","year":null},"citing_paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T16:45:17.022062Z"},"links":{"citing_paper":"/paper/2604.04172"},"observation_digest":"sha256:6ff9aef2ee95bcdf2fe7d967f8b8ab67fa692b10cf6c66bae9205a9415e4dfaf","observation_id":"f235db4d-e6cf-4d13-9104-83fca1482a0d","resolution":{"observed_at":"2026-05-14T05:58:14.850483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.04172","last_updated":"2026-04-05T16:30:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T13:21:33.606920Z","submitted_at":"2026-04-05T16:30:21Z","title":"GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":21,"verified_fuzzy":2},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2604.04172."}