{"as_of":"2026-08-12T20:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be97e0e6be542207fa8429fa356ed1da89765ee42f5645fc3526991c60483272","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:36:24.852757Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:19:03.335574Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:54:20.682844Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02368","snapshot_observed_at":"2026-08-07T13:19:03.335574Z","title":"Scimage: How good are multimodal large language models at scientific text-to-image generation?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22126","last_updated":"2025-05-28T08:51:01Z","snapshot_observed_at":"2026-08-09T20:35:08.450172Z","submitted_at":"2025-05-28T08:51:01Z","title":"SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:19:03.335574Z"},"links":{"cited_paper":"/paper/2412.02368","citing_paper":"/paper/2505.22126"},"observation_digest":"sha256:64b4ad0db100d27d7b536f102ccaa7f28546f8ed7452b99402e5255bd8610558","observation_id":"7f637f93-847b-483a-a77e-e272dc0cf8d2","resolution":{"observed_at":"2026-08-07T13:19:03.335574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"cited_work":{"arxiv_id":"2412.02368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02368","snapshot_observed_at":"2026-06-30T06:54:20.682844Z","title":"arXiv preprint arXiv:2412.02368 , year=","venue":null,"work_id":"e070508d-e5af-423f-b3b8-692eeadb9ef5","year":2024},"citing_paper":{"arxiv_id":"2604.18069","last_updated":"2026-04-20T10:37:26Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T10:37:26Z","title":"Modeling Human Perspectives with Socio-Demographic Representations","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:04.716416Z"},"links":{"cited_paper":"/paper/2412.02368","citing_paper":"/paper/2604.18069"},"observation_digest":"sha256:7c592786bba749c58f1d8e6572ef0756156f28f9041fa775ad310211fe22df46","observation_id":"0b3e74ec-ec27-4832-9a1c-3f71c099d409","resolution":{"observed_at":"2026-05-10T06:11:20.843879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"cited_work":{"arxiv_id":"2412.02368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02368","snapshot_observed_at":"2026-06-30T06:54:20.682844Z","title":"arXiv preprint arXiv:2412.02368 , year=","venue":null,"work_id":"e070508d-e5af-423f-b3b8-692eeadb9ef5","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-08-10T22:31:29.568323Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2412.02368","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:5528533f700189b0f12689342104d425b4c14f2b70d385665600245f2de37267","observation_id":"79eff9a3-0a08-4a2d-9908-10ce9e71b0e3","resolution":{"observed_at":"2026-05-11T16:11:08.840823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"cited_work":{"arxiv_id":"2412.02368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02368","snapshot_observed_at":"2026-06-30T06:54:20.682844Z","title":"arXiv preprint arXiv:2412.02368 , year=","venue":null,"work_id":"e070508d-e5af-423f-b3b8-692eeadb9ef5","year":2024},"citing_paper":{"arxiv_id":"2606.30124","last_updated":"2026-06-29T10:59:10Z","snapshot_observed_at":"2026-08-02T12:26:27.389877Z","submitted_at":"2026-06-29T10:59:10Z","title":"SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:22.594002Z"},"links":{"cited_paper":"/paper/2412.02368","citing_paper":"/paper/2606.30124"},"observation_digest":"sha256:d9e8bf70b014066dbde0b4a6472b7c8925de5ef1cbc204ff927f8a680027b127","observation_id":"ac12c993-210a-4983-a4e0-6ff6f93ff381","resolution":{"observed_at":"2026-06-30T06:54:20.684407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02368/citation-record","integrity":"/paper/2412.02368/integrity","json":"/paper/2412.02368/citation-record.json","paper":"/paper/2412.02368"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.599358Z","title":"Automatikz: Text-guided synthesis of scientific vector graphics with tikz","venue":null,"work_id":"fa43164b-409c-45ee-8a19-b0867ecb5158","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.582070Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:8722dde622f2aaf33d4c17de148105e258fe7d446821e99056c5186e119f33ad","observation_id":"c5372279-12b2-4b0a-95e3-63ce7951c627","resolution":{"observed_at":"2026-08-11T23:36:25.602380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15306","last_updated":"2024-11-06T09:49:31Z","snapshot_observed_at":"2026-08-12T09:22:55.195589Z","submitted_at":"2024-05-24T07:48:35Z","title":"DeTikZify: Synthesizing Graphics Programs for Scientific Figures and Sketches with TikZ","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15306","snapshot_observed_at":"2026-08-11T23:36:24.586355Z","title":"Detikzify: Synthesizing graphics programs for scientific figures and sketches with tikz, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.586355Z"},"links":{"cited_paper":"/paper/2405.15306","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:2e40890d9bca2595ab450bbb3ea5e73887c1773ecd75c152cb32fe3fa6ef9eae","observation_id":"661d87b5-b107-46a6-8f3e-344ef429b8df","resolution":{"observed_at":"2026-08-11T23:36:24.586355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.591511Z","title":"Scene text visual question answering","venue":null,"work_id":"ed32a50a-1465-429b-9276-5b1db55d0323","year":2019},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.589521Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:89e96553689c43b8c8e39bc432e3ce558f82bf936bbdbebc9136ce22f81be407","observation_id":"c3b372f0-0d0a-4809-bdd9-20ef8b921b47","resolution":{"observed_at":"2026-08-11T23:36:25.594425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1787/174aee8f-en","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.956209Z","title":"Elicit: Language models as research tools","venue":null,"work_id":"722f3e40-1ad9-493e-a476-152688d203cf","year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.591998Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:a30888c0bebe2f745b0b43b5a4ac8804286806926e0cda50c262a01f104f27b2","observation_id":"b8e1369e-e701-4757-b420-93dc7a76d9da","resolution":{"observed_at":"2026-08-11T23:36:24.958657Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T23:36:24.594724Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.594724Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:53b67a3d801d6a4d52823549229d02abacfd976ed677c28078ad02b208319eb6","observation_id":"c122e92b-403c-4fd4-9363-a2db1914d52b","resolution":{"observed_at":"2026-08-11T23:36:24.594724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.eval4nlp-1.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.948496Z","title":"Transformers go for the LOL s: Generating (humourous) titles from scientific abstracts end-to-end","venue":null,"work_id":"4d1927b6-03a5-46be-abc7-49610364fab8","year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.597894Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:cde0aed03d67f8a74db245062c48acf7ca48fecdbde56354e1e0b63187850cfb","observation_id":"ef81c52e-34e9-40e8-87fb-e3d08db2bbe1","resolution":{"observed_at":"2026-08-11T23:36:24.951208Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.583653Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to-image generation models","venue":null,"work_id":"5239b9a7-8d3c-4722-ab1a-d8f8009b857c","year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.600980Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:12e825c7eddf3fcd97ce96f5fd0cd7219533500165b5e7ae42bab582531ec1b9","observation_id":"70b5358e-5c68-488a-acfa-67c1e082bdc4","resolution":{"observed_at":"2026-08-11T23:36:25.586914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.603625Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.603625Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:e4e32cac36f10d1695c6585fbffa2c23c361dc7aa66f63a9593cd57cdc549753","observation_id":"0a8ae3c3-3b0d-4f63-a50a-4f3a9c678043","resolution":{"observed_at":"2026-08-11T23:36:24.603625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.571971Z","title":"Exams-v: A multi-discipline multilingual multimodal exam benchmark for evaluating vision language models","venue":null,"work_id":"6374a559-4fe2-4db3-af8d-9c3045577170","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.608636Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:8ba411c59f52beef05320cc1bf083641b126349ac6e83ecce0a0674970e29a78","observation_id":"bb9af1da-ee0c-4a7f-90fe-2960baab0669","resolution":{"observed_at":"2026-08-11T23:36:25.574864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.611608Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.611608Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:6f8dd529ba6f112ecc4bd35a54c16da5b33fe4f3890379d6a908e963d45b6429","observation_id":"07437ee4-269f-4035-b987-8e24aa871502","resolution":{"observed_at":"2026-08-11T23:36:24.611608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.614395Z","title":"The mnist database of handwritten digit images for machine learning research [best of the web]","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.614395Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:28a398bec755ccc96194859a49d5f5999800b09742a4d911a320a5a635aca4cc","observation_id":"0ed76c6a-7ea1-43c3-8341-31fa89ae0b0e","resolution":{"observed_at":"2026-08-11T23:36:24.614395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-11T23:36:24.617536Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.617536Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:65965585751c1b5e351f691aa5346d8faab6d0eb755a35c4c63b365cc1189f41","observation_id":"7945bba2-7c8f-43b0-b9c0-8be88271c234","resolution":{"observed_at":"2026-08-11T23:36:24.617536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.620687Z","title":"CLIPS core: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.620687Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:aca98c1c4f7ea57e3c692d30f4ee4e05b4c881d1a15d5cf4c88d5297d0a2c8ff","observation_id":"f787e6ca-3b28-449a-9e3d-edbaf58ea912","resolution":{"observed_at":"2026-08-11T23:36:24.620687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.623681Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.623681Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:2ff0f76faa13fcad6b81d3f359c6a2aa5981621ed2159c19152dc60e08bb7be6","observation_id":"a3b40108-ae91-4a10-8f24-37c94459b2f7","resolution":{"observed_at":"2026-08-11T23:36:24.623681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01569","last_updated":"2023-11-23T17:07:58Z","snapshot_observed_at":"2026-08-05T16:14:24.029428Z","submitted_at":"2023-05-02T16:18:11Z","title":"Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01569","snapshot_observed_at":"2026-08-11T23:36:24.626213Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.626213Z"},"links":{"cited_paper":"/paper/2305.01569","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:98727d0f1867ff1c677a351a1085a39fd7d20018ccb47427e7982676e012353f","observation_id":"afe80c1e-7d9e-4037-bd1b-ae7277da6592","resolution":{"observed_at":"2026-08-11T23:36:24.626213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.629335Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.629335Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:6facf2b93526d133da396689134d32c60911442d846840cdc840d1a5760fcbfd","observation_id":"261e4018-77df-49e3-ac78-748fb089be3a","resolution":{"observed_at":"2026-08-11T23:36:24.629335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.554980Z","title":"West, and Bill Howe","venue":null,"work_id":"7cd9b627-c99a-4fe2-b4fd-ea1fa856e6d1","year":2016},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.706202Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:b3e313b4f883ab208503d6b1973b691de0c3c897b623472b017ec246e1839940","observation_id":"56486e10-e646-4248-8dfb-7633f3915b8d","resolution":{"observed_at":"2026-08-11T23:36:25.557982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.546975Z","title":"Holistic evaluation of text-to-image models","venue":null,"work_id":"0da0dd42-0730-4ab8-a206-362b7ed339a1","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.709142Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:c5f6dccf3080250cdde98255fb9b9cc3a7da875be8e067f438b6b31e94de7999","observation_id":"c742c38a-ca43-4ae6-b5cd-3cef0c8e6df2","resolution":{"observed_at":"2026-08-11T23:36:25.549898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18528","last_updated":"2024-11-17T15:09:54Z","snapshot_observed_at":"2026-08-10T17:24:39.980138Z","submitted_at":"2024-06-26T17:56:29Z","title":"PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18528","snapshot_observed_at":"2026-08-11T23:36:24.712170Z","title":"Prexme! large scale prompt exploration of open source llms for machine translation and summarization evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.712170Z"},"links":{"cited_paper":"/paper/2406.18528","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:7bbe5aa666a229aafc1c64b6b71158ba64ac78e5437860ca6fe9b7efdbd581d3","observation_id":"4065fcbb-6140-4768-80a3-d1444fff5df0","resolution":{"observed_at":"2026-08-11T23:36:24.712170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.715531Z","title":"The E val4 NLP 2023 shared task on prompting large language models as explainable metrics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.715531Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:2649afd04bfcaf0728684cf6566669b2fa04c88676d65d419f7b45a33ae428b9","observation_id":"f5c09fb1-54bf-423b-9565-843611a298aa","resolution":{"observed_at":"2026-08-11T23:36:24.715531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-08-10T02:42:21.966875Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-08-11T23:36:24.718590Z","title":"Multimodal arxiv: A dataset for improving scientific comprehension of large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.718590Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:361d889627f26f8f5fa1913bbd02e5e31ed2b1552b7943a01209f88c8430017c","observation_id":"601ddb87-e901-45fb-aa69-054dc81ebdb7","resolution":{"observed_at":"2026-08-11T23:36:24.718590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04903","last_updated":"2025-02-20T05:57:34Z","snapshot_observed_at":"2026-08-10T02:35:48.418436Z","submitted_at":"2024-07-06T00:40:53Z","title":"MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04903","snapshot_observed_at":"2026-08-11T23:36:24.722836Z","title":"Mmsci: A dataset for graduate-level multi-discipline multimodal scientific understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.722836Z"},"links":{"cited_paper":"/paper/2407.04903","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:f4da8be5a68d1eb78df66f840b7e708d4066d59788bfb72fb1de5ea43e56dc5f","observation_id":"4eda8e9c-c886-4254-a71d-24491027ff13","resolution":{"observed_at":"2026-08-11T23:36:24.722836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.538961Z","title":null,"venue":null,"work_id":"3a2bdf90-bfb1-444f-86d6-0c1bac9b303a","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.725965Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:80a6ea6fe6b9d76d605097021db1cc22a5c16b71f14535b9f9be03f31e08cc2d","observation_id":"d7f6339b-00bf-495b-8543-e0446f83a03a","resolution":{"observed_at":"2026-08-11T23:36:25.541809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.728607Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.728607Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:04f2bf3ffeb12c464d9eb5a96e55026735073ca71aa60d2fdd092e33d2d54dca","observation_id":"6c95bd47-95a3-4194-87cb-380e7dec5d08","resolution":{"observed_at":"2026-08-11T23:36:24.728607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.25080/shinma-7f4c6e7-009","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.928209Z","title":"Figurefirst: A layout-first approach for scientific figures","venue":null,"work_id":"03ea4fac-03df-4332-866f-e06cc3bc7b73","year":2017},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.731346Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:1a4b64812dbbd9d0733bd3a06f39004c08176e6067703c619b0f25c0c9b0b9c3","observation_id":"62b7b0d7-f757-4fcd-90b3-606beac84412","resolution":{"observed_at":"2026-08-11T23:36:24.932781Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-11T23:36:24.734072Z","title":"The ai scientist: Towards fully automated open-ended scientific discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.734072Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:a93e51771b62ede45e30b7a1cf78249183a46a9d64dde2cfad3290a8dc5a26f0","observation_id":"69122b81-1fe2-49af-85bd-5b64ed6f81de","resolution":{"observed_at":"2026-08-11T23:36:24.734072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.524164Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"e3e3ee7b-f25b-4b63-a60d-f81bc13c2cdc","year":2022},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.736948Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:d75c7194daa6874ac41777fb828664c7dc8e694cabcca19a2d43f652c47b5727","observation_id":"8faf7e59-5c32-495b-abf5-dd27bb19d193","resolution":{"observed_at":"2026-08-11T23:36:25.527485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.515007Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"bebdf030-174e-44b5-85bc-3b2f167a9dec","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.739695Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:6527cc6a150519b918bac7e479f5aee473c903eb8e943034547237dfeb80a542","observation_id":"7e9585a5-dfb1-4cf9-82fa-09a236012bc5","resolution":{"observed_at":"2026-08-11T23:36:25.518354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T14:56:04.235544Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T23:36:24.742162Z","title":"SimPO : Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.742162Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:a4bf46db6a002052a15daf9977d6bcc5a09f17344768c03d838f7fe543bb8e3c","observation_id":"eb18100c-eed6-430b-a3fd-c97b21c86cb0","resolution":{"observed_at":"2026-08-11T23:36:24.742162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.744889Z","title":"State of What Art? A Call for Multi-Prompt LLM Evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.744889Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:f503376a11182077b8e9b03234154ab16c8426253ae6db85cfafd341835075ef","observation_id":"e1125bea-1dd7-4c59-a8c5-d20b99b7276f","resolution":{"observed_at":"2026-08-11T23:36:24.744889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.747047Z","title":"Evaluating large language models for structured science summarization in the open research knowledge graph","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.747047Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:b31677faded4f2ba6252e7d18e23abf12570eb7267a4a5c1423903165174cb27","observation_id":"c32e0fe4-2bdf-4e5c-b6cf-6c2597bb6c0f","resolution":{"observed_at":"2026-08-11T23:36:24.747047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.506188Z","title":"Introducing openai o1 (preview)","venue":null,"work_id":"e72ea65a-13da-4101-b4db-3999d28a67d2","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.749337Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:37defc6662bb688c65f53da67baec17005c275506d37591934326ce4a42635a2","observation_id":"f8fd8537-aa7e-47e4-8735-70dad3f503c5","resolution":{"observed_at":"2026-08-11T23:36:25.509261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-11T23:36:24.751632Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.751632Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:077a3a7bf2dead46ecdbd8ead2365ffcf9c8289145169ba22146c9882a48a4b5","observation_id":"93aa862c-c758-4532-8ab0-5fb96977256b","resolution":{"observed_at":"2026-08-11T23:36:24.751632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08807","last_updated":"2024-12-05T17:52:49Z","snapshot_observed_at":"2026-08-12T18:08:03.079140Z","submitted_at":"2024-05-14T17:54:17Z","title":"SciFIBench: Benchmarking Large Multimodal Models for Scientific Figure Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08807","snapshot_observed_at":"2026-08-11T23:36:24.754369Z","title":"Scifibench: Benchmarking large multimodal models for scientific figure interpretation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.754369Z"},"links":{"cited_paper":"/paper/2405.08807","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:ce930ba34879b7b9d3f238fbd95ab3936e7734c874d046e45d91fb64d604a08f","observation_id":"3ce14d11-9b2e-4f13-96b3-afe3728de606","resolution":{"observed_at":"2026-08-11T23:36:24.754369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.495791Z","title":"Ocr-vqgan: Taming text-within-image generation","venue":null,"work_id":"7b10dab0-2f30-485f-8f03-725dbdc4b263","year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.757290Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:32418087be7691ccef44879cde58e28c9c947f204a999501cb5289db2126d805","observation_id":"f4c579dd-bdd0-4f06-a76b-dcbcce905dd6","resolution":{"observed_at":"2026-08-11T23:36:25.500047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04251","last_updated":"2024-10-31T01:39:48Z","snapshot_observed_at":"2026-07-06T17:56:14.495769Z","submitted_at":"2024-04-05T17:57:16Z","title":"Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04251","snapshot_observed_at":"2026-08-11T23:36:24.759801Z","title":"Who evaluates the evaluations? objectively scoring text-to-image prompt coherence metrics with t2iscorescore (ts2), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.759801Z"},"links":{"cited_paper":"/paper/2404.04251","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:34687ff37f52b2c5cf85d2c6d14f0b431cdc1b9b837433d4ce5a44b324847a6a","observation_id":"a53ccde3-da8e-44e1-bcad-a2c239059785","resolution":{"observed_at":"2026-08-11T23:36:24.759801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14207","last_updated":"2024-04-08T05:38:50Z","snapshot_observed_at":"2026-08-10T06:30:53.320823Z","submitted_at":"2024-02-22T01:20:17Z","title":"Assisting in Writing Wikipedia-like Articles From Scratch with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14207","snapshot_observed_at":"2026-08-11T23:36:24.762652Z","title":"Kanell, Peter Xu, Omar Khattab, and Monica S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.762652Z"},"links":{"cited_paper":"/paper/2402.14207","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:604b353124c0de99e7386339c9173712b2248a4d75058a78eafff61dcec3fdda","observation_id":"a1c67c02-191b-4eec-ac8a-825d45a73b44","resolution":{"observed_at":"2026-08-11T23:36:24.762652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.765471Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.765471Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:bd537a1b9dd1fae11ab801c7462afcf28409dce4c6763106c83626069de79897","observation_id":"8339022e-882e-42c5-8e43-30b00e4c53fd","resolution":{"observed_at":"2026-08-11T23:36:24.765471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09961","last_updated":"2025-02-28T13:33:00Z","snapshot_observed_at":"2026-07-06T18:30:59.857334Z","submitted_at":"2024-06-14T12:10:51Z","title":"ChartMimic: Evaluating LMM's Cross-Modal Reasoning Capability via Chart-to-Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09961","snapshot_observed_at":"2026-08-11T23:36:24.768284Z","title":"Chartmimic: Evaluating lmm's cross-modal reasoning capability via chart-to-code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.768284Z"},"links":{"cited_paper":"/paper/2406.09961","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:c87d4e4b2a326fe1b8fb2497219ff47863352710bee4aa7e8cdc6d8c0fb95bac","observation_id":"8c211054-9ab3-4b9d-a2da-813c14d3d249","resolution":{"observed_at":"2026-08-11T23:36:24.768284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04109","last_updated":"2024-09-06T08:25:03Z","snapshot_observed_at":"2026-08-12T20:35:11.783927Z","submitted_at":"2024-09-06T08:25:03Z","title":"Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04109","snapshot_observed_at":"2026-08-11T23:36:24.771267Z","title":"Can llms generate novel research ideas? a large-scale human study with 100+ nlp researchers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.771267Z"},"links":{"cited_paper":"/paper/2409.04109","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:877495c287609dc42ccb088bd58079308361447f42724ed1932da5869860f7e6","observation_id":"92c77b8d-fda4-4811-ae56-944a4fcbd4ee","resolution":{"observed_at":"2026-08-11T23:36:24.771267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.485799Z","title":"Towards vqa models that can read","venue":null,"work_id":"3cffa0a2-086a-48d9-9211-13b1d4d917ad","year":2019},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.774247Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:6fcde7436e71bf4d9b5ad9b30dae1f8685dc9356f57705ba8c693f808e84b77c","observation_id":"6a9f03a6-efa5-4f09-8288-b1a2a5634fc3","resolution":{"observed_at":"2026-08-11T23:36:25.488831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T23:36:24.776853Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.776853Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:5b7975a66b8f65776a1e8726183d8aa34b4b1fcc0e2fa9ff5a58c790ae7b1c1f","observation_id":"652b5bc1-f02f-4ac5-8b8b-675c166aaf60","resolution":{"observed_at":"2026-08-11T23:36:24.776853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.780407Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.780407Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:57fb600402e8c42d745df5a6e9990012612803114ed59f8b47370e10a7a7e11d","observation_id":"e10d8a00-7504-4c61-ae91-60687ef018cc","resolution":{"observed_at":"2026-08-11T23:36:24.780407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-08-11T09:47:04.717881Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-11T23:36:24.783054Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.783054Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:3e3c0db79b877847829b17b885dd0c4c7eb2028a14834712159b701bf93d4be6","observation_id":"1e37139c-7570-4237-af61-b7157016c499","resolution":{"observed_at":"2026-08-11T23:36:24.783054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T23:36:24.786161Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.786161Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:cea2472c57f3e1dabf50034bd1bbcce59cd62b22098474bf55c8ab946a8fc3eb","observation_id":"47dad0a8-ded6-4426-b2ae-bfdabd94f879","resolution":{"observed_at":"2026-08-11T23:36:24.786161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.471190Z","title":"Plots made quickly: An efficient approach for generating visualizations from natural language queries","venue":null,"work_id":"36eb9a73-e781-48e7-ad99-72175c22c582","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.789043Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:4b7760f091362859547e88c6cfd25a9f533a0cb21e8804aa446be303e5c31ed9","observation_id":"a39e7aa2-91d3-4b09-a154-17c5a68cdf70","resolution":{"observed_at":"2026-08-11T23:36:25.474081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.462917Z","title":"Contextual: Evaluating context-sensitive text-rich visual reasoning in large multimodal models","venue":null,"work_id":"9099ed32-e21f-4365-a90a-4e11400cd02d","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.791619Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:81a58b1ad4056259d3b6b2c2c5bf0edd7f10654e67aaadb01fa62b5eaac8f3a5","observation_id":"1859436c-9ba3-4901-92fc-0cacfaa5973f","resolution":{"observed_at":"2026-08-11T23:36:25.465937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.454501Z","title":"Scibench: Evaluating college-level scientific problem-solving abilities of large language models","venue":null,"work_id":"9ad5b398-0560-4010-98fd-fa150106db63","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.794196Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:8619d69d2068329fe4ed90a3355bef447695b373d78eefa4280b080f35d77e42","observation_id":"34ec3669-99c7-447b-9a7c-3238a9de9f3f","resolution":{"observed_at":"2026-08-11T23:36:25.457618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-08-12T10:23:57.226997Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-08-11T23:36:24.796788Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.796788Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:512f789cdd0926d09320c4529f46126246f4907af2dfd14a058f5a7a5efc8e33","observation_id":"f031aa26-6506-42b8-babb-7d68b49cb617","resolution":{"observed_at":"2026-08-11T23:36:24.796788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.799390Z","title":"seaborn: statistical data visualization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.799390Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:4232d21cf857ce6dd40de4aa07afe546a071cc325911966bab8331e2914a9b10","observation_id":"280d9344-caab-4daf-958c-6f8f7b06dd35","resolution":{"observed_at":"2026-08-11T23:36:24.799390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.446470Z","title":"Evaluating and analyzing relationship hallucinations in large vision-language models","venue":null,"work_id":"e2e0cbe6-c92b-4b24-bc81-08fd97aea70b","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.802121Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:014b3eacc874fb33098e4f1c22dc43c625117285b63b0f42372cd0fca6e019d5","observation_id":"96bdf0c0-9074-46f8-87a8-f9e5f2768fa0","resolution":{"observed_at":"2026-08-11T23:36:25.449624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1375.32813","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.138068Z","title":"An automatic graph generation method for scholarly papers based on table structure analysis","venue":null,"work_id":"a7ec988d-6592-44c9-aecc-5586c901721f","year":2018},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.804221Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:b7573f33d605ae019daf09c793d5e1e49ad39c3c7d33c678eeb77bcc33f21b4e","observation_id":"804bfb6d-e949-4db8-9e41-b897d6bfa0fc","resolution":{"observed_at":"2026-08-11T23:36:25.142576Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.438058Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi","venue":null,"work_id":"dc55ce81-003e-4a67-8a1c-a96cec7f0ce3","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.806384Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:c0a94f959b39009f00cd3cc2714937cbae77a494d8dc7391190da7cf7748475a","observation_id":"56badd52-6031-4f40-be3d-4bd11ee4d2ff","resolution":{"observed_at":"2026-08-11T23:36:25.441426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.808524Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.808524Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:62de5c37bf8cadb2903fabb6491ce0914800dc038c58e4de35f7c2f1f08f21b2","observation_id":"330f4ae8-8e4a-49b0-af2b-331f6281e39f","resolution":{"observed_at":"2026-08-11T23:36:24.808524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-12T16:58:06.280003Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T23:36:24.810662Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.810662Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:bde829d1c394fd1b0a4c68772aff812b5c5e2a4c60239c8b64c4c53f05d61f32","observation_id":"c5c4a680-b8d6-41f9-af77-8246d708752a","resolution":{"observed_at":"2026-08-11T23:36:24.810662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10972","last_updated":"2024-08-29T17:55:52Z","snapshot_observed_at":"2026-08-11T18:44:14.686105Z","submitted_at":"2024-07-15T17:59:55Z","title":"VGBench: Evaluating Large Language Models on Vector Graphics Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10972","snapshot_observed_at":"2026-08-11T23:36:24.813015Z","title":"Vgbench: Evaluating large language models on vector graphics understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.813015Z"},"links":{"cited_paper":"/paper/2407.10972","citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:a707518a8a0439b2c03ac810a553a64f40466ad2cd5ed78b8113933ae99e7f64","observation_id":"6efe08f8-6c48-428d-860e-93166fb6f430","resolution":{"observed_at":"2026-08-11T23:36:24.813015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.815914Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.815914Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:566b27c04aef16597026d216ad2151e5a334e8614e12d1f531dfed612d34458c","observation_id":"f83bdc48-8871-4b57-83c1-8fd35ba4ae31","resolution":{"observed_at":"2026-08-11T23:36:24.815914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.819576Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.819576Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:8310a4a544be73aafea1915f3325d329b0704348b555ae040acb7a26510a30bc","observation_id":"9f72e5de-83b8-4647-8246-9b592ddc57b3","resolution":{"observed_at":"2026-08-11T23:36:24.819576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:24.822587Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.822587Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:68406bc47e372bf5497feaa545183564cfc8baf7192b112b7176efba9e05d357","observation_id":"4b8b12fa-ce42-423d-815a-2323c93d2a44","resolution":{"observed_at":"2026-08-11T23:36:24.822587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"guideline/0000775","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:36:25.042453Z","title":"!1A Qa","venue":null,"work_id":"a2c9a546-b113-4172-b279-83516b6b65f0","year":2024},"citing_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T23:36:24.852757Z"},"links":{"citing_paper":"/paper/2412.02368"},"observation_digest":"sha256:a080a7e04fe9d0ddfefcb8181c74282bf701b6ef3133be5c25248dd538e9618f","observation_id":"b38d3007-f889-430b-b41f-c538f42b203b","resolution":{"observed_at":"2026-08-11T23:36:25.047164Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T09:23:09.314430Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":39,"verified_exact":4,"verified_fuzzy":16},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 4 inbound Pith citation observations for arXiv:2412.02368."}