{"as_of":"2026-08-07T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37db39f31ea379bd245b3d3c7ad8607f4a90b424f9a8b2a47295732e11fa03c8","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:12:32.101737Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.31212/citation-record","integrity":"/paper/2605.31212/integrity","json":"/paper/2605.31212/citation-record.json","paper":"/paper/2605.31212"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:a7b6b98cb69552d98dc84f084bb71792da31ea3ab2b4fe3682433d498517e13b","observation_id":"2bd62212-ac62-4e01-a251-6a01f61377ff","resolution":{"observed_at":"2026-06-28T23:12:46.510598Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"InForty-first Interna- tional Conference on Machine Learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:30e4bbf156cf444dcb4b58e1768dc7e23464c27a3986a4b6a85b69f6b5dc83e9","observation_id":"b4123e56-afa1-4e98-bdbf-2ea4d7300008","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"International journal of Stem education, 2:1–13","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:99ad91ecceacfd9b24992e31c73c07f0feeeea2f9245e0b565383d690ce6d3a8","observation_id":"d672b9c9-6341-43e7-a694-db9f63f4200e","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"John Hoven and Barry Garelick","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:d35542282fc50da627e9257e87a60927554f1e4a312dcc5e7540c24fb90d70ef","observation_id":"ef16ec1b-2857-4d2c-918e-ebe381ed82d6","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"Featured Certification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:e1915d5aa9cf84376888466aa554a45a59da849318037bdbcb6a0cf2bb862d01","observation_id":"bece03ae-f791-4e47-a05d-eb6c929e49fb","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"Ministry of General Education and Instruction, Re- public of South Sudan","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:5a485e717a0f0b0f4ca143d2f1f5cbb838e074c0667e5732ea1e67330eccdba9","observation_id":"2e536e8c-260d-4890-9277-919708796976","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01955","last_updated":"2026-05-01T00:57:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:59:07Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","version":3},"cited_work":{"arxiv_id":"2507.01955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01955","snapshot_observed_at":"2026-06-28T23:12:46.506585Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","venue":"cs.CV","work_id":"d5132995-7b29-49f6-bdf7-c4cc201187b0","year":2025},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"cited_paper":"/paper/2507.01955","citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:0b2b490eacb26cb967407a2c42c94199d4117b24c99df33b2276459ebc968b71","observation_id":"15d0897b-ccfe-4f79-a439-0d17abd1a35f","resolution":{"observed_at":"2026-06-28T23:12:46.508029Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-06T04:41:26.667478Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":"2402.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-07-03T20:48:56.151594Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","venue":"cs.CV","work_id":"c59c0707-68e6-4ab4-9b9f-293004398dc7","year":2024},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:e3f0f589a0ce4916866a0bac5ae1f7e623c3abe17904969a4563e1c11caa8fab","observation_id":"985f120f-c920-4c7c-ae3a-11c5d6b448a3","resolution":{"observed_at":"2026-06-28T23:12:46.513148Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":"2506.15564","doi":"10.48550/arxiv.2506.15564","metadata_source":"pith","pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o2: Improved Native Unified Multimodal Models","venue":"cs.CV","work_id":"77f00563-1ce6-4fba-9d4e-c8ce83f716ac","year":2025},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:27436fd2fd90b783ffd68473b1e60af43e0a4c76cadb4aa03b95fd8b4c48b1a0","observation_id":"33863086-c1c3-466c-b1c4-c3a011572f8b","resolution":{"observed_at":"2026-06-28T23:12:46.505173Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"Create a cartoon style image to visualize this equation:3+4=7","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:82126ebe2678f39e935027366668afc9ad3e524c656be602c631850ce0e7ca59","observation_id":"4e5cfc5c-ec8f-46b6-8332-ce4a111e244b","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:ca891f7d0f0d06c5983c6e31b25814fc1c6f0621e231c7cc4596d6f95790524b","observation_id":"33211178-dcb5-474c-9bed-44af3499055d","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:9a5e97f487112512800530aa51e8ffa3200cb36ee62e1914e6137b99898487aa","observation_id":"f2b12a3d-7efd-4760-aabf-ffb44f7a3351","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"If the prompt involve same type of objects in different color, group objects of the same color together","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:dd4ebd8f0c41f7be8ca0f5c90be671c002952d8cdd1aebdc5848a2ee67b38bf7","observation_id":"b534a410-cf84-4250-a111-220d13a8ed0f","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"If there are too many objects, you can use a top-down view as indicated in the Background prompt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:9051c0e5eb1b41a6d7513ec4c853390af6c8b1331426c19446adcab416cf0fbd","observation_id":"f5274e41-e819-4d57-ac05-8d65a97227aa","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"Example:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:234298c680a75ec5ca2202e49f49e1c3f95390e17b4fcfdadd35894f8eb35470","observation_id":"87fa670b-5a2e-44fc-85ba-682bfaa1239b","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:12:32.101737Z","title":"A short distance away, there are eight green balloons also floating","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T23:12:32.101737Z"},"links":{"citing_paper":"/paper/2605.31212"},"observation_digest":"sha256:582a67680e3e7b645c70ad1e2594523946b09bc48355d344c990fd940e3e40f5","observation_id":"55115d66-1702-45fb-8801-93a5a323dde3","resolution":{"observed_at":"2026-06-28T23:12:32.101737Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.31212","last_updated":"2026-05-29T12:18:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T12:18:08Z","title":"Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2605.31212."}