{"as_of":"2026-08-20T09:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afd0b30df582b2960915cee5d06ca1697328236bf78aae5de8657714c15f13d6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:00:10.454387Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-16T13:50:06.099874Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":2},"reference_index":229,"source":"arxiv_source","source_observed_at":"2026-05-16T18:44:49.519995Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2405.14782"},"observation_digest":"sha256:3f1396e740fd55d733eb783dfa28a6b331e3b30e95397bcd2e32640fb3283b75","observation_id":"a5a5ce5c-fedb-4db0-b1e5-5aab38d9b175","resolution":{"observed_at":"2026-05-16T18:44:49.823811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T04:48:26.303240Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2406.19314"},"observation_digest":"sha256:b1b5da80dd38f195602bf43c4254b5f94eadf31e75622256af7b6acded3a2e6c","observation_id":"b68c51b3-4b36-4ad5-a1e6-5c9a3b33c4b4","resolution":{"observed_at":"2026-05-15T04:48:26.380848Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-08-16T08:54:56.543625Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-15T00:42:11.891829Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2410.05229"},"observation_digest":"sha256:a4cd0031bac6d9580e1f553f657806981ef16b481c273e6222ed8ea084bc9015","observation_id":"bb1e3955-e78f-47d7-a156-1a631e15d31c","resolution":{"observed_at":"2026-05-15T00:42:11.994710Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-12T12:53:38.959056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16679","last_updated":"2025-05-31T11:16:44Z","snapshot_observed_at":"2026-08-16T16:36:51.621940Z","submitted_at":"2024-11-25T18:59:30Z","title":"Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts?","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T12:53:38.959056Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2411.16679"},"observation_digest":"sha256:ab5b0f920b5a42ed9c4214d35efecd9862e4e843ca34e4cb0922e8628be2c208","observation_id":"ea7c5a03-6797-486f-abab-df38a4791870","resolution":{"observed_at":"2026-08-12T12:53:38.959056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-12T05:56:43.280659Z","title":"A careful examination of large language model performance on grade school arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19799","last_updated":"2024-11-29T16:03:14Z","snapshot_observed_at":"2026-08-14T11:28:04.777011Z","submitted_at":"2024-11-29T16:03:14Z","title":"INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T05:56:43.280659Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2411.19799"},"observation_digest":"sha256:ff31423edbd01a9b17562399e66177d303208b638f9cdcf17eeba732d8944dde","observation_id":"19155c10-d286-4379-bbb4-ca907877e2ee","resolution":{"observed_at":"2026-08-12T05:56:43.280659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-11T17:34:19.737720Z","title":"A careful examination of large language model performance on grade school arithmetic, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08819","last_updated":"2024-12-11T23:31:06Z","snapshot_observed_at":"2026-08-18T08:24:01.522950Z","submitted_at":"2024-12-11T23:31:06Z","title":"HARP: A challenging human-annotated math reasoning benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:34:19.737720Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2412.08819"},"observation_digest":"sha256:ee7f07d63894dbd2b620a3779ab5ea6da4928af95a4487ddf06b4530c69afc4c","observation_id":"5d1392fc-f062-4c28-ad58-286ae3a831b5","resolution":{"observed_at":"2026-08-11T17:34:19.737720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-11T12:58:02.310224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13670","last_updated":"2025-05-29T03:19:42Z","snapshot_observed_at":"2026-08-17T16:22:04.433511Z","submitted_at":"2024-12-18T09:53:12Z","title":"AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T12:58:02.310224Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2412.13670"},"observation_digest":"sha256:5ea81b767d665736e1a4c702807d02f4428fdfda002c4ebc9190812d910cc0be","observation_id":"3e601c16-9fa5-4f2c-9195-1860ba8669e1","resolution":{"observed_at":"2026-08-11T12:58:02.310224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-11T11:36:56.402576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15194","last_updated":"2024-12-19T18:58:04Z","snapshot_observed_at":"2026-08-20T02:22:18.860708Z","submitted_at":"2024-12-19T18:58:04Z","title":"MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T11:36:56.402576Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2412.15194"},"observation_digest":"sha256:c0522c9cb9889be848bf1fceb83a262b3b345916ce6c13f0b6f05acce02b14f4","observation_id":"cd2e9f8d-ffb1-4668-ace2-09e617f8a2d7","resolution":{"observed_at":"2026-08-11T11:36:56.402576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-10T21:57:14.371302Z","title":"A careful examination of large lan- guage model performance on grade school arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03225","last_updated":"2025-04-09T17:25:07Z","snapshot_observed_at":"2026-08-20T02:22:16.232424Z","submitted_at":"2025-01-06T18:57:31Z","title":"Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:14.371302Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2501.03225"},"observation_digest":"sha256:0022b71b4da5f72d4ae085f1b2146491e2ac496ef59d8bccecd7e50ffd5cbc66","observation_id":"14a60b25-e9db-49f9-bfcd-7a075ca3dba9","resolution":{"observed_at":"2026-08-10T21:57:14.371302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-10T15:40:39.912031Z","title":"A careful examination of large language model performance on grade school arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13766","last_updated":"2025-02-25T08:15:43Z","snapshot_observed_at":"2026-08-17T18:50:10.973005Z","submitted_at":"2025-01-23T15:46:43Z","title":"UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T15:40:39.912031Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2501.13766"},"observation_digest":"sha256:d8e1d9e768d4fa2c3e415c5b8f631e3bbbc19394bff7e7ae2164d7d35d122110","observation_id":"29d7a177-961d-447e-b8a0-95c4f6d97ac3","resolution":{"observed_at":"2026-08-10T15:40:39.912031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-09T19:27:46.905311Z","title":"A careful examination of large language model performance on grade school arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00334","last_updated":"2025-06-03T07:13:03Z","snapshot_observed_at":"2026-08-16T09:58:55.263084Z","submitted_at":"2025-02-01T06:42:02Z","title":"UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-09T19:27:46.905311Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2502.00334"},"observation_digest":"sha256:25eb915c87147b5a1fd06fa39368eafadd87d1c2429203a346fc5eda05e2af0e","observation_id":"2b38f87b-4619-4d65-bd20-2c4c45f5b783","resolution":{"observed_at":"2026-08-09T19:27:46.905311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-08T15:26:07.800182Z","title":"A careful examination of large 12 MATH-Perturb: Benchmarking LLMs’ Math Reasoning Abilities against Hard Perturbations language model performance on grade school arithmetic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06453","last_updated":"2025-02-12T23:16:27Z","snapshot_observed_at":"2026-08-16T00:12:44.179679Z","submitted_at":"2025-02-10T13:31:46Z","title":"MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T15:26:07.800182Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2502.06453"},"observation_digest":"sha256:5353925b2631309707282290d1bbebe1fb6b773f330d2a5e12e27655da460878","observation_id":"cbf57a64-effd-4191-b7df-e58cf849db4e","resolution":{"observed_at":"2026-08-08T15:26:07.800182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-08T15:22:45.097354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06470","last_updated":"2025-02-10T13:50:25Z","snapshot_observed_at":"2026-08-18T02:04:40.850005Z","submitted_at":"2025-02-10T13:50:25Z","title":"A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T15:22:45.097354Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2502.06470"},"observation_digest":"sha256:31e4d4dd8e46e5974946760ff0688d56f3abc8ddd929587035fd7a68b1f9b2ec","observation_id":"0b58a3d6-b9b1-42c3-896e-a3f41e1f58e0","resolution":{"observed_at":"2026-08-08T15:22:45.097354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-08T14:11:54.680317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06990","last_updated":"2025-02-10T19:36:21Z","snapshot_observed_at":"2026-08-15T03:05:12.462935Z","submitted_at":"2025-02-10T19:36:21Z","title":"Investigating the Zone of Proximal Development of Language Models for In-Context Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T14:11:54.680317Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2502.06990"},"observation_digest":"sha256:a9078408d544d711e9846b8afcf6cd79fdb66a0f11951d4fdee6618364f616fb","observation_id":"d3e59564-af7f-40ee-bac5-de8cd31c81d3","resolution":{"observed_at":"2026-08-08T14:11:54.680317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-08T16:55:24.021886Z","title":"A careful examination of large language model performance on grade school arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2503.04756","last_updated":"2025-02-09T23:57:33Z","snapshot_observed_at":"2026-08-20T02:22:18.436281Z","submitted_at":"2025-02-09T23:57:33Z","title":"Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T16:55:24.021886Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2503.04756"},"observation_digest":"sha256:26a470857a9ab042900779eb3228a49a7e1af95db5132ceff6cf29b9b421ed6f","observation_id":"2dda6688-f56f-4220-a0f9-58efe9f38463","resolution":{"observed_at":"2026-08-08T16:55:24.021886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-15T22:00:10.454387Z","title":"A careful examination of large language model performance on grade school arithmetic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08389","last_updated":"2025-05-13T09:35:40Z","snapshot_observed_at":"2026-08-19T12:56:48.355346Z","submitted_at":"2025-05-13T09:35:40Z","title":"Towards Contamination Resistant Benchmarks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T22:00:10.454387Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2505.08389"},"observation_digest":"sha256:0b458a0869414def7c93148c2d44864acef3d7751c719a665ba3dcebd70e0e91","observation_id":"95ca64ea-383a-474a-a83e-d399c0dea817","resolution":{"observed_at":"2026-08-15T22:00:10.454387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-07T11:04:36.030597Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11080","last_updated":"2025-06-04T08:42:14Z","snapshot_observed_at":"2026-08-14T01:13:13.516591Z","submitted_at":"2025-06-04T08:42:14Z","title":"MANBench: Is Your Multimodal Model Smarter than Human?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:36.030597Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2506.11080"},"observation_digest":"sha256:b8e530bd0dca0fc7dba5b5259ba1539d045e3971d993e1aac15d040d51d9227c","observation_id":"9a2fe13c-2714-4032-b3f4-6bdb30c1446e","resolution":{"observed_at":"2026-08-07T11:04:36.030597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-07T04:16:08.467524Z","title":"Hendryx, Russell Kaplan, Michele Lunati, and Summer Yue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-15T01:54:01.275744Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.467524Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:b058b9fae8a07ba745b063cadeea731b95dcac7a4b38023886db57b27a389880","observation_id":"1925b323-2750-4627-87d1-38c89723b7df","resolution":{"observed_at":"2026-08-07T04:16:08.467524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-06T22:49:39.921570Z","title":"A careful examination of large language model performance on grade school arithmetic.arXiv preprint arXiv:2405.00332, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20664","last_updated":"2025-06-25T17:55:27Z","snapshot_observed_at":"2026-08-15T19:56:38.334549Z","submitted_at":"2025-06-25T17:55:27Z","title":"The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:39.921570Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2506.20664"},"observation_digest":"sha256:b8d9c13c7e3368d451d6205aa59499e1e357528fb603805ecd1fe4c4e26f17eb","observation_id":"2a527933-1989-482c-8436-6261da33ad6e","resolution":{"observed_at":"2026-08-06T22:49:39.921570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T13:48:53.691192Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2509.16941"},"observation_digest":"sha256:9c7d5ebd979f9a9bd0a3e6c6201b978a6b2e9bcdf0c2d4dfa66027df5af3e136","observation_id":"69e784c3-d604-4142-8de4-1b074e2caeaa","resolution":{"observed_at":"2026-05-12T13:48:53.795243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-04T07:40:11.782844Z","title":"Acarefulexaminationoflargelanguagemodelperformanceongrade school arithmetic, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.24990","last_updated":"2026-08-02T21:17:46Z","snapshot_observed_at":"2026-08-16T09:58:53.130389Z","submitted_at":"2025-10-28T21:37:35Z","title":"The Economics of AI Training Data: A Research Agenda","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T07:40:11.782844Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2510.24990"},"observation_digest":"sha256:2ae763ec0dfde75cd4c191ab3d872148756b29b0577404a4527a84d01ac96dd5","observation_id":"092b449a-b293-4b35-928f-1f367d0db27e","resolution":{"observed_at":"2026-08-04T07:40:11.782844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2604.16392","last_updated":"2026-03-28T13:29:54Z","snapshot_observed_at":"2026-08-12T18:17:39.391122Z","submitted_at":"2026-03-28T13:29:54Z","title":"RoMathExam: A Longitudinal Dataset of Romanian Math Exams (1895-2025) with a Seven-Decade Core (1957-2025)","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T22:01:21.565986Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2604.16392"},"observation_digest":"sha256:e40ccaef9e6adeac14a1228054541dbcc02ae6bb16332a0fd36cf2c700bde0b3","observation_id":"00d1a1d2-e08a-4cd7-a64c-669875314ea8","resolution":{"observed_at":"2026-05-14T22:03:02.990783Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2605.05561","last_updated":"2026-05-07T01:10:34Z","snapshot_observed_at":"2026-08-11T08:55:07.414191Z","submitted_at":"2026-05-07T01:10:34Z","title":"BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T12:01:32.816855Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2605.05561"},"observation_digest":"sha256:007c8ded9320b7a1379939a577a30a4df354611f772e208148d5ab2d22e95dc0","observation_id":"5778955a-9027-4da2-823b-f94c99130be7","resolution":{"observed_at":"2026-05-11T19:26:08.385086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2605.06865","last_updated":"2026-05-07T19:06:35Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T19:06:35Z","title":"Dataset Watermarking for Closed LLMs with Provable Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:42.185498Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2605.06865"},"observation_digest":"sha256:24bf0b63574634703ab573d4deb8ee3e68571226d9f45fd379ca13c38ddcb197","observation_id":"88bcc9df-2775-49e3-bc84-bf4f955def28","resolution":{"observed_at":"2026-05-11T05:00:57.298388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2606.03650","last_updated":"2026-06-04T10:01:47Z","snapshot_observed_at":"2026-08-11T09:05:16.100158Z","submitted_at":"2026-06-02T13:41:43Z","title":"CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T10:46:24.554332Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2606.03650"},"observation_digest":"sha256:38dcb6100fff2a7d5c88a8b36cf1bb81079df0eadf2cf6bcea469951a78a1ddf","observation_id":"d69e9fc3-e29d-429e-b78e-c04a4cf234eb","resolution":{"observed_at":"2026-07-02T02:36:27.456819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2606.22678","last_updated":"2026-06-29T19:02:41Z","snapshot_observed_at":"2026-08-13T09:05:34.084750Z","submitted_at":"2026-06-21T21:41:34Z","title":"RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T09:40:00.507836Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2606.22678"},"observation_digest":"sha256:e9a5533e223c5ff37673183e863e16d6c198d226ad7ad61092fc9bb9e3daf2c2","observation_id":"eda4d12d-5f19-484c-9152-41a6d7234b22","resolution":{"observed_at":"2026-07-04T09:39:46.928751Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2606.22678","last_updated":"2026-06-29T19:02:41Z","snapshot_observed_at":"2026-08-13T09:05:34.084750Z","submitted_at":"2026-06-21T21:41:34Z","title":"RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T07:12:07.099036Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2606.22678"},"observation_digest":"sha256:cb83db1dfa3452416aa673c8cc209de4a9134828b3fe0f80e359fec494c5f5f3","observation_id":"c6a67174-8f9e-4167-8441-651f5ae44099","resolution":{"observed_at":"2026-07-01T08:45:35.434123Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":"2405.00332","doi":"10.48550/arxiv.2405.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2405.00332 , year=","venue":"arXiv (Cornell University)","work_id":"172a8232-f346-4451-ab9a-b76d33c6c118","year":2024},"citing_paper":{"arxiv_id":"2607.00276","last_updated":"2026-06-30T23:52:15Z","snapshot_observed_at":"2026-08-14T05:45:14.918470Z","submitted_at":"2026-06-30T23:52:15Z","title":"Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-02T19:18:43.558804Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2607.00276"},"observation_digest":"sha256:c892ed6fe8933e99f101b0b21967e3ecedbe193bd6f009d54bea3888c798fbff","observation_id":"6cef796c-8357-47a6-8a42-605166c1475d","resolution":{"observed_at":"2026-07-02T19:27:18.687360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-07-30T22:39:33.984319Z","title":"{description}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.984319Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:0c654817e7cca6fb861df5952d4e6ae1d73fd22b519411cf6644e6ec41888b45","observation_id":"40289591-417c-4a50-aa07-395d7ed23850","resolution":{"observed_at":"2026-07-30T22:39:33.984319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-01T02:41:51.475326Z","title":"GSM-Symbolic/GSM1K: Are large language models actually good at arithmetic reasoning?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26102","last_updated":"2026-07-28T07:28:38Z","snapshot_observed_at":"2026-08-15T21:29:03.385060Z","submitted_at":"2026-07-28T07:28:38Z","title":"A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:41:51.475326Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2607.26102"},"observation_digest":"sha256:95f13547d9da72c431f66a728595f61b1e4095367dc0f3cf2d8b6f52a8d36c36","observation_id":"4a7da1d2-2edf-481c-8d62-2e0872c13e61","resolution":{"observed_at":"2026-08-01T02:41:51.475326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-08T04:31:04.425762Z","title":"Zeyu Zhang, Ryan Chen, and Bradly C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-18T01:26:03.163519Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.425762Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:d5e01a4fed3da16d3801aeaffd8e2a7d63c36750851d317151136c00a3c06edb","observation_id":"cf2f86c7-c6f3-492d-bfa4-9deb7ac76e34","resolution":{"observed_at":"2026-08-08T04:31:04.425762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-10T06:02:27.990201Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-17T13:25:40.395266Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.990201Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:8961f53233316369a12307e2c59dc4a39d560e05855a763ea4fcf89fa53c3932","observation_id":"b3051fb7-1264-46c2-ae22-5c473129c3d2","resolution":{"observed_at":"2026-08-10T06:02:27.990201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.00332/citation-record","integrity":"/paper/2405.00332/integrity","json":"/paper/2405.00332/citation-record.json","paper":"/paper/2405.00332"},"outbound":[],"paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2405.00332."}