{"as_of":"2026-08-07T23:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3a5851eb27062e0ccc5946692edcb58f4a7ef23a24d9acc5823b7ab6930c7af","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:05:07.629687Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:47:25.903971Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T04:48:26.303240Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2406.19314"},"observation_digest":"sha256:eb40ff4ae575f01941fd7dd2cef96c317160b88cfbdb1de07f1787f99c6d7fdb","observation_id":"da975d38-1082-4a7f-8cb6-a4ee7715d135","resolution":{"observed_at":"2026-05-15T04:48:26.488804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-15T00:42:11.891829Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2410.05229"},"observation_digest":"sha256:f76416c906d4f5780537243e10ef92c9c08b3d138fa963d90fa567bf7373324d","observation_id":"eab653d2-d2a8-4d6f-a349-0f105c367b7c","resolution":{"observed_at":"2026-05-15T00:42:12.049878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-07T13:05:07.629687Z","title":"Srivastava et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23851","last_updated":"2026-06-17T17:18:26Z","snapshot_observed_at":"2026-08-07T12:54:58.195413Z","submitted_at":"2025-05-28T23:11:14Z","title":"ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:05:07.629687Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2505.23851"},"observation_digest":"sha256:44e7d75ceae6a53aaf139eb401c137667fae328376bbe3eec07c28e684dd125f","observation_id":"f329c6bc-ee4e-4f40-a39c-393130f64d25","resolution":{"observed_at":"2026-08-07T13:05:07.629687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-06T16:58:59.669192Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12379","last_updated":"2025-07-16T16:27:50Z","snapshot_observed_at":"2026-08-06T16:44:56.057967Z","submitted_at":"2025-07-16T16:27:50Z","title":"Probing for Arithmetic Errors in Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T16:58:59.669192Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2507.12379"},"observation_digest":"sha256:ecb4476dc1f3a19974d7c36ac36ac10a38dc1452504798997ddfdca3e75ebf6e","observation_id":"3826905d-f638-4ed1-aa2b-97dc4f193be1","resolution":{"observed_at":"2026-08-06T16:58:59.669192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2509.17677","last_updated":"2026-05-02T16:35:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T12:20:27Z","title":"EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T15:08:03.793304Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2509.17677"},"observation_digest":"sha256:4a0a7c2cccb9f23ad48fb92035880e05e7914dfe63cbca0c00e6da74bccf084d","observation_id":"fac53161-6d61-45da-b0ef-7080273f2620","resolution":{"observed_at":"2026-05-18T15:11:32.703761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-07-13T08:50:52.244397Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:42.607682Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2604.06802"},"observation_digest":"sha256:2dfa684bb63cfccbca4c4b8236d71bf4a17f21a295cc23dbfa105d4c0bb3f9b7","observation_id":"ac9ef06e-0d3a-4efc-a2b4-f1446c679a46","resolution":{"observed_at":"2026-05-11T05:36:00.854306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2604.08571","last_updated":"2026-07-21T03:29:11Z","snapshot_observed_at":"2026-08-02T17:25:29.828890Z","submitted_at":"2026-03-26T22:19:33Z","title":"Robust Reasoning Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T00:06:08.545334Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2604.08571"},"observation_digest":"sha256:7f34bda1f08d21a9f2a16d1c33d860efb4a0fb6bcae6fb703d87052bac511e1d","observation_id":"36339f75-5eda-42d9-a948-c9fb76348a22","resolution":{"observed_at":"2026-05-15T00:08:21.713534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2604.08571","last_updated":"2026-07-21T03:29:11Z","snapshot_observed_at":"2026-08-02T17:25:29.828890Z","submitted_at":"2026-03-26T22:19:33Z","title":"Robust Reasoning Benchmark","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T11:18:51.642405Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2604.08571"},"observation_digest":"sha256:1e444b248a2b2fb6a1d60c0879d74c37be09303bdceb6ecb6e7afcb993995870","observation_id":"6374d269-33f9-4537-8891-e3976752897d","resolution":{"observed_at":"2026-05-22T11:21:28.862792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-02T17:25:30.907575Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08571","last_updated":"2026-07-21T03:29:11Z","snapshot_observed_at":"2026-08-02T17:25:29.828890Z","submitted_at":"2026-03-26T22:19:33Z","title":"Robust Reasoning Benchmark","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T17:25:30.907575Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2604.08571"},"observation_digest":"sha256:88bde24c08f5f00a298acd2dde77fb0d9b8286499bea9991b6fc5031a6c693c4","observation_id":"3e85165a-702b-4235-8e8b-4d0b8e12e8b4","resolution":{"observed_at":"2026-08-02T17:25:30.907575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2605.15393","last_updated":"2026-05-14T20:26:59Z","snapshot_observed_at":"2026-07-06T23:26:41.848219Z","submitted_at":"2026-05-14T20:26:59Z","title":"LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-19T16:33:30.850113Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2605.15393"},"observation_digest":"sha256:f66f327ae5cfee227c42d6d5be0fa752ef2018e5863ce0f0adc8198916bfad00","observation_id":"e40167f0-3073-4d43-b3d3-dcb104f12179","resolution":{"observed_at":"2026-05-19T16:37:40.203346Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":1},"reference_index":257,"source":"pdf_text","source_observed_at":"2026-06-27T18:39:44.696961Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:1192feb0aa83d41ec6495b7664dba218d78b8a6e837238fd3d16dd8e948c3ed2","observation_id":"730dc534-79cb-4f5f-94b6-fd545a8a024e","resolution":{"observed_at":"2026-07-02T22:47:25.905611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-02T12:05:18.483003Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":4},"reference_index":259,"source":"pdf_text","source_observed_at":"2026-08-02T12:05:18.483003Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:e10ff7175151c5bddf1110de42bcd401732b1991b2b5ca650bd6cb5a44316346","observation_id":"9f4da5cd-79e4-435b-9d6a-4608fea40c7b","resolution":{"observed_at":"2026-08-02T12:05:18.483003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2606.30182","last_updated":"2026-07-17T10:56:56Z","snapshot_observed_at":"2026-08-07T11:50:08.233604Z","submitted_at":"2026-06-29T11:57:32Z","title":"MirrorCode: AI can rebuild entire programs from behavior alone","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:32.667865Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2606.30182"},"observation_digest":"sha256:86c9f78130afc353650434a607a276e9dd345da6acee5c2c7d60269e24e7406b","observation_id":"6f402b3a-c51d-487d-ac1b-8d2bd36d255e","resolution":{"observed_at":"2026-06-30T06:44:19.704626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-02T09:35:02.975384Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap.arXiv preprint arXiv:2402.19450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30182","last_updated":"2026-07-17T10:56:56Z","snapshot_observed_at":"2026-08-07T11:50:08.233604Z","submitted_at":"2026-06-29T11:57:32Z","title":"MirrorCode: AI can rebuild entire programs from behavior alone","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T09:35:02.975384Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2606.30182"},"observation_digest":"sha256:11b57159a88b332eb70970265dba7b1dfd52f97f88a7bc2cacf555cf0f6be0c6","observation_id":"f775b9b4-0b01-49ef-b1c7-7cf72a1db984","resolution":{"observed_at":"2026-08-02T09:35:02.975384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.19450/citation-record","integrity":"/paper/2402.19450/integrity","json":"/paper/2402.19450/citation-record.json","paper":"/paper/2402.19450"},"outbound":[],"paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2402.19450."}