{"as_of":"2026-08-09T16:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f812d838b2fabb206fa0e5a9c7b6d73c89baeb4b8baa433a7e38d52cadfef59","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:20:22.558735Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:05:13.012431Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"cited_work":{"arxiv_id":"2502.05714","doi":"10.48550/arxiv.2502.05714","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dougherty and R","venue":"ArXiv.org","work_id":"1285443c-1780-4221-8cb1-6760ae7b6d52","year":2025},"citing_paper":{"arxiv_id":"2606.01008","last_updated":"2026-05-31T04:51:27Z","snapshot_observed_at":"2026-08-07T10:38:24.939268Z","submitted_at":"2026-05-31T04:51:27Z","title":"FVSpec: Real-World Property-Based Tests as Lean Challenges","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:13.012431Z"},"links":{"cited_paper":"/paper/2502.05714","citing_paper":"/paper/2606.01008"},"observation_digest":"sha256:2a9312a3bd6f05a14594aa815dcb870480f63e4140dc015c45e48abf69897cb8","observation_id":"8b5825af-ab1a-4734-99f0-1f068be75cee","resolution":{"observed_at":"2026-06-28T17:12:24.162743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05714/citation-record","integrity":"/paper/2502.05714/integrity","json":"/paper/2502.05714/citation-record.json","paper":"/paper/2502.05714"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-08T18:20:22.514245Z","title":"Code Llama: Open Foundation Models for Code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.514245Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:92795ba5db33a6fee9ad8bf99634aee05b89a7e3dcceb3b6ed7dfbfff82276fc","observation_id":"2bdf5a32-745e-4ed2-bb03-33e0cf363d7b","resolution":{"observed_at":"2026-08-08T18:20:22.514245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00656","last_updated":"2023-10-27T12:44:32Z","snapshot_observed_at":"2026-08-07T23:33:42.816316Z","submitted_at":"2023-10-01T12:47:59Z","title":"LEGO-Prover: Neural Theorem Proving with Growing Libraries","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00656","snapshot_observed_at":"2026-08-08T18:20:22.519772Z","title":"LeanDojo: Theorem Proving with Retrieval-Augmented Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.519772Z"},"links":{"cited_paper":"/paper/2310.00656","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:08dc5c932d11d3ac136c9ecd785542b68f2b4b99fccc7b37102a18dcdb702f17","observation_id":"e2ed5352-a667-4e0d-bdb7-bada423db203","resolution":{"observed_at":"2026-08-08T18:20:22.519772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-08T18:20:22.529338Z","title":"[Dee+24] DeepSeek-AI et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.529338Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:cd46773320e5cbc21e6181b86f56dbbddc8841ebfced3aa52fa8a8a324eff843","observation_id":"3900a402-1c6f-4551-854a-ad7422fb89b0","resolution":{"observed_at":"2026-08-08T18:20:22.529338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T18:20:22.534347Z","title":"21783 [cs.AI]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.534347Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:c66eb87b7d4ba38f31f881dbb6d85c7f3bf8e095586d812e7c4040df66b7aad4","observation_id":"e1c46de1-6506-47fc-9c4d-d88503dc6464","resolution":{"observed_at":"2026-08-08T18:20:22.534347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08467","last_updated":"2024-06-12T17:53:31Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:53:31Z","title":"DafnyBench: A Benchmark for Formal Software Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08467","snapshot_observed_at":"2026-08-08T18:20:22.539045Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Lan- guage Models for Code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.539045Z"},"links":{"cited_paper":"/paper/2406.08467","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:d43e0a337882cd07aae44387de0452c2accde424f298ade36fa4953611cb940d","observation_id":"b1c27942-5e92-4b3c-a41d-e90b90ae2043","resolution":{"observed_at":"2026-08-08T18:20:22.539045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T18:20:22.543642Z","title":"Clover: Closed-loop verifiable code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.543642Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:e6b97fb8c1758e841da23a8ca44265b9250b39ba6370c8208b5592ece1a4836a","observation_id":"bbccd834-a36b-4fff-a4a6-72acc026921e","resolution":{"observed_at":"2026-08-08T18:20:22.543642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-02T14:58:44.167588Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-08T18:20:22.548525Z","title":"DeepSeek-Prover-V1.5: Har- nessing Proof Assistant Feedback for Reinforce- ment Learning and Monte-Carlo Tree Search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.548525Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:69bec47f6f50f16c5cc22bfe8d80cb8787dc020317badaadd23acb757331d8c9","observation_id":"3c559fc6-56aa-4a49-a686-c81480d1d42f","resolution":{"observed_at":"2026-08-08T18:20:22.548525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-07-06T18:18:25.746022Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-08T18:20:22.553511Z","title":"URL: https : / / arxiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.553511Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:aed2a7ef9f39da66d18eee695205226aaf3388f691926a0563c891de92498aa0","observation_id":"776b766b-eefc-400e-b66f-571f0ae33cad","resolution":{"observed_at":"2026-08-08T18:20:22.553511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13082","last_updated":"2025-08-22T16:12:45Z","snapshot_observed_at":"2026-07-06T19:18:27.644746Z","submitted_at":"2024-09-19T20:40:52Z","title":"AutoVerus: Automated Proof Generation for Rust Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13082","snapshot_observed_at":"2026-08-08T18:20:22.558735Z","title":"URL: https://arxiv.org/ abs/2409.13082","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.558735Z"},"links":{"cited_paper":"/paper/2409.13082","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:30695b8181dfd03c45eb67dd8e6edac3752352b92b80c2020ca3489b72946654","observation_id":"195d5823-d506-47d3-add2-a512adb2cbfe","resolution":{"observed_at":"2026-08-08T18:20:22.558735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09381","last_updated":"2019-05-21T17:56:02Z","snapshot_observed_at":"2026-07-06T07:54:49.110096Z","submitted_at":"2019-05-21T17:56:02Z","title":"Learning to Prove Theorems via Interacting with Proof Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09381","snapshot_observed_at":"2026-08-08T18:20:22.492751Z","title":"Learning to prove theorems via interacting with proof assistants","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":1891,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.492751Z"},"links":{"cited_paper":"/paper/1905.09381","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:e4073a73edc44dd7d4827d9c5ccf86d16b558f68ec28ed735ef155728dac2520","observation_id":"09b4de5c-6218-427a-aa9a-1f067e8ee89c","resolution":{"observed_at":"2026-08-08T18:20:22.492751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:20:22.810365Z","title":"Mining the Archive of Formal Proofs","venue":null,"work_id":"fec4d64b-9204-4e88-99f1-9f2e93584faf","year":2015},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.486469Z"},"links":{"citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:75134f1331f0f0895491e9f445a4f7e47aa1a07272c925eed67d51b6d02f7de1","observation_id":"dde48156-2f44-4ff4-ab47-205fc87ac575","resolution":{"observed_at":"2026-08-08T18:20:22.815459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08381","last_updated":"2020-06-15T13:06:29Z","snapshot_observed_at":"2026-08-09T14:26:13.197973Z","submitted_at":"2020-06-15T13:06:29Z","title":"DreamCoder: Growing generalizable, interpretable knowledge with wake-sleep Bayesian program learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.08381","snapshot_observed_at":"2026-08-08T18:20:22.498151Z","title":"URL: https : / / arxiv","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.498151Z"},"links":{"cited_paper":"/paper/2006.08381","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:ef95dd9eda8b056e6dd0e480975cb6efcddebf475503549ececcdb76ec574949","observation_id":"d2d9c1e6-329e-4ef9-b217-d6ec2760dc85","resolution":{"observed_at":"2026-08-08T18:20:22.498151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-08T18:20:22.503535Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.503535Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:1d2485dcb8dbf135119d2899ca43d2abcd86b0d45a7e15fb1efbfe03e7d38f8c","observation_id":"5f673435-009d-4a72-bf16-afe52d5b67e0","resolution":{"observed_at":"2026-08-08T18:20:22.503535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-08T18:20:22.508815Z","title":"Swe-bench: Can lan- guage models resolve real-world github issues?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.508815Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:a4e96d474fbaea832fc7975348cd2cc0c55b7bfa3007302712e57aa6a1fed413","observation_id":"b9e72d7c-0d3d-4756-8328-6f89ce593838","resolution":{"observed_at":"2026-08-08T18:20:22.508815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:20:22.791774Z","title":"google/discover/blog/ai-solves-imo-problems-at- silver-medal-level/ (visited on 10/30/2024)","venue":null,"work_id":"752a1ec1-6211-45c8-8d39-134f6b6be450","year":2024},"citing_paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T18:20:22.524655Z"},"links":{"citing_paper":"/paper/2502.05714"},"observation_digest":"sha256:df607a090bdc12ef639ac584ece0b26b82330c121625264e6fcfd9ebaa681a32","observation_id":"b3793567-4abc-487a-bbf6-9df12cf02119","resolution":{"observed_at":"2026-08-08T18:20:22.799322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05714","last_updated":"2025-02-08T22:54:58Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-09T14:26:22.603712Z","submitted_at":"2025-02-08T22:54:58Z","title":"Proving the Coding Interview: A Benchmark for Formally Verified Code Generation"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2502.05714."}