{"as_of":"2026-08-06T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0bc36033dfa05ff4ca757b2778bd663a685fea92a6710f1731c648f614b6db7","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T02:04:17.888553Z","state":"measured"},{"denominator":129,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":129,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":53,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:43:44.662023Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":173,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2303.17760","last_updated":"2023-11-02T17:34:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-31T01:09:00Z","title":"CAMEL: Communicative Agents for \"Mind\" Exploration of Large Language Model Society","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T01:40:53.351795Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2303.17760"},"observation_digest":"sha256:76faf889b1eb0888fddbd24f7c806f9579c3b4800771e244b6955045163bf93c","observation_id":"40aaa769-da10-494f-a81a-6b6d410f0289","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"reference_index":289,"source":"arxiv_source","source_observed_at":"2026-05-10T23:32:59.517389Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2305.06161"},"observation_digest":"sha256:a7a1712cd26a4c197a4c5c3a89f52df13356cfae6b76ddafeefb232c26c7f908","observation_id":"48975998-ef2f-4736-aa69-c3289948a757","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.148223Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2306.11644"},"observation_digest":"sha256:5e8034700408f03b8579bb65c3608418a55b67c46f40e7c140ba1ec0bf7348b3","observation_id":"c1862457-8bd6-468d-9b75-9c5425455271","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2309.05922","last_updated":"2023-09-12T02:34:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-12T02:34:06Z","title":"A Survey of Hallucination in Large Foundation Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-16T15:21:00.778049Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2309.05922"},"observation_digest":"sha256:71055bda94974c7ab5941f2528e9a0d914fa38b6d1a1e89761f2142d2d37b3ee","observation_id":"eb0386ec-8d79-42f0-ac77-d3e6558a12d4","resolution":{"observed_at":"2026-05-16T15:21:00.858962Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-10T14:02:01.201111Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2310.06770"},"observation_digest":"sha256:21d10a21ada55d5bb9094034e68d53c420f2d18a95334bad39f0577a51e81bbb","observation_id":"9d2f60b4-ba28-4982-946b-1f55c3023fda","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"reference_index":277,"source":"arxiv_source","source_observed_at":"2026-05-10T17:34:42.565806Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2403.07974"},"observation_digest":"sha256:ac795e5fb4be8116cc07d96bf6c3084752304143a22a9060718de7565d0677c0","observation_id":"5a6e1e36-c4e9-4760-a5ae-00f9de4c00e7","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T12:45:34.286368Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2405.15793"},"observation_digest":"sha256:92dbe54696b45ea1217622b6d19726e4806a647abb19d01b3ae87b6dfbe34e35","observation_id":"11e163e2-c1d4-4f87-ab0b-4667e551c619","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:d6e3b27f72ef0f0fea72dd1fe6989c7304dbb2078e89d01a978a229d77c0ef54","observation_id":"fd5de2bb-c7be-4f87-bf34-5a3b69153488","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T02:05:18.834924Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2506.17298"},"observation_digest":"sha256:9842e7422dce99eca5997008661aed2abc5bb9ef953c12bff91a9d628b83140f","observation_id":"6282e203-731d-4d3b-b0d2-f2945b65393e","resolution":{"observed_at":"2026-05-17T02:05:18.905965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:357f71a8063354a2941f1614593c9a6f348723f6a4c382d1670c52cd850d7153","observation_id":"2b7f693b-3821-4027-8715-437ead5f5ccc","resolution":{"observed_at":"2026-05-18T01:40:42.541794Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2603.27098","last_updated":"2026-04-04T02:18:57Z","snapshot_observed_at":"2026-08-02T12:17:19.632566Z","submitted_at":"2026-03-28T02:37:36Z","title":"Ensemble-Based Uncertainty Estimation for Code Correctness Estimation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T22:52:58.524934Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2603.27098"},"observation_digest":"sha256:21c13fecd90a8cbfa502d99dbadd2a802a10f60e392c4762fffdf6327a9b2790","observation_id":"1084df84-7ec8-49a2-9561-8a9106c465bd","resolution":{"observed_at":"2026-05-14T22:53:14.056575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.10387","last_updated":"2026-04-14T15:46:10Z","snapshot_observed_at":"2026-07-06T22:59:01.129724Z","submitted_at":"2026-04-12T00:21:38Z","title":"Leveraging Mathematical Reasoning of LLMs for Efficient GPU Thread Mapping","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:35:33.392202Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.10387"},"observation_digest":"sha256:fbfe7c51dd30c8da8a85124296750c31cd983d620ce401cee85a1b750193f58d","observation_id":"3b19f78c-15fc-4996-8f17-100d027cf72e","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-05T23:10:35.381305Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:50.762366Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:aec9555e39f194f21ab15bcc59624b9e65921da48e6538e44524d6864301265c","observation_id":"218a1ff0-f3c8-40de-a319-a1d625c43278","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-03T00:19:57.865123Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-05T23:10:35.381305Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T00:19:57.865123Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:033c5680e6f3b7c459653d4cec79cf95a3fe43bca2cca3c2d457dec8f30e08f0","observation_id":"a41a87fa-1cce-4152-b285-44bacb6a7aed","resolution":{"observed_at":"2026-08-03T00:19:57.865123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.16321","last_updated":"2026-02-25T07:55:49Z","snapshot_observed_at":"2026-08-03T01:31:14.694940Z","submitted_at":"2026-02-25T07:55:49Z","title":"LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T19:52:49.324500Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.16321"},"observation_digest":"sha256:18fe3239ac3047258742fe1fca4f40d470152242341f4f39195b210431e92b87","observation_id":"a343b8f7-60d1-4bcd-bb72-1bbee37aa1fe","resolution":{"observed_at":"2026-05-15T19:56:33.755930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T05:52:28.822723Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.18473"},"observation_digest":"sha256:2f09b97d5e25a59c7f26c88d77b355ccee46535c095d6b551e39ad9a9c0d4301","observation_id":"5cb5290e-be05-415e-b994-b43b142f8936","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.19826","last_updated":"2026-04-20T14:47:46Z","snapshot_observed_at":"2026-07-06T23:06:26.596990Z","submitted_at":"2026-04-20T14:47:46Z","title":"Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T04:21:39.637962Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.19826"},"observation_digest":"sha256:7c3cf2d88190f86b39e5a9f189652e4b4a89429d554ff44dfd59b2903a9e90ea","observation_id":"3f084246-e86a-43b0-ab80-84f920b33324","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.21598","last_updated":"2026-04-28T05:10:28Z","snapshot_observed_at":"2026-07-06T23:08:10.140279Z","submitted_at":"2026-04-23T12:21:03Z","title":"You Don't Need Public Tests to Generate Correct Code","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T20:57:43.802195Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.21598"},"observation_digest":"sha256:fb010989a86a30fd03814320f8bd656138dc483c2ac8c4dbc16ad45e3b143bdd","observation_id":"8d6e07d3-3929-444d-82fe-9ce2d533683b","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.24703","last_updated":"2026-04-27T17:07:08Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:07:08Z","title":"Defective Task Descriptions in LLM-Based Code Generation: Detection and Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T03:07:06.924437Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.24703"},"observation_digest":"sha256:5bca809d6a6b76d83ef9abff6fc319ae7a90d446f1f637169a8775aeb0d80616","observation_id":"5b0dd6e1-4b21-4614-ae54-72b8f8930637","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.24712","last_updated":"2026-04-27T17:21:09Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:21:09Z","title":"When Prompt Under-Specification Improves Code Correctness: An Exploratory Study of Prompt Wording and Structure Effects on LLM-Based Code Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T03:00:26.137401Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.24712"},"observation_digest":"sha256:085d71b3ed7c903c1655e061216119db8b879dd522a9b9b0bf4ad450ee2dadc8","observation_id":"d8d67c4e-06f9-43ed-b96a-70a287891fd9","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2604.26923","last_updated":"2026-04-29T17:38:37Z","snapshot_observed_at":"2026-07-06T23:12:29.385105Z","submitted_at":"2026-04-29T17:38:37Z","title":"ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T10:33:28.276228Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2604.26923"},"observation_digest":"sha256:af79a8a16162a2a3c7172c9bd9e2648f8105cb278246ce3763d8b469afac7602","observation_id":"4ec36916-308f-4f35-8a14-a51ea3e590a6","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:02:16.598404Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.03546"},"observation_digest":"sha256:1e57a03cf98a3a7a962f82406698ba1a71f559d60fb7061396f2e10e3e5b1fa3","observation_id":"32612799-a066-49b0-b250-2d8d92b0940e","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.05267","last_updated":"2026-05-06T09:38:31Z","snapshot_observed_at":"2026-08-04T17:41:12.164736Z","submitted_at":"2026-05-06T09:38:31Z","title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T17:37:51.790000Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.05267"},"observation_digest":"sha256:fff5adbd46b3dd9066d71cd03de94a54a9790f0e3cc886297f1fdaaca9d2c9ea","observation_id":"e9240e43-6025-4883-aef6-1fe98f3715d6","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T03:34:10.370956Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:197ee1ca0586ffdc054c50eab4cdcff1643a1cc527057762d9078220c8eeabd5","observation_id":"4423ff8d-f199-4bb1-bfff-6be961c09317","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.08738","last_updated":"2026-05-18T06:29:11Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:50:35Z","title":"SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-20T23:22:51.808346Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.08738"},"observation_digest":"sha256:74b728774a234601161cc2897959cf863395915823e38c0ad742319913d627d3","observation_id":"d9bcabbb-4713-4817-b8ce-183363f209e4","resolution":{"observed_at":"2026-05-20T23:23:51.285678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.09023","last_updated":"2026-05-09T16:02:54Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T16:02:54Z","title":"Using Semantic Distance to Estimate Uncertainty in LLM-Based Code Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:07:49.789835Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.09023"},"observation_digest":"sha256:c4ebd0eacf1c7e31026d22663f7a76a9ad86c302a6a25c2e7d22928275232d31","observation_id":"760705ac-573d-4fe2-baa0-39f883d84a80","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T02:27:11.573347Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:bfd45bc48a9db85840d8da9dabec20332842885a60f452581e5913a491274f67","observation_id":"8aefd51a-7419-46f4-8b6e-86b02e2f5293","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.09059","last_updated":"2026-06-09T18:21:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:05:44Z","title":"Evaluating LLM-Generated Code: A Benchmark and Developer Study","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T22:55:49.377456Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.09059"},"observation_digest":"sha256:2517646b427ef2483afbe4a7553be0492d733e655bbbac011ef5d4d05875fa96","observation_id":"cacf0642-5b7b-4c18-9d8d-cc6fc6eec3a1","resolution":{"observed_at":"2026-07-01T13:35:46.788186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.09188","last_updated":"2026-05-09T22:05:59Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:05:59Z","title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:49.428954Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.09188"},"observation_digest":"sha256:68c930f7bad66d76ec0dbc64e5170805b64b908b40d26ba3602d5bc0625b2332","observation_id":"3cdb55f6-0bde-4d7e-b438-2ebdf4116c63","resolution":{"observed_at":"2026-05-14T02:04:18.346890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.11739","last_updated":"2026-05-21T08:50:47Z","snapshot_observed_at":"2026-08-02T09:40:14.018328Z","submitted_at":"2026-05-12T08:19:15Z","title":"Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T10:10:14.565995Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.11739"},"observation_digest":"sha256:f2efc290e77ceb7f65bd8cae0a24b2e06263560bea5f3e285499b215777763de","observation_id":"f62d2ac0-7294-439d-9d67-3408ef4d6fcc","resolution":{"observed_at":"2026-05-22T10:11:22.819039Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.15301","last_updated":"2026-05-14T18:15:09Z","snapshot_observed_at":"2026-08-02T11:57:07.030410Z","submitted_at":"2026-05-14T18:15:09Z","title":"Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T16:28:23.113976Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.15301"},"observation_digest":"sha256:22d0aa5b504d4ad93525d945b8304205d73a771a4d7f625ee05876c1ed4aaaa7","observation_id":"e5b40be9-fd56-473e-914c-dc4bdcfcb9ff","resolution":{"observed_at":"2026-05-19T16:32:39.498041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.17958","last_updated":"2026-05-18T07:12:44Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:12:44Z","title":"Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T13:13:51.081597Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.17958"},"observation_digest":"sha256:c13cd2c59da7a45f629d97b38a04a99512b1a2a5d24148a2b3a774d3f749ef87","observation_id":"bcc93a67-bab7-4d9f-8068-85a5a2621b86","resolution":{"observed_at":"2026-05-20T13:18:18.484837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.25198","last_updated":"2026-05-24T17:59:06Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:59:06Z","title":"Hide to Guide: Learning via Semantic Masking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T12:16:12.108715Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.25198"},"observation_digest":"sha256:ba33634a695dcfaf2ebd3723064e9d2e276d913b75ef3a885dc92dba1a70dd10","observation_id":"c7bf2feb-010f-4fb2-927d-d630c7e32d9c","resolution":{"observed_at":"2026-06-30T12:24:40.021889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.25773","last_updated":"2026-05-29T17:41:55Z","snapshot_observed_at":"2026-08-05T10:12:01.305102Z","submitted_at":"2026-05-25T12:23:31Z","title":"Efficient Benchmarking Is Just Feature Selection and Multiple Regression","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-29T20:20:15.314971Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.25773"},"observation_digest":"sha256:b0817e213222202c2d6ce7194c0dfdb0f444c266a2a1b4a0e1f634c1e27ac4d1","observation_id":"17f86524-7e07-495f-b44c-ccf06ace390b","resolution":{"observed_at":"2026-06-30T00:24:05.147871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2605.31268","last_updated":"2026-05-29T13:01:11Z","snapshot_observed_at":"2026-07-06T23:40:27.543522Z","submitted_at":"2026-05-29T13:01:11Z","title":"Mellum2 Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T22:58:35.397914Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2605.31268"},"observation_digest":"sha256:e567b4dd190b2a9a014d3ce0d2613869707bd969617396af8a9e8aa76fe175a0","observation_id":"25a591e1-839c-457b-8a2c-5f4f3c417a3f","resolution":{"observed_at":"2026-06-28T23:02:46.558336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2606.01066","last_updated":"2026-05-31T07:18:07Z","snapshot_observed_at":"2026-08-04T23:05:19.894656Z","submitted_at":"2026-05-31T07:18:07Z","title":"Before the Model Learns the Bug:Fuzzing RLVR Verifiers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:45:28.461939Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2606.01066"},"observation_digest":"sha256:9d871ea7fc8ae54727ff0d6741ef24ddb1dcb8432f3540bd5c41f4cd955207b2","observation_id":"fc6dd5e8-dcb0-4ed7-9f18-1d229776522b","resolution":{"observed_at":"2026-07-01T20:46:13.789220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2606.10106","last_updated":"2026-06-08T19:35:37Z","snapshot_observed_at":"2026-08-01T08:26:23.637148Z","submitted_at":"2026-06-08T19:35:37Z","title":"What makes a harness a harness: necessary and sufficient conditions for an agent harness","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:57.372858Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2606.10106"},"observation_digest":"sha256:05e62b4d35f8c099ca3ad2a289b4e05ac7c617ea22f4718b29bc9f597f97f344","observation_id":"c04cad1e-f21f-4203-b121-d643ecf823ce","resolution":{"observed_at":"2026-06-27T19:31:10.824991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2606.18487","last_updated":"2026-06-22T09:16:48Z","snapshot_observed_at":"2026-08-05T23:38:39.942175Z","submitted_at":"2026-06-16T20:59:55Z","title":"SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T01:15:18.237335Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2606.18487"},"observation_digest":"sha256:0cf7c2a006b79d19c3141e4266c8266f4f006848367fa95245371791eeee668d","observation_id":"ae850d5d-f139-45b7-b894-84f5dc478d58","resolution":{"observed_at":"2026-07-03T20:38:55.637534Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2606.28998","last_updated":"2026-06-27T16:22:22Z","snapshot_observed_at":"2026-07-07T00:03:02.476882Z","submitted_at":"2026-06-27T16:22:22Z","title":"Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T08:30:37.016856Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2606.28998"},"observation_digest":"sha256:8deb41fae3732d04ea274b7439adba3027da5e4ac52740e42287ca7c0f611424","observation_id":"4c48cefe-3cb8-4e0e-8d01-8ca8db22e6a3","resolution":{"observed_at":"2026-06-30T08:34:26.739982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2606.31159","last_updated":"2026-06-30T05:37:39Z","snapshot_observed_at":"2026-07-07T00:04:53.774826Z","submitted_at":"2026-06-30T05:37:39Z","title":"An Empirical Study of Security Calibration in Large Language Models for Code","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T05:04:41.223743Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2606.31159"},"observation_digest":"sha256:86477fbeb0d5743f0d88b94b113a74143c281950bd887c117ae9bd8781b89ea7","observation_id":"47b71b74-eb5f-4be1-8c74-7423ae7750d8","resolution":{"observed_at":"2026-07-01T10:45:43.070608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2607.00062","last_updated":"2026-06-30T10:13:12Z","snapshot_observed_at":"2026-08-02T06:54:38.268284Z","submitted_at":"2026-06-30T10:13:12Z","title":"AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T18:09:02.049387Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.00062"},"observation_digest":"sha256:060e8a66ecf4b74054eb6bcd25cf554e90a00f0cf3f418b11e88816032e962cd","observation_id":"10b6b78b-dee3-45c4-ad93-253eab5c4f9d","resolution":{"observed_at":"2026-07-02T18:47:17.127993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Is your code generated by ChatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-04T00:31:51.076294Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:952e71051d408dfc89da0b19e93d69383d5811c4dd8832c85dbd0af0f8022c7f","observation_id":"c30963ce-27fa-400e-a435-fb9881c66479","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-07-12T05:56:18.797766Z","title":"arXiv:2305.01210 [cs.SE]https://arxiv.org/abs/2305.01210","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02942","last_updated":"2026-07-03T04:28:49Z","snapshot_observed_at":"2026-08-02T20:27:55.760321Z","submitted_at":"2026-07-03T04:28:49Z","title":"A Workflow-Aware Serving Layer for Agentic Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T05:56:18.797766Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.02942"},"observation_digest":"sha256:7c51090a01e07f0cefc692984ed6f78e08f4003aac82c664070b00f12f2164dc","observation_id":"f4053761-1f3a-4636-b63e-1601cd84c74c","resolution":{"observed_at":"2026-07-12T05:56:18.797766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-07-12T01:53:44.674517Z","title":"arXiv:2305.01210","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03523","last_updated":"2026-07-03T17:51:52Z","snapshot_observed_at":"2026-08-06T04:27:25.939318Z","submitted_at":"2026-07-03T17:51:52Z","title":"Anchored Self-Play for Code Repair","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T01:53:44.674517Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.03523"},"observation_digest":"sha256:9a4991fb6b7177c2f7bcd4b011855f852d0a15d0542de0bf98db0c2b1c717cb6","observation_id":"f66b06b5-0679-41c2-8d75-dc2f0fff2168","resolution":{"observed_at":"2026-07-12T01:53:44.674517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":"2305.01210","doi":"10.48550/arxiv.2305.01210","metadata_source":"pith","pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","venue":"cs.SE","work_id":"87dbe8ba-8890-4902-b093-990f456a6b2a","year":2023},"citing_paper":{"arxiv_id":"2607.08009","last_updated":"2026-07-09T00:27:07Z","snapshot_observed_at":"2026-08-03T01:18:12.663488Z","submitted_at":"2026-07-09T00:27:07Z","title":"From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-07-10T13:49:17.343893Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.08009"},"observation_digest":"sha256:b243c441a38b998bb0211853b732e4ebbcff9360ef332d16b31100d0dc738fd2","observation_id":"74094312-599d-401f-bb68-9e6b3453759b","resolution":{"observed_at":"2026-07-10T13:57:06.725523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-01T23:50:16.078214Z","title":"Benjamin Minixhofer, Fabian Paischer, and Navid Rekabsaz","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15232","last_updated":"2026-07-16T17:32:38Z","snapshot_observed_at":"2026-08-05T12:26:35.447590Z","submitted_at":"2026-07-16T17:32:38Z","title":"In-Place Tokenizer Expansion for Pre-trained LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:50:16.078214Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.15232"},"observation_digest":"sha256:a6c768eb23972924bb11827120eb5c356aab3e1c396f9cfcbb983edd23478598","observation_id":"5acf4e6d-2eaa-4133-858a-412334be0a1d","resolution":{"observed_at":"2026-08-01T23:50:16.078214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-01T20:12:53.304097Z","title":"Is your code generated by ChatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16721","last_updated":"2026-07-18T09:17:41Z","snapshot_observed_at":"2026-08-03T09:44:31.533960Z","submitted_at":"2026-07-18T09:17:41Z","title":"Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T20:12:53.304097Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.16721"},"observation_digest":"sha256:bca7554a8d8891cd0572684299e1404f6ed27863f2caa759657f9bbc104c80e5","observation_id":"352c5c68-993b-4673-8b6d-9112cf21ede2","resolution":{"observed_at":"2026-08-01T20:12:53.304097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-01T17:28:55.320455Z","title":"arXiv:2305.01210","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17652","last_updated":"2026-07-20T08:05:03Z","snapshot_observed_at":"2026-08-05T17:35:53.860154Z","submitted_at":"2026-07-20T08:05:03Z","title":"FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T17:28:55.320455Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.17652"},"observation_digest":"sha256:69ed80d870875b14ff28b2d3244906dea5d3fb9eef079d48d0e10aa3b5c5d62a","observation_id":"72b1a9ee-8265-41f2-88a1-b21122b24e24","resolution":{"observed_at":"2026-08-01T17:28:55.320455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-01T16:24:19.522774Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18026","last_updated":"2026-07-20T14:58:53Z","snapshot_observed_at":"2026-08-04T12:31:14.531365Z","submitted_at":"2026-07-20T14:58:53Z","title":"Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T16:24:19.522774Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.18026"},"observation_digest":"sha256:e2019d5f9cbfdd20bf3324ef50ed7ae57022d398011720f987394b88b0f85508","observation_id":"95e456d9-3bab-4274-9bd1-b4de3c8cf946","resolution":{"observed_at":"2026-08-01T16:24:19.522774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-02T08:17:28.145819Z","title":"arXiv preprint arXiv:2305.01210 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21627","last_updated":"2026-07-07T22:31:23Z","snapshot_observed_at":"2026-08-05T14:59:17.282844Z","submitted_at":"2026-07-07T22:31:23Z","title":"Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T08:17:28.145819Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.21627"},"observation_digest":"sha256:4526cb5eece91ba899c7b7f14fa09de2ffa5549f1f522ad163902adac2f4709e","observation_id":"3c17ac66-529a-446f-9b63-b65ecb06dc92","resolution":{"observed_at":"2026-08-02T08:17:28.145819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-07-30T22:39:33.929232Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-06T05:40:56.247850Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.929232Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:fcb6b7c5bd15fb29af73d87798a7daef24b9fc8266513569254fd8578bf71863","observation_id":"d5732c5c-1f04-4850-ae29-5c652702d708","resolution":{"observed_at":"2026-07-30T22:39:33.929232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-04T04:39:20.562448Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02569","last_updated":"2026-08-03T17:45:58Z","snapshot_observed_at":"2026-08-06T05:41:24.399203Z","submitted_at":"2026-08-03T17:45:58Z","title":"AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T04:39:20.562448Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2608.02569"},"observation_digest":"sha256:68b21bf15361cd29b0ee794ea3298867b0186a3920a49850af09964e8f4dd9fe","observation_id":"1cebe2c6-cf26-46bc-b2f4-b44bea188bbc","resolution":{"observed_at":"2026-08-04T04:39:20.562448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-05T20:43:44.662023Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03341","last_updated":"2026-08-04T08:52:40Z","snapshot_observed_at":"2026-08-06T05:46:10.271661Z","submitted_at":"2026-08-04T08:52:40Z","title":"Route-Align-Verify for Functional Correctness in Code Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:43:44.662023Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2608.03341"},"observation_digest":"sha256:af881bb8d83110c887e9aca186127932953b2c1266422739dd4d84563f6aae0d","observation_id":"a0c3983b-7ae8-4e92-9d97-88c789f1249b","resolution":{"observed_at":"2026-08-05T20:43:44.662023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.01210/citation-record","integrity":"/paper/2305.01210/integrity","json":"/paper/2305.01210/citation-record.json","paper":"/paper/2305.01210"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ahmed and P","venue":null,"work_id":"1bb08f1e-203e-4f1f-a10c-f01969ecedb9","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:9e9db788e056d2fc47a476dae9d67ba8607349fb7001df099c4c5c8361509c07","observation_id":"f73be170-7431-4faa-88aa-b52f8eecb123","resolution":{"observed_at":"2026-05-14T02:04:18.249862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03988","last_updated":"2023-02-24T09:53:40Z","snapshot_observed_at":"2026-07-06T14:40:01.183227Z","submitted_at":"2023-01-09T10:52:35Z","title":"SantaCoder: don't reach for the stars!","version":2},"cited_work":{"arxiv_id":"2301.03988","doi":"10.48550/arxiv.2301.03988","metadata_source":"pith","pith_arxiv_id":"2301.03988","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Santacoder: don’t reach for the stars!","venue":"cs.SE","work_id":"bf393c50-a11b-4a0f-8513-52428ede71f7","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2301.03988","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:389daefed0b199cf963a4735f6ae3bd8a211dfddcb5bdac8e86038a7120a52d1","observation_id":"949efa0e-16cf-4f29-b64c-dedd88bdc79c","resolution":{"observed_at":"2026-05-14T02:04:17.938020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:35.396233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:35.396233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Austin, A","venue":null,"work_id":"214a9f12-b122-4033-8e0c-c6414d4ff463","year":2021},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:47bb1e2d09774f9973cb72d6cf27e41810bfcb58b17791ba27108416c00ef961","observation_id":"70d2ca6d-ab75-4ac0-9be2-d1ce9c2416c6","resolution":{"observed_at":"2026-05-14T02:04:18.286404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"eaf2685d-5d0e-4925-8b9a-089a989d9bae","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:2b146939bde6ed09e839159dc56283f4dc156f50a2f58e256d49ad7c48ae3f85","observation_id":"fac0f6ae-5cee-4951-8239-75706a60ae9e","resolution":{"observed_at":"2026-05-14T02:04:18.289530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Black, L","venue":null,"work_id":"7300281c-8472-4002-9d18-dd583a8986d3","year":2021},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:abc89604e3aea5913188a3189ff30608ed0d848862f7fcc87b88faa436a28fe5","observation_id":"0688b73b-8ed6-4c6e-81fd-5e830ebde207","resolution":{"observed_at":"2026-05-14T02:04:18.293002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, B","venue":null,"work_id":"c20b01b4-6073-488b-bbd5-523f804a51ca","year":1901},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:f705ff1e81ed1154a9aa9a41a9fa2b6bb661f79186ee20ea7103dac75215e534","observation_id":"7f8acf35-d4fc-4f5e-9279-5d44ed6256c9","resolution":{"observed_at":"2026-05-14T02:04:18.300747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"99ac2e56-46a4-4fbb-b1c7-5d5e7f75b223","year":1980},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:ff1a08cb02b01aa943a8e1635960e9fdf4183d93538b7dca0ab542c07e37fce2","observation_id":"411e5b4e-02c1-4a32-b650-e4c0d593166c","resolution":{"observed_at":"2026-05-14T02:04:18.304288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cadar, D","venue":null,"work_id":"569fb51b-928b-4f29-92ab-6f9f2db26e6b","year":2008},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:74cad346c6820831b80edd66a99273e03b65fff90152bf23742d6075598366b1","observation_id":"43dbb854-6b83-4772-8695-6313582d45d7","resolution":{"observed_at":"2026-05-14T02:04:18.307765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cassano, J","venue":null,"work_id":"4d759210-88e9-478c-9593-4ec1e8f2e01d","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:692f02d54618b62e33ef8c9938b356a152fffae60e5fd94a9860694cf89299b5","observation_id":"ea0550b9-7865-43a5-a0ee-027f55684d79","resolution":{"observed_at":"2026-05-14T02:04:18.311374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"98556d0b-3343-43d8-b76d-d57580512a15","year":2015},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:97375c24293984684cacc20571dde9ab96edc7f0745ae8f0be22c46530866e6d","observation_id":"01893e90-e026-4c1f-b113-5d141122aa4e","resolution":{"observed_at":"2026-05-14T02:04:18.314674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:67475b6e8bb657c5728eed1d6ebbeba0e162672aff38164052778b4be627f1a8","observation_id":"5f0de9db-4d67-41a8-ad68-edb9b52b77f3","resolution":{"observed_at":"2026-05-14T02:04:17.959701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chiang, Z","venue":null,"work_id":"2f7147d5-0ae5-436e-bc19-8f40a3c5bc3c","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:6c56640a2e7f1289b67c94875b24b3807000c5b38734589385beda08e3b8497d","observation_id":"36f78d3c-1be9-46c8-a7f6-4e08ba570ced","resolution":{"observed_at":"2026-05-14T02:04:18.327981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3dfb2707-cecc-4627-8bc4-66ce9887b142","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:302943eb1f42625cc4d77062e913ea200f87df3faf37e4e71e770df7c5fe32a4","observation_id":"c5c7688c-859a-4e68-bd0f-83cb82f2e8f8","resolution":{"observed_at":"2026-05-14T02:04:18.331053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a9196481-979f-44d3-90db-605790757c11","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:8593e77e6869a89ab0909f5ae3424b8593777ebba235c729be50ad85b6fc5242","observation_id":"6bdc79ea-ee1a-4ff4-a742-b67b9cc0f4ae","resolution":{"observed_at":"2026-05-14T02:04:18.335212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0fd3dd8-ab07-4df9-bfe1-013bd9884ba5","year":2024},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:92eed8151a8d4e4f13e34cceed631ed2789d438b58041bb940e278b595e8adb5","observation_id":"66279dc6-8d9f-4679-bc48-798242d23d7f","resolution":{"observed_at":"2026-05-14T02:04:18.339909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fauxpilot: an open-source alternative to github copilot server","venue":null,"work_id":"643ea0ba-6604-432b-bbc8-63c0c5cf157c","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:5a7f7bcdd4a73f8d1f21f5f16a03ca8d68219ac9d78d8cbbb64c64ccdd5e2fa1","observation_id":"4b45ab5c-057b-4993-a08d-37c75e5acccc","resolution":{"observed_at":"2026-05-14T02:04:18.345772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a6a9c99b-8005-4cb1-af1c-9305654a2226","year":1998},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:afaf8722a91ce1a2cc5ee192c998894c26b88cd863999b248275636390eee090","observation_id":"29418d9f-fc37-4661-aef5-bccfcfe1939a","resolution":{"observed_at":"2026-05-14T02:04:18.035645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fried, A","venue":null,"work_id":"47945de5-07e6-427a-aa4a-cb21bc224508","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:6fd1b0ee32aadd2c667c4f6f764a76b0623343bd45bd865d9bf43fe80a78068d","observation_id":"8968cd5d-a183-49fc-b36d-d7db459f9be1","resolution":{"observed_at":"2026-05-14T02:04:18.041895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dfed3604-d8b0-4c61-a246-b72a3dc4913e","year":1981},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:361ef7bfab936cad4332a1d8e6d87253a9a07cee63ba15649ca4d97493045aeb","observation_id":"17cd2fbb-21c7-4c07-9348-11938d4ad6a0","resolution":{"observed_at":"2026-05-14T02:04:18.047446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b2c99f1-24f6-4e5a-888f-6c10a113188f","year":2011},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:dfbafb6807181cf2626cb83340eecb96004e42df7a7b4c5425abd6ffb8ecb55c","observation_id":"2079d139-fe79-4d00-a935-0d345e139e9e","resolution":{"observed_at":"2026-05-14T02:04:18.053673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gulwani, O","venue":null,"work_id":"a172507d-a497-459f-a7e6-db15dded8b02","year":2017},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:0c426eb203917aea7c0f3d30c9c2cab59ef09b39c8efdbbb4ed9f7f0e69924dc","observation_id":"8bf1ae76-8faf-42f3-93c1-65f71d1bbdc3","resolution":{"observed_at":"2026-05-14T02:04:18.063338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hastie, R","venue":null,"work_id":"1379bf2b-9524-4ccd-87e5-ed8dd5c6321d","year":2009},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:02fe3f02077378091f0c24fc4793a792c76d804367396e27305c9412a35c8b78","observation_id":"f77f2e7b-9911-4a06-a377-9c55202ed60a","resolution":{"observed_at":"2026-05-14T02:04:18.070028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holler, K","venue":null,"work_id":"5a7d7045-dce3-44c5-8a86-46a40cfac6d5","year":2012},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:d00dbd9615dfa3cfac7a937d2552122b6de191efd6cf56da259702b574eef5db","observation_id":"34ce07cf-2573-4151-be96-42a863889e1e","resolution":{"observed_at":"2026-05-14T02:04:18.074605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ivankovi´c, G","venue":null,"work_id":"c29b814f-9e72-4687-a235-29b94944cf68","year":2019},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:e4e135716c3aed375336f15f4297f39e5d3430d3eb93c537604fedf1f868ca1a","observation_id":"a300eaed-3f09-4678-b30b-65804bf3c580","resolution":{"observed_at":"2026-05-14T02:04:18.079390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"911763a6-e085-41af-8f9a-858573912e39","year":2018},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:b2563724add10fb5011961a04ecb9a1841af752fee73c0226bf1f91b8c01ee4b","observation_id":"374ce154-fb10-42bb-b507-37bce2261277","resolution":{"observed_at":"2026-05-14T02:04:18.085043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:8b0bc7871f14a0af2bdb701b8842918cddec2ed11ccd03f593838f4d28fd9818","observation_id":"4aa24f72-6b1a-445c-b36c-9ce893a23b34","resolution":{"observed_at":"2026-05-14T02:04:18.001948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05020","last_updated":"2023-04-16T20:32:27Z","snapshot_observed_at":"2026-08-06T05:51:14.795455Z","submitted_at":"2023-02-10T02:29:37Z","title":"Impact of Code Language Models on Automated Program Repair","version":3},"cited_work":{"arxiv_id":"2302.05020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.05020","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jiang, K","venue":null,"work_id":"0635332e-7e8b-4ffb-a50b-280766558113","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2302.05020","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:abae307bab0efc621410c6413020a8021290ac48a2a7002f2745ac4440f8d51a","observation_id":"52af1a6e-2121-430d-a47c-0b8f3c53b5c5","resolution":{"observed_at":"2026-05-14T02:04:18.014273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:132c4e7e6d3c14d22b410296d0c5b02fb2c9f2dbbef5f3dd7915ec403138c2cd","observation_id":"7fa4371e-4c3f-46e5-a8dc-7876d2ecd440","resolution":{"observed_at":"2026-05-14T02:04:18.022396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kalyan, A","venue":null,"work_id":"62c1020b-ac27-4e2b-8b78-d0cd628d08e3","year":2018},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:1c9cc727caa3b25f581d4af10f52362fc9a6130b6df9267014b1bbf946dc7797","observation_id":"d50fb4ef-afc7-441a-b004-ef92a7df5e61","resolution":{"observed_at":"2026-05-14T02:04:18.090978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"76556411-3867-48eb-bcbc-25ade3e412b0","year":1976},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:1106847009ed53e7a74a07f849e56897a3e02a08bee6ff7111793092a5dcebe9","observation_id":"a3138b82-c67c-4e3a-8cf7-da1edda36ac4","resolution":{"observed_at":"2026-05-14T02:04:18.098983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03511","last_updated":"2020-09-22T08:58:24Z","snapshot_observed_at":"2026-08-04T09:24:06.397404Z","submitted_at":"2020-06-05T15:28:01Z","title":"Unsupervised Translation of Programming Languages","version":3},"cited_work":{"arxiv_id":"2006.03511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03511","snapshot_observed_at":"2026-07-04T15:39:56.815085Z","title":"Un- supervised translation of programming languages","venue":null,"work_id":"8a049493-83de-4523-b00d-d85717933219","year":2020},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2006.03511","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:462f8ea80f01c9bc78416ff5394cf5f1e79c5015be75bf1c1c36bc22ed6dc084","observation_id":"4d310cd3-2c37-4d00-ad59-73124943232f","resolution":{"observed_at":"2026-05-14T02:04:17.993427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3579c95-7548-4183-a0fb-e40f07b80215","year":2010},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:3abb6256e58ad20f78f19f62780fa31e8233169771c0a9e776f112cdbdee024b","observation_id":"f2eb8f01-4c65-49f9-8673-f388a46ee0a1","resolution":{"observed_at":"2026-05-14T02:04:18.103730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5a4bfa97-adba-4e52-8488-b9416a3a4977","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:ac394dfbf94d3ae148bfc4856204870aa15dd0a8c202a1be1549838b5c6daa40","observation_id":"abdb1ea0-c616-46ad-9db3-5c4ca40bf96e","resolution":{"observed_at":"2026-05-14T02:04:18.111346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b22e1473-ba1f-4a35-9989-28809230ab94","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:1e02699a40fdf2538a7833c7a76ef6dae3f0d9dcb68318f192251a2adb1dce76","observation_id":"b63a7451-52dc-41e6-83b4-9eb99978cbc0","resolution":{"observed_at":"2026-05-14T02:04:18.119161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8193b58e-0dd8-4e55-bf99-a805cb5180c8","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:fc40ed01347d66618c7f0ad34f9b838a62d9b4eb9f19362a371e4cdac4d444cb","observation_id":"fa1da41f-c754-45e3-b78e-19fa62da4acd","resolution":{"observed_at":"2026-05-14T02:04:18.122573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f4aea477-7ed1-4805-b7e3-2d125d8bf75a","year":2021},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:af746f27ecd07a1c020a297e292dfd44efa0c219a344211e082477d2f522d71f","observation_id":"533ad619-2372-445d-9a43-8a88f4d15829","resolution":{"observed_at":"2026-05-14T02:04:18.126476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04664","last_updated":"2021-03-16T08:28:37Z","snapshot_observed_at":"2026-07-06T10:39:42.676631Z","submitted_at":"2021-02-09T06:16:25Z","title":"CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2102.04664","doi":"10.48550/arxiv.2102.04664","metadata_source":"pith","pith_arxiv_id":"2102.04664","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation","venue":"cs.SE","work_id":"240a5e43-7f22-4634-b794-78d01e855b1d","year":2021},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2102.04664","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:fe2a3271aafbcf055e0f84042c0fdae77e6b7c106ae6479973a9d1ab62136e32","observation_id":"7a53ef94-3f67-47df-92ed-c82981612337","resolution":{"observed_at":"2026-05-15T11:40:02.914862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08568","last_updated":"2025-05-27T07:40:36Z","snapshot_observed_at":"2026-08-04T15:08:40.203853Z","submitted_at":"2023-06-14T15:18:48Z","title":"WizardCoder: Empowering Code Large Language Models with Evol-Instruct","version":2},"cited_work":{"arxiv_id":"2306.08568","doi":"10.48550/arxiv.2306.08568","metadata_source":"pith","pith_arxiv_id":"2306.08568","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2306.08568 [cs]","venue":"cs.CL","work_id":"4fd8dce8-51bf-4600-ac86-b571f0dcd674","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2306.08568","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:79fa1ab982e5db5a2404ea25e455f9d14583b68dc8200b965adac87b345b060e","observation_id":"ead87ab5-6cef-4d53-b7bf-5df8003dabef","resolution":{"observed_at":"2026-05-14T02:04:17.985483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manna and R","venue":null,"work_id":"55312bf5-5016-4f89-b101-d29496cf2bba","year":1971},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:c1c573c36cfa83b0e2572c9a502b714fa5c0592493dc3f48bc0428dedf129a74","observation_id":"a455a752-73ee-4ac4-9d80-ce0a39234467","resolution":{"observed_at":"2026-05-14T02:04:18.133825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4b72a855-2289-48db-a167-1abe620e64a9","year":1998},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:69d1326bcf65b5ffc7bb1fd49a2ffb8d3a4815efad36ee8887a2cbb3d3f31188","observation_id":"76fba8f1-d798-4456-b4db-f133d7123aae","resolution":{"observed_at":"2026-05-14T02:04:18.137223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"37385e61-622b-42c2-a634-19dd3723a775","year":1992},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:c7d4b1d1b6fc70a254e62e6dd8f7fac90df82c957d8e2824ef6d3794af942738","observation_id":"e80156be-262b-4f1b-a0d4-07973268d354","resolution":{"observed_at":"2026-05-14T02:04:18.140516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GitHub Copilot – Your AI pair programmer.https://github.com/features/ copilot","venue":null,"work_id":"d7567856-e9d9-47bf-b37a-f7cc956b9009","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:1d372bc01c519edcf8b3ca82a268f48adaf5a9749a2a0ac3014aa708429c1a7d","observation_id":"8ead5d23-3592-446d-b850-e9da13ab7789","resolution":{"observed_at":"2026-05-14T02:04:18.148026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b553c82b-31c6-4d2d-aa9b-6d7e7a1ec9c0","year":1990},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:6f0a2cfc74626a14878a3457a2ab6b4fbaacd4ee08e19bb85c69f2445c78be25","observation_id":"aedbf686-24cf-4ad2-8502-7294825cabc7","resolution":{"observed_at":"2026-05-14T02:04:18.152202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bd594808-8f00-4b40-a757-e9dd73700ef9","year":2000},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:465bdb219d35a2e60eac7946673f4ddb13fac614d67422cea118ab2f86c7a3e4","observation_id":"ef70036b-a4bf-4258-b343-424e609f5e13","resolution":{"observed_at":"2026-05-14T02:04:18.156502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nijkamp, H","venue":null,"work_id":"bff03f92-8d05-4ad1-87ce-b2e72f83f4a4","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:6c682d701962c0dfe9fbfadc016dbcf9eddbe82e5d70f8d7e44ff360f073825c","observation_id":"8f23dfe8-7248-4f46-b55e-a2a9997199b8","resolution":{"observed_at":"2026-05-14T02:04:18.160859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nijkamp, B","venue":null,"work_id":"db203b85-c08a-4654-94ca-224269cc4b29","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:d3f6adf25b1e546c453456da403818277f4388dee94caef11929d20151c8b96c","observation_id":"4a8e6c2e-4908-4822-81ac-cf845dfebda4","resolution":{"observed_at":"2026-05-14T02:04:18.165155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ea092204-bbb4-42b7-b543-4e26eab975c9","year":2005},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:879bd734ebba3675eee3d791f552b58a46745a83a150b753832ec75e1bd2c75b","observation_id":"67422d45-fd7e-47af-a57b-adc9fa271af0","resolution":{"observed_at":"2026-05-14T02:04:18.169828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatgpt: Optimizing language models for dialogue","venue":null,"work_id":"bc496b4f-a1ad-493b-82a2-d2727e342bf4","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:61203fa6a2a6e3ff5a38cdd6ced11f4da7dac5d9b1ff1b715282b079e0f07b5f","observation_id":"e05f6857-6be3-4c99-aced-2f4ff5990bba","resolution":{"observed_at":"2026-05-14T02:04:18.177498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:ca961cb585dcd0f40be7e5290feb97e7123f56100ed6dc374ae12bd8196ad815","observation_id":"58ebfbde-dbc7-4b54-a72b-44d0d3b610a5","resolution":{"observed_at":"2026-05-14T02:04:18.008192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Papineni, S","venue":null,"work_id":"60df9027-733a-4420-a006-07eb927abee0","year":2002},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:905a30fa9ae25afa5dede07063d1241fe4b1e024cf57dcb24fcd1a020df34686","observation_id":"040cdad9-9fc2-422a-9fd0-fd3612114024","resolution":{"observed_at":"2026-05-14T02:04:18.185652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Petrovi´c and M","venue":null,"work_id":"c7b3c275-fe30-4f4a-8ef5-d19a5a75f3dd","year":2018},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:87980e09d2d4dc0983fa05b9c35de51761d7363bc77eefb7b34dfdcd41aac1aa","observation_id":"ad4371e0-fe75-4b4e-9e25-bf9fcc182a95","resolution":{"observed_at":"2026-05-14T02:04:18.195769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phind/phind-codellama-34b-v2 · hugging face","venue":null,"work_id":"b924cefa-4441-4867-896c-e747280a7626","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:d2c5c023c5ee577e73afe8bc638d04073927b5e7b29254c382f7f5db05da1a69","observation_id":"54038b96-f9c8-4450-8fff-fd9f12c5d017","resolution":{"observed_at":"2026-05-14T02:04:18.201717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rothermel, M","venue":null,"work_id":"9b6bc67b-a6d0-4141-9d6b-44e18985417e","year":2002},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:0ae4090a06d80e9023d7c211e47dd11138ee55b7e5572857d4c2438ab3f17ef9","observation_id":"1d12a269-ae13-4c0c-ad3c-04cbe961407a","resolution":{"observed_at":"2026-05-14T02:04:18.205944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:40770cf4f781ebc9b92663967552810deaa42504883793bc2cf5d76e06ce5536","observation_id":"1387f375-fb63-43f5-8064-f47684925b52","resolution":{"observed_at":"2026-05-14T02:04:17.969215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06773","last_updated":"2022-02-16T13:54:26Z","snapshot_observed_at":"2026-08-03T15:39:38.061563Z","submitted_at":"2021-10-13T15:08:43Z","title":"Leveraging Automated Unit Tests for Unsupervised Code Translation","version":2},"cited_work":{"arxiv_id":"2110.06773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.06773","snapshot_observed_at":"2026-07-04T00:59:18.939598Z","title":"Leveraging automated unit tests for unsupervised code translation","venue":null,"work_id":"df8f3a25-9c1e-40d3-a6f5-b1ba025b36ee","year":2021},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2110.06773","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:e0cc1d35e64fbba15d6a4e2eced32263bc4bdaff76f87a83bb459cab88e432c7","observation_id":"5a2bcf3d-6b40-411b-8ea3-814661c43b0c","resolution":{"observed_at":"2026-05-14T02:04:17.974075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Security","venue":null,"work_id":"209600f0-18e1-49f2-bf08-7d03ba0917f4","year":2007},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:c2184b06159ad6190591c5ae0ae7fe17628d5feffd3f7afd6e9378fdc008322a","observation_id":"f5d5f0c2-5bd9-4b0d-8fd5-d3ff6942ddd0","resolution":{"observed_at":"2026-05-14T02:04:18.210368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Serebryany","venue":null,"work_id":"6672d817-b057-40c5-8dff-7175a73b6225","year":2016},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:d4fb2dd7e096d633834930896835aebacc438847a33576e8c18d6c4eb76f4515","observation_id":"b62d1faa-3079-47d2-8881-6702e46e8d30","resolution":{"observed_at":"2026-05-14T02:04:18.215961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2812a5cd-faba-4741-93f1-ac1ba716601f","year":1975},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:9737519d07ef957ac870558f034afc2917cd5400830ec0ec284bad926cd767c2","observation_id":"0cff1382-c898-490f-95a9-fff5ccdc35bd","resolution":{"observed_at":"2026-05-14T02:04:18.220422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5d675808-5ce9-4342-9828-c580b56f97b4","year":2014},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:850a62f9af3764c407999aa79c48e52e920f032c3e95fec18b76db795a342583","observation_id":"817e2ba6-0bba-4ea7-9805-21c1afc5832c","resolution":{"observed_at":"2026-05-14T02:04:18.224667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stablelm: Stability ai language models","venue":null,"work_id":"63017174-eec2-414c-a4b7-813f71c9f63c","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:1509e9cc19b39bf8513e1eda4cd6bd2eae8eaab35ea2ee5dd080b34ba315f8ed","observation_id":"5490c333-f08a-47f3-9cca-26a3264b47b5","resolution":{"observed_at":"2026-05-14T02:04:18.229138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"5549f8c5-6f98-4d4a-b51f-7317a2d9c2e1","year":2017},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:3e91f9d26d4f430f96cdf2097ca2b1be860e7b932b16d6bdd3df5c55573b314f","observation_id":"63630815-ccf0-4f45-9534-cc7b27b0265c","resolution":{"observed_at":"2026-05-14T02:04:18.233368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6203cdd-6cc5-4d20-91f6-e19c8cbad4e4","year":1969},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:5fcf6623733d996304624e44f8bbc44d60c636445a94abf5615c62d8dd1c77a1","observation_id":"c1ebfdb5-bd0e-4dcf-af14-1cb47f90cca0","resolution":{"observed_at":"2026-05-14T02:04:18.237637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wang and A","venue":null,"work_id":"bdc2c002-aafd-469f-90c1-e176da1cbf80","year":2021},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:008ba18c10fa9bd2dc301f5c7be2ed621930241771cdd34ab314ba8ea3340d24","observation_id":"f37ade9c-ef78-4a70-aa7b-e39b36609806","resolution":{"observed_at":"2026-05-14T02:04:18.242502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07922","last_updated":"2023-05-20T07:27:15Z","snapshot_observed_at":"2026-08-01T08:49:52.462843Z","submitted_at":"2023-05-13T14:23:07Z","title":"CodeT5+: Open Code Large Language Models for Code Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2305.07922","doi":"10.48550/arxiv.2305.07922","metadata_source":"pith","pith_arxiv_id":"2305.07922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CodeT5+: Open Code Large Language Models for Code Understanding and Generation","venue":"cs.CL","work_id":"9a1f53cf-da37-4377-9707-c043ef9e5710","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2305.07922","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:14563f012c27159750cdee10f07d5af01d7d7c32050fd20e13dfc915e800aa21","observation_id":"c70a20bf-4ed4-4542-bb05-5808f9ce5db1","resolution":{"observed_at":"2026-05-19T05:26:57.653334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00608","last_updated":"2023-11-08T22:24:26Z","snapshot_observed_at":"2026-08-06T00:52:12.710324Z","submitted_at":"2023-09-01T17:54:14Z","title":"Copiloting the Copilots: Fusing Large Language Models with Completion Engines for Automated Program Repair","version":3},"cited_work":{"arxiv_id":"2309.00608","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00608","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad4de7a0-7d87-46a0-a0ab-6271111a0a66","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2309.00608","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:caf18276c95f61739c13268f720c06bb436ec6c8d93407e03a1c70d72e3e5fc1","observation_id":"9a793f47-af67-4557-a227-e3b203b221aa","resolution":{"observed_at":"2026-05-14T02:04:17.952242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Winterer, C","venue":null,"work_id":"f7d0ad2c-e2c7-4e9f-9fa5-8aed22c6249a","year":2020},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:8a87f41db84edc340a32fbe4db2ceb79508988b9b4d54a627e132fba96deebb0","observation_id":"784f48b6-3d7b-4b9a-b472-0205e3d903ec","resolution":{"observed_at":"2026-05-14T02:04:18.246481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a32f4157-8532-4546-b4fb-2075d7cbbc64","year":2024},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:9aa0faf8a122e8dd52b599d16df08ecb59b6cfabea4632a18fc61baeb4cf4a14","observation_id":"6a6e265a-f2af-44c1-aed0-82c85a5278ee","resolution":{"observed_at":"2026-05-14T02:04:18.283210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3a1811b-63e3-4240-9dd1-31f92fd4d638","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:452be0be8ced6d32d3b8ea31ed7112bd734ac2dae943e5770ed77143c17a0db7","observation_id":"27e9f268-6416-4047-bc48-15e164fd257a","resolution":{"observed_at":"2026-05-14T02:04:18.252923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f381cfd6-a3ad-4ac4-92f1-8357118f5272","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:3624b2e1c2426b2fb69a8d871cfe4f973fbea6c31f261688c659ce64dbbee0de","observation_id":"ea49175e-f8a9-46ab-8c8b-1023615d799a","resolution":{"observed_at":"2026-05-14T02:04:18.258639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"69899166-e118-4fea-a8e5-c3af4dde1b14","year":2022},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:a8f73b5b77520820feb358590acf8862a71150494e530de0f923ab8964880f98","observation_id":"4bf61302-0235-4e49-8dcb-f6d2012d1ee9","resolution":{"observed_at":"2026-05-14T02:04:18.262350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4a7fda36-7adf-4e3e-b133-969ad2179587","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:03d6d55767709e178c4637998c7f5835a9fe9c154566086055ac1549dd5289f1","observation_id":"50822c0d-70fe-4389-bb61-6356562a4a54","resolution":{"observed_at":"2026-05-14T02:04:18.265396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"66d9f840-50a9-434f-9878-8b33bebcd90f","year":2011},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:bea92fd8d068da652718f637133288070f1734623e0a514dc0688dd4b569caaf","observation_id":"6ee73def-f8a7-4677-94b6-bebeee093b52","resolution":{"observed_at":"2026-05-14T02:04:18.268788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cb293464-c8d7-4874-a984-5c35d92ee63e","year":2018},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:88490727ccf5197187af57f40a857d12a9911cd96d4df70002ab11cdfedf0b54","observation_id":"be4a29fd-3edd-442e-bc5a-dbe64d19da9d","resolution":{"observed_at":"2026-05-14T02:04:18.272073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zalewski","venue":null,"work_id":"b484c465-f85d-4498-88e4-e5540f76de20","year":2018},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:eadf84e2e68b581a3a1d817bb714a7bb08d06de938e6b05b4d7c1317211234b1","observation_id":"79cac963-d3db-4feb-bd5f-bf1526b40968","resolution":{"observed_at":"2026-05-14T02:04:18.275719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, D","venue":null,"work_id":"3f32aa32-88ac-4487-9a20-d3f7d8b0a298","year":2011},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:de0a6156a70e71425ab0758904251250886f984022fa3dc8dbcf82b4247cdbcb","observation_id":"a0df4eec-d2b2-43a5-baec-d2e5856d21a6","resolution":{"observed_at":"2026-05-14T02:04:18.279191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17568","last_updated":"2024-07-10T03:52:58Z","snapshot_observed_at":"2026-07-06T15:10:12.213443Z","submitted_at":"2023-03-30T17:34:01Z","title":"CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X","version":2},"cited_work":{"arxiv_id":"2303.17568","doi":"10.48550/arxiv.2303.17568","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17568","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zheng, X","venue":"arXiv (Cornell University)","work_id":"a437deb4-3fce-40c1-ab5b-0bfcb78d4e75","year":2023},"citing_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-14T02:04:17.888553Z"},"links":{"cited_paper":"/paper/2303.17568","citing_paper":"/paper/2305.01210"},"observation_digest":"sha256:b7f38a4a5def95b99a1eda95c770aace272bf99fc353b923985ef5f03f894b0c","observation_id":"d065e01f-19e0-4044-a0f1-5b1be68a83b1","resolution":{"observed_at":"2026-05-14T02:04:18.031433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","latest_version":3,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":14,"verified_fuzzy":31},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 53 inbound Pith citation observations for arXiv:2305.01210."}