{"as_of":"2026-08-17T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a84e65f845726e842008ea192b6bec6fa7e581aa4436e8de4f94d9e750b3b0d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:39:09.585165Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-08-14T16:40:35.729198Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T20:18:06.304134Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2406.00515"},"observation_digest":"sha256:47d66031e7dc3e71162ae84155f7fe766be78d129b2defd33bb1f2072664962d","observation_id":"493ee7ce-f59d-4a86-87b1-2c8bae5e5a44","resolution":{"observed_at":"2026-05-13T20:18:06.739448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2408.15815","last_updated":"2026-04-11T09:31:33Z","snapshot_observed_at":"2026-08-12T18:13:49.055116Z","submitted_at":"2024-08-28T14:24:48Z","title":"MR-Adopt: Automatic Deduction of Input Transformation Function for Metamorphic Testing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T22:17:02.681066Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2408.15815"},"observation_digest":"sha256:605d78dbed94727e6ae9cfe269d540468c4da48493bd8122bf07b77dcaba4ed4","observation_id":"a6fe8069-4af6-42a9-b8a4-475274dab7e2","resolution":{"observed_at":"2026-05-23T22:18:31.317120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-12T17:05:15.099853Z","title":", Liu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13611","last_updated":"2024-12-10T07:47:15Z","snapshot_observed_at":"2026-08-16T17:58:55.737221Z","submitted_at":"2024-11-20T02:03:16Z","title":"DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:15.099853Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2411.13611"},"observation_digest":"sha256:4ff20bbc5c78be7e1454864aba0ea336751ac6054152e0a111e606aef11a4edd","observation_id":"dae15ffe-6ac2-4676-832a-1328af38d70a","resolution":{"observed_at":"2026-08-12T17:05:15.099853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-12T13:21:05.560207Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16345","last_updated":"2025-02-14T09:32:11Z","snapshot_observed_at":"2026-08-15T05:41:45.095791Z","submitted_at":"2024-11-25T12:44:02Z","title":"Preference Optimization for Reasoning with Pseudo Feedback","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:21:05.560207Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2411.16345"},"observation_digest":"sha256:0db39131af4a441895486956252da82307fad7033dd4d91b5f1f11115a3e3342","observation_id":"6bbc4a7e-b8cc-4b9e-86d0-5d060bdf148d","resolution":{"observed_at":"2026-08-12T13:21:05.560207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-11T05:12:11.364925Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17908","last_updated":"2025-04-21T18:58:16Z","snapshot_observed_at":"2026-08-14T15:20:28.469571Z","submitted_at":"2024-12-23T19:04:46Z","title":"Trading Devil RL: Backdoor attack via Stock market, Bayesian Optimization and Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:11.364925Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2412.17908"},"observation_digest":"sha256:0e030e6aaa55176cc0264184389da934cb6ef113028489eaf21b4384c2fb1be8","observation_id":"7f1aaa35-7be3-47ad-a19d-409ca0333f57","resolution":{"observed_at":"2026-08-11T05:12:11.364925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-10T23:28:51.280416Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20340","last_updated":"2025-01-05T06:20:51Z","snapshot_observed_at":"2026-08-17T22:12:13.820021Z","submitted_at":"2024-12-29T03:49:13Z","title":"Distilling Desired Comments for Enhanced Code Review with Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:28:51.280416Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2412.20340"},"observation_digest":"sha256:5ac4694826f332d8e50c71f759b5402814cefc7414d1450849957c1e092be2a7","observation_id":"9d034c76-dece-451c-96ae-c69ff824e8a2","resolution":{"observed_at":"2026-08-10T23:28:51.280416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-09T14:53:49.686606Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01718","last_updated":"2025-05-24T04:36:48Z","snapshot_observed_at":"2026-08-14T06:10:00.978457Z","submitted_at":"2025-02-03T18:46:04Z","title":"ACECODER: Acing Coder RL via Automated Test-Case Synthesis","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T14:53:49.686606Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2502.01718"},"observation_digest":"sha256:b9a9b2471ff07cfe0cc7ec03dc66c0c3b5d9792d4b013cbdda55e2e840768607","observation_id":"7a48100f-4cdd-435d-8ebb-f657497a38e3","resolution":{"observed_at":"2026-08-09T14:53:49.686606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":164,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:b516af652feb8dc13315caab8e6cfee08fd9e81e6f3ddae9da3b0ed695358285","observation_id":"1c172a57-6eb3-497a-9cd2-7e8bdbb84290","resolution":{"observed_at":"2026-05-12T08:41:23.489044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-16T12:39:09.585165Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12365","last_updated":"2025-04-16T16:07:18Z","snapshot_observed_at":"2026-08-17T14:38:39.304507Z","submitted_at":"2025-04-16T16:07:18Z","title":"Themisto: Jupyter-Based Runtime Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:39:09.585165Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2504.12365"},"observation_digest":"sha256:c46e57126eb0fb07b4f18027d34221497793974ffac63f5ad9f02689e7f9a959","observation_id":"3403b63f-cad3-4b34-a036-c1401269f0ff","resolution":{"observed_at":"2026-08-16T12:39:09.585165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-16T11:34:01.054883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15210","last_updated":"2025-05-05T06:56:16Z","snapshot_observed_at":"2026-08-16T11:28:44.631415Z","submitted_at":"2025-04-21T16:29:07Z","title":"Integrating Symbolic Execution into the Fine-Tuning of Code-Generating LLMs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:01.054883Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2504.15210"},"observation_digest":"sha256:8d6d0ef08addca2371841eb7fd3dd47e6208d22e6df3b557abfe6f6ec68b4c0f","observation_id":"ea30a76c-e77e-40e4-b4e9-06aaaf99fb45","resolution":{"observed_at":"2026-08-16T11:34:01.054883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-15T21:22:19.042890Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10594","last_updated":"2025-05-15T08:13:45Z","snapshot_observed_at":"2026-08-17T10:45:27.876093Z","submitted_at":"2025-05-15T08:13:45Z","title":"CRPE: Expanding The Reasoning Capability of Large Language Model for Code Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:22:19.042890Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2505.10594"},"observation_digest":"sha256:7ed9f0f77d9ee728ec201e9aa2859b6166db6aa272d5f89315cb15450f83d351","observation_id":"44bd3ffe-f9ed-4004-ad79-63854f7f6591","resolution":{"observed_at":"2026-08-15T21:22:19.042890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-07T13:53:03.712435Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-16T04:25:26.189213Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:03.712435Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2505.20732"},"observation_digest":"sha256:495c883cdc5bbe47a3ad6f1144eb2ae5ac9c3b357c5f1e709694875e9065e1ad","observation_id":"59474258-9f83-4571-bd6e-e0f7e94a8363","resolution":{"observed_at":"2026-08-07T13:53:03.712435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-07T13:04:58.439514Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22704","last_updated":"2025-05-28T17:57:47Z","snapshot_observed_at":"2026-08-16T05:08:00.231847Z","submitted_at":"2025-05-28T17:57:47Z","title":"Training Language Models to Generate Quality Code with Program Analysis Feedback","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:04:58.439514Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2505.22704"},"observation_digest":"sha256:e5ab8b6f8b9179458c63b008aa1b4699e6499063e60a0cee7c10d636a243b90b","observation_id":"6bb10acb-174c-40f0-81d2-ae3bcbc23691","resolution":{"observed_at":"2026-08-07T13:04:58.439514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-07T12:50:24.562628Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23387","last_updated":"2025-06-03T09:55:22Z","snapshot_observed_at":"2026-08-16T12:28:23.201880Z","submitted_at":"2025-05-29T12:14:29Z","title":"Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:24.562628Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2505.23387"},"observation_digest":"sha256:39d7ce183f45d82c37c10f4404787ed9c2afa82fd7118c4a2bb2d8299381c0b1","observation_id":"457bd8db-44ed-4218-8753-a5053c9b1667","resolution":{"observed_at":"2026-08-07T12:50:24.562628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-07T12:13:28.236569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00296","last_updated":"2025-05-30T22:58:35Z","snapshot_observed_at":"2026-08-17T15:53:37.350666Z","submitted_at":"2025-05-30T22:58:35Z","title":"CRScore++: Reinforcement Learning with Verifiable Tool and AI Feedback for Code Review","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:28.236569Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2506.00296"},"observation_digest":"sha256:8a175b8f7d2377540e3cb963465faf68bb039f10c1954e9011f41e2026215bbd","observation_id":"4887bd46-fc39-4dd5-b312-36bb30a7e0e8","resolution":{"observed_at":"2026-08-07T12:13:28.236569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-07T11:31:53.249493Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-16T13:45:01.747227Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.249493Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:ae5f9525673207f89f0903f1d79005395ab68c699a3fca01d6b9cfb3c82ebeb7","observation_id":"27ef6c89-a7dc-41ec-84a4-cefc545ee0fd","resolution":{"observed_at":"2026-08-07T11:31:53.249493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-07T04:41:56.947388Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10125","last_updated":"2026-07-13T18:29:32Z","snapshot_observed_at":"2026-08-13T18:06:25.505077Z","submitted_at":"2025-06-11T19:09:08Z","title":"D-LiFT: Improving LLM-based Decompiler Backend via Code Quality-driven Fine-tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:41:56.947388Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2506.10125"},"observation_digest":"sha256:65dfa384127b3cc1c67102a8f76277f3f4a4e0255db7dfdac6a8a8994090c005","observation_id":"14c18af4-3176-4b4b-a3dc-f9fdb4b4e445","resolution":{"observed_at":"2026-08-07T04:41:56.947388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-15T19:19:10.403693Z","title":"Stepcoder: Amélioration de la génération de code avec l’apprentissage par renforcement à partir des retours du compilateur","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21608","last_updated":"2025-06-20T13:17:44Z","snapshot_observed_at":"2026-08-17T14:41:29.556039Z","submitted_at":"2025-06-20T13:17:44Z","title":"SysTemp: A Multi-Agent System for Template-Based Generation of SysML v2","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:19:10.403693Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2506.21608"},"observation_digest":"sha256:415e5ef405944b795f36965ce198c5bdf22723e97a91bc1345a9710f10bda5d0","observation_id":"7c073181-d46a-45d0-908e-9845c553223b","resolution":{"observed_at":"2026-08-15T19:19:10.403693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-06T16:45:47.513069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12674","last_updated":"2025-07-18T01:02:16Z","snapshot_observed_at":"2026-08-16T19:05:57.267993Z","submitted_at":"2025-07-16T23:12:14Z","title":"ParaStudent: Generating and Evaluating Realistic Student Code by Teaching LLMs to Struggle","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:47.513069Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2507.12674"},"observation_digest":"sha256:792816a449ab08d772b67ac3eaa81e47ec709a04ed683e3efb52e8896291739c","observation_id":"7a511d87-afd3-4702-83c6-9d560eabbca4","resolution":{"observed_at":"2026-08-06T16:45:47.513069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2507.21990","last_updated":"2026-04-14T13:50:18Z","snapshot_observed_at":"2026-08-11T18:31:57.205339Z","submitted_at":"2025-07-29T16:40:49Z","title":"ChemDFM-R: A Chemical Reasoning LLM Enhanced with Atomized Chemical Knowledge","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T03:29:23.464348Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2507.21990"},"observation_digest":"sha256:3fd2a56bf0ab46b844935fce859219d3d61fcaea4fdf3fcf571077997247a75d","observation_id":"e11cf801-ef24-4569-aa48-584de858c0cc","resolution":{"observed_at":"2026-05-19T03:32:01.539614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-06T11:19:19.040967Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22853","last_updated":"2025-07-30T17:24:05Z","snapshot_observed_at":"2026-08-17T19:15:32.678870Z","submitted_at":"2025-07-30T17:24:05Z","title":"Repair-R1: Better Test Before Repair","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:19:19.040967Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2507.22853"},"observation_digest":"sha256:217bd43458f55d5eb539ca90aea62c053649b2c7de06711c75511d2bdf544b2a","observation_id":"1182d1ba-ef9a-4b20-a296-7ae0aea84ed5","resolution":{"observed_at":"2026-08-06T11:19:19.040967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2508.16771","last_updated":"2026-07-02T23:23:00Z","snapshot_observed_at":"2026-08-15T17:08:03.987036Z","submitted_at":"2025-08-22T20:08:09Z","title":"EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T20:54:30.449792Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2508.16771"},"observation_digest":"sha256:4451755f5b15fe154cf56e087aff1f9ac8a52715f3473885bafd155df9885ef6","observation_id":"983fec0b-a38e-41d8-aba5-5a554a3e9642","resolution":{"observed_at":"2026-05-18T20:56:50.471275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T15:17:13.749999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03537","last_updated":"2025-08-27T17:26:44Z","snapshot_observed_at":"2026-08-15T21:09:00.493220Z","submitted_at":"2025-08-27T17:26:44Z","title":"AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:17:13.749999Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2509.03537"},"observation_digest":"sha256:60838a0545844f3c762934f9c2d7ad240ca94be04ea80172e73f8a43b82f7059","observation_id":"bbe70dc4-8e78-4d4e-88a8-b072a15b3a7e","resolution":{"observed_at":"2026-08-05T15:17:13.749999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-03T09:02:26.930703Z","title":"Elkabetz, O","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15158","last_updated":"2026-06-03T13:13:08Z","snapshot_observed_at":"2026-08-07T05:40:53.543305Z","submitted_at":"2026-01-21T16:36:19Z","title":"Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:26.930703Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2601.15158"},"observation_digest":"sha256:e1b1716fc6eaff499990002aea4729117ed6961488d24717a44dd025b98424d6","observation_id":"26cfeec9-3740-40b3-b940-d4cd569333d8","resolution":{"observed_at":"2026-08-03T09:02:26.930703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2604.11297","last_updated":"2026-04-13T10:59:28Z","snapshot_observed_at":"2026-08-13T09:13:17.587485Z","submitted_at":"2026-04-13T10:59:28Z","title":"The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:31.715954Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2604.11297"},"observation_digest":"sha256:4590bd5f503b8de94c2c0d2e1c83a25138311c85d81947b10f4b661038c32038","observation_id":"b21c6ace-e1f4-4553-8d50-6b21cb945071","resolution":{"observed_at":"2026-05-10T15:35:32.826796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2604.13934","last_updated":"2026-04-15T14:46:12Z","snapshot_observed_at":"2026-08-12T12:33:30.694917Z","submitted_at":"2026-04-15T14:46:12Z","title":"Towards Enabling An Artificial Self-Construction Software Life-cycle via Autopoietic Architectures","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T12:43:14.903173Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2604.13934"},"observation_digest":"sha256:c7c7da025fecfb9cec3ed82599ea094ec1697e06bbdae0e28a286f12e03f7832","observation_id":"9d74a1e8-b880-4c2e-bf55-8761bab3834c","resolution":{"observed_at":"2026-05-10T12:45:23.468601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2604.16804","last_updated":"2026-05-06T17:41:05Z","snapshot_observed_at":"2026-08-16T05:07:13.086560Z","submitted_at":"2026-04-18T03:24:54Z","title":"AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T07:02:02.992871Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2604.16804"},"observation_digest":"sha256:e301d683adde6bccab045c463a30a91e0dca25029de3ccea87869e173f95d20b","observation_id":"ae70bde9-1c87-4c90-aff3-4b911f425f8f","resolution":{"observed_at":"2026-05-10T07:11:53.660929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2604.20398","last_updated":"2026-04-22T10:04:46Z","snapshot_observed_at":"2026-08-16T03:22:56.265605Z","submitted_at":"2026-04-22T10:04:46Z","title":"WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T00:18:18.340391Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2604.20398"},"observation_digest":"sha256:efef5839799a2155a45cab9afd3fd31d888c55e2512ee6b0f23aa8f5a26105fb","observation_id":"52d9851c-dd6b-438e-b8a0-86ca5b61a069","resolution":{"observed_at":"2026-05-10T00:19:46.690201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2604.27308","last_updated":"2026-04-30T01:43:00Z","snapshot_observed_at":"2026-08-17T01:30:36.820648Z","submitted_at":"2026-04-30T01:43:00Z","title":"BoostLoRA: Growing Effective Rank by Boosting Adapters","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:21.048408Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2604.27308"},"observation_digest":"sha256:1a337a7f7b9662b48d037596aa087e3aa095029349b51d7fce63fbc79c2b7553","observation_id":"81432182-5677-4745-bd85-ee10950b3dc0","resolution":{"observed_at":"2026-05-12T10:06:27.696129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2605.00433","last_updated":"2026-05-01T06:10:03Z","snapshot_observed_at":"2026-08-15T09:11:18.857763Z","submitted_at":"2026-05-01T06:10:03Z","title":"Improving LLM Code Generation via Requirement-Aware Curriculum Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T19:21:30.956682Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2605.00433"},"observation_digest":"sha256:28bcd296e28434e6d946448d4330d6b787587eab4353dc6f4e29ab518d7e24b3","observation_id":"c8fd815c-4d19-4ff3-9422-04b899c04fca","resolution":{"observed_at":"2026-05-11T15:46:25.357376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2605.17174","last_updated":"2026-05-16T22:18:04Z","snapshot_observed_at":"2026-08-15T08:44:08.288511Z","submitted_at":"2026-05-16T22:18:04Z","title":"Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T14:03:45.869373Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2605.17174"},"observation_digest":"sha256:5ad1c6101e5bb7368d52b39ba49fd77321691a0b9d0b8792a27143c827234c21","observation_id":"2836c5b3-c6a5-4726-9aa4-7c5e83278da3","resolution":{"observed_at":"2026-05-20T14:08:21.267584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2605.24375","last_updated":"2026-05-23T03:30:36Z","snapshot_observed_at":"2026-08-04T17:22:32.357745Z","submitted_at":"2026-05-23T03:30:36Z","title":"Distilling Game Code World Model Generation into Lightweight Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T13:58:37.956333Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2605.24375"},"observation_digest":"sha256:b775e6cc844a0442a8e5b31a5ca15a69671062dddc192154286415b690e9c715","observation_id":"f96a4253-1842-4991-b3d9-ad54b92d3e15","resolution":{"observed_at":"2026-06-30T14:04:44.656018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2605.28409","last_updated":"2026-05-27T12:43:14Z","snapshot_observed_at":"2026-08-16T03:01:16.551916Z","submitted_at":"2026-05-27T12:43:14Z","title":"Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T11:54:07.211895Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2605.28409"},"observation_digest":"sha256:14e67faf1dde3a68c992b7760f88bdd7cdabd85e86784177c8a3be6fbd15765f","observation_id":"c3ffb77b-e6c1-4d7a-89fc-d70816408c83","resolution":{"observed_at":"2026-06-29T12:03:24.427771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2605.30478","last_updated":"2026-05-28T18:50:00Z","snapshot_observed_at":"2026-08-05T07:46:46.502172Z","submitted_at":"2026-05-28T18:50:00Z","title":"Improving Small Language Models for Code Generation with Reinforcement Learning from Verification Feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T06:11:06.960389Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2605.30478"},"observation_digest":"sha256:148e8a930daa60eba87079ad522a9fdacf90cdb204d5c9142a503d2bc0f34b7f","observation_id":"819bc428-11f8-4236-a84a-3f8b2dd030b1","resolution":{"observed_at":"2026-06-29T14:53:32.268045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2606.11052","last_updated":"2026-06-09T16:17:19Z","snapshot_observed_at":"2026-08-14T00:43:02.598148Z","submitted_at":"2026-06-09T16:17:19Z","title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T13:08:57.218711Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2606.11052"},"observation_digest":"sha256:7700080d50fbc0271b17d41f89c8a037f5a3de86c3389f119c259cb370147afb","observation_id":"1e40299e-9fa3-4d54-a36f-a848fbcf333f","resolution":{"observed_at":"2026-06-27T13:10:55.862963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2606.17682","last_updated":"2026-06-16T08:48:58Z","snapshot_observed_at":"2026-08-16T06:37:12.142618Z","submitted_at":"2026-06-16T08:48:58Z","title":"From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T00:59:50.038405Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2606.17682"},"observation_digest":"sha256:6cbf68dd82bc0bdbca447128b3a1196edd15702540b1164857c95fee6d702fd7","observation_id":"8b70a479-b2a7-40a8-b68c-7f5172e8d7ab","resolution":{"observed_at":"2026-06-27T01:00:19.817888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2606.20641","last_updated":"2026-06-02T16:07:28Z","snapshot_observed_at":"2026-08-15T08:39:43.756737Z","submitted_at":"2026-06-02T16:07:28Z","title":"MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T09:31:56.712360Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2606.20641"},"observation_digest":"sha256:12968f3427c9c8cc32a400d8e0bd2450ab16f5d75e8ba8bdb154469f460be825","observation_id":"a8185407-e9a5-4fd2-906a-d6a1d7386175","resolution":{"observed_at":"2026-07-02T03:56:35.169574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":"2402.01391","doi":"10.48550/arxiv.2402.01391","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stepcoder: Improve code generation with reinforcement learning from compiler feedback.arXiv preprint arXiv:2402.01391","venue":"arXiv (Cornell University)","work_id":"75e19688-9dee-43d2-b058-3cd127182dbd","year":2024},"citing_paper":{"arxiv_id":"2606.20881","last_updated":"2026-06-18T19:15:50Z","snapshot_observed_at":"2026-08-07T07:30:08.874288Z","submitted_at":"2026-06-18T19:15:50Z","title":"When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T17:07:21.486960Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2606.20881"},"observation_digest":"sha256:52c72975e44cdcd9a8961c8e54d608877209d0ad897926f049074f713675ce23","observation_id":"e5986654-96d5-413b-8126-212f1c8c847e","resolution":{"observed_at":"2026-07-04T04:19:33.953898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-01T15:29:53.759973Z","title":"Gehring, J.; Zheng, K.; Copet, J.; Mella, V.; Cohen, T.; and Synnaeve, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26457","last_updated":"2026-08-04T08:18:00Z","snapshot_observed_at":"2026-08-15T21:08:57.851438Z","submitted_at":"2026-07-29T04:16:33Z","title":"DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T15:29:53.759973Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2607.26457"},"observation_digest":"sha256:2fdcadc9baee229cf8cd52d6fa593209cab7b6f078d26d800b5b20434c42d886","observation_id":"396d5770-455f-4181-9e4a-5c07690b25d9","resolution":{"observed_at":"2026-08-01T15:29:53.759973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01391","snapshot_observed_at":"2026-08-05T04:27:42.958248Z","title":"Gehring, J.; Zheng, K.; Copet, J.; Mella, V.; Cohen, T.; and Synnaeve, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26457","last_updated":"2026-08-04T08:18:00Z","snapshot_observed_at":"2026-08-15T21:08:57.851438Z","submitted_at":"2026-07-29T04:16:33Z","title":"DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T04:27:42.958248Z"},"links":{"cited_paper":"/paper/2402.01391","citing_paper":"/paper/2607.26457"},"observation_digest":"sha256:42d19c01f3ef3bef53b6b61bff49d4492fa7866f9e8bb0a817fe2de1d69c3237","observation_id":"ab486f05-3228-4ee3-9670-56dd3dd2c8af","resolution":{"observed_at":"2026-08-05T04:27:42.958248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.01391/citation-record","integrity":"/paper/2402.01391/integrity","json":"/paper/2402.01391/citation-record.json","paper":"/paper/2402.01391"},"outbound":[],"paper":{"arxiv_id":"2402.01391","last_updated":"2024-02-05T13:28:23Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-17T14:37:36.214810Z","submitted_at":"2024-02-02T13:14:31Z","title":"StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2402.01391."}