{"as_of":"2026-08-08T18:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9f34816390c43ff47db961f89c1608ec02647ae4ae4c58651659504d63b7991","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":49,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:14:54.193857Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T21:20:59.128986Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2501.09686"},"observation_digest":"sha256:4955443664ab86c03004fce14231266e632c270b48242df00ee4ef724af48bce","observation_id":"91e1c7b4-1331-4b0d-8ee6-10cdad3b9da5","resolution":{"observed_at":"2026-05-15T21:20:59.399537Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-15T10:27:56.185943Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2502.18449"},"observation_digest":"sha256:5d8e3b4a5d1cdcb81a175913e1541f5db19dd91ab4a389460ee8069515fc0901","observation_id":"4f86d814-6f5b-4ad7-a836-828d61c88d09","resolution":{"observed_at":"2026-05-15T10:27:56.341144Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-08T15:14:54.193857Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2503.05703","last_updated":"2025-02-10T14:42:13Z","snapshot_observed_at":"2026-08-08T15:09:29.410362Z","submitted_at":"2025-02-10T14:42:13Z","title":"What I cannot execute, I do not understand: Training and Evaluating LLMs on Program Execution Traces","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T15:14:54.193857Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2503.05703"},"observation_digest":"sha256:018f75fa6345ed265a9667dfe391e775f2481d3788e8e7ae385e23f13c10a117","observation_id":"404dd99f-12dc-46b2-bc31-ea15c2f6cafe","resolution":{"observed_at":"2026-08-08T15:14:54.193857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:0cc811d18fd21d7b9be495995b0c69c3c784ace60566b35de1cfddf307c2348d","observation_id":"dfd6e967-1c5b-4d72-be45-fe8404b61f48","resolution":{"observed_at":"2026-05-12T08:41:23.564056Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:40e758a89bdee814260d5826d52d06f1bada1320b220d6f77cc8ab769e1142c7","observation_id":"43bae483-6515-488d-813f-dedbbcfb33ce","resolution":{"observed_at":"2026-05-22T22:22:12.170943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:3fd2c7cc04bd01c60ae5e34fad28776ccd7efb41584652f13ccdf3e3136ec984","observation_id":"c56626ec-d521-44db-b591-9947b9a4ba79","resolution":{"observed_at":"2026-05-22T19:32:00.981090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T13:35:50.613928Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.613928Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:a10937519ccab7d34716bad6bf4ce8f8abff2bb71827685adb1b023ab5998aa1","observation_id":"41cd47ac-0822-4c76-8982-68592cfe2bbc","resolution":{"observed_at":"2026-08-07T13:35:50.613928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T13:04:58.623446Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22704","last_updated":"2025-05-28T17:57:47Z","snapshot_observed_at":"2026-08-07T13:00:05.272741Z","submitted_at":"2025-05-28T17:57:47Z","title":"Training Language Models to Generate Quality Code with Program Analysis Feedback","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:04:58.623446Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.22704"},"observation_digest":"sha256:f9465a127e6fed037309e853eda88d46e7cffd9685584d3717dde119c7f69cfc","observation_id":"484deb15-1a48-4b08-a34d-273bc18125e1","resolution":{"observed_at":"2026-08-07T13:04:58.623446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T12:50:24.815311Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23387","last_updated":"2025-06-03T09:55:22Z","snapshot_observed_at":"2026-08-07T12:44:29.008842Z","submitted_at":"2025-05-29T12:14:29Z","title":"Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:24.815311Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.23387"},"observation_digest":"sha256:02092aaa98d9f510f3310bbdf478d61c5b52182f7d51aa505cff094f22e693f5","observation_id":"5badb4da-5bed-4308-8c0b-fd622e9b4717","resolution":{"observed_at":"2026-08-07T12:50:24.815311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T12:45:25.658504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.658504Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:e1e77df19cef250caf14f58c5f094cf95fdfd216355cf477c463c942710da59c","observation_id":"1aff602b-b69d-462f-8792-7d66865a4e5d","resolution":{"observed_at":"2026-08-07T12:45:25.658504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T11:31:53.421299Z","title":"arXiv preprint arXiv:2410.02089","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-07T11:26:06.598387Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:53.421299Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:e0c06e3d1acbf86f589c0743715aba771af81e419370eec734fcf6e284ffa724","observation_id":"42e8fd50-6085-47b2-9879-b8b77ad352ed","resolution":{"observed_at":"2026-08-07T11:31:53.421299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T00:31:36.562765Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-07T00:23:33.491596Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.562765Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:989b95d6e24761099e8cc1dfac4c61b5d382ca58057c5814186a3da6d23b0818","observation_id":"43b36156-2531-46f0-b9dd-afe892cd943c","resolution":{"observed_at":"2026-08-07T00:31:36.562765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T04:37:29.805270Z","title":"arXiv preprint arXiv:2410.02089 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-07T04:29:23.657896Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.805270Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:16431a3a8b859fad269227fdee9d81780e8bc5216f0a2c86f794b1905bdf9af5","observation_id":"3b9a162a-60ac-446a-8ddc-30c8f0d508da","resolution":{"observed_at":"2026-08-07T04:37:29.805270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T21:12:41.213688Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10059","last_updated":"2025-09-02T20:11:20Z","snapshot_observed_at":"2026-08-07T22:00:25.741642Z","submitted_at":"2025-08-12T22:03:54Z","title":"CodeGrad: Integrating Multi-Step Verification with Gradient-Based LLM Refinement","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:12:41.213688Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2508.10059"},"observation_digest":"sha256:ea2503c483a00b17be0d943678abba7c235acd94527dadb7d173db6a0878e888","observation_id":"9b939a93-5116-451a-b01f-0489329ea5b0","resolution":{"observed_at":"2026-08-05T21:12:41.213688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T16:28:23.056538Z","title":"Gehring, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18462","last_updated":"2025-08-25T20:20:44Z","snapshot_observed_at":"2026-08-06T15:52:17.152933Z","submitted_at":"2025-08-25T20:20:44Z","title":"VERIRL: Boosting the LLM-based Verilog Code Generation via Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T16:28:23.056538Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2508.18462"},"observation_digest":"sha256:8f14079f582cfcc5b1f700a0092a6cb39bef711ed2450c7bd6128279e0c0fe5a","observation_id":"ea83a352-454f-448a-810f-8d2cc060d73a","resolution":{"observed_at":"2026-08-05T16:28:23.056538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2509.24552","last_updated":"2026-05-04T14:21:45Z","snapshot_observed_at":"2026-08-02T23:01:03.041288Z","submitted_at":"2025-09-29T10:04:12Z","title":"Short window attention enables long-term memorization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T12:10:42.646127Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2509.24552"},"observation_digest":"sha256:14fe654b8b481b7f0d4dc23c864f17105e12f20b3f884c0a2aa8c22b67a4b7e7","observation_id":"97650b8c-9389-4fae-9456-c96ce892e39f","resolution":{"observed_at":"2026-05-18T12:11:21.813433Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-03T13:45:23.514060Z","title":"Corresponding authors: Aram Markosyan, Mark Saroufim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23236","last_updated":"2026-07-06T22:18:07Z","snapshot_observed_at":"2026-08-08T15:31:06.724407Z","submitted_at":"2025-12-29T06:31:55Z","title":"KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:45:23.514060Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2512.23236"},"observation_digest":"sha256:93d4708dd275c275c134d9bbebc301d4d28ee95494f6a16558c22b1f1751b402","observation_id":"9651214a-fb95-4701-9ae9-a09d438c2181","resolution":{"observed_at":"2026-08-03T13:45:23.514060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-03T12:19:31.452883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03525","last_updated":"2026-05-26T16:39:06Z","snapshot_observed_at":"2026-08-06T03:27:45.707151Z","submitted_at":"2026-01-07T02:29:49Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T12:19:31.452883Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2601.03525"},"observation_digest":"sha256:ae457462990c393abc8361c88b7e85011419df81257c42d180730413d3c7e8d4","observation_id":"ba509e48-0377-4279-bbfb-229312551200","resolution":{"observed_at":"2026-08-03T12:19:31.452883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-13T10:38:11.981408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04236","last_updated":"2026-04-05T19:36:51Z","snapshot_observed_at":"2026-08-04T16:18:20.141337Z","submitted_at":"2026-04-05T19:36:51Z","title":"NEURA: A Unified and Retargetable Compilation Framework for Coarse-Grained Reconfigurable Architectures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T10:38:11.981408Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.04236"},"observation_digest":"sha256:499ebf14f44af4d4659de0c7696ad2144ddb767646e17d43f66a8324fa4ddf13","observation_id":"6f6b0ecb-48a8-4d63-a242-e6c291cdc467","resolution":{"observed_at":"2026-07-13T10:38:11.981408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.04580","last_updated":"2026-04-06T10:26:46Z","snapshot_observed_at":"2026-07-06T22:53:33.177713Z","submitted_at":"2026-04-06T10:26:46Z","title":"Beyond Fixed Tests: Repository-Level Issue Resolution as Coevolution of Code and Behavioral Constraints","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T20:12:53.062214Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.04580"},"observation_digest":"sha256:ab6562868ce018aa59d2637396e50c9666ce37a92ee65e0ba197f8e54c8e6b99","observation_id":"b38a1b66-17ac-4be1-844c-5a99239250b9","resolution":{"observed_at":"2026-05-10T22:10:47.874733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.05560","last_updated":"2026-06-30T13:49:36Z","snapshot_observed_at":"2026-07-13T09:22:43.743786Z","submitted_at":"2026-04-07T08:00:54Z","title":"An Iterative Test-and-Repair Framework for Competitive Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T19:44:32.950977Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.05560"},"observation_digest":"sha256:cb89cd34f1cabd9a3ea61500f84986df4921412181f376162fd3dd790b289a82","observation_id":"f5e72726-7d9c-4e30-9322-09cbe9cfdc61","resolution":{"observed_at":"2026-05-10T22:35:48.523439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-13T09:22:44.557413Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.05560","last_updated":"2026-06-30T13:49:36Z","snapshot_observed_at":"2026-07-13T09:22:43.743786Z","submitted_at":"2026-04-07T08:00:54Z","title":"An Iterative Test-and-Repair Framework for Competitive Code Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T09:22:44.557413Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.05560"},"observation_digest":"sha256:70a3ba7904e51e8efeb04bd0c4501eb0731d446bc00dd59d2a6441dcfd905153","observation_id":"98fd10ca-0dbe-4f9b-bc8d-ac1fcde25d4e","resolution":{"observed_at":"2026-07-13T09:22:44.557413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.06079","last_updated":"2026-04-07T16:58:14Z","snapshot_observed_at":"2026-08-08T07:28:08.490235Z","submitted_at":"2026-04-07T16:58:14Z","title":"Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T19:45:40.915428Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.06079"},"observation_digest":"sha256:53e6a8429db42d402400600480aaff79f9b55c5b9163fa0fd5e740cd6b309d35","observation_id":"b6d7d84f-326b-455e-8077-d709f2e0fac7","resolution":{"observed_at":"2026-05-10T22:30:53.249113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.09813","last_updated":"2026-04-10T18:38:52Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:38:52Z","title":"Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:42:57.596073Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.09813"},"observation_digest":"sha256:3b9338be610064c563c5ab419a4d1d397d505c6acf890173303fc4259d327830","observation_id":"1027fdd9-2fe5-4d0a-8b08-6c6c3423f5e0","resolution":{"observed_at":"2026-05-11T06:15:58.374374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.16335","last_updated":"2026-03-13T02:23:49Z","snapshot_observed_at":"2026-08-04T04:51:19.798134Z","submitted_at":"2026-03-13T02:23:49Z","title":"Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T12:22:13.551709Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.16335"},"observation_digest":"sha256:f9bb18e0d3bb55779aa6d25749aa4dd6cb42cb1048d8d8c6a2beef999734cdf5","observation_id":"d4a371a1-8bf5-49fd-8ab3-d17134a5225b","resolution":{"observed_at":"2026-05-15T12:25:35.836993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2604.18027","last_updated":"2026-04-20T09:52:50Z","snapshot_observed_at":"2026-07-31T18:18:26.451057Z","submitted_at":"2026-04-20T09:52:50Z","title":"CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T04:59:44.880102Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2604.18027"},"observation_digest":"sha256:b4bd389e2411a0470cd1620e1d6c42c745284c09d25a279da2ec986000c49892","observation_id":"5335f5e0-a2ef-4c60-aca3-0809b19ee7ab","resolution":{"observed_at":"2026-05-10T10:29:25.217935Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.08468","last_updated":"2026-05-08T20:39:32Z","snapshot_observed_at":"2026-08-02T16:12:56.247576Z","submitted_at":"2026-05-08T20:39:32Z","title":"PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:12:37.970638Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.08468"},"observation_digest":"sha256:ac250f64912d4a30ae31196f4ab6a6d8e62fb1f9472d7c7f7d9f8533071a103b","observation_id":"de5616c2-4498-479a-80ef-866762313403","resolution":{"observed_at":"2026-05-12T08:21:26.080342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.09134","last_updated":"2026-05-13T16:38:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T19:31:02Z","title":"BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-12T03:09:40.321500Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.09134"},"observation_digest":"sha256:69ff7743ae1714d2ba8f6340e0a808f84cbfb79d66d976b4da0762de40553544","observation_id":"1e6959cd-4a2f-4088-9d8f-8fa9aee28c31","resolution":{"observed_at":"2026-05-12T03:11:18.979788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.09134","last_updated":"2026-05-13T16:38:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T19:31:02Z","title":"BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-13T06:03:32.270553Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.09134"},"observation_digest":"sha256:733dc2da7a5e5634202c1cd1a0d737f4902acebe913f6d8a63bd50b7901133f8","observation_id":"71e6a669-defc-4543-bd0c-571fbabf2cb5","resolution":{"observed_at":"2026-05-13T06:07:22.367744Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.14539","last_updated":"2026-05-14T08:22:21Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:22:21Z","title":"Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T01:41:31.631505Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.14539"},"observation_digest":"sha256:30fb7db9225f4f0255a380fab3690b2e440b5fe7f0fd40d63ec2742bc5510954","observation_id":"61dd3dc0-56a7-474c-93e4-1a540b0357bf","resolution":{"observed_at":"2026-05-15T01:43:27.601951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.17497","last_updated":"2026-05-17T15:14:24Z","snapshot_observed_at":"2026-08-05T13:27:59.292796Z","submitted_at":"2026-05-17T15:14:24Z","title":"Self-Supervised On-Policy Distillation for Reasoning Language Models","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-20T14:42:55.368104Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.17497"},"observation_digest":"sha256:6ed4652111f522fd712c31b7c386b0b9283ebab023a840d807ea0d1e89c3dc13","observation_id":"706ce023-1d4b-400f-9605-f8ed0fb8259a","resolution":{"observed_at":"2026-05-20T14:43:22.222344Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.17792","last_updated":"2026-05-18T03:17:38Z","snapshot_observed_at":"2026-07-06T23:28:45.646975Z","submitted_at":"2026-05-18T03:17:38Z","title":"HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-20T13:28:03.965754Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.17792"},"observation_digest":"sha256:167710a1118c9bd419394fc61a3a96f73c2e1abbcacc425a28e5857bc9683267","observation_id":"cbbfb1d5-2ad0-4a09-851a-d943557595ac","resolution":{"observed_at":"2026-05-20T13:28:18.834772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.18747","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:59:03Z","title":"Code as Agent Harness","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-20T10:54:54.558241Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.18747"},"observation_digest":"sha256:433aaab8064912268af76ab28cc927263cb09c8883d23b51eb5ff981685ed818","observation_id":"4b8c36f2-35bd-48e7-b0fe-ebdaa2ae94e0","resolution":{"observed_at":"2026-05-20T10:58:14.301565Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.21235","last_updated":"2026-05-20T14:24:11Z","snapshot_observed_at":"2026-08-03T21:38:51.443581Z","submitted_at":"2026-05-20T14:24:11Z","title":"LamPO: A Lambda Style Policy Optimization for Reasoning Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T05:11:35.785227Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.21235"},"observation_digest":"sha256:b9cee7ed333cbeeecfa34c0cf844ae77ca5ccb282ffdfec17c7ec8304167797c","observation_id":"e60c5963-68fb-4953-90eb-5fc7254f05f9","resolution":{"observed_at":"2026-05-21T05:13:58.422663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.22675","last_updated":"2026-05-21T16:18:41Z","snapshot_observed_at":"2026-07-31T08:48:25.385630Z","submitted_at":"2026-05-21T16:18:41Z","title":"Self-Policy Distillation via Capability-Selective Subspace Projection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T05:31:42.803465Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.22675"},"observation_digest":"sha256:f8cc5eaf8629e195866cf274eb6f7cbe7a956b64b98d45a85c378cb6e789a706","observation_id":"59c618b0-de54-4a45-99fb-e3b65c89d6f4","resolution":{"observed_at":"2026-05-22T05:34:40.386519Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2605.28328","last_updated":"2026-05-27T11:28:38Z","snapshot_observed_at":"2026-08-01T21:53:13.483450Z","submitted_at":"2026-05-27T11:28:38Z","title":"Learning the Error Patterns of Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T13:56:04.187007Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2605.28328"},"observation_digest":"sha256:309a8db1447a82cee14948090bfff20eab7d266956b6461b44ddec4670e30f7c","observation_id":"86301b5d-5ca7-45a6-93ff-f7022016e5a4","resolution":{"observed_at":"2026-06-29T14:03:29.670798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2606.03489","last_updated":"2026-06-02T11:07:20Z","snapshot_observed_at":"2026-07-06T23:43:46.458792Z","submitted_at":"2026-06-02T11:07:20Z","title":"Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T09:40:35.258818Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2606.03489"},"observation_digest":"sha256:b89cf32e7fd2febe2d9dc781900b903a8dcc660bcd2707b4c1057de696fc2cf3","observation_id":"cf5dea75-95b2-4735-be05-ef2454e75c9d","resolution":{"observed_at":"2026-07-02T03:46:33.093345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2606.21228","last_updated":"2026-06-23T04:40:39Z","snapshot_observed_at":"2026-08-02T19:24:45.644999Z","submitted_at":"2026-06-19T08:47:40Z","title":"Sakana Fugu Technical Report","version":2},"reference_index":298,"source":"arxiv_source","source_observed_at":"2026-06-26T14:22:37.596720Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2606.21228"},"observation_digest":"sha256:baf9e027382a4a5bc4c97078369333b07275ea6f1f199a120ee2dd872a43003b","observation_id":"af5d5b50-2658-4b97-b35b-aa63b36d48df","resolution":{"observed_at":"2026-07-04T06:29:38.270687Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2606.28438","last_updated":"2026-06-26T07:35:43Z","snapshot_observed_at":"2026-08-03T00:04:55.169727Z","submitted_at":"2026-06-26T07:35:43Z","title":"When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs","version":1},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-06-30T01:29:42.919461Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2606.28438"},"observation_digest":"sha256:d7bf5b72c10952c1306a922994bac40cec43c2b5f7bf6634d97fe41f2896916c","observation_id":"0db63301-0fce-4dd1-a679-b74a2b8679f3","resolution":{"observed_at":"2026-06-30T01:34:09.489245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.02089","doi":"10.48550/arxiv.2410.02089","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gehring, K","venue":"arXiv (Cornell University)","work_id":"69420a77-ff3b-4234-9a5d-438b7632b04d","year":2025},"citing_paper":{"arxiv_id":"2607.02390","last_updated":"2026-07-02T16:25:10Z","snapshot_observed_at":"2026-08-03T00:49:51.748486Z","submitted_at":"2026-07-02T16:25:10Z","title":"DecompRL: Solving Harder Problems by Learning Modular Code Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-03T16:30:34.793328Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.02390"},"observation_digest":"sha256:63d1b61a4b6eed2f286f82b1fb03161d1b7b0b729ede541dd7ff09bfe420e27d","observation_id":"94718f18-42ee-4043-b317-adf8860d58f3","resolution":{"observed_at":"2026-07-03T16:38:39.791771Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-11T17:00:48.664985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04577","last_updated":"2026-07-06T01:04:40Z","snapshot_observed_at":"2026-08-07T07:55:48.839021Z","submitted_at":"2026-07-06T01:04:40Z","title":"Beyond the Need for Speed: Energy-Aware Code Generation via Simulation-Guided Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T17:00:48.664985Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.04577"},"observation_digest":"sha256:bdc70e2879b58e4e950657d75c42603111ff66ff7c604b2ff7357d2fb9c34ac0","observation_id":"16ed8299-fb9d-4606-9c31-af71c070ade7","resolution":{"observed_at":"2026-07-11T17:00:48.664985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-02T07:22:05.963032Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:ad851bc65734dab4ecbad9b3c17d1cc52f08f3b28d6345c78d19aceb231b8cc5","observation_id":"dfd47062-a949-4b64-969c-22bb38ce2cf8","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T13:39:15.458226Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19044","last_updated":"2026-07-21T12:34:59Z","snapshot_observed_at":"2026-08-03T16:19:01.714132Z","submitted_at":"2026-07-21T12:34:59Z","title":"Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T13:39:15.458226Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.19044"},"observation_digest":"sha256:f5b9cde324119d4b34de21bbcf8f24c2ca10e50005aee16521b4945f4fa91e6e","observation_id":"ae5926b7-33cb-4f8d-93b0-fb5d51422def","resolution":{"observed_at":"2026-08-01T13:39:15.458226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T09:12:22.385849Z","title":"https://arxiv.org/abs/2410.02089v2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20862","last_updated":"2026-07-23T02:39:11Z","snapshot_observed_at":"2026-08-06T06:00:14.599452Z","submitted_at":"2026-07-23T02:39:11Z","title":"CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T09:12:22.385849Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.20862"},"observation_digest":"sha256:02686c80b86e8c0781a3d1296de2a9ec536172e097cd6084ae2f8a8ffc56c051","observation_id":"873b42e5-cbfb-4569-9dae-a9a5bf5f35a1","resolution":{"observed_at":"2026-08-01T09:12:22.385849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T08:36:30.457193Z","title":"arXiv preprint arXiv:2410.02089 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21090","last_updated":"2026-07-23T09:20:38Z","snapshot_observed_at":"2026-08-06T22:04:57.750051Z","submitted_at":"2026-07-23T09:20:38Z","title":"Training Large Language Models for Self-Explanation Faithfulness","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-08-01T08:36:30.457193Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.21090"},"observation_digest":"sha256:73a50843311f41db271ccde007990298784436da6a9a5d894954f72a97363f94","observation_id":"8597521d-8618-40b5-9d1a-cfa2c439d041","resolution":{"observed_at":"2026-08-01T08:36:30.457193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T04:28:45.552110Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22529","last_updated":"2026-07-24T17:59:22Z","snapshot_observed_at":"2026-08-01T04:28:42.700487Z","submitted_at":"2026-07-24T17:59:22Z","title":"Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T04:28:45.552110Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.22529"},"observation_digest":"sha256:9ef94627e9b1131807afe5ccf15d2f647eae0c06dd29a58774d331094a247ce3","observation_id":"bba3d182-65cb-4f0c-a6a5-429435763b84","resolution":{"observed_at":"2026-08-01T04:28:45.552110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-01T10:53:08.880515Z","title":"Guo, D.; Yang, D.; Zhang, H.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27271","last_updated":"2026-07-29T11:39:55Z","snapshot_observed_at":"2026-08-06T17:49:02.982269Z","submitted_at":"2026-07-29T11:39:55Z","title":"RLPF: Reinforcement Learning from Performance Feedback for Code Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T10:53:08.880515Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2607.27271"},"observation_digest":"sha256:d5f1d6de7428be55188dba21b8eb04d464c76cc4fb4ae6c2a8352dab1eab3c33","observation_id":"9989336a-ed70-49c6-9097-e3ccdfc965fc","resolution":{"observed_at":"2026-08-01T10:53:08.880515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T00:14:38.260775Z","title":"Jonas Gehring, Kunhao Zheng, Jade Copet, Vegard Mella, Quentin Carbonneaux, Taco Cohen, and Gabriel Synnaeve","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01804","last_updated":"2026-08-04T02:24:08Z","snapshot_observed_at":"2026-08-07T23:09:44.849861Z","submitted_at":"2026-08-03T07:12:52Z","title":"LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:38.260775Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2608.01804"},"observation_digest":"sha256:645c784a82bfc4882d5596c3e892aa0319b38136679437c956243d8072130382","observation_id":"4b0e5296-46c0-4996-9f78-40f3af77103c","resolution":{"observed_at":"2026-08-07T00:14:38.260775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-04T19:59:00.219331Z","title":"arXiv preprint arXiv:2410.02089","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.219331Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:4a3390a1506384f26b0da9eb673fd5320317781d5ba66a83b95fe40a3b1f302d","observation_id":"6b017c0d-f03d-4ccb-8932-104c8caa8a47","resolution":{"observed_at":"2026-08-04T19:59:00.219331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02089/citation-record","integrity":"/paper/2410.02089/integrity","json":"/paper/2410.02089/citation-record.json","paper":"/paper/2410.02089"},"outbound":[],"paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 49 inbound Pith citation observations for arXiv:2410.02089."}