{"as_of":"2026-07-26T14:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd354627de7b61960242b5407610a114f333bcc95a75357f3532fe0adda0d352","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T05:16:28.008746Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-26T06:30:07.085553+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T14:30:20.959431Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2603.29957","last_updated":"2026-04-27T03:21:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-31T16:24:03Z","title":"Think Anywhere in Code Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T23:16:42.782431Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2603.29957"},"observation_digest":"sha256:d1e12b2a7fbbe6f2e64207f1712bba7b49c50110c2d8f6fbd8f348862bf5a1a9","observation_id":"d84a2454-7244-45eb-b109-e7f1f8a552cd","resolution":{"observed_at":"2026-05-13T23:18:25.612924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2604.01799","last_updated":"2026-04-17T04:26:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-02T09:13:52Z","title":"TestDecision: Sequential Test Suite Generation via Greedy Optimization and Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T21:36:14.478007Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2604.01799"},"observation_digest":"sha256:c99c836c290b925373d085e737dd94129d2d6986fb22f4e3a214ceeaa7e400b4","observation_id":"6a76c5aa-6361-4f47-8d5e-46524980184e","resolution":{"observed_at":"2026-05-13T21:38:18.780983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2604.02709","last_updated":"2026-04-15T09:12:39Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T04:06:39Z","title":"Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T19:51:08.304741Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2604.02709"},"observation_digest":"sha256:900e265c376d11ccf0d0581623a1d9780c84e6b6bfa98bd47020fa5915059590","observation_id":"830188b8-49f9-4487-9787-53a440b74aeb","resolution":{"observed_at":"2026-05-13T19:53:11.753782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:0114da7da3f246be6fd60b3157ec892d9643003a748c7092a316b7c3f7a1d012","observation_id":"b9f4dcbc-5880-46cb-8691-fba541979f9c","resolution":{"observed_at":"2026-05-10T07:01:49.478225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2605.06111","last_updated":"2026-05-07T12:24:53Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:24:53Z","title":"Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T09:11:20.733960Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2605.06111"},"observation_digest":"sha256:b4cf4f178fc14a7261dadf527660d34751bac94fc979f4607761c5528cfb9e05","observation_id":"dfa64b51-5155-4abd-b316-84f35d5c18d6","resolution":{"observed_at":"2026-05-11T20:26:10.469171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2605.15012","last_updated":"2026-05-14T16:12:30Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T16:12:30Z","title":"Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T03:18:26.590871Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2605.15012"},"observation_digest":"sha256:a9039a33fd4734b7ec7c5bf414b1c2f1b9591a40539983971479f0bce15502da","observation_id":"bb4b95a2-b255-4026-908e-42ee84ae03c4","resolution":{"observed_at":"2026-05-15T03:19:43.108008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2605.18747","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:59:03Z","title":"Code as Agent Harness","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-20T10:54:54.558241Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2605.18747"},"observation_digest":"sha256:5220ed569084a888f0996c893d3eb6060b0d5409533e769648c2c7141fa8018b","observation_id":"7c6a563f-8d8c-4ba8-ad5f-9cff54d5c9dc","resolution":{"observed_at":"2026-05-20T10:58:14.219194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2605.24375","last_updated":"2026-05-23T03:30:36Z","snapshot_observed_at":"2026-07-06T23:34:28.608412Z","submitted_at":"2026-05-23T03:30:36Z","title":"Distilling Game Code World Model Generation into Lightweight Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T13:58:37.956333Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2605.24375"},"observation_digest":"sha256:cc473f39b92458b47ac437cb9ecc9fc4bdbac536bca4adf210705a10a585ec6d","observation_id":"a33f4fe7-b7ed-4d90-9ab7-71c8191ca18e","resolution":{"observed_at":"2026-06-30T14:04:44.660858Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2605.30478","last_updated":"2026-05-28T18:50:00Z","snapshot_observed_at":"2026-07-06T23:39:43.967889Z","submitted_at":"2026-05-28T18:50:00Z","title":"Improving Small Language Models for Code Generation with Reinforcement Learning from Verification Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T06:11:06.960389Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2605.30478"},"observation_digest":"sha256:923a0945403e94199026debd2e7835ec553bba37689e8bc05f36cb3c7250677b","observation_id":"737d4a5e-111d-4cbb-b10a-0c5d1446197f","resolution":{"observed_at":"2026-06-29T14:53:32.279726Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2606.05784","last_updated":"2026-06-04T07:15:43Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T07:15:43Z","title":"TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:11.638029Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2606.05784"},"observation_digest":"sha256:d4dce338941a670dc28e14c020929f258c13437f0fd9c15bc2fef79d9977b829","observation_id":"45b56bcc-7699-4426-ac98-e248ca395c1b","resolution":{"observed_at":"2026-07-02T12:16:57.774024Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-07-06T23:47:38.671681Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:c0549f3ce4c19eef72b7b03c4207ae2fad814139b5bc671ecf02d7e1bc6ce239","observation_id":"aa580c9a-1676-4f23-8d9d-52405be4a5f2","resolution":{"observed_at":"2026-07-02T21:07:23.933247Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2606.11052","last_updated":"2026-06-09T16:17:19Z","snapshot_observed_at":"2026-07-06T23:50:11.160843Z","submitted_at":"2026-06-09T16:17:19Z","title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T13:08:57.218711Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2606.11052"},"observation_digest":"sha256:5e4170cc1142a7cb2b9bc8c4f97690f47c3a2dc6a680c83ff2e0e8e5093b9c41","observation_id":"54136184-f7a3-452a-b109-c60542fdb2ef","resolution":{"observed_at":"2026-06-27T13:10:55.917848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2606.11867","last_updated":"2026-06-10T09:42:11Z","snapshot_observed_at":"2026-07-06T23:50:53.469137Z","submitted_at":"2026-06-10T09:42:11Z","title":"Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T08:35:16.435272Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2606.11867"},"observation_digest":"sha256:7a3b1b6e5cb3cd4301ccd2699803f7801379a7a00d785e34867ac34b8282e2b7","observation_id":"1fa12586-08a0-4488-af79-31c964d593d0","resolution":{"observed_at":"2026-07-03T12:58:08.768615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2606.17682","last_updated":"2026-06-16T08:48:58Z","snapshot_observed_at":"2026-07-06T23:53:16.412242Z","submitted_at":"2026-06-16T08:48:58Z","title":"From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T00:59:50.038405Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2606.17682"},"observation_digest":"sha256:cecd0ca63b82f64977cfbb336dbef859d6b50166782bb0a9990be7998fb9fefb","observation_id":"e2839e89-9d81-4a5b-9f33-b3947090af37","resolution":{"observed_at":"2026-06-27T01:00:19.806171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2606.20881","last_updated":"2026-06-18T19:15:50Z","snapshot_observed_at":"2026-07-06T23:55:57.945000Z","submitted_at":"2026-06-18T19:15:50Z","title":"When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T17:07:21.486960Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2606.20881"},"observation_digest":"sha256:b1ee45abcb1c7b2be25fcc945e23f1a3aef4aa7bbab376db95f6a61fa45684bb","observation_id":"a9389d13-50cf-41b5-ad78-a794dfa3a7fa","resolution":{"observed_at":"2026-07-04T04:19:33.972007Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Xue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-07-11T14:30:20.064751Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:a23cb4e0479907d43a26527a6182f74a32a601d0baf30bd28b872294be8247a3","observation_id":"401e2898-b4b6-464c-8117-91fcc19a8df3","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.18471/citation-record","integrity":"/paper/2510.18471/integrity","json":"/paper/2510.18471/citation-record.json","paper":"/paper/2510.18471"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.01943","last_updated":"2025-08-07T23:04:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T17:50:31Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","version":2},"cited_work":{"arxiv_id":"2504.01943","doi":"10.48550/arxiv.2504.01943","metadata_source":"pith","pith_arxiv_id":"2504.01943","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","venue":"cs.CL","work_id":"31790e33-a933-4aaa-826b-10fccec3ffdf","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2504.01943","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:95c7f30ba72749f2d63e1b8cf92c2c01cc663cbda0e9d5ef9ede39d9e1e6fcd1","observation_id":"cb50c0e3-7c6a-4401-9a99-147dea01ef50","resolution":{"observed_at":"2026-05-18T05:20:54.609566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:ccf0f62449515db9406ce5ee3d70f87f70ddc7b61eff978fb59ef0f7fec21f6b","observation_id":"133023d3-99be-4eae-9140-1fb305078c90","resolution":{"observed_at":"2026-05-18T05:20:54.602730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-11T10:18:59.594684+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T10:18:59.594684+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:6ecb098dafbbe177761ae8902cc9bc3c518808322490cb7fe23462c471a7fc92","observation_id":"35c381a8-345a-4eea-b64f-bc280f5d75ff","resolution":{"observed_at":"2026-05-18T05:20:54.624448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:ec382acfaa590e660e7fddbd942cb9586e96e506c0b20462d461beba0568b290","observation_id":"9f1ccf0c-4e9f-499f-85d0-45291f2e4ac4","resolution":{"observed_at":"2026-05-18T05:20:54.579753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09043","last_updated":"2024-09-05T14:00:11Z","snapshot_observed_at":"2026-07-06T14:43:31.440090Z","submitted_at":"2023-01-22T02:59:59Z","title":"CodeScore: Evaluating Code Generation by Learning Code Execution","version":4},"cited_work":{"arxiv_id":"2301.09043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.09043","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yihong Dong, Jiazheng Ding, Xue Jiang, Ge Li, Zhuo Li, and Zhi Jin","venue":null,"work_id":"2bcf1fd8-f84f-4b39-b10c-ef1f8bfdfc4c","year":2023},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2301.09043","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:3b2d03b76ff64bbbfa1577946321b721944c4b370eaca87123242e810111c871","observation_id":"19022fa2-d24f-4201-97be-b9d8355ac07a","resolution":{"observed_at":"2026-05-18T05:20:54.620410Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00083","last_updated":"2025-09-30T03:34:50Z","snapshot_observed_at":"2026-07-06T22:05:57.485783Z","submitted_at":"2025-07-31T18:17:36Z","title":"A Survey on Code Generation with LLM-based Agents","version":2},"cited_work":{"arxiv_id":"2508.00083","doi":"10.1007/s41233-023-00059-2","metadata_source":"pith","pith_arxiv_id":"2508.00083","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"A Survey on Code Generation with LLM-based Agents","venue":"cs.SE","work_id":"d958445f-408f-4ff3-bd9a-decd431c419a","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2508.00083","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:cd011ff067eca20be099e779e7da1db7353d39bfbcb289fe03cadab2155c5d5e","observation_id":"f3ba0fca-58f2-4a83-98fe-1e1ceb21b23b","resolution":{"observed_at":"2026-05-19T23:02:21.366092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05170","last_updated":"2026-05-05T15:31:45Z","snapshot_observed_at":"2026-07-06T22:09:13.286008Z","submitted_at":"2025-08-07T09:04:10Z","title":"ReCode: Reinforcing Code Generation with Reasoning-Process Rewards","version":3},"cited_work":{"arxiv_id":"2508.05170","doi":"10.48550/arxiv.2508.05170","metadata_source":"pith","pith_arxiv_id":"2508.05170","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ReCode: Reinforcing Code Generation with Reasoning-Process Rewards","venue":"cs.SE","work_id":"5189297d-938c-4b3c-8c55-08c2c99ca8d4","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2508.05170","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:cb8d426cb7c6984022c9af1c50ff5ae0ffa8b5148af25715cefacf195c030c8d","observation_id":"33cd7339-6bfe-4775-ac0e-7e589667d67e","resolution":{"observed_at":"2026-05-18T05:20:54.545492Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":"2306.08543","doi":"10.48550/arxiv.2306.08543","metadata_source":"pith","pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","venue":"cs.CL","work_id":"16edb291-dd18-41c5-8486-c6c715ec5311","year":2023},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:a8cd2492274e48da3e26c9b4315fde2725ba0bf938dcd39a2d6d460e54761f00","observation_id":"a92c6490-3bd4-4fd2-9249-c8876bf892ad","resolution":{"observed_at":"2026-05-18T05:20:54.589881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":"2305.15717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-07-04T05:09:36.906364Z","title":"The False Promise of Imitating Proprietary LLMs","venue":"cs.CL","work_id":"f843d86a-7fd6-4b0d-bf8b-f1ad3fbc3f04","year":2023},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:62b4786b86a45d05724f3ed1b205b96d054b4f9a5c1677fc011ff7f47f8c6662","observation_id":"42fdce16-fd98-40e5-8748-dc2aaa83dbe6","resolution":{"observed_at":"2026-05-18T06:54:31.902059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-07-06T17:41:06.530605Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:ed3e73f1af420793c9f07427f066722c4de92caa11050bdb78e28e5215941dcb","observation_id":"86d251eb-e19e-42fc-aca2-e7b41d675a63","resolution":{"observed_at":"2026-05-18T05:20:54.606098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":"2505.22312","doi":"10.48550/arxiv.2505.22312","metadata_source":"pith","pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Skywork Open Reasoner 1 Technical Report","venue":"cs.LG","work_id":"27740ebb-6704-4ef9-8878-5b81d4269869","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:2e4f716d4f55755aa1cce093cb39c6e7ef93a70d72851190f5864279635b515f","observation_id":"4509fc09-955f-49be-9835-cd4b484f275c","resolution":{"observed_at":"2026-05-18T05:20:54.576707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":"2105.09938","doi":"10.18653/v1/2021.eacl-main.225","metadata_source":"pith","pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Measuring Coding Challenge Competence With APPS","venue":"cs.SE","work_id":"c014c12f-1080-4cb2-ae03-ab6b7c09445c","year":2021},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:dfde7a7fd9a6c36507655f8b9cb9cb1fb7a4e108223ae64006bf6a7ff12f4b0b","observation_id":"c92de9ca-b71f-443b-a17b-025fe33c0ba0","resolution":{"observed_at":"2026-05-18T05:20:54.613065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Designing and interpreting probes with control tasks","venue":null,"work_id":"a6a71a03-3802-41f1-9bbe-f0e9cf249224","year":2019},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:cf6c319adc20b1cba5811e541917bc9ebda4bb318cd9617df0fb1aeaf4af68c6","observation_id":"bc0ebe0d-b6de-4509-8776-3e848d148cc1","resolution":{"observed_at":"2026-05-18T05:25:55.141010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":"2409.12186","doi":"10.48550/arxiv.2409.12186","metadata_source":"pith","pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-07-10T16:07:20.290468Z","title":"Qwen2.5-Coder Technical Report","venue":"cs.CL","work_id":"09ba463d-6377-4017-9801-444ffb94b056","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:1f67ed2a9443761ef7dd479419936c3d1cc0f58c4108c18377be687c7b972f99","observation_id":"feda402c-46a4-464d-9774-51e523e764a1","resolution":{"observed_at":"2026-05-18T05:20:54.522277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:18:55.772185+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:18:55.772185+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:6d16fd9057974942cffeebcc8767f7b51e3602bc4c5754fec27b2e2f2c35fa82","observation_id":"428da1f5-5f6a-42a0-9113-5b1de683fc1d","resolution":{"observed_at":"2026-05-18T05:20:54.599756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.00046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SEED: customize large language models with sample- efficient adaptation for code generation.CoRR, abs/2403.00046, 2024a","venue":null,"work_id":"30a6b3ff-3a1e-4264-b209-09273439f896","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:24fafa5e5005414d26fa4022ee922212736f733a93be0892c6a3bc85ca6c10d4","observation_id":"fae20ebe-62cb-41d4-8060-b9a257df0488","resolution":{"observed_at":"2026-05-18T05:20:54.555648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16061","last_updated":"2024-03-04T13:37:48Z","snapshot_observed_at":"2026-07-06T17:35:06.195492Z","submitted_at":"2024-02-25T11:15:42Z","title":"How Large Language Models Encode Context Knowledge? A Layer-Wise Probing Study","version":2},"cited_work":{"arxiv_id":"2402.16061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.16061","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How large language models encode context knowledge? a layer-wise probing study","venue":null,"work_id":"86cb44d3-ec8b-4187-944a-ac8c24ba7908","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2402.16061","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:fb169c0112d8e3cb041227b38e409303131fe8286be9e7ed1e476a6378630825","observation_id":"883330c4-a3b1-4746-b00f-3c2b18ea02a0","resolution":{"observed_at":"2026-05-18T05:20:54.586746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":"2312.14852","doi":"10.48550/arxiv.2312.14852","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"TACO: Topics in algorithmic COde generation dataset.arXiv preprint","venue":null,"work_id":"67740cc1-d973-4614-adf4-686babd14274","year":2023},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:8d537fcb9b0b46cecfe3cccdd959e3130973ff8f5466ecec4b35ca75346777e3","observation_id":"498c88f4-de7e-41d7-b0fb-2772d6d3bf35","resolution":{"observed_at":"2026-05-18T05:20:54.527865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:d7796b7f4b2b58e84715adff592670587a8b4de4b7e1b67ba5a5d9d8943cad99","observation_id":"67f68427-9c13-4e8f-8a61-4f441c4caee8","resolution":{"observed_at":"2026-05-18T05:20:54.616387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-07-11T03:17:52.238641Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:446fabccbec0460d15346cec18012c28117fefbe756635b82d083bba01dfda62","observation_id":"d75a2d4a-d82e-47e6-924a-1b12a506e19b","resolution":{"observed_at":"2026-05-18T05:20:54.631628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:1528c2617a3fd8068803cb9b58b42def946aee0969eae64706f2cfd18951cd66","observation_id":"f338b61f-d491-4256-adb8-294aac569a5d","resolution":{"observed_at":"2026-05-18T05:20:54.627938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:666c4a4b1f0a98cd5e125701d87c11bbf8abf0b97238087a7f269b5d6f13eb7f","observation_id":"1ef83e66-5b18-4934-a089-3cab40d05de3","resolution":{"observed_at":"2026-05-18T05:20:54.559062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:077bcdf42c28b8b5ac3d854e25f2d17a748603b0636d5b3ea41af40925702401","observation_id":"7b23b830-ed05-4bf7-99dc-b4222ef13cee","resolution":{"observed_at":"2026-05-18T05:20:54.549662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17548","last_updated":"2025-07-23T14:26:58Z","snapshot_observed_at":"2026-07-06T22:01:40.281520Z","submitted_at":"2025-07-23T14:26:58Z","title":"CodeReasoner: Enhancing the Code Reasoning Ability with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.17548","snapshot_observed_at":"2026-07-10T19:57:34.114468Z","title":"Codereasoner: Enhancing the code reasoning ability with reinforcement learning","venue":"cs.SE","work_id":"615654f3-ede8-499c-8511-2ff7374139fc","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2507.17548","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:5c12bd9b52a1ffc2c9fd2f08ccad6269f5b32c19db03011c741456dc1941bbb4","observation_id":"bf918166-6fc3-4071-8ec0-d28d694f7339","resolution":{"observed_at":"2026-05-18T05:20:54.583092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05242","last_updated":"2025-08-07T10:31:24Z","snapshot_observed_at":"2026-07-06T22:09:18.804010Z","submitted_at":"2025-08-07T10:31:24Z","title":"CodeBoost: Boosting Code LLMs by Squeezing Knowledge from Code Snippets with RL","version":1},"cited_work":{"arxiv_id":"2508.05242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05242","snapshot_observed_at":"2026-07-01T17:05:50.847043Z","title":"CodeBoost: Boosting code LLMs by squeezing knowledge from code snippets with rl","venue":null,"work_id":"4c5f69a1-2550-4264-9479-a7da8937e0c7","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2508.05242","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:ac1eb37d0d87bc74468e1378a57644948433b6eced1893fd292575f832553855","observation_id":"7bd90871-6fa5-4941-b7e0-192da2733377","resolution":{"observed_at":"2026-05-18T05:20:54.573655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03136","doi":"10.48550/arxiv.2506.03136","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Co-evolving llm coder and unit tester via reinforcement learning.arXiv preprint arXiv:2506.03136","venue":null,"work_id":"62814e75-f541-485a-9707-8e48d14708f7","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:b80e90bef5a45995f6f379493fd61a5026609db9e1d3c542a5619c700d447830","observation_id":"c8a3f9db-b5ba-4130-b6c0-afbef25450ab","resolution":{"observed_at":"2026-05-18T05:20:54.562712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-07-06T21:12:12.799570Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"cited_work":{"arxiv_id":"2504.14655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14655","snapshot_observed_at":"2026-07-04T18:30:01.590053Z","title":"Leetcodedataset: A temporal dataset for robust evaluation and efficient training of code llms","venue":null,"work_id":"fa4f9b7e-a077-4016-9e1e-920df8d601b6","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2504.14655","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:6e55f7ff0eed8d8437d43dfed65835e43a789aa17069686c18b191a9678076c7","observation_id":"c5509687-8d24-4de0-8b8a-917d97791d98","resolution":{"observed_at":"2026-05-18T05:20:54.593415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":"2402.13116","doi":"10.48550/arxiv.2402.13116","metadata_source":"pith","pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-07-11T12:15:01.025339Z","title":"A Survey on Knowledge Distillation of Large Language Models","venue":"cs.CL","work_id":"b1dcdadf-875e-4695-8fcf-0907c69302f3","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:ff242605cf41c9bac26ba84eb65d7da14e7381f9cca6ae086d4470c5d37afad9","observation_id":"d6eb99f1-bcfd-41d2-bf6a-f13127b68e17","resolution":{"observed_at":"2026-05-18T05:20:54.566348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-11T12:49:12.049248+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T12:49:12.049248+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Here's a step-by-step approach to achieve this:1","venue":null,"work_id":"b931083b-9000-4eda-88c1-938010f411f3","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:801b3232fe2b372c991d81df2e7b195e221d1e3734fc17f0fff1225d47949403","observation_id":"835bd351-177b-4e26-abc7-1012ea600259","resolution":{"observed_at":"2026-05-18T05:25:55.133531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Initialize a Dictionary to Track Blocks: Use a dictionary to map the top-left corner of each 2x2 block to the count of black cells in that block.2","venue":null,"work_id":"58feb686-c3d4-4170-9750-741ab0ca4e66","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:5687d5cdc209324333f9ab6309484751a7d62e1199f48e46151a2e042e41d6c8","observation_id":"fb4308cd-a36e-4705-927c-258161822413","resolution":{"observed_at":"2026-05-18T05:25:55.136519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"86e995e7-9174-4d98-891d-6530b2b47d95","year":2025},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:7b022e0f52a169e80f40ddced67309c01e03957998f6690fbb5e3d93461449ad","observation_id":"815fb496-5bf3-4a86-b4e5-5b659f91ef37","resolution":{"observed_at":"2026-05-18T05:25:55.138529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-26T06:30:07.085553+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":24,"verified_fuzzy":4},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-26T06:30:07.085553+00:00","source":"crossref"},{"observed_at":"2026-07-26T06:30:01.561857+00:00","source":"retraction_watch"}],"thesis":"As of 26 July 2026, this Paper Citation Record lists 31 of 31 outbound references and 16 inbound Pith citation observations for arXiv:2510.18471."}