{"as_of":"2026-08-09T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1c5df34b6b5ac090a56c952b6c1259a9768e4d760cce9a71d89de6fd09b2326","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:10:39.001050Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:31:54.286136Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T12:44:40.230064Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-08-07T11:31:54.286136Z","title":"PRLCoder: Leveraging Process-Supervised Reinforcement Learning to Enhance Code Generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02211","last_updated":"2025-06-02T19:50:16Z","snapshot_observed_at":"2026-08-09T18:07:13.909506Z","submitted_at":"2025-06-02T19:50:16Z","title":"Improving LLM-Generated Code Quality with GRPO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:54.286136Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2506.02211"},"observation_digest":"sha256:a2826cf721c946335cdb8db10f42500dc3c075e4475f19d8c41f801f1360263a","observation_id":"18e4674b-e365-46e7-8ec7-e59fadbb27af","resolution":{"observed_at":"2026-08-07T11:31:54.286136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-08-06T15:24:25.819837Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.819837Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:12d30339e6eaac91e43eccc00e972900a74b7d6f836ecde3c59b2a5e78b95f02","observation_id":"aaffbf05-6329-479d-bf10-f10098639611","resolution":{"observed_at":"2026-08-06T15:24:25.819837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-08-03T23:27:38.089096Z","title":"Process-supervised reinforcement learning for code generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05933","last_updated":"2026-06-24T14:20:52Z","snapshot_observed_at":"2026-08-07T19:34:44.238702Z","submitted_at":"2025-11-08T08:56:29Z","title":"Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T23:27:38.089096Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2511.05933"},"observation_digest":"sha256:6fffbfba4eac526c3fbc6549f4a0cdaff2e46193cb31b88fd45ece7b614d4156","observation_id":"1ebf6c85-9541-44f4-ba5d-45ae9cf8dc64","resolution":{"observed_at":"2026-08-03T23:27:38.089096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-08-03T12:19:35.177823Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03525","last_updated":"2026-05-26T16:39:06Z","snapshot_observed_at":"2026-08-06T03:27:45.707151Z","submitted_at":"2026-01-07T02:29:49Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T12:19:35.177823Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2601.03525"},"observation_digest":"sha256:eb798615f0a9dc504e8a7c7f568b0f764c66a368d3f1119045c8181eb03862b4","observation_id":"862d71d8-3201-45e2-a169-e6611ec11551","resolution":{"observed_at":"2026-08-03T12:19:35.177823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":"2502.01715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-06-30T12:44:40.230064Z","title":"arXiv preprint arXiv:2502.01715 , year=","venue":null,"work_id":"cb4abcb3-63bf-4564-9b7f-887a01f9163e","year":2025},"citing_paper":{"arxiv_id":"2604.01799","last_updated":"2026-04-17T04:26:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-02T09:13:52Z","title":"TestDecision: Sequential Test Suite Generation via Greedy Optimization and Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T21:36:14.478007Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2604.01799"},"observation_digest":"sha256:dbbbf2af77b922084c87dcb41c99bbac97b7499630643bf2048b5a3272b6158c","observation_id":"e0374b31-8d81-4623-8e1e-6d44d37a3bfb","resolution":{"observed_at":"2026-05-13T21:38:18.788744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":"2502.01715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-06-30T12:44:40.230064Z","title":"arXiv preprint arXiv:2502.01715 , year=","venue":null,"work_id":"cb4abcb3-63bf-4564-9b7f-887a01f9163e","year":2025},"citing_paper":{"arxiv_id":"2605.04065","last_updated":"2026-05-07T04:49:30Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-11T07:26:04Z","title":"Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T16:58:10.013475Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2605.04065"},"observation_digest":"sha256:1f3b89cb77bbdf44ad0f0ef9c022b6c05ae755ead6299d86eef507a1e4b93487","observation_id":"6a3feea1-6dfe-49be-aa00-6b9d94158540","resolution":{"observed_at":"2026-05-11T07:45:59.984342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":"2502.01715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-06-30T12:44:40.230064Z","title":"arXiv preprint arXiv:2502.01715 , year=","venue":null,"work_id":"cb4abcb3-63bf-4564-9b7f-887a01f9163e","year":2025},"citing_paper":{"arxiv_id":"2605.04066","last_updated":"2026-05-07T04:57:40Z","snapshot_observed_at":"2026-08-02T15:49:26.057284Z","submitted_at":"2026-04-11T07:34:59Z","title":"Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T16:51:19.555272Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2605.04066"},"observation_digest":"sha256:47a7031cd79127ad038c6f569c8b4f4ea4cbdb8ff793311358d64e06e33f4bac","observation_id":"cd0ae5ae-5a2c-43c2-abbf-20c4a72c161e","resolution":{"observed_at":"2026-05-11T08:01:00.233468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":"2502.01715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-06-30T12:44:40.230064Z","title":"arXiv preprint arXiv:2502.01715 , year=","venue":null,"work_id":"cb4abcb3-63bf-4564-9b7f-887a01f9163e","year":2025},"citing_paper":{"arxiv_id":"2605.29697","last_updated":"2026-05-28T09:57:12Z","snapshot_observed_at":"2026-08-05T09:39:33.107372Z","submitted_at":"2026-05-28T09:57:12Z","title":"Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T07:58:55.548382Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2605.29697"},"observation_digest":"sha256:946ead190a23433ee97c342f9ec36ba863d4f24b9f9b44eb080c2468a5af77fc","observation_id":"1d03fe18-37d5-47bd-8db7-482b1e88f803","resolution":{"observed_at":"2026-06-29T08:03:14.288936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":"2502.01715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-06-30T12:44:40.230064Z","title":"arXiv preprint arXiv:2502.01715 , year=","venue":null,"work_id":"cb4abcb3-63bf-4564-9b7f-887a01f9163e","year":2025},"citing_paper":{"arxiv_id":"2606.28707","last_updated":"2026-06-27T03:25:53Z","snapshot_observed_at":"2026-07-07T00:02:47.924620Z","submitted_at":"2026-06-27T03:25:53Z","title":"BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-06-30T10:07:39.554999Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2606.28707"},"observation_digest":"sha256:568c8bb035efb9f060c6afe18d1d21e9ea1596d35ccb243f2a3e04e61c4b2ab7","observation_id":"fae0bdb1-6d17-4048-8adb-07a787463b99","resolution":{"observed_at":"2026-06-30T12:44:40.231715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01715/citation-record","integrity":"/paper/2502.01715/integrity","json":"/paper/2502.01715/citation-record.json","paper":"/paper/2502.01715"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T15:10:38.746645Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.746645Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:dce865145d4c7fb42c06f691685d7d0040486544e7ecae112ad9665cd7920a22","observation_id":"44db55d9-7fb6-4803-94ee-e4ec4ec07176","resolution":{"observed_at":"2026-08-09T15:10:38.746645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.751842Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.751842Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:179ea1c671ca4a8cfd5450b2eea71b877b9261c7df5f0b73a28fcafcca8c0a5f","observation_id":"0056b658-88b8-42cb-8aff-613fa78adb8a","resolution":{"observed_at":"2026-08-09T15:10:38.751842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-09T15:10:38.757164Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.757164Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:958bc0b3fab74855ca445c33505450e36b151c9c495ffeeb5bab031d7ac23a17","observation_id":"6c32569f-3a9d-4705-8abf-cf0b3e87ab48","resolution":{"observed_at":"2026-08-09T15:10:38.757164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-09T15:10:38.762277Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.762277Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:251a8cbf23a6416794e24f5e28c4b3f0ad23e9cb9a0c4e5f40ffb781e7f24320","observation_id":"20a2211f-d9c2-46ed-8157-fb84d8f6dae9","resolution":{"observed_at":"2026-08-09T15:10:38.762277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-09T15:10:38.767129Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.767129Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:85e3c4ddb4775a5e55ce6729277656058f7e8996ab31ea449600cedce22a2fca","observation_id":"c367e2ca-b73d-4664-a06f-075c3c6e5282","resolution":{"observed_at":"2026-08-09T15:10:38.767129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-09T15:10:38.772031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.772031Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:29ff33c52d2811f5e97e48fc519761a728cc4d002b4ecac9cea0db766fbd7688","observation_id":"81b336dd-1a86-4be9-b198-ad2b53e51433","resolution":{"observed_at":"2026-08-09T15:10:38.772031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-09T15:10:38.777654Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.777654Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:60f03f8c863d1ac4df25b32c973697c1b0162ec9bbd5188947202925dbef9094","observation_id":"11ed19ae-6dd5-4a38-9bfb-088af0c68af3","resolution":{"observed_at":"2026-08-09T15:10:38.777654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17621","last_updated":"2025-02-04T09:24:30Z","snapshot_observed_at":"2026-07-06T19:38:18.191612Z","submitted_at":"2024-10-23T07:22:33Z","title":"Process Supervision-Guided Policy Optimization for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17621","snapshot_observed_at":"2026-08-09T15:10:38.782468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.782468Z"},"links":{"cited_paper":"/paper/2410.17621","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:c4525ab22615cccba4159ab1dd39ea77f2dbdb3a278c70acd20059cba352845e","observation_id":"9cb63d96-72bc-49c9-bfb8-cbba843e0a92","resolution":{"observed_at":"2026-08-09T15:10:38.782468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.00777","last_updated":"2017-04-20T17:26:35Z","snapshot_observed_at":"2026-07-06T05:09:08.360468Z","submitted_at":"2016-09-03T01:02:51Z","title":"Towards End-to-End Reinforcement Learning of Dialogue Agents for Information Access","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.00777","snapshot_observed_at":"2026-08-09T15:10:38.787613Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.787613Z"},"links":{"cited_paper":"/paper/1609.00777","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:6b263b15d242c5610916c0026428d5ab501de032b7e3aadca4f6179d1e2b8e70","observation_id":"763fd09c-214a-4f75-8455-fa3a916adb48","resolution":{"observed_at":"2026-08-09T15:10:38.787613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T15:10:38.792717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.792717Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:3e166f4abc448dd1a2d1194641512b718f42779869800da8cb5c86c6798b4da5","observation_id":"012cf20e-210f-4178-b988-d7b3b102023c","resolution":{"observed_at":"2026-08-09T15:10:38.792717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08155","last_updated":"2020-09-18T15:38:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-19T13:09:07Z","title":"CodeBERT: A Pre-Trained Model for Programming and Natural Languages","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08155","snapshot_observed_at":"2026-08-09T15:10:38.797764Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.797764Z"},"links":{"cited_paper":"/paper/2002.08155","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:214b784ff5b9b8872dc02479b189869b751d5945fe837394eca999ed1556668e","observation_id":"7b976b9b-1e7e-4b0a-b036-cab8504a3c38","resolution":{"observed_at":"2026-08-09T15:10:38.797764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.802256Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.802256Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:51267dd56d068e9cd649a4000b6ec85ca5339431ca0fceccee69b7be9b90926e","observation_id":"477ad882-2a87-40b3-bdf6-9882e2eac1a4","resolution":{"observed_at":"2026-08-09T15:10:38.802256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03850","last_updated":"2022-03-08T04:48:07Z","snapshot_observed_at":"2026-08-02T05:58:04.510079Z","submitted_at":"2022-03-08T04:48:07Z","title":"UniXcoder: Unified Cross-Modal Pre-training for Code Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03850","snapshot_observed_at":"2026-08-09T15:10:38.807462Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.807462Z"},"links":{"cited_paper":"/paper/2203.03850","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:be7a93532c861a2e9c4a9f08df54a9c435b73c381d6c0dc419df1d7b169d2115","observation_id":"38f56300-3a0c-407c-9728-b45cdc92ef5e","resolution":{"observed_at":"2026-08-09T15:10:38.807462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.08366","last_updated":"2021-09-13T05:48:51Z","snapshot_observed_at":"2026-07-06T09:56:32.308108Z","submitted_at":"2020-09-17T15:25:56Z","title":"GraphCodeBERT: Pre-training Code Representations with Data Flow","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.08366","snapshot_observed_at":"2026-08-09T15:10:38.812077Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.812077Z"},"links":{"cited_paper":"/paper/2009.08366","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:e5f642518cff81ebc7144a61a25c566603792568813933953a1c60929f211ad5","observation_id":"06359d2f-5ce0-4aab-8cf5-1c94af8c2df3","resolution":{"observed_at":"2026-08-09T15:10:38.812077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-09T15:10:38.816815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.816815Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:9d13c376deb6e4903427f74b5b26f2868bbdabc11af037debd8acf3afc0b9273","observation_id":"bbab7549-6628-4783-8e7e-9fd8ec298cdd","resolution":{"observed_at":"2026-08-09T15:10:38.816815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.778673Z","title":null,"venue":null,"work_id":"e1e29b06-328b-4ce1-9962-31e2dba6b6ff","year":2015},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.821485Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:f2648c6ec17bf25657fc290b0a056d227c5fc4d5acf22407c3264fbe300c890e","observation_id":"15a9ec98-f86f-4d15-b564-d810cf708beb","resolution":{"observed_at":"2026-08-09T15:10:39.783815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.761571Z","title":null,"venue":null,"work_id":"04cb0cca-fd2e-4dc9-86a2-4be6a66952b2","year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.825981Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:6a19bb324b8aafdff8789c0eb8dd45a6933f35419d6492b8a34aaef20bfe1e6b","observation_id":"e7c9a691-87fa-4cf0-b645-0c8c88e73e3c","resolution":{"observed_at":"2026-08-09T15:10:39.767454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-09T15:10:38.830590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.830590Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:01dd24fef176827691b874a83ed193ea2146fa7752ebd4a41507a70bef4423d9","observation_id":"7d60ab94-c0e6-4cd8-ba32-9e9591c08c3b","resolution":{"observed_at":"2026-08-09T15:10:38.830590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.835716Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.835716Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:190f5c9c7da5a8730188c4a04088eab380c6c84bb579be0b01acdffe93904222","observation_id":"2d0c8187-abce-4049-8641-ef4c0fcd7ff7","resolution":{"observed_at":"2026-08-09T15:10:38.835716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.736392Z","title":null,"venue":null,"work_id":"16c71970-5207-4847-b3dd-a19a04316d1f","year":2022},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.840331Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:20d85bd0cec2d7151adce75110326bdcdbc87d5cd1ada1fb63dc1aebe96562c1","observation_id":"ec13d256-b9ae-4e69-b018-ec4e62afcfd8","resolution":{"observed_at":"2026-08-09T15:10:39.741845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-09T15:10:38.844627Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.844627Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:a3c81570437c406dcd68a9ea257ab66e7ae01e3b141a7afd10e5d5d8867e4e8d","observation_id":"8dbd8ac3-f10b-4ffe-a237-a13a61f4b112","resolution":{"observed_at":"2026-08-09T15:10:38.844627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-09T15:10:38.849701Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.849701Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:fea82751550af352bf9cb6a240b127f799f03ac5c029bee3f45bbca39be40363","observation_id":"d0aa659f-55d3-41eb-a76e-edc90acd3175","resolution":{"observed_at":"2026-08-09T15:10:38.849701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.854560Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.854560Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:ec0bbc5bffbdd75d526421712c72984ce57a684c76561c4922d7cec234928982","observation_id":"54c0398b-cf32-4f36-a34d-92907d7de799","resolution":{"observed_at":"2026-08-09T15:10:38.854560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-09T15:10:38.859562Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.859562Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:e087dcf9865155622bf5918cceee91c2450bfc8419d1f9ba7285f80f54412780","observation_id":"777d1184-b482-4e03-8384-2d3dddb99d23","resolution":{"observed_at":"2026-08-09T15:10:38.859562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.711037Z","title":null,"venue":null,"work_id":"e6f2441b-078c-4080-ba3d-a26ba50ce72b","year":2007},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.864580Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:8cf58468009e63f2bdc277a05270f956cd2dabcabfda6b8830d40b49635875ae","observation_id":"bf02f726-c214-480a-b365-4b18e1a0c4ea","resolution":{"observed_at":"2026-08-09T15:10:39.716141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04349","last_updated":"2023-11-13T03:49:27Z","snapshot_observed_at":"2026-07-06T15:51:58.017259Z","submitted_at":"2023-07-10T05:18:18Z","title":"RLTF: Reinforcement Learning from Unit Test Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04349","snapshot_observed_at":"2026-08-09T15:10:38.868972Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.868972Z"},"links":{"cited_paper":"/paper/2307.04349","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:fc63f0a8ce9d0341b3b5afc3718d3271aabdbd46468fb95a7d1d2f200cb06bc3","observation_id":"399b8bb8-37a4-4c0a-aa2f-376e220713c2","resolution":{"observed_at":"2026-08-09T15:10:38.868972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-09T15:10:38.874401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.874401Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:b2aad76d3db85d3b250616fa458ce165ed47567196e494b9ec87cc239fc02218","observation_id":"da135484-570d-4fc5-b66b-a249d7f9f50f","resolution":{"observed_at":"2026-08-09T15:10:38.874401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10080","last_updated":"2023-10-16T05:21:50Z","snapshot_observed_at":"2026-07-31T13:07:40.008796Z","submitted_at":"2023-10-16T05:21:50Z","title":"Let's reward step by step: Step-Level reward model as the Navigators for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10080","snapshot_observed_at":"2026-08-09T15:10:38.879367Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.879367Z"},"links":{"cited_paper":"/paper/2310.10080","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:77f47b7c468b2fb5b7f040419a0fec0b3d7316230e6582284cf5bced507bd497","observation_id":"54fc7869-4a4c-4613-8f6a-c6c38907ce13","resolution":{"observed_at":"2026-08-09T15:10:38.879367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-09T15:10:38.884186Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.884186Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:50663e26376a35c642829ef842c9307c10bd2ffaa004f89c3daa0683c147f99a","observation_id":"0aedf4ac-34bd-41ce-b874-7a9d7fb118cc","resolution":{"observed_at":"2026-08-09T15:10:38.884186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.889088Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.889088Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:250a00c30e035f88b7c832dd6f3b757ef4fc67dabca6850dd21f62485b40c3dc","observation_id":"bd164991-ce4a-49c2-b077-7b6446eb505f","resolution":{"observed_at":"2026-08-09T15:10:38.889088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-09T15:10:38.893567Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.893567Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:6a629742cd7371a45f94c0dbc1a5ce90b3c095d807b5f9c2ad230b6fc2863a14","observation_id":"a5cf2432-338a-4442-be1d-5965b8d2d9a3","resolution":{"observed_at":"2026-08-09T15:10:38.893567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.898254Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.898254Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:bcfdcf3d123a73820079832b847f84cd97dc3a1ed3a77843499f6b7f05e37f7e","observation_id":"b48f425f-3241-492f-b801-20288909d7d8","resolution":{"observed_at":"2026-08-09T15:10:38.898254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.903595Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.903595Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:221498ce6669ac5e0cdf897bc1fc641a1422bd11ef25a6840e57e6e7f1598415","observation_id":"9534e56e-ce12-4d14-934f-789adc462854","resolution":{"observed_at":"2026-08-09T15:10:38.903595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10297","last_updated":"2020-09-27T04:07:11Z","snapshot_observed_at":"2026-08-01T07:33:26.380394Z","submitted_at":"2020-09-22T03:10:49Z","title":"CodeBLEU: a Method for Automatic Evaluation of Code Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10297","snapshot_observed_at":"2026-08-09T15:10:38.908142Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.908142Z"},"links":{"cited_paper":"/paper/2009.10297","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:dc5bf05c726b1996cb2ad7941410f03638ffb1b411f1aa1dfabe6c7455dd4481","observation_id":"7519ed64-db05-4ee2-9168-3ce1d56b98da","resolution":{"observed_at":"2026-08-09T15:10:38.908142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.913160Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.913160Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:7f37fda0084e46e1d772af5b2e5c1c0c3df719277dff7f632913c92815ff7cac","observation_id":"9dd5e846-051b-45f2-ae80-93322471ba29","resolution":{"observed_at":"2026-08-09T15:10:38.913160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T15:10:38.917519Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.917519Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:4475673a9724e14c832e0ffa07b200404ffc709f25d825794c90b414ccc7df57","observation_id":"b22b0fb4-2ea6-45f7-9200-0afb4b0bd28a","resolution":{"observed_at":"2026-08-09T15:10:38.917519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13816","last_updated":"2023-07-19T19:55:31Z","snapshot_observed_at":"2026-08-06T04:20:20.002125Z","submitted_at":"2023-01-31T18:02:26Z","title":"Execution-based Code Generation using Deep Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13816","snapshot_observed_at":"2026-08-09T15:10:38.922030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.922030Z"},"links":{"cited_paper":"/paper/2301.13816","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:18b6c91a1ded240aa666ecc39c18ea99436dba197b0b80711847095fc6348444","observation_id":"3e62896b-58e7-403e-bc94-5d8f11da6227","resolution":{"observed_at":"2026-08-09T15:10:38.922030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T15:10:38.926569Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.926569Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:77d091f3518d2650cb7d63b1abda6d85fef556181f415192d673edc06fee7321","observation_id":"54915dd4-887f-4690-9423-85276bffe2ee","resolution":{"observed_at":"2026-08-09T15:10:38.926569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T15:10:38.930919Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.930919Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:b42cf0c6ee6072cd963c129899929afcb1d163be9203520a5200a461dabf404c","observation_id":"4625abeb-b736-42cf-8643-24031b2b9917","resolution":{"observed_at":"2026-08-09T15:10:38.930919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-09T15:10:38.935579Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.935579Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:65670a354e03d2a524177c0def8d11c930d5c60f7a1aa5fc7deb3438df21997c","observation_id":"f9f01a97-994a-4618-afa8-76c2534bdf8e","resolution":{"observed_at":"2026-08-09T15:10:38.935579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.655724Z","title":null,"venue":null,"work_id":"316d19ad-b790-4491-8df3-e1e48882c745","year":2016},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.940441Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:a769dbee34c0d3b15d94f1b5d1267d1976cc6e52592cff2574ea261645be1057","observation_id":"81c24362-4f0a-4cdb-9134-116180b7db97","resolution":{"observed_at":"2026-08-09T15:10:39.661393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.944659Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.944659Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:1f5ac1c05f093316b297974f1fe94281f18aac517d79e14ffe8a36f210dbdb87","observation_id":"8454ba4b-efd8-41b4-840c-51b2d9f2ff55","resolution":{"observed_at":"2026-08-09T15:10:38.944659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05132","last_updated":"2022-03-10T03:15:17Z","snapshot_observed_at":"2026-08-06T05:39:12.203368Z","submitted_at":"2022-03-10T03:15:17Z","title":"Compilable Neural Code Generation with Compiler Feedback","version":1},"cited_work":{"arxiv_id":"2203.05132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.05132","snapshot_observed_at":"2026-08-09T15:10:39.152141Z","title":"Compilable Neural Code Generation with Compiler Feedback","venue":"cs.CL","work_id":"49b15079-beee-4712-8ba1-dfa93d4670ff","year":2022},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.949102Z"},"links":{"cited_paper":"/paper/2203.05132","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:a0cae53bdc9e5e346a2451b6153151b1a83cab6a353e893a3af58cf6385c58f1","observation_id":"247ed4be-1511-457e-b6a0-261ed9b59708","resolution":{"observed_at":"2026-08-09T15:10:39.157183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07922","last_updated":"2023-05-20T07:27:15Z","snapshot_observed_at":"2026-08-08T01:28:05.271964Z","submitted_at":"2023-05-13T14:23:07Z","title":"CodeT5+: Open Code Large Language Models for Code Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07922","snapshot_observed_at":"2026-08-09T15:10:38.953669Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.953669Z"},"links":{"cited_paper":"/paper/2305.07922","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:8fe700f4da800c04b4603dfee28afa055679a37d7c8a03442c9808158c045524","observation_id":"0cc9f4bb-5586-44e6-9fab-b4b98adca092","resolution":{"observed_at":"2026-08-09T15:10:38.953669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00859","last_updated":"2021-09-02T12:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-02T12:21:06Z","title":"CodeT5: Identifier-aware Unified Pre-trained Encoder-Decoder Models for Code Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00859","snapshot_observed_at":"2026-08-09T15:10:38.958717Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.958717Z"},"links":{"cited_paper":"/paper/2109.00859","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:854f8c36ffcf45fe9f681d0fb4fff65d597f6e5a4dcfca86240f1ec9f27c9727","observation_id":"626d8ee4-88f9-42ef-92a6-01ac4b2928b1","resolution":{"observed_at":"2026-08-09T15:10:38.958717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03274","last_updated":"2017-04-24T14:39:27Z","snapshot_observed_at":"2026-08-08T07:51:18.482638Z","submitted_at":"2017-02-10T18:24:13Z","title":"Hybrid Code Networks: practical and efficient end-to-end dialog control with supervised and reinforcement learning","version":2},"cited_work":{"arxiv_id":"1702.03274","doi":null,"metadata_source":"pith","pith_arxiv_id":"1702.03274","snapshot_observed_at":"2026-08-09T15:10:39.098201Z","title":"Hybrid Code Networks: practical and efficient end-to-end dialog control with supervised and reinforcement learning","venue":"cs.AI","work_id":"644d2848-6017-412a-a654-ce24feb6de21","year":2017},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.963219Z"},"links":{"cited_paper":"/paper/1702.03274","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:66baf74b609270d990376fb1c8d69ee8becf0284324bfe70a4eccdddbb13309e","observation_id":"054dac79-5ce3-4e3c-8023-ddb7455b472f","resolution":{"observed_at":"2026-08-09T15:10:39.104213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10862","last_updated":"2021-09-27T21:12:49Z","snapshot_observed_at":"2026-08-04T13:56:39.444746Z","submitted_at":"2021-09-22T17:34:18Z","title":"Recursively Summarizing Books with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10862","snapshot_observed_at":"2026-08-09T15:10:38.967859Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.967859Z"},"links":{"cited_paper":"/paper/2109.10862","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:8acfc606ec8a1113ed175b11688fdfb26d5bd6bbf3585fecf10bef86e6d8cd2d","observation_id":"b102dee4-1e04-41d4-8eb8-727ec912214f","resolution":{"observed_at":"2026-08-09T15:10:38.967859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.629826Z","title":null,"venue":null,"work_id":"b80688ca-7d4f-436c-821d-6166c3ed07e2","year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.972239Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:2ec55fc46ab2f14784d1f39cb70d990d3e22cf999dcf882e01d2a6f8e8657a63","observation_id":"068badc7-02e3-4791-a5a0-d8c04c9de420","resolution":{"observed_at":"2026-08-09T15:10:39.635553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.612712Z","title":null,"venue":null,"work_id":"0b0aa33a-8b50-4820-9dcc-b314549f9a0f","year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.976377Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:e46eee5a4e4490e958cc7df6eccc8b334b0efd020c60916a6c514d77e6f24a40","observation_id":"88e70d61-df5f-4499-8ba5-0301212479d5","resolution":{"observed_at":"2026-08-09T15:10:39.618283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09420","last_updated":"2023-05-08T10:25:41Z","snapshot_observed_at":"2026-08-08T23:45:28.042958Z","submitted_at":"2022-12-19T12:55:32Z","title":"Large Language Models Meet NL2Code: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09420","snapshot_observed_at":"2026-08-09T15:10:38.981032Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.981032Z"},"links":{"cited_paper":"/paper/2212.09420","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:3ff93d6b863607e0871c92c47f668acba680eecb515b6e9c2a9ed7c7b7f15551","observation_id":"a0fe9872-cd95-4a06-aca8-11e1f8c28c74","resolution":{"observed_at":"2026-08-09T15:10:38.981032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11432-023-3956-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.033109Z","title":null,"venue":null,"work_id":"043cb794-0ba6-49d3-98df-4254eebcd0a0","year":2024},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.986407Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:1a1fa6b5af259140e340c514cb6bcbba1e2262911abf72c0de2f6061599ac590","observation_id":"fb166f4f-8517-4990-9242-8b043d6b6f61","resolution":{"observed_at":"2026-08-09T15:10:39.039045Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07989","last_updated":"2024-06-26T07:11:00Z","snapshot_observed_at":"2026-08-02T13:00:12.541823Z","submitted_at":"2023-11-14T08:34:26Z","title":"Unifying the Perspectives of NLP and Software Engineering: A Survey on Language Models for Code","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07989","snapshot_observed_at":"2026-08-09T15:10:38.991652Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.991652Z"},"links":{"cited_paper":"/paper/2311.07989","citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:d78d0776fed7b4407579085ab54f9cceca37ca021495d5db37ccf640d299bed2","observation_id":"a443e119-8987-407d-b456-34cff9e5173a","resolution":{"observed_at":"2026-08-09T15:10:38.991652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:38.996261Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:38.996261Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:5d47c7b58ba4542e3fbe74a99a270f3316ffbc5e1c7b7968f8fc00b76bafc6d2","observation_id":"2c9d9588-16f3-47b8-af7f-3226fbbdbd79","resolution":{"observed_at":"2026-08-09T15:10:38.996261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T15:10:39.001050Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T15:10:39.001050Z"},"links":{"citing_paper":"/paper/2502.01715"},"observation_digest":"sha256:681b1cf081f6bb1ed766718e428e94c243aca161156480b475fd44d2fe23be18","observation_id":"9d8e089c-8dda-4b85-9f4c-c38fd3e6e9a2","resolution":{"observed_at":"2026-08-09T15:10:39.001050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 9 inbound Pith citation observations for arXiv:2502.01715."}