{"as_of":"2026-08-11T01:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09f08fcc43c38859c4e9d589a70622f3721ec64ef1ce7b06b8dadee59e8b3160","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:45:25.874749Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:23:56.891313Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:21.670108Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"cited_work":{"arxiv_id":"2508.19576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19576","snapshot_observed_at":"2026-07-03T14:08:21.670108Z","title":"Rest-rl: Achieving accurate code reasoning of llms with optimized self-training and decoding,","venue":null,"work_id":"2fca031a-ed7e-4c85-b8a3-c67142557927","year":2025},"citing_paper":{"arxiv_id":"2604.14564","last_updated":"2026-04-16T02:52:24Z","snapshot_observed_at":"2026-08-10T23:23:17.856255Z","submitted_at":"2026-04-16T02:52:24Z","title":"MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T11:27:28.245835Z"},"links":{"cited_paper":"/paper/2508.19576","citing_paper":"/paper/2604.14564"},"observation_digest":"sha256:8f5b2e3b7f3f788323a0573d3b28f33c3e0121f5f20bea333925fb956e5cc724","observation_id":"faac2c7a-0710-4a7d-ae45-b324f3875e95","resolution":{"observed_at":"2026-05-10T11:30:18.824443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"cited_work":{"arxiv_id":"2508.19576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19576","snapshot_observed_at":"2026-07-03T14:08:21.670108Z","title":"Rest-rl: Achieving accurate code reasoning of llms with optimized self-training and decoding,","venue":null,"work_id":"2fca031a-ed7e-4c85-b8a3-c67142557927","year":2025},"citing_paper":{"arxiv_id":"2606.13176","last_updated":"2026-06-11T10:44:50Z","snapshot_observed_at":"2026-08-07T20:58:00.884372Z","submitted_at":"2026-06-11T10:44:50Z","title":"Mental-R1: Aligning LLM Reasoning for Mental Health Assessment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T07:15:00.398111Z"},"links":{"cited_paper":"/paper/2508.19576","citing_paper":"/paper/2606.13176"},"observation_digest":"sha256:6dae81ac7240e302ecd301c21e478c69dce43b167a73a9f71d3016c390251d78","observation_id":"ecddc6aa-ea6c-481f-914b-ec867be66e78","resolution":{"observed_at":"2026-07-03T14:08:21.671873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19576","snapshot_observed_at":"2026-08-07T12:23:56.891313Z","title":"ReST-RL: Achieving accurate code reasoning of LLMs with optimized self-training and decoding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06216","last_updated":"2026-08-06T16:07:26Z","snapshot_observed_at":"2026-08-09T23:13:07.679087Z","submitted_at":"2026-08-06T16:07:26Z","title":"Continual Learning in Transition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:56.891313Z"},"links":{"cited_paper":"/paper/2508.19576","citing_paper":"/paper/2608.06216"},"observation_digest":"sha256:84d50c663d0b5a591f8b4182759adc97d85225f2b0be646ef3c30b527a0a9eed","observation_id":"d6f58a78-07b7-4087-9e46-9547b07c6fd2","resolution":{"observed_at":"2026-08-07T12:23:56.891313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19576/citation-record","integrity":"/paper/2508.19576/integrity","json":"/paper/2508.19576/citation-record.json","paper":"/paper/2508.19576"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.345030Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.345030Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:f2a828b5581fe3650da323d1ee2ac4011900a79619c4f87617e8c91b31c138b8","observation_id":"a60a4c92-264c-447b-8b38-be13e1b5183b","resolution":{"observed_at":"2026-08-05T15:45:24.345030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.394829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.394829Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:fc40dab7aad9ad3faa68cfea89e2c096b2e60bdf3b689b81980322bd3eaf6eb9","observation_id":"bd05cd66-c6bb-414c-a6d5-e445557a6857","resolution":{"observed_at":"2026-08-05T15:45:24.394829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:30.385760Z","title":"The lessons of developing process reward models in mathematical reasoning, 2025","venue":null,"work_id":"3d63ede1-24c1-4c1b-bf80-3a0098f57fa5","year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.445026Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:6cc693fd80c2b161a43fb61ffb671b95716ea9381f69ca414b67dcd86513c49e","observation_id":"0464326c-2220-4f6c-909e-d1c51896f0ff","resolution":{"observed_at":"2026-08-05T15:45:30.424911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.466089Z","title":"Measuring coding challenge competence with apps, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.466089Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:08eebf3b86b38a83adb7e8f88d9743cc4568c0054394804da451a165dc7c6788","observation_id":"285765fa-6c82-49c7-89c2-f592990cd7fd","resolution":{"observed_at":"2026-08-05T15:45:24.466089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:30.154826Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions, 2025","venue":null,"work_id":"b0c9cf10-51b9-4378-8ecd-55922d600bbf","year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.507007Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:37fce565ebf2b27ab6df68e041dc09946240e2f8721810a8c0140f5e4c22a9bd","observation_id":"b14037e4-5565-4d98-8b12-1f5a4cf810d1","resolution":{"observed_at":"2026-08-05T15:45:30.176357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.557391Z","title":"Wizardmath: Empowering mathematical reasoning for large language models via reinforced evol-instruct, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.557391Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:726bd1c9ce9dd5cbc30c2675d653cb0fcb56a080e5fa37ccd7c8d9f821c86f55","observation_id":"6de4234e-f4a4-43c3-99af-0c1adfb6f309","resolution":{"observed_at":"2026-08-05T15:45:24.557391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.606921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.606921Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:888b425e71de493ad99e450717b2dcf1f18f6c7732329645a2477100bad3a80d","observation_id":"ab22b356-6564-4fd2-9f72-eacc65650263","resolution":{"observed_at":"2026-08-05T15:45:24.606921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:29.814837Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":"9ee219a2-7f4d-4094-a418-e14247823e6c","year":2017},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.634749Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:f866545b84916bac0299158ff785d0241ebbdf783f7e4a8d3f783c857affec0c","observation_id":"92664116-49b8-468f-9888-29660062a672","resolution":{"observed_at":"2026-08-05T15:45:29.850809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.665314Z","title":"Reinforced self-training (rest) for language modeling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.665314Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:79b55ffb32c3f44491f4cfd85b5de5a39bb926d04d054c2ef4d51628c59d00f6","observation_id":"b633ee1d-19fb-4e55-bc88-399855cef95b","resolution":{"observed_at":"2026-08-05T15:45:24.665314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.691732Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.691732Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:b9dd0163f6e59007105499c8736140c374ea8f222d1070c1397c36cea2c09212","observation_id":"8b07e88e-f82b-4015-879d-84ab74b7dec5","resolution":{"observed_at":"2026-08-05T15:45:24.691732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.715154Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.715154Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:c7c0cd2f31a2a1859a8219f6c2352873d6785f23221f3308f41034fc70903368","observation_id":"7ac86a5a-13e6-422a-a657-8efefc8693bb","resolution":{"observed_at":"2026-08-05T15:45:24.715154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-05T15:45:24.746306Z","title":"Beyond human data: Scaling self-training for problem-solving with language models.arXiv preprint arXiv:2312.06585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.746306Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:a093090379d972bda93e77b92e5087539a8a2bc25e0c674711220e5d2bd9a037","observation_id":"87b836da-7df4-457d-a007-3dbb733fc341","resolution":{"observed_at":"2026-08-05T15:45:24.746306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.772773Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.772773Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:655d209b98472c0f78caa15c98db9ba85db10dd3e711c0f2ca72ab80d00ff75e","observation_id":"395e6487-9a00-42b5-816e-1352a9c5a287","resolution":{"observed_at":"2026-08-05T15:45:24.772773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.807225Z","title":"Solving math word problems with process- and outcome-based feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.807225Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:5a7b4b765fc24bec6a330bd23d64ebb97b7f602d8f20f3262ec2e08ad03c8d97","observation_id":"26a75e80-eec5-40d5-bc22-5b826471279b","resolution":{"observed_at":"2026-08-05T15:45:24.807225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.854247Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.854247Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:48889abb7fae558dca41746e17e2c3fb5cb9925ae57a2298d4936f54c5574bfa","observation_id":"cf8b6baa-1348-419d-a785-65e77a65bd9a","resolution":{"observed_at":"2026-08-05T15:45:24.854247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:29.084743Z","title":"Don’t throw away your value model! generating more preferable text with value-guided monte-carlo tree search decoding, 2024","venue":null,"work_id":"3baf9ef5-4e00-458c-8233-6e164d20ad3f","year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.894475Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:c64bf37c9c8783432041b84a5061058b7aa200863c2553b5c3e2531b42d14ac6","observation_id":"b2298171-678a-429f-b3ab-d93bede8b177","resolution":{"observed_at":"2026-08-05T15:45:29.124983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.908108Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.908108Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:93c435bae0e9a4b0d88999227925d25ae906d692d6b242cf250a85603b39bb07","observation_id":"7d9bf68a-649b-4cf0-9b89-28b967dd121c","resolution":{"observed_at":"2026-08-05T15:45:24.908108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.844747Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization, 2025","venue":null,"work_id":"6b6ad7b7-637e-4e91-8878-5a5fcdaa8215","year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.935044Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:330d956928ec9b31ffd469d50ba1024bdcab05cad68ee53e631c1cfae29860e2","observation_id":"d026e5d3-7815-40cd-b6c9-57440a7e51fd","resolution":{"observed_at":"2026-08-05T15:45:28.884827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:24.974749Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:24.974749Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:3d1ec7499bdaff5c2887e600ecd0a13edab97ee94a10aff41ac913cfa40fd8c2","observation_id":"67be6a1d-670a-4911-b0be-c06630bba609","resolution":{"observed_at":"2026-08-05T15:45:24.974749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.584746Z","title":"Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":null,"work_id":"9d67e8b5-a322-416d-a03a-58b81c4f4a2d","year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.024763Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:265b8333a9c669bc819e10b93cd5b3153f27a81f475cf8c1d2fa756f8312b051","observation_id":"4483e15b-d22a-450a-ae42-64843050f91f","resolution":{"observed_at":"2026-08-05T15:45:28.654742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.454829Z","title":"Code with codeqwen1.5, April 2024","venue":null,"work_id":"1d921812-b250-4dbc-9dff-9dcddf96b7fc","year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.057163Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:d8ae60ca87168bd7d7b5dc9a3025b9d58677b54b66bb04bd3b086a19238df490","observation_id":"7426c0c7-f201-4fe8-9947-e31e6a755f36","resolution":{"observed_at":"2026-08-05T15:45:28.494850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14658","last_updated":"2025-01-07T05:37:04Z","snapshot_observed_at":"2026-08-06T03:14:31.781649Z","submitted_at":"2024-02-22T16:06:23Z","title":"OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14658","snapshot_observed_at":"2026-08-05T15:45:25.104749Z","title":"Opencodeinterpreter: Integrating code generation with execution and refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.104749Z"},"links":{"cited_paper":"/paper/2402.14658","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:1fdd4416f2558486b6914d91191a980b8e25bfd95c315d64d8d35dfaa9d9b2c4","observation_id":"e00ea81a-0836-4ae5-9e35-a39b47ab048e","resolution":{"observed_at":"2026-08-05T15:45:25.104749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.324745Z","title":"Tenenbaum, and Chuang Gan","venue":null,"work_id":"0bbeabc2-6a3d-44d4-8558-37fe39881a94","year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.145037Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:b044265a7f0cd556f33a0c2e9662f62443edf6deb7f5ba7e0bffabb573aa8eee","observation_id":"ced27b90-3a83-484a-a60f-dcb6b9027441","resolution":{"observed_at":"2026-08-05T15:45:28.355103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.174975Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":"e13b8557-a96d-4c05-a87e-156527ff3c9b","year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.195191Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:1a5989305778ebc15eccc83c99d6cc0301d233d95bd3d5cd2b5cbcc86b3779e5","observation_id":"92ee3d93-802c-4791-8843-9a1f350c15cd","resolution":{"observed_at":"2026-08-05T15:45:28.224747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.245194Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.245194Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:93362275caa15493f2ee0bd6af2b0fcfee43337145daf26bfb36fe5018ef60db","observation_id":"db52f004-bdc6-46db-98bf-c841ce605ba3","resolution":{"observed_at":"2026-08-05T15:45:25.245194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:27.912378Z","title":"Pspo*: An effective process-supervised policy optimization for reasoning alignment, 2024","venue":null,"work_id":"de0b70ed-4347-4aa3-bda5-4f9c0875ab65","year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.284748Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:f19a3851dcd8834967fe256d1997089e7e786457d2210315b9a537d51b995abc","observation_id":"efde76ed-bddc-498b-bb3a-9ca6434be0e5","resolution":{"observed_at":"2026-08-05T15:45:27.986574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:27.434826Z","title":null,"venue":null,"work_id":"fa8913bd-0977-4a1e-80f4-b56ed77a57f1","year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.334751Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:940739ee4174c14053715d8189bb89aab674c4fdb049c41d9a684203303d1805","observation_id":"4dff5136-fc75-4f6a-8de6-66ce1bea5707","resolution":{"observed_at":"2026-08-05T15:45:27.674899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.384748Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.384748Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:49ec7dbdcce21635bb383986ee75dfa6683002bed7378fb8105fd90e17c8100a","observation_id":"633b31e6-0ab6-414b-aa06-415a3df86dc0","resolution":{"observed_at":"2026-08-05T15:45:25.384748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.434824Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.434824Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:4a8592092b606c5674457778749f7806e1ad5da21ac17d58ec87afdcc36b375e","observation_id":"3afc0a37-acd2-4b08-8782-f6ee69c42127","resolution":{"observed_at":"2026-08-05T15:45:25.434824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:26.884088Z","title":"Sra-mcts: Self-driven reasoning augmentation with monte carlo tree search for code generation, 2025","venue":null,"work_id":"24d9384e-831f-480c-9c8b-531d88d204d1","year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.475053Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:a327d8aab36a086885d47046e0122cb6cf1c8bfeb29893b4e83fd3a92ae23cf1","observation_id":"b9d8e6d4-9b13-4c45-a38e-0ce90ee69bf4","resolution":{"observed_at":"2026-08-05T15:45:27.054841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.524747Z","title":"Accessing gpt-4 level mathematical olympiad solutions via monte carlo tree self-refine with llama-3 8b, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.524747Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:bec220990962770db86363e80ec68f400e98be25b823f6ed3f3d76fcb4545829","observation_id":"f14061ea-d91f-4861-b37e-73c7d3245ce1","resolution":{"observed_at":"2026-08-05T15:45:25.524747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.574819Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.574819Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:515483ea0cc4e93e9b9cca970449570821e827861a3785790953d743d31ba97f","observation_id":"283cc7ff-73ce-46b9-a5c6-f315b223cce8","resolution":{"observed_at":"2026-08-05T15:45:25.574819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-05T15:45:25.624748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.624748Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:0139e0a85410f28f441917d22d30705646ccdd54b4ffa575bae6289a96539350","observation_id":"3c654c56-76c3-4b7a-9920-237fa938e6ff","resolution":{"observed_at":"2026-08-05T15:45:25.624748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.674750Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.674750Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:44eb9cbdf13a30a07092c090364cfee880a334a711011b27f968dab1d39a1c54","observation_id":"629afcb8-3aff-44ef-b900-cd5457763673","resolution":{"observed_at":"2026-08-05T15:45:25.674750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.717705Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.717705Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:3acc220c82f62027b78a20dd24d1af719e4c1f08092440cd8a6c67b3597c9863","observation_id":"d069aee4-119a-4538-a5cb-537ee583cb65","resolution":{"observed_at":"2026-08-05T15:45:25.717705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.764827Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.764827Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:0e8217870588fb3ddbbb44049375e9f5063177ad81107bbdf62e6b9bd6d115de","observation_id":"87a5e739-ada5-49ec-b3d4-c7812f70237e","resolution":{"observed_at":"2026-08-05T15:45:25.764827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.814825Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.814825Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:0e7bfcf49d454a82db37ce81c58e59046cb4dca127c1ffbd3e82011961785f8f","observation_id":"0b083143-5493-4f29-95ae-d9af24999b87","resolution":{"observed_at":"2026-08-05T15:45:25.814825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:25.854752Z","title":"Reward hacking in reinforcement learning.lilianweng.github.io, Nov 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.854752Z"},"links":{"citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:badce76ce9701385756493c9ff2d9526119c54d9aca496175b12bddaa96f4d42","observation_id":"c177dc3c-5724-40b6-80a9-cea292e5f0cb","resolution":{"observed_at":"2026-08-05T15:45:25.854752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-05T15:45:25.874749Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms.arXiv preprint arXiv:2410.18451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:25.874749Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2508.19576"},"observation_digest":"sha256:35af194b2277fabf1dfba8893cd4469fe32ec7e714bc981f2f71fc420b0be767","observation_id":"c5d66e67-fb19-425b-a5e7-c3f3d9d21913","resolution":{"observed_at":"2026-08-05T15:45:25.874749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19576","last_updated":"2025-09-08T13:12:19Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T21:52:55.688066Z","submitted_at":"2025-08-27T05:16:03Z","title":"ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2508.19576."}