{"as_of":"2026-08-22T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2da95c744a5b406794a5e3ce2f0370bc210b720b393f3eca0172b05a131e3736","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:37:53.152370Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:26:33.858637Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04272","snapshot_observed_at":"2026-08-01T21:26:33.858637Z","title":"arXiv preprint arXiv:2606.04272 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-08-09T03:34:06Z","snapshot_observed_at":"2026-08-16T16:12:57.559488Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.858637Z"},"links":{"cited_paper":"/paper/2606.04272","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:54a9f4d50ffbf348f94c00b1c009de40278414f34688ba8372d1f008464915b4","observation_id":"9a5d67da-066c-4e9a-9def-35c2a8f57ba4","resolution":{"observed_at":"2026-08-01T21:26:33.858637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.04272/citation-record","integrity":"/paper/2606.04272/integrity","json":"/paper/2606.04272/citation-record.json","paper":"/paper/2606.04272"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19249","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:46:29.025709Z","title":"Reinforcement learning on pre-training data.arXiv preprint arXiv:2509.19249","venue":null,"work_id":"65cab8fa-4ea2-4d2b-b3fa-2e385ed76533","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:dbcc40743ce5c9a84b3827e5252289f725b95b28afd45b82aaaf93ef2a01a8be","observation_id":"c50e5123-6655-4a91-909c-42f8823b2885","resolution":{"observed_at":"2026-07-02T02:46:29.028151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:c63b128108c643dcb44b8407b55e6ee5256c1e6335758e4a071f102be1ac2297","observation_id":"4383ca90-3c58-411b-a610-ad941016c0a5","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-19T19:12:34.221057Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:03e9050dd38592255d6a11b8e0cef4d3fa727849d796c3d372a9cd87ab1224e7","observation_id":"ba6d57a6-4722-4e50-a417-4552047a6fb5","resolution":{"observed_at":"2026-07-02T02:46:29.032828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:ff0b8e74186ced422b50c4f6bf802143166dcd5f7d1033d59e90b65742250f76","observation_id":"ca0cfcdb-d01f-40f2-93f1-4ab0139559b1","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:05426e6ae11789c0ca307dda7d646cc67b0710a287f27ddb2986dc91f606deef","observation_id":"a28dced6-e67a-4efa-a83c-a474f8a32073","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"International Conference on Machine Learning (ICML) , pages =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:7bf5953e27e868bca6d3bb18d9eda0a069da7b301cb9afe3bcbfe4bd656c566c","observation_id":"7982491a-0431-440e-a9d2-9b0e517a6f18","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:6c6d2f64cba07c9b3c4dcc6ab284edbf13418407ffeeed9c76e53cc71a118989","observation_id":"a5283c9e-cc67-45b0-b767-d4500200055a","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"Secrets of","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:14c90ce553589d9c7f9830f383c6bd7794afc5c647c67bc14f2d8f873d171da5","observation_id":"cb40cfcb-cb99-4967-875d-99f831075796","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:13fd4c1ad0e1777f2dcc7a2934df075498a8d40397e9102f5dd5de9955145b74","observation_id":"a6e9194c-8070-4ce0-8925-91144a9be7aa","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"On the Interplay of Pre-Training, Mid-Training, and","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:32d5a146815a2233587a0d6a6a56ef27db687cea92e3793053cc69388efd891f","observation_id":"20e26056-393f-43ec-b02f-ee0fecee4344","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:38:56.018423Z","title":"arXiv preprint arXiv:2510.15020 , year=","venue":null,"work_id":"6a468d06-b0b2-4d32-85fd-004b5cb11cc7","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:2f58c2ae9143f393b89db988c286aca76ed25a546b23509a0f0f55c21f67b877","observation_id":"aed3fbaa-6ff7-406f-a60d-e470c49527ca","resolution":{"observed_at":"2026-07-02T02:46:29.010483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07453","last_updated":"2025-03-13T23:15:55Z","snapshot_observed_at":"2026-08-20T08:32:58.221721Z","submitted_at":"2025-03-10T15:31:42Z","title":"Is a Good Foundation Necessary for Efficient Reinforcement Learning? The Computational Role of the Base Model in Exploration","version":2},"cited_work":{"arxiv_id":"2503.07453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07453","snapshot_observed_at":"2026-07-03T08:07:45.297854Z","title":"arXiv preprint arXiv:2503.07453 , year=","venue":null,"work_id":"dc135234-0e5d-42d3-8400-e9d9539e3064","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2503.07453","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:8f78773643a3547b9defb8890037b8c5e177a93a7f6f39795337f05865ba3e64","observation_id":"121a3219-5509-4dcb-8413-376fa84b50a1","resolution":{"observed_at":"2026-07-02T02:46:29.015086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:b81b9be8748d0a0b2692ccd33384c665cc9062459cc7711cd15680aa7248dca5","observation_id":"bc25554b-1c10-40a0-8f70-03b0c2821027","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:8307f1ead6ff5495431c7f860e4ac58160c2c864afc512749c684007fbe789e6","observation_id":"8aaedb04-4fc7-4dfb-83eb-95d393d6bef6","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2023 , organization =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:194146a80912caef7d9be9c8fcff410abc4c2431929cfef410e126422616a2f9","observation_id":"dddd8ad2-1cf7-4d2e-858e-a42cbad3a3e9","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"Conference on Language Modeling (COLM) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:c9c345a2e89a80128a94b5ca7713540cbd692bbe5d8f9fbf7d4b4c82e2bfd9d6","observation_id":"9c625d6f-91c0-4344-932a-ec98327e595a","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:b1f4ece25d2a46697e6057726223a1a82b8ce4484eae6c306346ce5d4f5efb82","observation_id":"8dcf0d89-f4f1-4bd9-afbf-aa2501561406","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:c1c29fffe4e8566d26bc1e0993966a642cd1fea04f13bd9d18cd5c15d0fa5cf5","observation_id":"ef484a2d-e6c3-430b-8d7b-36e01b57746a","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:a1c5063aa89192bddf37c1a4720904c677737c6064c23f194c45e023116ae136","observation_id":"8c3a323d-dcc1-422a-9e8f-690dbd1ff8aa","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2021 , url =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:dcd191b291cc459c1cc074d0b71693e682c80b713ecb0daed27079a6ac3aa927","observation_id":"458c0839-00bf-4f33-bb69-c71c4583681e","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2020 , url =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:2329abc3be02ba54f25d6877f753547b03ce4d00797431306c53d04381925e98","observation_id":"44f43cd7-81e3-4636-ad1b-e2a264d52ca3","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"Advances in Neural Information Processing Systems , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:f542084da6ff6df77a1e5eb353dd1a589c9099a20c0d8b616210281e2a80e626","observation_id":"74d714f0-b551-408f-b3c5-f57ad6dff0cc","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2019 , eprint =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:22f7a975cad3b0d139804e313e4f2f3f774350d6e6ebfa878d711cf45e9b1042","observation_id":"46eafb37-2a1a-4896-bd5c-f3a838eb87cd","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:68aa02d9c9218aeeb82971a51039060add5708883d4c222a1290eac78e55e2b8","observation_id":"2da44d80-0f2b-40c8-9865-e1fb13575ba5","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:cc5bc9bedcc146b8ee5daba1f03e161a3d2b86557a9e65fee7f29259567968fb","observation_id":"08fb571e-44b2-4a4b-ac05-09818c4d67c9","resolution":{"observed_at":"2026-07-02T02:46:29.005163Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:bb18fe8e10fda74a00f3daa30ed8160031ed0619540e88cdc26db1e7053dfe2f","observation_id":"070a267f-bb99-4b75-8997-9cbec284a564","resolution":{"observed_at":"2026-07-02T02:46:29.000903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"Measuring Mathematical Problem Solving with the","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:ef7776ebf684e6c41b392df745ab3753fbd43122386cbd68ebfcc127ba0354ae","observation_id":"76901fb7-a0f7-4e7d-b8e5-331645346cce","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:ecadc88a7eb8e77075de8dede6aa884de1acb822c997d6c31175bd433a9bbd90","observation_id":"5d879b86-e998-44ce-9933-a219600d4a5b","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:9b8d51f1546f9585610eb553ab516080ed62a1eb865c85eee5f3aa84a7a8cd5b","observation_id":"48876333-6ea8-4b76-9383-9b5c824b7b12","resolution":{"observed_at":"2026-07-02T02:46:29.019630Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"The Invisible Leash: Why","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:2f3156b935763ad6aba63b7550551fcde82eb8800703e46883fffac9b3dba9f1","observation_id":"df50f29f-2842-4f13-b1c0-130c4a385d85","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:23d11b14f9cf7cc6a2de722ea40ab4157bdb1f83202d05513d55fd2e18e53218","observation_id":"8d37cba8-1c47-487c-ab06-85da1c859b13","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:f7fc4db2a96b2bb9dfbecd06a0d560be1a1b218eb674da1d6ab400e87caa329d","observation_id":"9a3f247f-3421-45dd-8857-e1b8b5637a01","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-16T16:18:35.731432Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":"2512.13961","doi":"10.1007/s13755-026-00428-z","metadata_source":"pith","pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Olmo 3","venue":"cs.CL","work_id":"74de5f5e-0a69-4f73-862d-e5705fa9f4bb","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:a68600c5a75fa478b99b390d6e40a9d9fc4a66231cb2cce39d1a233d6d4c0e6d","observation_id":"105465d2-7129-4f7d-bb0e-caeb01e29c86","resolution":{"observed_at":"2026-07-02T02:46:29.023535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:8ac4b3676ef52d265ef2fe94eb7049a80b1b09ed0b702e487a6f8dabc253d5dc","observation_id":"5728a67e-fc49-43da-bdbf-369bcfcf5586","resolution":{"observed_at":"2026-07-02T02:46:28.991589Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:9ec7737ddcf6471e69bc3373a7156d4e34827ccef1ebc1b591022b1296b89c3b","observation_id":"336a2e91-d373-4b2f-9122-4a4757173a7e","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:6f8bbe846b717e043cf0959b9b58b68cb8445a1f7cb7c67fb250a4f11be305cc","observation_id":"02792363-90c7-4c3d-8015-dfe1491fb7e3","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:716aadb83b04d721a552f9938dc80431527ea7c95f3b3a6544fffb9219c12ea5","observation_id":"a645d370-9dcd-4c3a-ab77-486656631ffb","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.04419","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:57.027486Z","title":"Towards a unified view of large language model post-training.arXiv preprint arXiv:2509.04419","venue":null,"work_id":"83dcd5a6-8660-437d-9f0c-4855290c9901","year":2026},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:64831f2b60941048ae8ed878e1e1cb20b3565faaeb9b7b0302b29d0fb5860f62","observation_id":"540bccad-7215-41fb-853e-e5f01f4aadf3","resolution":{"observed_at":"2026-07-02T02:46:28.998009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:14d386d082c782bb1dbe6a6c1ba1b69a82ca7069bcd54dc20a92f10043982fd0","observation_id":"7804ce0a-a8ac-4ce4-8ba0-18495b214c2a","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.11408","doi":"10.48550/arxiv.2508.11408","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2508.11408 , year=","venue":"arXiv (Cornell University)","work_id":"994df3c4-5dc6-45c0-9db5-e82e415ce5d8","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:a9bc272d6d3e19b0fe98459ae4bc33d31531c43915e63227690a0937fa346e98","observation_id":"0a052105-5b53-4020-a542-742571cee4f4","resolution":{"observed_at":"2026-07-02T02:46:28.984570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14901","last_updated":"2025-10-16T17:18:11Z","snapshot_observed_at":"2026-08-17T01:33:28.883972Z","submitted_at":"2025-10-16T17:18:11Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","version":1},"cited_work":{"arxiv_id":"2510.14901","doi":"10.48550/arxiv.2510.14901","metadata_source":"pith","pith_arxiv_id":"2510.14901","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","venue":"cs.LG","work_id":"56a35230-70da-4209-8bd7-899023fabb1b","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2510.14901","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:b5f8dd15802be651acd72f530ebd16e15ac3c7932af0dbec40f917e5d469c57d","observation_id":"0b6ae605-f2f8-44b8-91c1-46d0617c85a8","resolution":{"observed_at":"2026-07-02T02:46:28.988369Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:7ef80c2e37893e13fb90d06a160ed2a8deb3eeba222b7ad9f09bee2c2d28ad7a","observation_id":"a0a1b4ef-e6b4-48a5-a829-75a391b07927","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:c3ee5bbdf8fd2317d0a4e2e6f58554bb79e3f553983dab705ea79cfc1bb6e07e","observation_id":"e199826d-5b70-4d5a-ba19-84ea89c70b74","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"Proceedings of the National Academy of Sciences , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:82e0b6482111d650f098408b322ed6d3168c492c8bebb2ac706eb5cf9919e0e3","observation_id":"b23aab82-b223-4a18-9989-2398ff665ae0","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:572540abdbaa1b1293fa13e328ce061fc3e606d6a45a7f7d8790792179309b26","observation_id":"673226cb-ef8f-4a45-8026-8d9c8c439844","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:d0d3505624927fd6917c9d1839d216a0ae82cd630d238b22cde10e1b9383790f","observation_id":"1c4ea56d-bbe6-4ac9-ac4f-f2239273c100","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:2fbaeb214de861beb7694da16095c9275790db096ef33367072842e22fc151e4","observation_id":"9eba6ef1-07e6-40bc-bdbe-0a3752181737","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-08-18T16:44:13.851821Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:34b05e20e236aaf2a9c6d18bd8a38f4add2940cbcaeefc94134a46deb95bcc2e","observation_id":"d40eddb5-23b1-42d0-9853-690827aeed2a","resolution":{"observed_at":"2026-07-02T02:46:28.994858Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:bea5dd001831654db0bddac739f0f6ecbeb8adb3c444c3701a6cda1fcef6f7e5","observation_id":"e6b48ae6-c1de-452f-9bb0-097b29c260aa","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:37:53.152370Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:2b9301f8b1bb9ccb1ba731adad1ae387fa78f782cad0aec54030519595fbd274","observation_id":"64043b4a-9574-4f4e-b31e-51a8bbbe24ae","resolution":{"observed_at":"2026-06-28T10:37:53.152370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.04619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:29:51.006192Z","title":"arXiv preprint arXiv:2412.04619 , year =","venue":null,"work_id":"2978e269-264f-4a41-8a4c-6da8e67ad932","year":null},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:e98ea94b8d6823c6a78368d4890d432661d0d48d29f4e39c3ae4f5c2c7a1c5d6","observation_id":"da46f109-766e-4bfe-9bb9-aef13c358ebd","resolution":{"observed_at":"2026-07-02T02:46:28.980781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T00:42:19.330390Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":37,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2606.04272."}