{"as_of":"2026-08-11T17:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8705212ed03a5137ad5e6264200c1d4acdccf9af6a628d6854c06cdc8eb4802d","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:11:50.343466Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T16:52:29.295566Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08472","snapshot_observed_at":"2026-08-02T16:52:29.295566Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.03472","last_updated":"2026-07-22T14:38:55Z","snapshot_observed_at":"2026-08-11T15:28:55.218753Z","submitted_at":"2026-04-03T21:40:03Z","title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T16:52:29.295566Z"},"links":{"cited_paper":"/paper/2605.08472","citing_paper":"/paper/2604.03472"},"observation_digest":"sha256:502ad450e3b5128605fa4b3fe54b9c47c04d9c27c79384600b213e00edb7c29e","observation_id":"8bbcf149-05dc-45c5-8b39-70200dde9818","resolution":{"observed_at":"2026-08-02T16:52:29.295566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.08472/citation-record","integrity":"/paper/2605.08472/integrity","json":"/paper/2605.08472/citation-record.json","paper":"/paper/2605.08472"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":"2402.10571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization with an offset","venue":null,"work_id":"aca16f09-1a50-46c9-ba22-07ebf249d309","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:d247d6518770443b24380791c1e6066d0f4667810006728566d8851cf7bada4b","observation_id":"ff72c57d-92f4-4a47-8303-02b273dab3f7","resolution":{"observed_at":"2026-05-12T08:26:23.350262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Matharena: Evaluating llms on uncontaminated math competitions, February 2025","venue":null,"work_id":"c0fb582a-cb84-4b48-8012-f972670f7890","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:0745aee38bfdde5432b2d649cca81026b92a12f02913570aff9499fcb10917c6","observation_id":"675a0eb5-0ba6-4dd0-9d49-1842335af846","resolution":{"observed_at":"2026-05-14T08:15:54.253921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9da42e83-8197-49b8-95d8-bb472a6076b1","year":2021},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:c9e1ca6ccef4a68d69815fb59f99339417b9317c2aa099e0376f45136d3555f5","observation_id":"4965bf03-a41e-4d63-a7ce-85511b040d3d","resolution":{"observed_at":"2026-05-14T08:15:54.257691Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:34894aacf00c62fd5cb177e2239dd599a7ac3fce0a2117829ef4b386f0a05753","observation_id":"bd904d25-fa3e-46cd-8aa9-0523b1bbb46d","resolution":{"observed_at":"2026-05-12T08:26:23.377260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01970","last_updated":"2026-05-27T04:01:11Z","snapshot_observed_at":"2026-08-03T19:07:02.389133Z","submitted_at":"2025-12-01T18:27:25Z","title":"Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies","version":3},"cited_work":{"arxiv_id":"2512.01970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.01970","snapshot_observed_at":"2026-07-03T20:38:56.026958Z","title":"From atomic to composite: Reinforcement learning enables general- ization in complementary reasoning","venue":"cs.AI","work_id":"bd6cf7a1-abc4-4db3-b3c7-6b8adc476ddd","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2512.01970","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:91e0f4d25e1936e431b7ef348b08b473a053f1dab3216d6a6b8da6d241cedf32","observation_id":"0428cd94-e17c-42ca-ad2a-d88a0d704612","resolution":{"observed_at":"2026-05-28T02:04:12.409186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:dc2a8b9e16ccf10321257234ce29f38f6afbf712a07833a13ec94fb075988340","observation_id":"aac59382-4b8a-456a-9ae9-9605a9bb6128","resolution":{"observed_at":"2026-05-12T08:26:23.288590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:f26c0c1a6e302c79d7ee0b44b31c49be1c8390ef44a578af4cc9b9da138c9047","observation_id":"fd2b9ec8-0272-4fd9-b465-31a9521b468c","resolution":{"observed_at":"2026-05-12T12:31:34.026635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02410","last_updated":"2023-07-02T22:58:51Z","snapshot_observed_at":"2026-08-07T23:25:34.011944Z","submitted_at":"2022-10-05T17:32:16Z","title":"The Vendi Score: A Diversity Evaluation Metric for Machine Learning","version":2},"cited_work":{"arxiv_id":"2210.02410","doi":"10.48550/arxiv.2210.02410","metadata_source":"pith","pith_arxiv_id":"2210.02410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The vendi score: A diversity evaluation metric for machine learning","venue":"cs.LG","work_id":"bfb3a637-0b6f-40c7-a0df-d21712e30504","year":2022},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2210.02410","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:95feb7ea754946e2fb7e7a0679815f127454de8d82e6edef3fde12d16faefe35","observation_id":"4d690ac3-7f72-4110-ad4e-b70f54a63d19","resolution":{"observed_at":"2026-05-12T08:26:23.299429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:24:51.39774+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:24:51.39774+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-08T21:52:29.510852Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":"2503.01307","doi":"10.48550/arxiv.2503.01307","metadata_source":"pith","pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","venue":"cs.CL","work_id":"f65a84bf-c5b4-4491-a618-18bb263c60e5","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:031b8d5ef7b4180e99a546a9f20a4f6631f0eabbb866182c9e15ce32c4636206","observation_id":"59887040-9301-48f7-b223-8ffec54f4e1f","resolution":{"observed_at":"2026-05-17T11:40:33.380427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:f713004cb90e6c21160854a291507686e626ddabfaf4a621b9014c0fec238842","observation_id":"987a00bd-b665-45f1-86e2-6d4247f4054f","resolution":{"observed_at":"2026-05-12T08:26:23.367825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:49279cc8ade12d82ecb7d9e5e617df7f1254f22639e97e9ea6f447c263379a88","observation_id":"2589dc55-b08f-4d7a-bb31-b9f1338913fa","resolution":{"observed_at":"2026-05-12T08:26:23.269899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17876","last_updated":"2024-08-08T06:32:00Z","snapshot_observed_at":"2026-08-10T18:54:13.019138Z","submitted_at":"2023-10-27T03:32:17Z","title":"TarGEN: Targeted Data Generation with Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.17876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17876","snapshot_observed_at":"2026-06-29T15:23:32.685681Z","title":"Targen: Targeted data genera- tion with large language models","venue":null,"work_id":"5a749a19-de9f-42ea-a1da-73bc82d2345a","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2310.17876","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:fa1d07bfeab20fea921aa5bce1ee0e103d3b11dc630e26ab9f766e74c29c595f","observation_id":"ad569163-ad8a-4d7d-87f1-466ebed15892","resolution":{"observed_at":"2026-05-12T08:26:23.317202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02355","last_updated":"2025-06-20T04:14:47Z","snapshot_observed_at":"2026-08-08T15:13:20.527982Z","submitted_at":"2025-06-03T01:15:15Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","version":2},"cited_work":{"arxiv_id":"2506.02355","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02355","snapshot_observed_at":"2026-07-03T20:38:55.917128Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening","venue":null,"work_id":"349bfcd5-c482-404a-961a-599b6e5813d9","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2506.02355","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:0096ac55cdc1199d0bef58219b3104900e5ea1cf0796f6a07246220685ebc56a","observation_id":"7789266f-52ec-495e-8127-4b7fac36b3a0","resolution":{"observed_at":"2026-05-12T08:26:23.332890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:8a13167b517a75581a8fee5ffd5c37c5c8b388df6856598400cd2325fde89cfc","observation_id":"ce05cce0-ee35-484e-822d-823e00d079fc","resolution":{"observed_at":"2026-05-12T08:26:23.335936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-10T19:38:46.551479Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:bce7fed3db333d0515da07c6b13d108bd01187fab06ae3f476d79668d7fd1f37","observation_id":"b35cf74e-1a9d-4ee5-ada3-20189188e3c4","resolution":{"observed_at":"2026-05-16T10:31:04.851073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:b4ac4c1f060315b46be137cc654653be9d22ea0dd94e6a571aec1cc325911eea","observation_id":"b9752c4f-a4f7-4230-a2e6-0a434e7047ff","resolution":{"observed_at":"2026-05-12T08:26:23.306433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:36:22.410800Z","title":"Unnatural instructions: Tuning language models with (almost) no human labor","venue":null,"work_id":"4a995097-5432-43ce-8be6-cc8abe3f4b20","year":2023},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:f437c632bd200b0a1d0f382ee5e13cee1656ad7e3301541ea220093708474387","observation_id":"6364a0eb-cfa0-4754-91d1-44c534e3fdc1","resolution":{"observed_at":"2026-05-14T08:15:54.229301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Math-verify: Robust mathematical expression evaluator","venue":null,"work_id":"65a766b3-ed0d-4078-955f-378b535a8dc7","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:d7cdb9e21516e19714c59ca7a43e04195e791fdeb459164d04d01b4f237bc1d8","observation_id":"3189ae89-9f0b-4cb3-9d14-6be738866498","resolution":{"observed_at":"2026-05-14T08:15:54.179887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:6c3aafc01ae62fc1f31213a77b6d6af9ebf3c073fffef0e80cecd39b470c67ef","observation_id":"2100ae73-85ef-4301-afc0-06b2ad90b92d","resolution":{"observed_at":"2026-05-12T08:26:23.259514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:1635aef4261a80408a5710dce45466fff22ed30a59aee70d7a595bc51b61c532","observation_id":"a422bd89-057c-47b4-bfda-9a446b4402be","resolution":{"observed_at":"2026-05-12T08:26:23.262633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-08-10T14:49:33.428173Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:555f5d1e1f623e5751e3316b683577f89d979a2b103ad0852997178f7c375acb","observation_id":"9e8e7edf-f295-47ff-9b1f-1ba7ae188728","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoc: Search-based pseudocode to code.Advances in Neural Information Processing Systems, 32","venue":null,"work_id":"cb94c237-e3ec-4902-acc8-6137d435f3cc","year":2019},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:116b7f688387b9ee65a102bfc80342c2efaa3f6713f7fd3b6af5a8bfb315b30a","observation_id":"1eeba29b-2ec2-405c-85f1-63dc2c17debc","resolution":{"observed_at":"2026-05-14T08:15:54.184209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T09:02:13.068592Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"55d06a5a-70ca-433f-966a-21dd9d276d2b","year":2023},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:bb0c5006b483be231ae3694fdd3255a045381d628efd3af9645db702999b1e75","observation_id":"7788295f-2a5b-4967-9d86-56a858c25aae","resolution":{"observed_at":"2026-05-14T08:15:54.203126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:3a2fc11fde17f57e3b8c16420401ff5144b56b4cf7e3cb8aea6883454bc73086","observation_id":"e145583c-698b-40c5-8677-aaac3491cc14","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:4a72e0da37fac734f43ecf2cc2a50a86b7be57a841e3403f15108f5b1030ea78","observation_id":"5f346081-10c9-4510-91fd-29809d2213ee","resolution":{"observed_at":"2026-05-12T08:26:23.284596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:33:40.241438Z","title":"The measurement of observer agreement for categorical data.biometrics, pages 159–174","venue":null,"work_id":"3d83c61a-3d9e-430a-8819-b63caa7a7fe9","year":1977},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:87f411972d27f34aaaf2e3e265e516b5b37fe9f9babad5a679bda157c6f5dcd4","observation_id":"c03e7620-157c-4327-bd61-18db927190b4","resolution":{"observed_at":"2026-05-14T08:15:54.198739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.1301","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Small models struggle to learn from strong reasoners","venue":null,"work_id":"7f69f63f-d04f-44e2-9c26-db78c6b7e367","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:57e91e40eab36d316f6ad9ba539fdbfa31ea7e2ee7cd93a3b24575bf30f792e2","observation_id":"c99a57c5-8e34-4783-a228-9d9191655941","resolution":{"observed_at":"2026-05-12T01:16:15.422726Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01352","last_updated":"2026-03-02T20:56:17Z","snapshot_observed_at":"2026-08-04T07:18:25.941807Z","submitted_at":"2025-07-02T04:40:29Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy","version":3},"cited_work":{"arxiv_id":"2507.01352","doi":"10.48550/arxiv.2507.01352","metadata_source":"pith","pith_arxiv_id":"2507.01352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy","venue":"cs.CL","work_id":"c44139eb-e611-43d2-80db-eaecb038fe32","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2507.01352","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:d17f9a419f9fc6daf34f6f31da6be4563530c49c456a3e0f9ede51d9cbfb96f9","observation_id":"6edb31ee-ce2f-412a-acef-be306d12ea27","resolution":{"observed_at":"2026-05-16T22:17:43.404381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235","venue":null,"work_id":"a62bcdba-f0bb-4db8-b5c2-9453b249c555","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:8a43fbd1107967c40fb9186a8c5c61f1d6f7542617c4a31630cc148ac81c2600","observation_id":"7b989002-0fcf-4191-9927-ff9589f81044","resolution":{"observed_at":"2026-05-14T08:15:54.188956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-task gener- alization via natural language crowdsourcing instructions","venue":null,"work_id":"dc6ea8f4-ec7f-4155-a3d9-01afdb69dde8","year":2022},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:f6123e66a69cb8ef69f97faf0391daab8da098cd8b9e99a02e3a31d1423e1962","observation_id":"4592ac03-26c8-4464-8822-5e5471a9ba26","resolution":{"observed_at":"2026-05-14T08:15:54.165918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11045","last_updated":"2023-11-21T19:43:31Z","snapshot_observed_at":"2026-08-09T03:30:58.801577Z","submitted_at":"2023-11-18T11:44:52Z","title":"Orca 2: Teaching Small Language Models How to Reason","version":2},"cited_work":{"arxiv_id":"2311.11045","doi":"10.48550/arxiv.2311.11045","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11045","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D., Mahajan, S., Codas, A., Simoes, C., Agrawal, S., Chen, X., Razdaibiedina, A., Jones, E., Aggar- wal, K., Palangi, H., Zheng, G., Rosset, C., Khanpour, H., and Awadallah, A","venue":"arXiv (Cornell University)","work_id":"43b4fe4e-8b4f-4766-b66c-19835b73d4e2","year":2023},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2311.11045","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:69631ab203771988fd5bf8ace0cb7d5a9a446d421a8fb85de146f2a1acd252ac","observation_id":"01e7acb6-7832-42c2-b2f0-a548372fbe6e","resolution":{"observed_at":"2026-05-12T08:26:23.266438Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T18:40:03.223224Z","title":"Mid-training of large language models: A survey","venue":null,"work_id":"2d258d6b-f30c-4f76-b61a-2ebf6a4434cd","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:c2200058dd8599a7a30bab2a1202eb4b1e32a15c1ca73e1cb580d785a1a4aa6b","observation_id":"29024956-17e6-4c5b-8957-bb8271e22e91","resolution":{"observed_at":"2026-05-12T08:26:23.339800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":"2306.02707","doi":"10.48550/arxiv.2306.02707","metadata_source":"pith","pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","venue":"cs.CL","work_id":"3e29b6b5-4ea8-4e8a-8fa8-6e63093e31c1","year":2023},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:914d0ad68e7c2d777a719bdab169c68b687b4d7e9152ddb10fe4db0403c54d72","observation_id":"4b71ea29-b3bc-4005-bc28-ade95fcd600d","resolution":{"observed_at":"2026-05-15T09:42:05.373278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AMC 12A (2023): Problems and Solutions","venue":null,"work_id":"70baae61-2d8d-4b2a-bf8e-d649bbc957fd","year":2023},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:1ba8350cc8d932d91ba6c5d2b7d6e9f8578226e1ca72b847ee8627ac88ba7876","observation_id":"44ead73a-9baf-47a0-83d3-0f7efcb710e4","resolution":{"observed_at":"2026-05-14T08:15:54.242758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":"2512.13961","doi":"10.1007/s13755-026-00428-z","metadata_source":"pith","pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Olmo 3","venue":"cs.CL","work_id":"74de5f5e-0a69-4f73-862d-e5705fa9f4bb","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:86ffc32d2c693c53754267371da44f28e86cf412899e5f47edc0898610452240","observation_id":"499f4c98-07c5-4171-a6a8-4fd8ecc010a3","resolution":{"observed_at":"2026-05-12T08:26:23.370856Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"New embedding models and api updates","venue":null,"work_id":"f98fc28f-2f70-4abc-ad7b-d7c306ff702d","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:a3df5040003cebd5442a5575528ed022333fc702b5ced915fd742ce690f63411","observation_id":"38add820-83e4-43b8-a773-ecc1659b13b7","resolution":{"observed_at":"2026-05-14T08:15:54.225268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:15da8bbb9309bbe0d0ffad2a462250fcc48bda1fbe778bbc7dc2312a4f7fb9d9","observation_id":"5fa81818-66f8-4cf8-ba06-d13b7452840a","resolution":{"observed_at":"2026-05-14T08:15:54.155968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How many data samples is an additional instruction worth? InFindings of the Association for Computational Linguistics: EACL 2023, pages 1042–1057","venue":null,"work_id":"ea40e102-41b7-4228-8c47-08797386dd1e","year":2023},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:186ead9d9293d7d05e931227d73232afaaf16ee7de232caa564ec8e1daf11658","observation_id":"4f51d288-cc4b-449f-bd5f-b5ac249f82f6","resolution":{"observed_at":"2026-05-14T08:15:54.208003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Princeton science library","venue":null,"work_id":"17796922-e613-496a-bf1a-8a586b829dd1","year":2004},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:fb917a092046549a9d752dc581b4c03e7e1c700cb9cb89084784d7d51eca648a","observation_id":"a6e04f74-1168-4fdf-bafe-ff639c8e4d03","resolution":{"observed_at":"2026-05-14T08:15:54.151240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:50.108470Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"5d2e1082-e73f-4c1b-a18c-bf0ba1772c23","year":2023},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:cb40a042b6e937e33b0355578691d137c9b3415fcbaec59f32be76a4f7122c69","observation_id":"7deff357-4d27-4d81-a351-ee0d43279d2d","resolution":{"observed_at":"2026-05-14T08:15:54.161016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07616","last_updated":"2025-08-21T06:17:25Z","snapshot_observed_at":"2026-08-08T03:30:30.635878Z","submitted_at":"2025-08-11T04:51:43Z","title":"ThinkTuning: Instilling Cognitive Reflections without Distillation","version":2},"cited_work":{"arxiv_id":"2508.07616","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07616","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinktuning: Instilling cognitive reflections without distillation","venue":null,"work_id":"14756ac4-5eb5-4ee4-b2bd-d2f251a19c48","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2508.07616","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:f180bb66f6bac0a4f18a52f4df64e5e0cb39d612044687ad5160706fde980953","observation_id":"a82b28cd-d1b4-458f-ac9b-ae3772e00f66","resolution":{"observed_at":"2026-05-12T08:26:23.380848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16681","last_updated":"2025-02-18T04:26:49Z","snapshot_observed_at":"2026-08-09T09:43:34.115104Z","submitted_at":"2024-05-26T20:18:11Z","title":"Triple Preference Optimization: Achieving Better Alignment using a Single Step Optimization","version":2},"cited_work":{"arxiv_id":"2405.16681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16681","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Triple preference optimization: Achieving better alignment using a single step optimization","venue":null,"work_id":"6b2aa46c-f7e3-47a5-99e3-4b38c8050b71","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2405.16681","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:247ae63bb6efb5ed1cc48b4e8dbd9cbc92fc866a738745597b21fc4b54a3d347","observation_id":"3be10a95-fe9c-4d2a-a596-1b5b5e479f9c","resolution":{"observed_at":"2026-05-12T08:26:23.346238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:2c0f50797b8a6aaf178e087281855e2e53e113185a6ca31b49ef886e08a5dda4","observation_id":"62eb4ce1-8673-4f51-bc0c-db154e5e3fec","resolution":{"observed_at":"2026-05-12T08:26:23.309669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rl on incorrect synthetic data scales the efficiency of llm math reasoning by eight-fold.Advances in Neural Information Processing Systems, 37:43000–43031","venue":null,"work_id":"f8db8491-6bb7-4a38-938c-f929e74d8e40","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:ad34e3fd006bef992f40002c658744d7d9e6a66a1235d9297b61fabd67523d30","observation_id":"6171f08d-2732-40ad-a371-15a5c4404548","resolution":{"observed_at":"2026-05-14T08:15:54.175437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:612e1981d4a1f887297e499b6594616c6ba2656ef22deed6ed8a0d85a4d57018","observation_id":"fd06ad82-9169-46d6-904a-299687785907","resolution":{"observed_at":"2026-05-12T08:26:23.373677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:f5b2a1a0ac562af16531d16bafac93481159b0b3ed4ba0c3d1b8e660ee566a9c","observation_id":"cb78f1e9-767c-4971-b5e6-ed049cea6f10","resolution":{"observed_at":"2026-05-12T08:26:23.295282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16049","last_updated":"2024-03-23T21:21:44Z","snapshot_observed_at":"2026-08-04T21:08:49.454029Z","submitted_at":"2023-10-24T17:59:20Z","title":"MuSR: Testing the Limits of Chain-of-thought with Multistep Soft Reasoning","version":2},"cited_work":{"arxiv_id":"2310.16049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.16049","snapshot_observed_at":"2026-07-03T14:28:31.206071Z","title":"Mirac Suzgun, Nathan Scales, Nathanael Sch¨arli, Sebastian Gehrmann, Yi Tay, Hyung Won Chung, Aakanksha Chowdhery, Quoc V Le, Ed H Chi, Denny Zhou, , and Jason Wei","venue":null,"work_id":"07c6d656-acea-4b1c-a918-d3410e88d8b6","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2310.16049","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:478814c60b5eebd5ad6b3b78e41a008d9830483a695c22db030c91693cc0e30d","observation_id":"0f896885-a606-47d4-a270-dd718fc19e4f","resolution":{"observed_at":"2026-05-12T08:26:23.291935Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"3f8840f6-37f6-4c9a-bbf7-2c9cca1696ce","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:46e3d89e9622ff212e40e913cfdeb95a799cced2b6f1e642c81b55ba12caa43f","observation_id":"d8c18b49-bfd4-45a2-b077-4d74ae59e0e7","resolution":{"observed_at":"2026-05-14T08:15:54.142446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:20:07.367685Z","title":"A survey on llm mid-training","venue":null,"work_id":"684c449e-80ce-4f9c-a56f-f27a5c69bc7e","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:c2fd91fa5157c75a562f1d10aa0e4ccc021119ca6396bd93b4d9e803ebf42d91","observation_id":"c1d08b41-a72c-4882-9aa3-fef12409b799","resolution":{"observed_at":"2026-05-12T08:26:23.313398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trl: Transformer reinforce- ment learning.https://github.com/huggingface/trl","venue":null,"work_id":"4887e0c3-06b1-43ea-bb8e-44a06a2155d6","year":2020},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:e7c32fd419ae1e10f2068e558b6a4188840d8d4466513ce0596cdfcde497941c","observation_id":"91c3b67a-ed70-4aec-a4cf-f7afc2a807b7","resolution":{"observed_at":"2026-05-14T08:15:54.221282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01939","doi":"10.48550/arxiv.2506.01939","metadata_source":"pith","pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","venue":"cs.CL","work_id":"e5e936f3-0cff-4732-b394-f607d7a63f5f","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:5e62d0ef49e371f82f442b5a63738d5cec3e315d39cd4a3f1eec192e1a679228","observation_id":"20af2015-3b07-41d5-ae74-883752cb9b33","resolution":{"observed_at":"2026-05-12T12:12:09.004283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.469423Z","title":"Self-instruct: Aligning language models with self-generated instruc- tions","venue":null,"work_id":"40d20eeb-4469-4548-b78d-d83166af6146","year":2023},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:6832bfff958d6deb671f790490f90bb344bcbf000d348987668c4489cbdef991","observation_id":"4a3322ce-3a85-4435-a2b6-27c1ac169c21","resolution":{"observed_at":"2026-05-14T08:15:54.216521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":"2109.01652","doi":"10.3030/823782","metadata_source":"pith","pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Finetuned Language Models Are Zero-Shot Learners","venue":"cs.CL","work_id":"7ed6cdaa-ed67-4db4-aceb-b7e1b0e6e7c4","year":2021},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:f040cd3ca96993ccf66b05f83d699aaed194f4299067ffe43679b070b1d9b4e9","observation_id":"1b9c4119-405b-44cd-9442-0c73ed173a06","resolution":{"observed_at":"2026-05-12T08:26:23.342903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf00992696","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:47:34.373100Z","title":"Williams","venue":"Machine Learning","work_id":"469b3b81-55f9-4542-9dd7-570a63cfda74","year":1992},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:c82af155f614bfac1e26618b8ddce0443d818e3be2fae790bffb5d5d97c146c9","observation_id":"b2c38db9-a19f-49f2-9d9d-ce3d189c299c","resolution":{"observed_at":"2026-05-12T01:16:15.425980Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:27.931327+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:27.931327+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wizardlm: Empowering large pre-trained language models to follow complex instructions","venue":null,"work_id":"15fe9005-d9f6-4ec4-8a45-0ff2ef15b030","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:2bdae2c0533270260e22d3ffe5dc4043e9e81fba804078eafa261a8135d661ab","observation_id":"ca29502b-3249-492b-b520-311988ac9f61","resolution":{"observed_at":"2026-05-14T08:15:54.133754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-07T17:29:28.382943Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":"2503.02951","doi":"10.48550/arxiv.2503.02951","metadata_source":"pith","pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KodCode: A di- verse, challenging, and verifiable synthetic dataset for coding.arXiv preprint","venue":"cs.LG","work_id":"7a8a1722-94c4-4a65-9391-3ffde48c168a","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:ad27442d3dd221a48b5a9a538f43be14be0c660b78b8daf8e0025cec051a02a3","observation_id":"3517e1bb-4afc-45e7-b370-e2d00fa5ba8c","resolution":{"observed_at":"2026-05-12T08:26:23.303325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:c5450ca42c5e4fc5500e1b492d7602094a2158b52b98e1e64708a47e90cb6c5e","observation_id":"b486751e-90e9-42e3-b462-095e38d3da75","resolution":{"observed_at":"2026-05-12T08:26:23.277909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:05:55.476500Z","title":"arXiv preprint arXiv:2509.25123 , year=","venue":null,"work_id":"fa71b9a8-6156-4143-b27b-4628df9c9a4b","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:19b1600b76c04180923614d33a3dc9fc91b400805e4abf97587c4e06a29a1964","observation_id":"750955e6-33f0-481d-a306-9c33e41762f0","resolution":{"observed_at":"2026-05-12T08:26:23.357265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:65cb246212229f3d989cab33bf7a1eeef9a67a2423b638f3f9a5189a3eacad66","observation_id":"1080d409-8863-4337-be3d-ec58246afb59","resolution":{"observed_at":"2026-05-12T08:26:23.360380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:37:31.974827Z","title":"Star: Bootstrapping reasoning with reasoning.Advances in Neural Information Processing Systems, 35:15476–15488","venue":null,"work_id":"881016d6-8d7b-4c2d-bbe1-05339013b83f","year":2022},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:697e746840fd5a9b90ddeee44dbac02c781b80f1bd104484250d6fb60c88f9e1","observation_id":"4b7d1b1c-1615-47e0-94bd-54169a493084","resolution":{"observed_at":"2026-05-14T08:15:54.138440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:00:08.493261Z","title":"On the interplay of pre-training, mid-training, and rl on reasoning language models, 2025 a","venue":null,"work_id":"0e148fc4-dd1f-4b6f-946d-385c5883da2b","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:eb4f189c85db64bd7c5af0f86f71814edcd99c3a8a7d35591bc7ebce46e85841","observation_id":"c7630bfd-da44-4e11-a038-cf37e83d1801","resolution":{"observed_at":"2026-05-12T08:26:23.388268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:53:55.014752Z","title":"American invitational mathematics examination (aime) 2024","venue":null,"work_id":"c89df4af-f9f0-4144-8e3e-26c9942c3ba7","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:ca5a48ace4c2527d9881f6ea224c48a076fe895e973dbfc95005675bcdd19d94","observation_id":"02dc47df-a062-4b6c-b96a-c51be6529c44","resolution":{"observed_at":"2026-05-14T08:15:54.237942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:03:40.086802Z","title":"American invitational mathematics examination (aime) 2025","venue":null,"work_id":"27d55e43-baf9-4333-ab45-2d36e5a48005","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:59b2ad735f09e6c8d62f11357351a4afc7791ce134184e50b4af3c62a003d57f","observation_id":"1983d042-f39c-4416-b394-30a0e1774b7c","resolution":{"observed_at":"2026-05-14T08:15:54.125582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16949","last_updated":"2026-08-01T14:42:28Z","snapshot_observed_at":"2026-08-06T23:10:34.815079Z","submitted_at":"2025-08-23T08:47:31Z","title":"Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning","version":7},"cited_work":{"arxiv_id":"2508.16949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16949","snapshot_observed_at":"2026-08-04T02:23:17.018487Z","title":"Breaking the exploration bottleneck: Rubric-scaffolded reinforcement learning for general llm reasoning.arXiv preprint arXiv:2508.16949","venue":null,"work_id":"ca755e28-afae-49ff-addc-7f3dbaca0baa","year":2025},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2508.16949","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:8a35db014aa7d583b7ae2664c9f2063248014fc440f04c0ac99708a492a51ef7","observation_id":"335150b7-a233-4aee-9af1-253c8b86fb5d","resolution":{"observed_at":"2026-08-04T02:23:17.018487Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"81aa7568-cedf-4d06-ae2f-0380fde259c6","year":null},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:8409f0d7962a2b2d02dea28333e03a540fe63e686b533bae45fb055193e6d207","observation_id":"9d044ff9-65c6-4755-9401-dcf9d369aca8","resolution":{"observed_at":"2026-05-14T08:15:54.233028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e502eaa2-4923-4c1b-9bea-2d4cb28e0477","year":null},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:8279bbc449fdbf36dec299f9ec05e20faaaee06e6fd25b49a4a6a0c51b94c51b","observation_id":"f2abb68c-3cf2-4e90-88dd-75cc25ee3e7c","resolution":{"observed_at":"2026-05-14T08:15:54.250175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decision: Yes","venue":null,"work_id":"dc2744c5-7483-4c2e-9d37-1f16f9259c78","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:9b1e367d9ce8dc03a4fa03465b90196d8f2738a08be1c67d8d56728eae625000","observation_id":"5fcea277-bb05-4a79-8c2c-50ac61738c24","resolution":{"observed_at":"2026-05-14T08:15:54.120885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"determination hope success","venue":null,"work_id":"f0cedb84-1a5a-41ee-b767-3b830c988ec3","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:3f800e2709bd0d07e199f4da31b5bba8365d18e3590b4a032a56cabb945374b9","observation_id":"c6405a68-7b39-448b-877c-b50aebbc9754","resolution":{"observed_at":"2026-05-14T08:15:54.129552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All the given conditions are satisfied, and the context makes sense","venue":null,"work_id":"5bc41abb-c0eb-478a-9047-ea7c2cf7cc1f","year":null},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:89803bbc577c0d8e9c72c02eacd147b951a1aa37a103b2e0398b3fc23c74c9bf","observation_id":"609123af-37b3-42ed-901e-e3c921da2c54","resolution":{"observed_at":"2026-05-14T08:15:54.246962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pappus First construct or create something that helps you explore the problem","venue":null,"work_id":"0dc9b4d1-d242-4c0d-bf53-0a5d9362adbe","year":null},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:8511744bcb71f9125a9b4be890f85056bffbd9e881ae58c1968146b6f463e078","observation_id":"38a02fda-7189-4293-a34a-e5d91845e667","resolution":{"observed_at":"2026-05-14T08:15:54.194464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First, find what seems to be the right answer or pattern by exploring ex- amples, calculating, or testing possibilities","venue":null,"work_id":"6ff79efc-7999-45da-b8a3-9b8596e9ef38","year":null},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:11d7fde85174a0a00ba6ec1cdcafbda0a140e82212cbddc5e8a93acbb46a7b36","observation_id":"59137995-f6b9-4baf-988f-37c91dd175d5","resolution":{"observed_at":"2026-05-14T08:15:54.212244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"So, this possibility is inconsistent with the problem statement","venue":null,"work_id":"a2a1090f-95f9-43a9-850e-b46996450fb2","year":null},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:cc530b920c9cef98be70e05255defefb2b0f601ac7cc699a36f380aeb73ac550","observation_id":"f095898f-082b-4c6f-900d-574fdc0f1fcd","resolution":{"observed_at":"2026-05-14T08:15:54.147173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Now, adding both months together, 48 plus 24 gives 72","venue":null,"work_id":"128276a2-6e4f-44ed-94f6-7d01a9277792","year":null},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:ea08f3f685f5d26e20513bae925c9d2dc859b6849124abb976d625e390f746b1","observation_id":"84da0b5a-0dac-461e-a3ae-39c5f09f4c8d","resolution":{"observed_at":"2026-05-14T08:15:54.170472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":3,"verified_exact":36,"verified_fuzzy":29},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2605.08472."}