{"as_of":"2026-08-19T13:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cd6b3910a462efb0c9596e4a00a654df1d266839e3ab459cba2a118113b1068","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:04:38.905912Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T12:15:08.304150Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.573829Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"cited_work":{"arxiv_id":"2505.02142","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02142","snapshot_observed_at":"2026-07-04T08:09:40.573829Z","title":null,"venue":null,"work_id":"4e64db60-5e15-412a-999a-990a0bad53b2","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":204,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2505.02142","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:82d15a6345820088075710694ab814a2333a6f61a1cc9495e1e873394e16c377","observation_id":"10c0d3fa-2308-45cb-9039-12172632c9c6","resolution":{"observed_at":"2026-07-04T08:09:40.575141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02142/citation-record","integrity":"/paper/2505.02142/integrity","json":"/paper/2505.02142/citation-record.json","paper":"/paper/2505.02142"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-18T07:57:35.968161Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-08-16T01:04:38.684571Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.684571Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:1e45e35d9347ae6573daf312d4ca4c9e0f01a5da81655c6a9f51fc12e1f101d2","observation_id":"cfc6ffb7-03ba-4eba-9fd6-71af80d16ba8","resolution":{"observed_at":"2026-08-16T01:04:38.684571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.688977Z","title":"2023 AMC 8 Problems/Problem 10","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.688977Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:ca61f7963025d13b9c45ef50a3bf76e8c9ffe06f4149b40662649c689199be41","observation_id":"21aaef41-7ec3-4365-960b-e84b79d8d4a6","resolution":{"observed_at":"2026-08-16T01:04:38.688977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T01:04:38.696928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.696928Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:2d971bf4add277a46582d3eb4127b1c406ea7edce6aeb5bb3b459f1779270cfc","observation_id":"e60a095f-4414-472f-a3bc-0f3766cc8b3e","resolution":{"observed_at":"2026-08-16T01:04:38.696928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:39.505212Z","title":"Aime_1983_2024 (revision 6283828), 2025","venue":null,"work_id":"930f7b8d-b115-458a-8108-d6c2c926415a","year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.701302Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:2625dfccf4bcf0b30db83d8c611a35c386c1ab525c0ca3a7b8a9281e77b43258","observation_id":"dfb5a672-30d7-486a-87c1-6d3faeed708a","resolution":{"observed_at":"2026-08-16T01:04:39.509068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-16T01:04:38.704305Z","title":"Kto: Model alignment as prospect theoretic optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.704305Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:862e1195541e5c9f97bc5b47b4ea988b91c4bfdf9458e549e19aa60e7a0f371a","observation_id":"b981d4f7-0535-4099-aa09-7de0a0976236","resolution":{"observed_at":"2026-08-16T01:04:38.704305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.707916Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.707916Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:620a216f9ff78f10699ff058fb53a1adc2c3d9bfbbbe4d1204e3c3d52d17f575","observation_id":"c03598fa-80d8-423c-80a7-12c5a4bc109c","resolution":{"observed_at":"2026-08-16T01:04:38.707916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16182","last_updated":"2025-03-20T10:52:45Z","snapshot_observed_at":"2026-08-16T17:29:34.633542Z","submitted_at":"2025-02-22T10:59:11Z","title":"IPO: Your Language Model is Secretly a Preference Classifier","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16182","snapshot_observed_at":"2026-08-16T01:04:38.711041Z","title":"Ipo: Your language model is secretly a preference classifier, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.711041Z"},"links":{"cited_paper":"/paper/2502.16182","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:9834cbcd0cdd7015e0a66cc2f58cc6bae6a29b4bdd3fd106ec6ddc161527be60","observation_id":"bfd2a199-21d7-4047-b36c-e29037e716e8","resolution":{"observed_at":"2026-08-16T01:04:38.711041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.714253Z","title":"Fine flan: Seqio to parquet so you don’t have to","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.714253Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:209bbd497c33f680e0f182edb1e3b7165ffbef36c251956aa9072b805e30c846","observation_id":"b043f8c1-2096-43e6-9b3c-ded5ad26ccf3","resolution":{"observed_at":"2026-08-16T01:04:38.714253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:39.482066Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":"1c7c8327-d054-47ba-b1b5-dcacbb4bcc9a","year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.718052Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:5db2d63a9e40beec91bdf65671b8d7e01f53edf862b70110500441c1226df67b","observation_id":"35edec94-921d-417f-8268-b5b7d7e4a3df","resolution":{"observed_at":"2026-08-16T01:04:39.485870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.720852Z","title":"Logic-701: A benchmark dataset for logical reasoning in english and russian","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.720852Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:e94a2c1fd0d1852043c86c95027a990afe7835aec851ae05e8431f634f1b4dd8","observation_id":"36ba94a6-3d6c-401e-8be6-f05dc26f9909","resolution":{"observed_at":"2026-08-16T01:04:38.720852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-16T13:02:01.818557Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-16T01:04:38.723914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.723914Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:3fac1ae635c052575fdf24f124b3d2630cdba76475f9ff014a82173577749f07","observation_id":"8acd92c1-cf25-489f-b27b-1220df8292fa","resolution":{"observed_at":"2026-08-16T01:04:38.723914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-16T01:04:38.727591Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.727591Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:8cf1020b8913f5d058a9ae8ebb20ecea865b8730908cff4c9f01a49d1cd010d5","observation_id":"d021b717-b790-4671-a5ca-0bb263ddb1a9","resolution":{"observed_at":"2026-08-16T01:04:38.727591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.731892Z","title":"Ncert biology 11th dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.731892Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:1fa7d3d667d92fecaf0459ae83384b55201ad76f19eea7f7c08bc119bf147a62","observation_id":"42d522cd-ce98-4ee4-b609-2adaff4b37ad","resolution":{"observed_at":"2026-08-16T01:04:38.731892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.735710Z","title":"Ncert biology 12th dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.735710Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:e34e1ac86a7ae59fa9ed9c1cb4190e88f27214919936fddcd09642f983e2f282","observation_id":"c94e6c7e-6def-4fae-854b-0f554c700c60","resolution":{"observed_at":"2026-08-16T01:04:38.735710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.738934Z","title":"Ncert chemistry 11th dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.738934Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:9cf62047beb0c161be5ee49c4e15a78475e494ac9de741d5cec9006c79442309","observation_id":"e7ef0b56-65a4-4d23-b65e-da49396f755d","resolution":{"observed_at":"2026-08-16T01:04:38.738934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.742197Z","title":"Ncert chemistry 12th dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.742197Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:81bab477b9993577f400d27250aec9a1fa38f1f755f223c9b032fd4854ed0f40","observation_id":"c6bead1f-4387-4d28-bc3e-50f346df2916","resolution":{"observed_at":"2026-08-16T01:04:38.742197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.746718Z","title":"Ncert physics 11th dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.746718Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:88cea0ab877e9a21b1e6ac7cdda32f04b7114cb14a607015066a9555ebf2da60","observation_id":"8cde3bd2-2c7e-4634-8363-63f554372d81","resolution":{"observed_at":"2026-08-16T01:04:38.746718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:39.436044Z","title":"Ncert physics 12th dataset","venue":null,"work_id":"0785918c-3a92-44d3-8fad-c9cb4259b171","year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.750319Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:bc2e7d21ddb32b2be93936852ab7fc0b91917a577a3ec6cafae32bf16cdbbe0d","observation_id":"c0bbfb90-8d5d-4a05-98d5-fa4f063b1e26","resolution":{"observed_at":"2026-08-16T01:04:39.439637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.753815Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.753815Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:fda446381eb97a9f1538575cfb6ae175372eeb42925ff1629269d0bf8846c9d5","observation_id":"e9709543-80d9-4672-8f4b-5cca0aa9c277","resolution":{"observed_at":"2026-08-16T01:04:38.753815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-16T01:04:38.756644Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.756644Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:a0e7af9144b4ab9431aefd5eef0ffcf7aea2b163817e991b0daf3b4694237403","observation_id":"52f0d26b-1f39-4ea6-8f0c-0cafd8564693","resolution":{"observed_at":"2026-08-16T01:04:38.756644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.759853Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.759853Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:800183ae2472f96a29732560451884b185352c95be2d3b93bd0bbab907f1c9c6","observation_id":"f43b0eef-f44c-4906-9d5a-7d44d721057b","resolution":{"observed_at":"2026-08-16T01:04:38.759853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-16T01:04:38.762722Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.762722Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:51980b985558994a7dd7af54485ee6e24312a2f132faf012512602f8b9316ebb","observation_id":"2f863bc1-17ab-45ff-af56-419ba43e37e8","resolution":{"observed_at":"2026-08-16T01:04:38.762722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:39.413275Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":"f32b6bbb-8684-4305-b609-d8cedace7bf4","year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.765848Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:5e9c7f6181e1c95a7f1be54613bee342ac7c1ce10b89b9e198fecb9c18ccbd3c","observation_id":"ea88edfd-e382-4f14-a47f-eafaec48804a","resolution":{"observed_at":"2026-08-16T01:04:39.416887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.769300Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.769300Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:c681133f3375c1e09eac691a3a56c755085d5fd7b5c48ed1e14fcad7ed7bb4a3","observation_id":"b7ce3c49-d795-499a-a456-2ee1ea860d6c","resolution":{"observed_at":"2026-08-16T01:04:38.769300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:39.397098Z","title":"Kw-r1: A simple implementation of the grpo algorithm","venue":null,"work_id":"f750d8cc-5a63-4907-bd2d-88e6253a3b22","year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.774225Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:6f2fae1f1b985aaa0d63d52e775b098a74c75c9977969d35599f39258c72c0ea","observation_id":"64020ec3-470c-4727-8ea9-87132461dc8b","resolution":{"observed_at":"2026-08-16T01:04:39.400427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06411","last_updated":"2024-11-28T02:53:40Z","snapshot_observed_at":"2026-08-16T17:29:35.207164Z","submitted_at":"2024-09-10T10:49:38Z","title":"Length Desensitization in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06411","snapshot_observed_at":"2026-08-16T01:04:38.778559Z","title":"Length desensitization in direct preference optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.778559Z"},"links":{"cited_paper":"/paper/2409.06411","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:1162edccc6865dca3960e031c30f6cbf26182c03a04d36b10da5b8caa811dc83","observation_id":"facd71f4-229c-44e6-a287-0e06394fdd04","resolution":{"observed_at":"2026-08-16T01:04:38.778559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-16T01:04:38.781933Z","title":"Understanding r1-zero-like training: A critical perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.781933Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:e2c4c9851f7affe4252bd4795e9a45bdfbf1721df103b68ef563be45ba4a7bcd","observation_id":"0670d9b8-4713-456d-be9f-fabe8423b899","resolution":{"observed_at":"2026-08-16T01:04:38.781933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:39.387052Z","title":null,"venue":null,"work_id":"cf201840-69fb-42cb-bc9e-d1299147868b","year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.785530Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:fa40b3de4343d2d471a46d085097bad4001a799ea397f50b382330a92c090959","observation_id":"d431f0b3-a664-4330-8609-ed74c031d357","resolution":{"observed_at":"2026-08-16T01:04:39.390630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.789797Z","title":"Le, Barret Zoph, Jason Wei, and Adam Roberts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.789797Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:48455e3da0ddc9f7cb41a7dbc660f94229033de850586ac55e9734f4de924621","observation_id":"0577ce0a-83a9-4fd4-8c11-5b7329c71616","resolution":{"observed_at":"2026-08-16T01:04:38.789797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.793190Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.793190Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:5a4072da8641f6688414953bfb0c6f27eeaa7f80fc86700983f74289d47e9cb6","observation_id":"4b1d1f10-5720-4b46-91d9-c527e7e721a9","resolution":{"observed_at":"2026-08-16T01:04:38.793190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.796500Z","title":"Chemistry-qa","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.796500Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:36138c06d6e947610e152cdbfb2a59dea93ab8e61f04fbe5e85f8ed628d83fd7","observation_id":"54d018df-6ac2-4545-910f-3acbebc95abd","resolution":{"observed_at":"2026-08-16T01:04:38.796500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-16T01:04:38.799528Z","title":"s1: Simple test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.799528Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:e2434c01a5462ffdf57554d0aebbd2f9e75ea69f2a304d738d6ab835f76c06e7","observation_id":"cd907a48-355e-4704-a676-b64958b1a11b","resolution":{"observed_at":"2026-08-16T01:04:38.799528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:39.356899Z","title":"Llama-nemotron-post-training-dataset","venue":null,"work_id":"ebeb769a-bc32-4e06-a2b5-de45623c95f1","year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.803057Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:5727d401a45247bd6e1e9ccf94b2caee95a95fe169522f1cbd4ca28ace0115d5","observation_id":"9cc0aef8-6577-47a1-b6ba-dcb9d7ec331b","resolution":{"observed_at":"2026-08-16T01:04:39.361345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.806310Z","title":"Llama-3_1-nemotron-ultra-253b-v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.806310Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:be88c8bc59892ebe3d94254033eae2256b1df3a1d44ca90d4cf59f0fb821ebcb","observation_id":"bb9b5037-b839-4a3c-af70-4eeb96a5a5f1","resolution":{"observed_at":"2026-08-16T01:04:38.806310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.809759Z","title":"Infinity instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.809759Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:24a59897134b3cbec240fd2b42449e4a2bd0c57dea0c44b410a6279d0e1ecc40","observation_id":"0b60eb25-de3b-4dd7-86bc-e3098757d1da","resolution":{"observed_at":"2026-08-16T01:04:38.809759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.813326Z","title":"Verifiable coding problems (python)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.813326Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:7f3a1f338236fd7c1d8c6b5372fc22b3e45ae8c48d63c2e2d113fafa9b1d5453","observation_id":"65cd8540-6e1e-410f-becc-2038e4d44abf","resolution":{"observed_at":"2026-08-16T01:04:38.813326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.816799Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.816799Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:cc4843e55498018f141152dc28af7ccd0e380fe0c885078d5336bc8abefc95b4","observation_id":"5be56665-1c51-4312-bc76-20fb0449a1ad","resolution":{"observed_at":"2026-08-16T01:04:38.816799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-16T01:04:38.820093Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.820093Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:f582408dd5be2e466c571effa0df9902e62105787cefd4074bf60c7c70b8ad3d","observation_id":"2e5fa7e0-01f8-4933-8485-2132de1b6538","resolution":{"observed_at":"2026-08-16T01:04:38.820093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.823918Z","title":"Codeforces cots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.823918Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:530ac7ad81ff54e9b43e2cbc9bc6e48753e90b5175233e505d01d779502f37ed","observation_id":"4b7aec5e-ab2b-41de-9601-c70744877383","resolution":{"observed_at":"2026-08-16T01:04:38.823918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.827452Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.827452Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:f2bf0815683fc920991b2a5683b5965e219721c7f24ca0263994cba432aec2b3","observation_id":"c50da048-1071-44d1-9016-a30d6181b3a2","resolution":{"observed_at":"2026-08-16T01:04:38.827452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-16T01:04:38.830986Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.830986Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:9fe9d66d01ae1980d4db37cff1af045b65537748c14bd336758a17d70a6a9b07","observation_id":"753f0b64-6e9e-460c-bbda-031399d893e8","resolution":{"observed_at":"2026-08-16T01:04:38.830986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.834346Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.834346Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:7e00c065dfb4d066a032a1e0a1b8d56bc2559eac8192bd0b3dad6c2f94e13402","observation_id":"92d7cc52-07a7-4321-8c8e-0a0355e26dd9","resolution":{"observed_at":"2026-08-16T01:04:38.834346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T01:04:38.837931Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.837931Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:29ec2ee6298bdc2ebd9c300a8ea61f889ddd8909af625105fd9e4428e781c2b4","observation_id":"bd0549cc-770a-4436-92f5-61b169cc9406","resolution":{"observed_at":"2026-08-16T01:04:38.837931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T01:04:38.841121Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.841121Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:6da8a2fbd6916ab2851bb9fb702b77e133c821521e024ae2a365f2cef2eaeb7e","observation_id":"f086508c-8213-4813-b586-6bda26b8ad29","resolution":{"observed_at":"2026-08-16T01:04:38.841121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.844397Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.844397Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:c0a971a7609c39309ec09ac94c2eed7c7d6e72775aa2ccbb718d3ff696844c55","observation_id":"3debcc52-d762-4f34-b563-ec1ec39d6de5","resolution":{"observed_at":"2026-08-16T01:04:38.844397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.847460Z","title":"Wizardlm evol-instruct 70k dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.847460Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:15e0a594aa8346a14cc1d3827f148c7b95f5696e968f960f9e9ab41966c88dfb","observation_id":"0348ce26-7209-4680-9726-41fb111acac4","resolution":{"observed_at":"2026-08-16T01:04:38.847460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.850481Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.850481Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:6f4703284f917f72a17ef9dc67bf9f779d0ae72fef44cd08b62a1ea8f12e278a","observation_id":"47c34423-45bb-4bc5-a98d-66f46ff80514","resolution":{"observed_at":"2026-08-16T01:04:38.850481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17565","last_updated":"2025-05-13T07:43:57Z","snapshot_observed_at":"2026-08-17T00:13:10.644095Z","submitted_at":"2025-04-24T13:57:53Z","title":"DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17565","snapshot_observed_at":"2026-08-16T01:04:38.853466Z","title":"Deepdistill: Enhancing llm reasoning capabilities via large-scale difficulty- graded data training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.853466Z"},"links":{"cited_paper":"/paper/2504.17565","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:9efd66edaeb535fbd96688d8ab3cf2c4ed04a82443d9fae131e4123351e2251f","observation_id":"eedb6bee-05fb-4a92-a0c7-7f105e290fa1","resolution":{"observed_at":"2026-08-16T01:04:38.853466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07705","last_updated":"2022-10-24T07:00:15Z","snapshot_observed_at":"2026-08-16T17:06:36.906080Z","submitted_at":"2022-04-16T03:12:30Z","title":"Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07705","snapshot_observed_at":"2026-08-16T01:04:38.856568Z","title":"Smith, Hannaneh Hajishirzi, and Daniel Khashabi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.856568Z"},"links":{"cited_paper":"/paper/2204.07705","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:3dcc0d6fdf911500a5f68772004a161e28e5de04af18a3cda4b5ce38f523f2da","observation_id":"ba424970-494b-490e-8b2f-b9ed22ca704a","resolution":{"observed_at":"2026-08-16T01:04:38.856568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.859743Z","title":"Smith, Hannaneh Hajishirzi, and Daniel Khashabi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.859743Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:d190a432b5587ea8b71b7ab9f32aeb747f00efb1a25c9a10ec2ded9e98b617c5","observation_id":"91904807-967f-4db1-86cd-37e533561d43","resolution":{"observed_at":"2026-08-16T01:04:38.859743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.862534Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.862534Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:a9d48642804c14ad73e95af250b1433283aefc189f159b266526267a4631be1c","observation_id":"ec7a51fd-cdcc-4664-bd13-e3da0b781e75","resolution":{"observed_at":"2026-08-16T01:04:38.862534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-16T12:53:05.855883Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-16T01:04:38.865499Z","title":"Kodcode: A diverse, challenging, and verifiable synthetic dataset for coding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.865499Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:6987c34ccd64812b3a694a51c236648d449d215d20ea8ab927a1b04b32f8b8e2","observation_id":"d1257ba9-7fda-4218-8b8a-3b8827da053e","resolution":{"observed_at":"2026-08-16T01:04:38.865499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-16T01:04:38.868464Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.868464Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:59cd81e130df10e4b4398b9b5935faa9c6dbec4d7e385a3621c516166f23ffb1","observation_id":"cc608c9c-c12e-4716-ad8f-1e5d2a0f5d7b","resolution":{"observed_at":"2026-08-16T01:04:38.868464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-13T10:57:13.012119Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-16T01:04:38.872002Z","title":"Metamath: Bootstrap your own mathematical questions for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.872002Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:4c776fbd4c1aff733718d7f0b2fae34e36e17b42c06bf64394c977ea63a1cf8e","observation_id":"4daa4ef2-7916-475e-a215-45761ca69b20","resolution":{"observed_at":"2026-08-16T01:04:38.872002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-16T01:04:38.875723Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.875723Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:65f1b3d71737d847843ce9d7616ac2d9957c79be28fc82bd9aed7d925143acea","observation_id":"c0ff78bd-e467-4fe8-89fa-d8e224d68732","resolution":{"observed_at":"2026-08-16T01:04:38.875723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-18T19:37:22.484551Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-16T01:04:38.879469Z","title":"Free process rewards without process labels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.879469Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:16b8f5c063b74506e5cd797c6d234608b1b74d19ffe45fffe472a3e5610c7c60","observation_id":"965369bd-dfbd-4177-bbed-3666517ad2ce","resolution":{"observed_at":"2026-08-16T01:04:38.879469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.883074Z","title":"Naturalreasoning: Rea- soning in the wild with 2.8m challenging questions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.883074Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:c53cf965c275aa5e5cc4c8b6832768ef9bb4048f6354675ccc1712d532a91837","observation_id":"88222009-4be8-4abc-9e76-f8086dd15721","resolution":{"observed_at":"2026-08-16T01:04:38.883074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-16T01:04:38.886277Z","title":"Vapo: 12 Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.886277Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:23a2a1cb40197ebf9db3be7d15b0a2c83df398ba5fe1b3a9e64e818017a75d35","observation_id":"58731850-bb23-41c3-8764-5e480bd74fcd","resolution":{"observed_at":"2026-08-16T01:04:38.886277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-16T16:48:21.526954Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-16T01:04:38.890403Z","title":"Acecoder: Acing coder rl via automated test-case synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.890403Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:01e21687c9169469ea7f0cfe4b18284efd6031964f67849b4268c063266c3694","observation_id":"0dab8b0b-d2ba-43d3-8881-a4ecc0b15ec3","resolution":{"observed_at":"2026-08-16T01:04:38.890403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07089","last_updated":"2024-08-09T08:18:20Z","snapshot_observed_at":"2026-08-18T12:36:04.559972Z","submitted_at":"2024-08-09T08:18:20Z","title":"InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07089","snapshot_observed_at":"2026-08-16T01:04:38.893490Z","title":"Infinitymath: A scalable instruction tuning dataset in programmatic mathematical reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.893490Z"},"links":{"cited_paper":"/paper/2408.07089","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:6ababd4f536858c3ff54622c07cdb4d8745de492516c66ebe824460766f1165e","observation_id":"fe5866d2-194b-4ebb-9a3c-9d3b314333ff","resolution":{"observed_at":"2026-08-16T01:04:38.893490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07045","last_updated":"2024-09-11T06:27:50Z","snapshot_observed_at":"2026-08-16T17:15:57.374737Z","submitted_at":"2024-09-11T06:27:50Z","title":"Beyond IID: Optimizing Instruction Learning from the Perspective of Instruction Interaction and Dependency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07045","snapshot_observed_at":"2026-08-16T01:04:38.896787Z","title":"Beyond iid: Optimizing instruction learning from the perspective of instruction interaction and dependency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.896787Z"},"links":{"cited_paper":"/paper/2409.07045","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:9143e90debfdfdd5f97b512afa0a1b20b0d81616bb76f3097480ededa0e700c2","observation_id":"7e271105-5461-4e7d-a69e-1c64742f4812","resolution":{"observed_at":"2026-08-16T01:04:38.896787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-16T01:04:38.900467Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.900467Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:76ad36ecb3415ce6960f583287ade397fce89dd0c5c0c6e4514599c4de85817b","observation_id":"b05ddc4c-e6e0-44d5-8d31-9137448fea7e","resolution":{"observed_at":"2026-08-16T01:04:38.900467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:39.269937Z","title":"Hey Siri","venue":null,"work_id":"6738b27f-83c5-48d9-87d7-aa7cf15a2156","year":null},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.905912Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:f8af75317f24cb709e5ba2197fb50d9f1f68ea34420455ec04b99f67164edb9b","observation_id":"5dbfd169-9ebf-4bf4-937a-9d09a617fa74","resolution":{"observed_at":"2026-08-16T01:04:39.275023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:04:38.693266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T01:04:38.693266Z"},"links":{"citing_paper":"/paper/2505.02142"},"observation_digest":"sha256:d6b07408cec8d73cd4602166b03bfb4fed24f278e7a8b68d314d96d4925f193e","observation_id":"07956d67-68b3-43fc-9354-a4ca7e89ccda","resolution":{"observed_at":"2026-08-16T01:04:38.693266Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02142","last_updated":"2025-05-04T15:09:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T17:16:43.837774Z","submitted_at":"2025-05-04T15:09:49Z","title":"Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":56,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2505.02142."}