{"as_of":"2026-08-08T16:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:899f22ac290460a2bda0a97e024a57a62dd65f3d317c2fa303744375e6f05670","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:26:22.163198Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:14:24.194857Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:49:02.979112Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-08-06T19:14:24.194857Z","title":"Reinforcement pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06203","last_updated":"2025-07-10T16:43:36Z","snapshot_observed_at":"2026-08-07T04:57:37.201438Z","submitted_at":"2025-07-08T17:29:07Z","title":"A Survey on Latent Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:24.194857Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2507.06203"},"observation_digest":"sha256:f9cb99462d4427c9ad77346f79cb1a1304af8c77010c3e506d129192ef4cf76c","observation_id":"6367d345-5a3b-46e6-960c-b812ef785c02","resolution":{"observed_at":"2026-08-06T19:14:24.194857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-08-06T14:22:31.430188Z","title":"Reinforcement pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19477","last_updated":"2025-07-25T17:59:13Z","snapshot_observed_at":"2026-08-07T21:58:03.201541Z","submitted_at":"2025-07-25T17:59:13Z","title":"Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T14:22:31.430188Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2507.19477"},"observation_digest":"sha256:9a5bb72e605a42a777aee6f6641c7911cc7e43b4d75c98086a769056b4bbdaa5","observation_id":"2d97bc87-0bb9-4a59-8dba-42c4713a9f58","resolution":{"observed_at":"2026-08-06T14:22:31.430188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:56449f4795fb6a538f7084222b4d8ab0fd7994d80647d5929ca930c2a8c8b3c9","observation_id":"df887682-effa-49cc-926f-47e4e88480b0","resolution":{"observed_at":"2026-05-18T19:21:48.478904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:eaf4d3f8220129e4676ee8fc10c07e79169fa98564a72df5889ee5120b4ae837","observation_id":"c37de614-28a2-4049-bf61-f6feba96f1aa","resolution":{"observed_at":"2026-05-18T00:02:25.291186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-08-04T16:07:28.792504Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.792504Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:6f1b93ad13417188c2f981949280eee5295346a241e20183efda19f5f7c01bbc","observation_id":"481bd3f4-b9cc-419d-be04-f5ae99ef2ace","resolution":{"observed_at":"2026-08-04T16:07:28.792504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-08-04T09:59:47.063555Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13726","last_updated":"2026-07-08T03:06:02Z","snapshot_observed_at":"2026-08-08T12:13:45.483235Z","submitted_at":"2025-10-14T09:35:27Z","title":"Refine Thought: A Test-Time Inference Method for Embedding Model Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T09:59:47.063555Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2511.13726"},"observation_digest":"sha256:b05cf5c5224c12f26f957feffc9c94a07d1e26e2e655bcedb3aae6057fe62a2f","observation_id":"b9b28ba4-21ed-401a-9f34-9bec50a52788","resolution":{"observed_at":"2026-08-04T09:59:47.063555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":207,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:f005268412a1ede40a58bce05d81e2956554f70852d1a4abd5c9eb682112af1d","observation_id":"95dfa54e-503a-4b53-bef1-2844aa2839a1","resolution":{"observed_at":"2026-05-17T15:14:26.226702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-08-03T05:14:18.061552Z","title":"Reinforcement pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-08T03:39:37.418634Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.061552Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:54f69f32c59f3a9e360feae8f8a9164685ffa64a5309405a226c6e406c2c0c34","observation_id":"09b938cb-cfa9-409d-9fde-7fd96d8601ba","resolution":{"observed_at":"2026-08-03T05:14:18.061552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-15T12:09:16.468055Z","title":"Reinforcement pre-training.arXiv preprint arXiv:2506.08007,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.09221","last_updated":"2026-05-29T05:28:18Z","snapshot_observed_at":"2026-07-15T12:09:13.856257Z","submitted_at":"2026-03-10T05:42:13Z","title":"Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-15T12:09:16.468055Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2603.09221"},"observation_digest":"sha256:75892d2690ca8be8589f1d5ef1f7404b31a13963c5324ceedb8f6939cdb419df","observation_id":"19deb135-22eb-4e42-a387-9f0ed445e441","resolution":{"observed_at":"2026-07-15T12:09:16.468055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2604.12160","last_updated":"2026-04-14T00:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T00:35:39Z","title":"PubSwap: Public-Data Off-Policy Coordination for Federated RLVR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:27.319466Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2604.12160"},"observation_digest":"sha256:7ece655cf0d4c131007af7d3baf0a531e3f100cf44904d9044b625da298e34e1","observation_id":"65083332-4263-4475-9d35-f7512bdf980f","resolution":{"observed_at":"2026-05-11T09:21:00.321774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:fdc9039158dc9af1f2d30ef8d1249d4acc7b1ad7cde41d1fbecf09123e2e3032","observation_id":"dddbcb56-be36-4ec5-90db-16b4ac71e80c","resolution":{"observed_at":"2026-05-11T11:41:04.013130Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2605.10810","last_updated":"2026-05-15T15:01:38Z","snapshot_observed_at":"2026-08-01T14:39:13.243144Z","submitted_at":"2026-05-11T16:32:06Z","title":"Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T17:20:39.969447Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2605.10810"},"observation_digest":"sha256:8c1a0eaf3b2d2416329e656a3d5780237fb4c9c450596eadbc840607b4fa8593","observation_id":"461999dc-ad6a-4e77-a4ae-6c712e72e1bb","resolution":{"observed_at":"2026-05-19T17:22:41.994710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2605.19444","last_updated":"2026-05-27T03:12:51Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:58:44Z","title":"Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-20T07:20:50.835826Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2605.19444"},"observation_digest":"sha256:5be16eab0c5b45a02ff25f1fb6964a3bf5ccbb53e477874a30c37d48a6dd5255","observation_id":"014e622b-6525-4eb9-9844-da26c2ebbd97","resolution":{"observed_at":"2026-05-20T07:23:06.972704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2605.21654","last_updated":"2026-05-20T19:09:05Z","snapshot_observed_at":"2026-08-01T22:11:44.467960Z","submitted_at":"2026-05-20T19:09:05Z","title":"Value-Gradient Hypothesis of RL for LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-22T08:52:21.361294Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2605.21654"},"observation_digest":"sha256:e2a99c992c34a6c8a671e4dafb5126568994c512d790e8423f7744c6d85ed39c","observation_id":"3534117c-d9fa-4072-af1e-56b4d2aa5b6d","resolution":{"observed_at":"2026-05-22T08:54:45.940210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:ae0d717c139d16b5c4a1093022db470c58eca11dceb8cce2f1fb2b0fbe08fcdc","observation_id":"a758bfb8-2b50-4fad-a4d5-d89675e1fabe","resolution":{"observed_at":"2026-07-01T20:56:13.441534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-08-07T20:44:00.088711Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T10:37:53.152370Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2606.04272"},"observation_digest":"sha256:e93f3df7cb37d2f0a81642aeb2488187794372bdedcd677eb948cf2e1ea7b1b2","observation_id":"ba6d57a6-4722-4e50-a417-4552047a6fb5","resolution":{"observed_at":"2026-07-02T02:46:29.032828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2606.18961","last_updated":"2026-06-17T11:42:01Z","snapshot_observed_at":"2026-08-06T13:00:47.933590Z","submitted_at":"2026-06-17T11:42:01Z","title":"Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-26T21:40:55.946788Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2606.18961"},"observation_digest":"sha256:32b86b4a309887f80a14a97cfa99ac4819120fa8cc0a80765592217b6fbceeda","observation_id":"6b8fd053-aa22-480d-82f6-17d2e23ecb2a","resolution":{"observed_at":"2026-07-03T23:49:02.980949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08007/citation-record","integrity":"/paper/2506.08007/integrity","json":"/paper/2506.08007/citation-record.json","paper":"/paper/2506.08007"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:26:22.074900Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.074900Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:5229cf9cfb0706a7564b7cfcb488eee0893438c21aa5f09488a3f3bba7b8e596","observation_id":"3d8f1335-deaf-46fa-80f0-f65e345af051","resolution":{"observed_at":"2026-08-07T05:26:22.074900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:22.462225Z","title":"Notably, the performance of R1-Distill-Qwen-14B is evaluated in two different manner: standard next-token prediction and reasoning-based answer prediction (indicated as ‘+ think’)","venue":null,"work_id":"0cabe7fc-468d-4c90-b887-5ce423429b32","year":1990},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.163198Z"},"links":{"citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:123fe8f71ebfe5ea8c4391e86efb6a2092ea57cd485aa87cc57f6b077d29a617","observation_id":"6d7b5087-d78a-413f-8956-492c0623a394","resolution":{"observed_at":"2026-08-07T05:26:22.469919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T05:26:22.097018Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.097018Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:b4425014785f62ef1f0414431b61870b9dceb99f30944d5afa1fce6dadbe388f","observation_id":"914df787-450c-4f09-adb8-3a345f3b7ae3","resolution":{"observed_at":"2026-08-07T05:26:22.097018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-08T15:56:07.800611Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-07T05:26:22.114660Z","title":"Skywork open reasoner 1 technical report.arXiv preprint arXiv:2505.22312,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.114660Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:1e9bb50c6532a43012c9007e71d191d261d0a17d0f03cfb9cdf038355b776f57","observation_id":"d9211a4a-fdfe-4571-8125-a93116d8f10f","resolution":{"observed_at":"2026-08-07T05:26:22.114660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T05:26:22.120498Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.120498Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:93a3602c7bd60f20a3cefe37f33ccfa38b310cf64620c5aae7b86418b1c0743a","observation_id":"7e82d631-dda2-4351-ba9c-19ed2971b7ff","resolution":{"observed_at":"2026-08-07T05:26:22.120498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T05:26:22.126155Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.126155Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:0249aaa533502afad46154ac7c7529672712402c517fb96f3eec40b77a0e5210","observation_id":"c83d3403-b506-4074-8cd4-8a8e049e2775","resolution":{"observed_at":"2026-08-07T05:26:22.126155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14652","last_updated":"2025-06-09T17:40:25Z","snapshot_observed_at":"2026-08-08T07:13:10.579807Z","submitted_at":"2025-05-20T17:41:33Z","title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14652","snapshot_observed_at":"2026-08-07T05:26:22.131730Z","title":"General-reasoner: Advancing llm reasoning across all domains.arXiv preprint arXiv:2505.14652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.131730Z"},"links":{"cited_paper":"/paper/2505.14652","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:a6d119f1f21ca998ef8bbac757af9ada98893658b8e672b4cb31d553fad90430","observation_id":"b84d26e8-1849-4665-96d1-d46135f5a881","resolution":{"observed_at":"2026-08-07T05:26:22.131730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T05:26:22.136750Z","title":"HybridFlow: A flexible and efficient RLHF framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.136750Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:c47b66d96c02ab45b89704d703aa2e172ca40e5d0c0b37524cbccb4782a3b8c3","observation_id":"331c4ee9-c514-4eaf-9c09-c942f71f0115","resolution":{"observed_at":"2026-08-07T05:26:22.136750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:26:22.142165Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.ArXiv, abs/2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.142165Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:740ee1e1b51f5df2127e10b2cdb70c98ce41512d2bec8ebc6265e3dde1766fe3","observation_id":"99f5089e-12c0-4f1e-b071-e2dbd9917abd","resolution":{"observed_at":"2026-08-07T05:26:22.142165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-07-31T09:25:34.205362Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-07T05:26:22.147943Z","title":"Quiet-star: Language models can teach themselves to think before speaking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.147943Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:9b06bad43342fffa3d62d9e2327935f1bb31ffcfe9e35bead351548213eed80a","observation_id":"e81c777e-7081-4098-8990-1ba27f7473e8","resolution":{"observed_at":"2026-08-07T05:26:22.147943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-07T23:06:45.603790Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-07T05:26:22.153069Z","title":"A survey on test-time scaling in large language models: What, how, where, and how well?arXiv preprint arXiv:2503.24235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.153069Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:a64aa331dabcaaf8d0fd245c9e7f60171f1f25366a754f20bd5369c209a1a969","observation_id":"5fbd83f4-6378-40a7-ab4d-98acd0087fee","resolution":{"observed_at":"2026-08-07T05:26:22.153069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-07T05:26:22.158083Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.158083Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:3f3cc37909e3c6e1218b3e230a38149aa6b4cb07e9532bdb66ead3f75b7f7bf6","observation_id":"881d37f7-a003-4bc1-a8de-289095639b6c","resolution":{"observed_at":"2026-08-07T05:26:22.158083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T05:26:22.108551Z","title":"Rae, Oriol Vinyals, and L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.108551Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:d2808c257f770a63afebc481911ddfdb775a06306e400eb505b3ab2bef9dd9e5","observation_id":"fa147932-a54b-4940-b749-83a0c62ea092","resolution":{"observed_at":"2026-08-07T05:26:22.108551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T05:26:22.080543Z","title":"SuperGPQA: Scaling LLM evaluation across 285 graduate disciplines.arXiv preprint arXiv:2502.14739,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.080543Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:44a4a1ec37d576914b451ffd9faf9f865646f10972f29dc00b7ed0856877adc2","observation_id":"5389ff90-d184-48a4-92d4-a32f79566ead","resolution":{"observed_at":"2026-08-07T05:26:22.080543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:26:22.091745Z","title":"Deepseek-r1: Incentivizing rea- soning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.091745Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:addcabae08fc53972edcf1b52edb1e6679548cd7518c4f23140655cca268d341","observation_id":"1448d7ff-8ad2-4796-a615-b5970a04fb3d","resolution":{"observed_at":"2026-08-07T05:26:22.091745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T05:26:22.086147Z","title":"Omni-MATH: A universal Olympiad level mathematic benchmark for large language models.ArXiv, abs/2410.07985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.086147Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:7c4c69ea7200dc261fbc5a994beb1241dbb63e05744de2f6b549e058e994c529","observation_id":"e711829c-0ac3-47de-a042-751ba8441949","resolution":{"observed_at":"2026-08-07T05:26:22.086147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T16:39:54.879011Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 17 inbound Pith citation observations for arXiv:2506.08007."}