{"as_of":"2026-08-10T08:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d00f41ecc73097556343a9792dc1616554a71fc0cc1e0e70812eecde8bff3b04","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:38.586086Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:53:08.661292Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:48:56.210532Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2508.07809","last_updated":"2026-04-20T09:03:51Z","snapshot_observed_at":"2026-08-02T08:22:04.058996Z","submitted_at":"2025-08-11T09:49:01Z","title":"EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T23:56:47.274169Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2508.07809"},"observation_digest":"sha256:98e03fd2cf08d6dbfa24c0cc6493304e3bfcacae1fce7abeb6f4ca30f529cba5","observation_id":"ae143971-845e-4b2c-a967-2259fae6503a","resolution":{"observed_at":"2026-05-18T23:56:55.008684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2509.21882","last_updated":"2026-05-25T20:11:55Z","snapshot_observed_at":"2026-08-04T14:57:15.491600Z","submitted_at":"2025-09-26T05:06:25Z","title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T14:24:48.666197Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2509.21882"},"observation_digest":"sha256:40cae5e3fd42ac7aa8bad88c5fe3bd4838275f4539b11c8049f12fdfca4c3a16","observation_id":"a5a87b9b-3829-498b-a3b9-57b85d3d4566","resolution":{"observed_at":"2026-05-18T14:26:28.367388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-04T10:53:08.661292Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.661292Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:677de1dd6bc1c225acfb5c200c1cf1fa8cc4cf4cc9192052af55a66582e6178c","observation_id":"11411b44-0b68-42f9-aeb6-eab51a369da2","resolution":{"observed_at":"2026-08-04T10:53:08.661292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-09T19:21:36.282967Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:28:18.615371Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:8449767676920d438b239012af05ed186ba057370b1eaee444fdc71d097bb64a","observation_id":"c4ef3d49-52e8-4f36-943f-efa6b001fcff","resolution":{"observed_at":"2026-05-13T01:47:05.199208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-09T19:21:36.282967Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:20:24.066520Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:12bcc4378757d8ca9fb9aefe81e880caf6a4dc8d60872d9ee4ad3a0422c250e4","observation_id":"f6f35c7f-8dc4-4247-968c-0dd26bff82cf","resolution":{"observed_at":"2026-05-14T21:22:59.342700Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-08-07T08:55:02.984200Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:b6471058d87a228f2440efb2f699cb416d08d2e9da457e804b7bee271cd90b56","observation_id":"2cf22fff-26b7-4055-817f-97f6907687bc","resolution":{"observed_at":"2026-05-13T05:07:17.751601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2605.25198","last_updated":"2026-05-24T17:59:06Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:59:06Z","title":"Hide to Guide: Learning via Semantic Masking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T12:16:12.108715Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2605.25198"},"observation_digest":"sha256:e62d1b751a88b8db27c404c69c7e0febc6775e3cf2425e6c8f78c9754e1d97f4","observation_id":"155a57b7-919a-4bda-89cb-84696c4310ee","resolution":{"observed_at":"2026-06-30T12:34:39.107566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-09T07:41:33.424534Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:75599b981633b386d8c3ff271bfdb1898cdf3e24f942fbafd7261d2c501ac747","observation_id":"9ca26ac3-6aa4-4d9d-99a9-9af34efbb577","resolution":{"observed_at":"2026-07-03T20:48:56.211961Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-02T14:45:22.917496Z","title":"arXiv preprint arXiv:2506.13923 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16205","last_updated":"2026-05-07T13:16:09Z","snapshot_observed_at":"2026-08-05T18:20:48.142001Z","submitted_at":"2026-05-07T13:16:09Z","title":"It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T14:45:22.917496Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2607.16205"},"observation_digest":"sha256:1881513d804f24007f512ee4c68bc6221a5296ccf6bce20dfd8c3e6aebc61031","observation_id":"8c9260d2-455f-405f-93e9-c5f57909abad","resolution":{"observed_at":"2026-08-02T14:45:22.917496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-01T01:28:56.693276Z","title":"arXiv preprint arXiv:2506.13923 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-09T00:49:04.936227Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.693276Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:1520d407d0934d466f607930633908ec9ac7fc095dd531e1a1d0471379bc0836","observation_id":"994c961a-99d7-4a9e-8378-21d7cd9ceb46","resolution":{"observed_at":"2026-08-01T01:28:56.693276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-31T02:45:28.621215Z","title":"Adaptive guidance accelerates reinforcement learning of reasoning models.arXiv preprint arXiv:2506.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-03T15:42:49.918444Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.621215Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:1aa8621f67bf365cb60116715ef3196282a2ac31638d008a809a3daf2c6f8222","observation_id":"44f73572-76ad-4cac-a237-d43b714ec9a0","resolution":{"observed_at":"2026-07-31T02:45:28.621215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13923/citation-record","integrity":"/paper/2506.13923/integrity","json":"/paper/2506.13923/citation-record.json","paper":"/paper/2506.13923"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T00:31:33.630703Z","title":"Richardson","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.630703Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:4f6a0bc2d7ba1afd4fd27d9f503087006ce3cdb96957ec55636c937775c3beb5","observation_id":"93c69185-51db-403f-b91c-1b1ce5ffd1d1","resolution":{"observed_at":"2026-08-07T00:31:33.630703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:31:33.673149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.673149Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:abf3acf8aae62017c72048422240cd0dfa9f423090adf8d63e32e45a0cd9efe1","observation_id":"a8988f1e-0c2e-4284-bd35-823af1320e74","resolution":{"observed_at":"2026-08-07T00:31:33.673149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T00:31:33.763546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.763546Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:f955fa08f83f9362253e56cea22991a31f38602019e9e2a94a97f60dd0b01bb8","observation_id":"b7ba5a2e-91c5-42a3-9966-0dd733e5b83c","resolution":{"observed_at":"2026-08-07T00:31:33.763546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:33.824990Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.824990Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:169718502b6de9e66734617094e0ad0e4527cd831f8fcd3e5dcdfd4c194bb058","observation_id":"aeed9b1a-ca68-44e7-a2ec-7aa18495b3a8","resolution":{"observed_at":"2026-08-07T00:31:33.824990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T00:31:33.883507Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.883507Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:371fcb9b9ffab23ba78972d69a5bd401a3e06566cc60419293cc60f3674de1f7","observation_id":"d0963d46-c208-49b6-a62c-dfbab7fe6557","resolution":{"observed_at":"2026-08-07T00:31:33.883507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.879179Z","title":null,"venue":null,"work_id":"72265293-c459-4ae9-b0ca-b318c913f628","year":2022},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.976587Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:3e7a6727e7efb86032519cbe8c379095a9e6932739f7424c1ac21e3cea6da423","observation_id":"13e84987-c960-42bc-9126-4f976a084cc3","resolution":{"observed_at":"2026-08-07T00:31:42.968767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-07T00:31:34.071107Z","title":"Reinforced self-training (rest) for language modeling.arXiv preprint arXiv:2308.08998, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.071107Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:42dd5df1aa62b15e9ac582eecb8a7aa8aa446f7520ca93c115fe1cc83c4743bd","observation_id":"e30394ea-1a98-4aed-b777-7263413883c9","resolution":{"observed_at":"2026-08-07T00:31:34.071107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.658498Z","title":"Openai’s reinforcement fine-tuning research program, 2024","venue":null,"work_id":"cb58c500-e5b1-455d-972a-ad797f2577e0","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.138304Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:755909d57227ac4a227c7f0678a2ea5ef0f400d532f69e951cd2d2402ad0e94c","observation_id":"689b6931-b901-48bb-96f4-67616561938a","resolution":{"observed_at":"2026-08-07T00:31:42.742679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.511905Z","title":"Be- yond human data: Scaling self-training for problem-solving with language models.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"4663038b-e642-4eee-9c00-3fd0fd9d755d","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.205487Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:1d5d144550d3d086f17d91906a4d8786bb25797a88abb0d78de58c9e07a84a0c","observation_id":"c1892acf-dbe5-43b7-95c3-e78b068ceaea","resolution":{"observed_at":"2026-08-07T00:31:42.566202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.386827Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":"3d677821-f61c-4b1c-83a1-da85f9fce07b","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.323233Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:746d4a7aa52130d668e4a217bd741f8a1fbd84de812794e84d90f3d689605ccf","observation_id":"77cc6ec1-5c4b-4636-94df-9c093f623c76","resolution":{"observed_at":"2026-08-07T00:31:42.501094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.173465Z","title":"ReST- MCTS*: LLM self-training via process reward guided tree search","venue":null,"work_id":"fa784609-7fcd-436a-957d-51022d8befee","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.410205Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:ab174be5fc037865a523cdbfdd73b7ac3faf7d005c52dc2c57de49d81a72a11e","observation_id":"c2bb22dc-bb45-4d6b-ab4c-61751a999089","resolution":{"observed_at":"2026-08-07T00:31:42.266560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T00:31:34.508482Z","title":"Continuous control with deep reinforcement learning.arXiv preprint arXiv:1509.02971, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.508482Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:3ec29cc65ed4a2f0fb434baa29f37074cf67506cbc8268a31be1366c0e7bf88d","observation_id":"b2a05105-dcec-47c0-9c68-e37529ec670d","resolution":{"observed_at":"2026-08-07T00:31:34.508482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:31:34.635249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.635249Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:0d455790633bd45b067f3392f123c920dc17320717d2f8029f33b88019d89360","observation_id":"b0c55e14-5657-40b7-af77-ff320e39af2b","resolution":{"observed_at":"2026-08-07T00:31:34.635249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T00:31:34.851692Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.851692Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:73af62a64cc4c46ff469f376f488e5f22cd5747c282261fdce2e12efd56a6a5d","observation_id":"503ce4ba-3497-4e35-aff9-16f65a6e7112","resolution":{"observed_at":"2026-08-07T00:31:34.851692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.048764Z","title":"Aime 2024","venue":null,"work_id":"174ea1dd-ba58-4636-9d53-af6caadba023","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.924828Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:b07e701e5a06208d08e1805439abb6af20bf472b8cd80ceb97b543796dac1324","observation_id":"a94a7577-dd41-45a5-befa-721617b21833","resolution":{"observed_at":"2026-08-07T00:31:42.081687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.961167Z","title":"Aime 2025","venue":null,"work_id":"39bfcb7c-30de-417a-91ba-299bf22cc1c0","year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.021740Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:2c4f5c4264d9ce8d26b7b0307f9a18e1a7e773d1f6b415a9c445532a322bbb60","observation_id":"27f7e066-ca93-4f55-bde1-e8f978f7cb64","resolution":{"observed_at":"2026-08-07T00:31:42.010708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.840385Z","title":"Amc 2023","venue":null,"work_id":"b8e8373d-9d4d-4bf5-86a2-0c50396453b2","year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.145729Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:d392b5dbe0c2438a58cc2959b679f9c4dbfae1670456657f144f5b08eec28367","observation_id":"5a8cccb6-bcf6-462a-af42-818c0d348387","resolution":{"observed_at":"2026-08-07T00:31:41.885367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:35.213884Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.213884Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:565584635a2c35b0edbc8abc15388d997ac60ea7b73e2cf756f7f9195d5e4b5f","observation_id":"07087427-359a-4e9b-9f33-1c67cb2dfdfa","resolution":{"observed_at":"2026-08-07T00:31:35.213884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T00:31:35.273503Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.273503Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:1a3a59e7a2d56942569f66512541a1b76ea6f6bb41acb2dd16114457bc4ff2c7","observation_id":"c05f9dc9-279f-4538-b816-a2bec136b49b","resolution":{"observed_at":"2026-08-07T00:31:35.273503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T00:31:35.407856Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence.arXiv preprint arXiv:2401.14196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.407856Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:8cea4854cbdf92962877b1d71dd1e25731e46010355b9e071d72bd5650b01590","observation_id":"beb9fd64-2327-4d99-9065-6f3e2b8f317e","resolution":{"observed_at":"2026-08-07T00:31:35.407856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.736930Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint, 2024","venue":null,"work_id":"03027b48-51bb-48c6-9b65-e7b1f24bd7e0","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.477463Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:f3a7819a1caab5f1a2292e163296cb8545a7aa93f47db4361a70d5472e4ed09a","observation_id":"2577b0f8-e45f-4c7a-a99f-bf593af79254","resolution":{"observed_at":"2026-08-07T00:31:41.787072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T00:31:35.563471Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.563471Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:a3dc1c56d153f19391d5c08f16fd9ccec55b38ac9a2f6a7a30293c4a8ead5f50","observation_id":"098d9765-40b6-4420-900c-835487736344","resolution":{"observed_at":"2026-08-07T00:31:35.563471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:35.647369Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.647369Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:32da7f98244f913aa549eb2ee3c58b4a05d0e1c70a605c8d1fb4e251cde1f209","observation_id":"35b5e4f3-a3a6-487f-a86d-414cb3cac3d3","resolution":{"observed_at":"2026-08-07T00:31:35.647369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:35.732089Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.732089Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:73cf1d3acc8b034da9a2c6da078ddc5826b5d2a07749be3c1100e987c4460fac","observation_id":"a9ff5d5f-0123-4e33-b672-8e7b2dd1c244","resolution":{"observed_at":"2026-08-07T00:31:35.732089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T00:31:35.831960Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.831960Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:90fd090f35dda4a662e91db780df5761a969ac9e4a629332f9bb36473ef8363b","observation_id":"c7094ab0-9a3c-441e-b0b6-b7e5c9eb3c5e","resolution":{"observed_at":"2026-08-07T00:31:35.831960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.575164Z","title":null,"venue":null,"work_id":"c024cd66-4d20-44b4-980e-349e8f2ddc95","year":2022},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.904313Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:fffd90ba07f37ca69f5404dced131f9779d269c111041de3f94ce28b1118e555","observation_id":"97b7a885-7d76-403d-8754-9278b13936d2","resolution":{"observed_at":"2026-08-07T00:31:41.628336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T00:31:36.028658Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models.arXiv preprint arXiv:2311.18232, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.028658Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:0ffa287224e8781cfde829739a7953a75ff3dca15acc79578ad645a421b32336","observation_id":"a9c0a123-1458-4ec2-ad46-403029fe2937","resolution":{"observed_at":"2026-08-07T00:31:36.028658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.447912Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"7cb207f6-ae8e-4685-b985-3000c4184274","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.112436Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:2cc6d787907c335f7d84e13ad67922a05c5d6944a8a2f915bd7b622df1c19794","observation_id":"c63c58de-bbae-4044-892f-a21618e9f075","resolution":{"observed_at":"2026-08-07T00:31:41.511850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.336849Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":"f9d3fe5e-de3f-4a1c-bbdd-0d56386db2ad","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.165728Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:b41e9ad0d446de9a380ad502427307c410db5faa0c5e1ebac2678b351c0a9b1b","observation_id":"9a9491a7-4fca-4fb7-b1ee-481b3c08470d","resolution":{"observed_at":"2026-08-07T00:31:41.386519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T00:31:36.250869Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.250869Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:0520ea563c831f5978ff0a21d8733ecb8ed04c0bf6fe7de7b097fb4d9ab67e4b","observation_id":"63cc29ad-0a40-48b2-b947-c9ab58369e60","resolution":{"observed_at":"2026-08-07T00:31:36.250869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:31:36.352872Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.352872Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:2b2a467aa4b947e9aa5e70d2633533f1396040c416378682051da3a95303832d","observation_id":"62593bd3-d18c-4b33-b0fb-2ab464d70a43","resolution":{"observed_at":"2026-08-07T00:31:36.352872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T00:31:36.490405Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.490405Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:4be4d738458d62fcc94bcedf29d21bc74cdd27578f98ea24ecd1d03fa4591dbb","observation_id":"a56e454b-536e-4593-a6ea-861ee4fba24f","resolution":{"observed_at":"2026-08-07T00:31:36.490405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T00:31:36.562765Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.562765Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:b62051157a42f4ce9d7af060ba88589f6478fc572c2c773f245c4f08098d4690","observation_id":"43b36156-2531-46f0-b9dd-afe892cd943c","resolution":{"observed_at":"2026-08-07T00:31:36.562765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T00:31:36.601300Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.601300Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:622329e15a2457b39fc6951f5d342eff20c55c9b2e1bc55a6efd06bfcf414255","observation_id":"0e997cca-1852-4654-a328-b4b1db39ef8c","resolution":{"observed_at":"2026-08-07T00:31:36.601300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:36.691691Z","title":"Scaling LLM test-time com- pute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.691691Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:81edc37fa589ff0f350de92f5de6cd7618fefd53ba0021340ec850a4f770849e","observation_id":"386ef46f-11a8-45a7-9bcd-9bf7868f5487","resolution":{"observed_at":"2026-08-07T00:31:36.691691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-09T01:40:08.645048Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-07T00:31:36.795096Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining.arXiv preprint arXiv:2504.07912, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.795096Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:c5c547d20883039460511a138094100ca46a2314224ff73b8b7ec6b60ae7507c","observation_id":"3f71c7fa-5d4b-4ef8-a912-a461dd82f61c","resolution":{"observed_at":"2026-08-07T00:31:36.795096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:36.881955Z","title":"Assessing diversity collapse in reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.881955Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:1bbed6f69ef18ef08f0e84d6e311ae64359e52b312ccee01710215ec26586e7b","observation_id":"9fb8845d-8e9c-4e18-981d-6214dbf83a0d","resolution":{"observed_at":"2026-08-07T00:31:36.881955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:36.976302Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.976302Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:5df40053a378e609bf88429d8c74207abb86d876d431a18ae63ce808d56a9ee3","observation_id":"fee6f11f-2095-4421-a497-0c9994c674eb","resolution":{"observed_at":"2026-08-07T00:31:36.976302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-07T16:54:46.428327Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-07T00:31:37.043476Z","title":"Bellemare, Jonathan Lebensold, Arnaud Bergeron, Joshua Greaves, Alex Fréchette, Carolyne Pelletier, Eric Thibodeau-Laufer, Sándor Toth, and Samantha Work","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.043476Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:a349c49499469b7c44b2b7d264f62244df90f0b5eb7af0be4f23edf79863d769","observation_id":"699988d1-d4a5-403a-b834-fa3f35c6c9b9","resolution":{"observed_at":"2026-08-07T00:31:37.043476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-07T00:31:37.128523Z","title":"Learning to reason under off-policy guidance.arXiv preprint arXiv:2504.14945, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.128523Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:7eec3b8f70d16b845b7684083c5d812998039307304ba46f0751ea3e87a84569","observation_id":"eaf1f6ed-4b5c-439f-ad65-cf6251c95323","resolution":{"observed_at":"2026-08-07T00:31:37.128523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T00:31:37.204240Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.204240Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:3c17f1cecf98aac425ead089e3107b70f7e0c14e455e858e51550d15c5584c48","observation_id":"3294b235-12d3-4aea-af15-30508f14116f","resolution":{"observed_at":"2026-08-07T00:31:37.204240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.171250Z","title":null,"venue":null,"work_id":"2f49f6af-95d8-4799-be0b-09d02f9a9336","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.313993Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:1b80ccdeb79aaae54819f6389b640cef762062656b8c499c8552f3dc3b5c7803","observation_id":"2cbc1157-af60-4496-8d47-c2d7ac995883","resolution":{"observed_at":"2026-08-07T00:31:41.227473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.059035Z","title":null,"venue":null,"work_id":"63f2aacc-2a43-4368-82d0-928b8fb16372","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.393926Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:3bc03cb9e6e379762f22bf972165cb911796a24382665cfe2f93a7e20547e9fe","observation_id":"0b287539-eb83-4218-bd02-e499e193e097","resolution":{"observed_at":"2026-08-07T00:31:41.116242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.959460Z","title":null,"venue":null,"work_id":"8512ead1-7f23-40a2-a310-f05c67d90a44","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.478330Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:1769a1b2e68bac4c6dc59e344e74374b6bc879c2f1cbaad59ffc5c613d58db7f","observation_id":"3ed7525f-09d6-411a-9a85-7468a3918160","resolution":{"observed_at":"2026-08-07T00:31:40.987925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.850627Z","title":null,"venue":null,"work_id":"8c0d5156-c7ee-430f-b125-b5c816771b02","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.558393Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:4861ba7f64eaac5f4fd440d8ada9749fa23f8c8c02062d41ffe11b9e68cc2dbb","observation_id":"b6d942a2-c234-4217-98f2-f56e1763451c","resolution":{"observed_at":"2026-08-07T00:31:40.908596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.711669Z","title":"A hint to the problem is provided below: [HINT_START]","venue":null,"work_id":"499b107b-66f6-419d-a87d-dfc2b0281e41","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.607764Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:8ee47e9d7a10954a14a3a36e04dc18a531fab4c5e3e17442430c26662e63462d","observation_id":"2bc9a944-19ff-4b71-bdeb-cc3b8a69008b","resolution":{"observed_at":"2026-08-07T00:31:40.776609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.561634Z","title":"Think about how the identity (a²/4) - (4/a²) might be used as a building block for factoring the larger expression","venue":null,"work_id":"b04380d2-6f61-4a00-946d-b59f7e215b1e","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.657446Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:f051740e18e44ed9163c6f14cdfa9378ef32be12c0aa2953c29944325229398c","observation_id":"85b570b4-9fb5-485c-b190-aab6de5316ce","resolution":{"observed_at":"2026-08-07T00:31:40.646643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.377575Z","title":"Ask yourself if a difference of powers or a recognizable factorization pattern might help connect the two parts of the expression","venue":null,"work_id":"181fd6a3-7390-4fef-90b9-644fe25ddae7","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.765087Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:aeb2d9b86fe7fa1b57658f8394b9c3bdf121d8460dd9462e84acf98442fb8f65","observation_id":"e13d6c72-369a-437f-ad8c-5d16f7844303","resolution":{"observed_at":"2026-08-07T00:31:40.472946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.261895Z","title":"How can this substitution simplify the structure of the problem? ,→ ,→","venue":null,"work_id":"20c1beca-4edc-4b22-ae2d-6fb8541dd9b3","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.850950Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:71c99ee7ea124a71af35cb916abaa70f345ab8d24a2c6713687e89c2ea7465fd","observation_id":"a818a75b-c756-4365-9c30-8c403835893b","resolution":{"observed_at":"2026-08-07T00:31:40.307652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.110552Z","title":null,"venue":null,"work_id":"a3f96dfa-2cf4-485e-9b3b-7abb7cc42141","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.940379Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:fb5a225f38b380205a3ecaac5275db9cedfb9b78c76689108f6dd87d65cda2f4","observation_id":"ea984d5a-4322-41c4-93a6-29d8d3507596","resolution":{"observed_at":"2026-08-07T00:31:40.185924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.936877Z","title":"Use these observations to guide your step-by-step approach toward the final simplified result","venue":null,"work_id":"54475180-9490-44de-a4ca-411ed614d712","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.063163Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:b0d68bf46325c5b2fd8e31994160eb3bc2c76c7b2c89ed4fa3119b1e0b6ae9aa","observation_id":"5ecf4a51-a6e2-4c78-aa2a-0f184f08c3db","resolution":{"observed_at":"2026-08-07T00:31:40.020913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.803890Z","title":null,"venue":null,"work_id":"7333b306-783d-4de8-a35b-77a1b8d3cb13","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.128400Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:bdd25c0b855b49de43c10b4c2e306c37909d201005f25c8d3ed91d967e073f88","observation_id":"c4566f0d-4b2d-4f7c-a2b6-124fc1a5569b","resolution":{"observed_at":"2026-08-07T00:31:39.842436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.735547Z","title":null,"venue":null,"work_id":"c896084a-605e-440b-9f20-f0199278e6ff","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.201603Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:4a62fadbe7f463aa6fe0181dbcbf1e967cc1730120acae430e6191e6eef3b9ba","observation_id":"d504db0d-c856-45e5-804c-5eb4622496fe","resolution":{"observed_at":"2026-08-07T00:31:39.762269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.556338Z","title":"What does that imply about multiplying the side length? ,→ ,→","venue":null,"work_id":"431f2c18-d450-4ac6-b075-09d1a531e201","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.255892Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:084c48fa4d5c152b088624b52ca41394e86b83d53dd9cb95d59ebb4dea101bdd","observation_id":"b03f974b-9501-4cfc-9c19-0e6a97c4b804","resolution":{"observed_at":"2026-08-07T00:31:39.645444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.442882Z","title":"Ensure each step follows from the properties of a square.,→","venue":null,"work_id":"b7040236-e09b-4f61-8081-3f2a84c64d7d","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.345981Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:444a690ca21f5e5310cb8edc34bfed3bb6f582cf77a9ea49c8e7f2e3be0f09fd","observation_id":"e8681102-13af-4343-9de8-61d3a7d873a2","resolution":{"observed_at":"2026-08-07T00:31:39.495423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.299730Z","title":"using the hint","venue":null,"work_id":"507ac192-a135-4cf0-b60d-e65dd82b9573","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.429016Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:2aa475b4a2559875b8161b307b8ccb718ceac6583400937716746690fd652206","observation_id":"a5312c55-30df-4e3f-bd80-b29e1640dc0b","resolution":{"observed_at":"2026-08-07T00:31:39.367706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.107069Z","title":"This example shows how a concise, domain-specific hint can redirect the model’s reasoning and correct a systematic geometric error","venue":null,"work_id":"7641eea3-93f6-479c-875e-9d75cd712af9","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.509431Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:5949557cb06cd3ed1db690195b6abe61cbd0ce0fb6560e5e5d71746afcfb09ee","observation_id":"79e676a7-60b4-4be4-b507-194276321478","resolution":{"observed_at":"2026-08-07T00:31:39.190927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:38.928910Z","title":"<think>\\n {thoughts} </think>\\n\\","venue":null,"work_id":"692718a0-0115-430b-9328-021148fa77a7","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.586086Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:dd3b7a92804771f400715a01fbf5632cfe493bea93f802c1db7e23ec0d1067a0","observation_id":"9efcd0cd-68c1-4bd7-bcb7-2855da000ad5","resolution":{"observed_at":"2026-08-07T00:31:39.011456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:37:58.158981Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 11 inbound Pith citation observations for arXiv:2506.13923."}