{"as_of":"2026-08-06T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:316f6d6a915046238cd213302b0ba392691ed910847426b13e48dc4a63cb51c5","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:26:36.017309Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16097/citation-record","integrity":"/paper/2607.16097/integrity","json":"/paper/2607.16097/citation-record.json","paper":"/paper/2607.16097"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03893","last_updated":"2024-10-04T19:51:03Z","snapshot_observed_at":"2026-08-05T03:45:08.790407Z","submitted_at":"2024-10-04T19:51:03Z","title":"Human-aligned Chess with a Bit of Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03893","snapshot_observed_at":"2026-08-01T21:26:32.196479Z","title":"arXiv preprint arXiv:2410.03893 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.196479Z"},"links":{"cited_paper":"/paper/2410.03893","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:2926a5714dde8da00f2b7123e8377fd5c948f318c6ac17dc30e0915b09a52dd7","observation_id":"78c1ecb4-d656-4c8d-ba3f-de8d4f0e6350","resolution":{"observed_at":"2026-08-01T21:26:32.196479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.245778Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.245778Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:4609652adfa8b18c69ec2eaae54f387ebee206e47d74dd5be064555eef1d5728","observation_id":"24b31eb4-1cc8-4f77-b48a-95641d23a195","resolution":{"observed_at":"2026-08-01T21:26:32.245778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T21:26:32.325889Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.325889Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:d5f4fa98c362ee1bc560cd8ace521483335414dacb3a20fd91d533d907ef1dbd","observation_id":"b0bc2b55-2ce2-4f5c-936b-f1642c36a28b","resolution":{"observed_at":"2026-08-01T21:26:32.325889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-01T21:26:32.388270Z","title":"arXiv preprint arXiv:2409.19256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.388270Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:89abfd6222a9a09c67ffa842ab585cd7ab575b050b3f09be25d2e8ba042c31b8","observation_id":"4ca9d9e2-8735-488a-ab05-c3bda2e0d27b","resolution":{"observed_at":"2026-08-01T21:26:32.388270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-01T21:26:32.456353Z","title":"arXiv preprint arXiv:2001.08361 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.456353Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:aaca981ee55dbdb876e65e8658714faf356b53ead39cee765022bd2ecfcc552b","observation_id":"cebc0c53-dddb-4c49-8821-ec843289af4d","resolution":{"observed_at":"2026-08-01T21:26:32.456353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-01T21:26:32.517791Z","title":"arXiv preprint arXiv:2203.15556 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.517791Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:784044665215bf581297084afbcda027dcf65c7f1ba61d9e6eaaa4d4c0b792f0","observation_id":"c354859d-0e8c-448e-8406-5892327cbe32","resolution":{"observed_at":"2026-08-01T21:26:32.517791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.556078Z","title":"arXiv preprint arXiv:2509.21016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.556078Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:78c1158378bbd5d7d661c90700a82ffbdfa0f7504a522f0f6c7471cb59a52352","observation_id":"45fc3c09-1649-4265-b169-8500af46fc1a","resolution":{"observed_at":"2026-08-01T21:26:32.556078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20311","last_updated":"2024-07-29T17:52:40Z","snapshot_observed_at":"2026-07-06T18:53:35.627045Z","submitted_at":"2024-07-29T17:52:40Z","title":"Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20311","snapshot_observed_at":"2026-08-01T21:26:32.620292Z","title":"arXiv preprint arXiv:2407.20311 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.620292Z"},"links":{"cited_paper":"/paper/2407.20311","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:f0e0c0534f4221b5a19e31b824c7bb1a2961deb8ea1758e7f3ba55b0c56f5390","observation_id":"626e3a08-4e60-4c35-907e-4d49baadecca","resolution":{"observed_at":"2026-08-01T21:26:32.620292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.665546Z","title":"arXiv preprint arXiv:2509.25123 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.665546Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:696be63f7c000eaee93fce4a2e97d92912e762415682b07b84f9c244b47ddcc9","observation_id":"b6ae222a-ec23-46e0-b510-42e7fb47b6a1","resolution":{"observed_at":"2026-08-01T21:26:32.665546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-01T21:26:32.726200Z","title":"arXiv preprint arXiv:2510.13786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.726200Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:cb2169e1045826e7f45adb803efb7c707c53d8d5f20bd38a417d58f237515cdb","observation_id":"b84ad023-1d0f-4acb-8a1b-f1c422cb1437","resolution":{"observed_at":"2026-08-01T21:26:32.726200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.746663Z","title":"arXiv preprint arXiv:2512.07783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.746663Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:a851d756312d01010fc5f464f2507fe58591bdf0cfea13519c5d6d532271de6e","observation_id":"c70e37f8-63be-4dba-b5d7-78eeefc9767f","resolution":{"observed_at":"2026-08-01T21:26:32.746663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.826713Z","title":"arXiv preprint arXiv:2506.16029 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.826713Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:531d89de1e3b56f6825dafd2a2a4930719907e79d2fe19dcc4667e703459e81a","observation_id":"92239618-bc87-45f7-950c-e08f769ec455","resolution":{"observed_at":"2026-08-01T21:26:32.826713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:32.962357Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:32.962357Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:e44514c6d259b93290e061aff4b46bf19f8b39c7320732e4bf2b3f3bc9e4e6bf","observation_id":"1a3a5358-4373-4775-9e9e-8879069c263a","resolution":{"observed_at":"2026-08-01T21:26:32.962357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18574","last_updated":"2026-04-20T17:57:49Z","snapshot_observed_at":"2026-08-02T19:02:42.933975Z","submitted_at":"2026-04-20T17:57:49Z","title":"When Can LLMs Learn to Reason with Weak Supervision?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18574","snapshot_observed_at":"2026-08-01T21:26:33.106406Z","title":"arXiv preprint arXiv:2604.18574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.106406Z"},"links":{"cited_paper":"/paper/2604.18574","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:79f61a8b7d348665ec79439dfb608363698616d0815a30d0fcc380cf2ba159dc","observation_id":"5b0e64e7-b806-40ff-a5b4-d7e81e974fcf","resolution":{"observed_at":"2026-08-01T21:26:33.106406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.207178Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.207178Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:4fa40121cf2113d0d39052833713ab88a98de6dd5176ee082d8141ae4c15e932","observation_id":"a45fb5e0-7c75-4a33-82a4-4f8f70bba4ed","resolution":{"observed_at":"2026-08-01T21:26:33.207178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08291","last_updated":"2023-05-15T01:18:23Z","snapshot_observed_at":"2026-07-06T15:27:02.376191Z","submitted_at":"2023-05-15T01:18:23Z","title":"Large Language Model Guided Tree-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08291","snapshot_observed_at":"2026-08-01T21:26:33.265609Z","title":"arXiv preprint arXiv:2305.08291 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.265609Z"},"links":{"cited_paper":"/paper/2305.08291","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:ed95b559b33856a7c766dad8a343875422781858d83e25f74c0c549676e6328c","observation_id":"9b6e379a-522a-4a4b-8ec7-34e3ae3ab709","resolution":{"observed_at":"2026-08-01T21:26:33.265609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-01T21:26:33.359440Z","title":"arXiv preprint arXiv:1712.01815 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.359440Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:9708dd2cba5a8b6a7c21b0777a930f5828382ae03a096b6e269b00575f51ddef","observation_id":"08f6bcbd-825e-4aa6-a44a-bc9b8da73d75","resolution":{"observed_at":"2026-08-01T21:26:33.359440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-01T21:26:33.421318Z","title":"arXiv preprint arXiv:2504.13837 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.421318Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:a55f059bbc4cadb774ef6be29161e3cacf546753fcee6d01d3c161b325c7ecad","observation_id":"4a5557aa-a76f-4593-86ce-5065c85fd2cc","resolution":{"observed_at":"2026-08-01T21:26:33.421318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.498829Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.498829Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:3e5fa98782d41037f472715569356d6782ae67985ad0e3771affa60550586ca4","observation_id":"4799bc1c-e8c3-4fe1-95fe-fecb6d52b39d","resolution":{"observed_at":"2026-08-01T21:26:33.498829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.572158Z","title":"arXiv preprint arXiv:2510.15020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.572158Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:7ae94c697b9c524d54af031801d7ee6ff4578b9a6b63d455934fa20e35400df4","observation_id":"409cf8b7-2a5f-430f-8756-d6a2e22989b6","resolution":{"observed_at":"2026-08-01T21:26:33.572158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14901","last_updated":"2025-10-16T17:18:11Z","snapshot_observed_at":"2026-08-04T14:57:11.439686Z","submitted_at":"2025-10-16T17:18:11Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14901","snapshot_observed_at":"2026-08-01T21:26:33.626064Z","title":"arXiv preprint arXiv:2510.14901 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.626064Z"},"links":{"cited_paper":"/paper/2510.14901","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:1ab04c5a76c5ee6a38d94709076cc00ddae5583c2493a7e06a2706748fd69ce2","observation_id":"8806f68c-2a92-4957-9c86-840f6788134a","resolution":{"observed_at":"2026-08-01T21:26:33.626064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.688075Z","title":"arXiv preprint arXiv:2603.24844 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.688075Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:e0d06ee811e1d02f049fa2720fc3075717017636a4bdf7302428886ac215e0a6","observation_id":"8a1576f0-0758-4d8b-93da-12f169afbe46","resolution":{"observed_at":"2026-08-01T21:26:33.688075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.743899Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.743899Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:7861677c9d088315399da6f6952b9f767ef2676280392d78084a28e03200b007","observation_id":"3108f45c-5ee9-4bf9-99c1-a35a01ca66e3","resolution":{"observed_at":"2026-08-01T21:26:33.743899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:33.794436Z","title":"arXiv preprint arXiv:2510.03264 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.794436Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:f224ce9ce19a5455bb8fdeddb8967c926a9172d4fca77a8015a582d24bb66b4b","observation_id":"b0ff0808-fe3f-49b6-8fff-7ecd19d83944","resolution":{"observed_at":"2026-08-01T21:26:33.794436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04272","last_updated":"2026-06-02T22:55:18Z","snapshot_observed_at":"2026-07-06T23:44:23.633099Z","submitted_at":"2026-06-02T22:55:18Z","title":"RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04272","snapshot_observed_at":"2026-08-01T21:26:33.858637Z","title":"arXiv preprint arXiv:2606.04272 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.858637Z"},"links":{"cited_paper":"/paper/2606.04272","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:04c1c348929273a0184d9ed1466eaefb910b1e8480128c6a672000d441e06c98","observation_id":"9a5d67da-066c-4e9a-9def-35c2a8f57ba4","resolution":{"observed_at":"2026-08-01T21:26:33.858637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19206","last_updated":"2025-03-28T02:10:05Z","snapshot_observed_at":"2026-07-06T20:58:06.224759Z","submitted_at":"2025-03-24T23:11:56Z","title":"Overtrained Language Models Are Harder to Fine-Tune","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19206","snapshot_observed_at":"2026-08-01T21:26:33.911069Z","title":"arXiv preprint arXiv:2503.19206 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.911069Z"},"links":{"cited_paper":"/paper/2503.19206","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:4c795034c92f1325eaae9f91fedce83a9d77d593c7ebe5a1430f20c806c4b4a5","observation_id":"ea635115-ac45-4d79-8c01-04e2eec82f04","resolution":{"observed_at":"2026-08-01T21:26:33.911069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-01T21:26:33.973602Z","title":"arXiv preprint arXiv:2412.19437 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:33.973602Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:ffb0e6ce5602664683985626f357be573f191e4de8ab03e7561172cfd2b4bd14","observation_id":"23efc518-9d68-4987-9e7c-d30238763bf6","resolution":{"observed_at":"2026-08-01T21:26:33.973602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.025800Z","title":"2003 , publisher=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.025800Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:d04d1bf981a18718164211220c0889a5c2a6189f345b02588c93a10e3b1823ab","observation_id":"784ade2e-5bac-4cbe-abaf-ac0d8f2f6811","resolution":{"observed_at":"2026-08-01T21:26:34.025800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.113763Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.113763Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:7a994a0973584738c81dc6779472d65a3a464bb92ed56871bf18865392338d9c","observation_id":"fdab7b28-675e-48c1-853b-0c0ea6516391","resolution":{"observed_at":"2026-08-01T21:26:34.113763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T21:26:34.227557Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.227557Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:63df00b4fbdb0804ac01c3b3b9f8d966fb8182d711aa6b47b1426b3ffbf83de6","observation_id":"6d29db7a-b219-4134-ae32-310a7918d01d","resolution":{"observed_at":"2026-08-01T21:26:34.227557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21878","last_updated":"2025-04-07T17:44:38Z","snapshot_observed_at":"2026-07-30T21:58:54.192349Z","submitted_at":"2025-03-27T18:00:08Z","title":"Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21878","snapshot_observed_at":"2026-08-01T21:26:34.271964Z","title":"arXiv preprint arXiv:2503.21878 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.271964Z"},"links":{"cited_paper":"/paper/2503.21878","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:4f5bd9cdfcadfe23b6c63be9ab156a2a50d3b81c1ec596bcfd7afe9501fdc771","observation_id":"77660dd6-614d-41b8-b6d4-c78b36dbc429","resolution":{"observed_at":"2026-08-01T21:26:34.271964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-01T21:26:34.361691Z","title":"arXiv preprint arXiv:2512.13961 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.361691Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:ba9d3e1128c96f34a7ebf22593466478f96b72e1431cabdeb32ec5ba87526b79","observation_id":"8bd31739-576a-4b1c-85d7-c12eb9916ab5","resolution":{"observed_at":"2026-08-01T21:26:34.361691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.431145Z","title":"Notion Blog , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.431145Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:789d15ce301a0d16711556de35f64096589e337551d1b9541fa8c923bd038f92","observation_id":"e725fcb1-eca8-4e91-8e3f-0c858c3bdd0b","resolution":{"observed_at":"2026-08-01T21:26:34.431145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-01T21:26:34.509727Z","title":"arXiv preprint arXiv:2501.00656 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.509727Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:65c29a29fa2e962d9e883161f3e70333f5b055396af0d02c25c23d7d0b237619","observation_id":"cd460ae0-bd66-41f7-a510-52a33a7802e0","resolution":{"observed_at":"2026-08-01T21:26:34.509727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.573030Z","title":"Hugging Face repository , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.573030Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:0d42a0e2eff99b600c8dd285ceec5a26872dea30b0b9d4696d22c7d48ee058e2","observation_id":"937a5172-5451-4180-b85c-fd5f55e941b1","resolution":{"observed_at":"2026-08-01T21:26:34.573030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.633423Z","title":"arXiv preprint arXiv:2512.15489 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.633423Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:c6ccdcaba56caa906c367885c957cc4a4bada05dd5563afc6e7991d6d7bac1ed","observation_id":"b6844668-ff3a-4f18-bbd6-daf0aabebbad","resolution":{"observed_at":"2026-08-01T21:26:34.633423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.713790Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.713790Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:6ab6f2b2bd43fc5fb2c775d1b8d105c1d72864aa432cd0b6dedf5fed968f39e0","observation_id":"28e949f9-a828-4357-bdb5-b64bf1caffa6","resolution":{"observed_at":"2026-08-01T21:26:34.713790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.786841Z","title":"Proceedings of the 41st International Conference on Machine Learning , articleno =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.786841Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:db46ae7599fd72c576875d561ea5df769156afa804002d535b00f8e277d34704","observation_id":"53615201-a48e-4812-9c48-2a8b6d14d0b2","resolution":{"observed_at":"2026-08-01T21:26:34.786841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.855268Z","title":"arXiv preprint arXiv:2604.01411 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.855268Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:4f1e68addfcf9f656fea1df29634c2a3ddd0ed87869623ff317ec0920a1de8d4","observation_id":"709bf90f-e0d2-48f8-b25b-5349a2feb3bb","resolution":{"observed_at":"2026-08-01T21:26:34.855268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:34.944396Z","title":"arXiv preprint arXiv:2503.19551 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:34.944396Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:aefa637454aa163c26f4e4ccc9cb15eff46f05e064de82892c9d49b44ee75906","observation_id":"9ab0fc64-d5c4-4525-b062-90ff395db5a3","resolution":{"observed_at":"2026-08-01T21:26:34.944396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.036633Z","title":"arXiv preprint arXiv:2603.12151 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.036633Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:fef18961000b8bc5c9f4847de4111327c9da7e6106f10e32d72323d03c73a988","observation_id":"e1aa124e-f5a7-40f8-8bbb-47722f4c3f60","resolution":{"observed_at":"2026-08-01T21:26:35.036633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.100440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.100440Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:1b9f735acdd642f1289c2488290f9d7e1352f8e036369586c2a62997884a6694","observation_id":"4785bc8e-996f-4b65-a777-71c970f5b7cc","resolution":{"observed_at":"2026-08-01T21:26:35.100440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-01T21:26:35.191672Z","title":"arXiv preprint arXiv:2411.15124 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.191672Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:c550af1287b4db717b4021520fee4ab1740d680314149865d3d7aadfb8bc1f7d","observation_id":"5b9ac02a-dbd0-464c-a7fa-f04b92ac1b3f","resolution":{"observed_at":"2026-08-01T21:26:35.191672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T21:26:35.256751Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.256751Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:1ae275b426fe9023f234a9a839a90654a67f765e83dab22bfbdd07924606dcf4","observation_id":"9d0ee7bb-462d-4f8d-b77c-7d7be8780496","resolution":{"observed_at":"2026-08-01T21:26:35.256751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-01T21:26:35.371952Z","title":"arXiv preprint arXiv:2503.18892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.371952Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:d3bdd22e31bad81a8bdbda6b72dfa5a6d545aa5a62198cdeaf10d709d8e5764c","observation_id":"3e830194-4084-4a75-8762-4b6451a1e9db","resolution":{"observed_at":"2026-08-01T21:26:35.371952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T21:26:35.468782Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.468782Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:ede29d580bc946bf936107e072280c87fe31d112b6833d6e48c24388444382ee","observation_id":"0efc0bd5-37b3-490e-86aa-af80a7317620","resolution":{"observed_at":"2026-08-01T21:26:35.468782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.533985Z","title":"Google AI , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.533985Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:6ab7cf24cf57f41bf5469346735ac2a5d197349b90d6fbdf6994fb56652f30d3","observation_id":"473d8c2d-476f-4065-836f-32d1657426be","resolution":{"observed_at":"2026-08-01T21:26:35.533985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.635555Z","title":"nature , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.635555Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:72507132edad8a43a4c30f11e17c121fa352f80c18570711bdff4f1e5c795225","observation_id":"84f78f46-bfb5-49b4-852a-90d2f2a76c47","resolution":{"observed_at":"2026-08-01T21:26:35.635555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:26:35.793794Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.793794Z"},"links":{"citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:1c1fdb61b541cd6545a6516303526fe0723e371924ac60ac0677fc6e70e25a87","observation_id":"6e532969-9a8e-4aa0-953d-7b2c4afde200","resolution":{"observed_at":"2026-08-01T21:26:35.793794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-07-06T17:02:09.539730Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-01T21:26:35.909813Z","title":"arXiv preprint arXiv:2312.09390 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:35.909813Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:768c55b2726214cb0985e06d8d1474b05769c1e4a6a8e2c0c97969416da0d5cf","observation_id":"27fc059a-610b-4a7b-897f-6a6bfd8f15ce","resolution":{"observed_at":"2026-08-01T21:26:35.909813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15096","last_updated":"2025-08-20T22:16:57Z","snapshot_observed_at":"2026-08-05T18:08:02.752427Z","submitted_at":"2025-08-20T22:16:57Z","title":"Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15096","snapshot_observed_at":"2026-08-01T21:26:36.017309Z","title":"arXiv preprint arXiv:2508.15096 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T21:26:36.017309Z"},"links":{"cited_paper":"/paper/2508.15096","citing_paper":"/paper/2607.16097"},"observation_digest":"sha256:e8b939ac0c8236297602ebe5ed9e4b4e992ecc296c621312971eee5e38375919","observation_id":"7fa24bc0-fc18-4e03-b808-19433a53a2e6","resolution":{"observed_at":"2026-08-01T21:26:36.017309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16097","last_updated":"2026-07-17T16:31:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T21:26:25.268127Z","submitted_at":"2026-07-17T16:31:58Z","title":"Understanding Reasoning from Pretraining to Post-Training"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.16097."}