{"as_of":"2026-08-05T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91cf7b637ffbebbb2a68be13d41a2a1387d52ceba13fb7b726205bdc6e8f41c8","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T04:04:13.942267Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07646/citation-record","integrity":"/paper/2607.07646/integrity","json":"/paper/2607.07646/citation-record.json","paper":"/paper/2607.07646"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":"2506.14758","doi":"10.48550/arxiv.2506.14758","metadata_source":"pith","pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Exploration: An Entropy Perspective","venue":"cs.CL","work_id":"5670d60c-ec64-40eb-93e1-1e51c35e9050","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:ace5aba252ebb5516d518e96da2fe63d9549d3e4fe7e4544d26e51f1648a99a1","observation_id":"9e5a1bfb-af03-4cbb-aa3e-1ee2e1e513c2","resolution":{"observed_at":"2026-07-09T04:05:55.478521Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":"2501.17161","doi":"10.48550/arxiv.2501.17161","metadata_source":"pith","pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","venue":"cs.AI","work_id":"258dd934-025c-47f5-b4f6-5a0c1c338cc6","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:41d99f5d517d432b1b7f9cd4d8d280270504a103f6651ff63012e870c5ccb6f3","observation_id":"b9b34299-e08b-4ff3-99f0-4fbe54755ddf","resolution":{"observed_at":"2026-07-09T04:05:55.481095Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:a1f4cdaf4378fb70f6e0f802187d35e283d4c53749aaf4304d051a5487313b86","observation_id":"886e0802-4b12-49da-8643-0c054b72ab5a","resolution":{"observed_at":"2026-07-09T04:05:55.491553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:7cf0e391e20c9b2a50ade6b371d46ebf7598a793cf3a7082feeee3efa283cfc0","observation_id":"d1161cd2-2b67-4b46-a2a0-96cc8d128ea2","resolution":{"observed_at":"2026-07-09T04:05:55.493284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-31T17:40:45.057417Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:f50c62609b86fb302e0eb889d947b75c32ae4cd3ec438f0938cb473245b1deb3","observation_id":"e4c210a0-bc67-4d85-8272-b4298fb9f1cd","resolution":{"observed_at":"2026-07-09T04:05:55.461276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:14c2a156ff80abf043ea367d02a20fa23c3c8ce23468da1b62967777161b7d8b","observation_id":"f5c25b2d-c968-4333-b469-e58d2bcee014","resolution":{"observed_at":"2026-07-09T04:05:55.490553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.21625","doi":"10.48550/arxiv.2512.21625","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking sample polarity in reinforcement learning with verifiable rewards","venue":"arXiv (Cornell University)","work_id":"0f345e40-45da-4508-98ad-f641e718c578","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:2e2c70fe5cb4051d918eb58ebcc835e76dfaa4c8658e17a9f1c41a444bce2b98","observation_id":"a4720dae-dd96-4b8a-a84b-9300af08d97d","resolution":{"observed_at":"2026-07-09T04:05:55.475237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:8666fa79e527f19c6e707522492d038cda20cfaf56b0b6c67970d3eeb7c84302","observation_id":"91d72329-834d-4aa9-85a3-a02ad3547861","resolution":{"observed_at":"2026-07-09T04:05:55.471938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.03646","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:05:55.482941Z","title":"Emergent hierarchical reasoning in llms through reinforcement learning","venue":null,"work_id":"fcfdaff1-0ffe-4c1a-a987-257744e095d9","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:b429c464d0e46a5d364eac95230af3e8191e5cea4da819eaea4ca71c93cacc89","observation_id":"1af94325-0b81-4800-a5d4-2bc2ea721aa8","resolution":{"observed_at":"2026-07-09T04:05:55.484824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.14843","doi":"10.48550/arxiv.2507.14843","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The invisible leash: Why rlvr may or may not escape its origin","venue":"arXiv (Cornell University)","work_id":"71f17397-1cd4-4f68-ab1d-e91bb5f5953d","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:5b6a02d81613705205b7910563e65cc19e8b924cc5b2a811929747fb5bf8cb1b","observation_id":"2a0565b5-129a-4dc0-886a-f67595930fbc","resolution":{"observed_at":"2026-07-09T04:05:55.474654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:5061aadd71f9480375760407257d3996941c611087a0d00f459655b86536d924","observation_id":"6299d2f4-a2e8-4d50-99c9-9b112124ab68","resolution":{"observed_at":"2026-07-09T04:05:55.457832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:05:55.476500Z","title":"arXiv preprint arXiv:2509.25123 , year=","venue":null,"work_id":"fa71b9a8-6156-4143-b27b-4628df9c9a4b","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:167e967d56af360c0b543a652e7636dc46a7f2bf2ed0b1365d3d2260db6de544","observation_id":"da7a4ad2-faa1-42e5-942e-73e99f1353fb","resolution":{"observed_at":"2026-07-09T04:05:55.478757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:473b0b7a208d5ee44f463136800b79c82799859319d635195d2868c183160430","observation_id":"19bbfce2-7ce2-4954-9f7a-bed918ce15fb","resolution":{"observed_at":"2026-07-09T04:05:55.489088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14465","last_updated":"2022-05-20T13:52:54Z","snapshot_observed_at":"2026-08-05T03:08:42.211484Z","submitted_at":"2022-03-28T03:12:15Z","title":"STaR: Bootstrapping Reasoning With Reasoning","version":2},"cited_work":{"arxiv_id":"2203.14465","doi":"10.48550/arxiv.2203.14465","metadata_source":"pith","pith_arxiv_id":"2203.14465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wu, andN.D.Goodman","venue":"cs.LG","work_id":"3339dfe0-b229-41ec-a6e0-8f601080eb97","year":2022},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2203.14465","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:bdacbf4f9e375c29903b33ff55401b07dbd89791979c31aba08199d9c5d483e4","observation_id":"94236739-64e4-4465-84ec-8c5cb5f8ea07","resolution":{"observed_at":"2026-07-09T04:05:55.483803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:15.019726+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:15.019726+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:c4e4215b768e22fbdca8cd2f7d30ac3ff6eb0df09c5da571c1eec22bbc6d096a","observation_id":"e419ae80-2f9d-411a-bc8c-2a8f4b32b3d2","resolution":{"observed_at":"2026-07-09T04:05:55.494223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-11T23:20:18.291178Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2607.07646."}