{"as_of":"2026-08-07T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f3ab290ef3a06792cd8814c1f3654d59d27b335dbb282d31f5878811885475a","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:13:15.438371Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:57:02.003590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00726","snapshot_observed_at":"2026-08-01T08:57:02.003590Z","title":"Can large lan- guage models develop strategic reasoning? post-training insights from learning chess.arXiv preprint arXiv:2507.00726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20952","last_updated":"2026-07-27T07:48:14Z","snapshot_observed_at":"2026-08-01T08:57:00.559037Z","submitted_at":"2026-07-23T06:18:43Z","title":"The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:57:02.003590Z"},"links":{"cited_paper":"/paper/2507.00726","citing_paper":"/paper/2607.20952"},"observation_digest":"sha256:d7ddfdb7716d47de9cf8df6f4c9d272eb66809279570524e3b7af0c684ce4d77","observation_id":"d7f9eae7-12e7-4379-aaea-ec90088c20bb","resolution":{"observed_at":"2026-08-01T08:57:02.003590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00726/citation-record","integrity":"/paper/2507.00726/integrity","json":"/paper/2507.00726/citation-record.json","paper":"/paper/2507.00726"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:14.562989Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.562989Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:8f976105ec581982fa47167c1141783b8a23d7bec7eb5c5763f04234f100a837","observation_id":"4f523d3a-94c7-4424-857c-5d1edba60f18","resolution":{"observed_at":"2026-08-06T21:13:14.562989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:16.006055Z","title":null,"venue":null,"work_id":"ed1452da-081b-4d84-9b6d-faa065fd621b","year":1994},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.602250Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:eb7f16f7eaf77031b8723570eb4d43229e850779d90a0551abf1c862f7aaeb05","observation_id":"45a3217f-1ab5-4a3c-bac4-a3fa983b97bb","resolution":{"observed_at":"2026-08-06T21:13:16.011700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.989348Z","title":"Chessgpt: Bridging policy learning and language modeling","venue":null,"work_id":"9fd05cf6-03b1-419c-affa-5e80c8df328e","year":2023},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.636904Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:cda0b7d43a5664e75f34b35f85880ae694674147ccb68dbb6531fee21ae6821f","observation_id":"50699f88-3097-4635-9f23-0e6dc5c007cf","resolution":{"observed_at":"2026-08-06T21:13:15.995114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:13:14.673504Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.673504Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:5de1dfe13e126454c0161e39fffcda0fc2cbb7c1664f1417e24d98268f1f562b","observation_id":"1478d935-a06a-48d6-bd50-aada7116b6cc","resolution":{"observed_at":"2026-08-06T21:13:14.673504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:13:14.708823Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.708823Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:da848c231bd492ba8f692d3e271e36d5037e4c2234fd5b1441fbeab6448f45ea","observation_id":"5a9e949a-8796-4961-8374-ef58ad103bde","resolution":{"observed_at":"2026-08-06T21:13:14.708823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22828","last_updated":"2025-09-08T02:43:27Z","snapshot_observed_at":"2026-08-07T16:29:20.966350Z","submitted_at":"2025-03-28T18:48:26Z","title":"Learning to Reason for Long-Form Story Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22828","snapshot_observed_at":"2026-08-06T21:13:14.743741Z","title":"Learning to reason for long-form story generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.743741Z"},"links":{"cited_paper":"/paper/2503.22828","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:358049412269f95242374a3e2f515707bfab6b3ef00a9e3114233f3d70bdf9d8","observation_id":"a27acc06-c949-4c8c-8792-6b2e0fbe7e01","resolution":{"observed_at":"2026-08-06T21:13:14.743741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.971460Z","title":"Improving regression performance with distributional losses","venue":null,"work_id":"29a59f14-ee6d-4231-b48d-ce63d857ba98","year":2018},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.778740Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:06b81b2ae0175c202a8e10d41af543f6544ba5ccd9f57a038ed57a1140366edc","observation_id":"219e7b23-2f66-41dd-a309-695a3ec33382","resolution":{"observed_at":"2026-08-06T21:13:15.977225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.952866Z","title":"Bridging the gap between expert and language models: Concept-guided chess commentary generation and evaluation","venue":null,"work_id":"262f4a80-b109-497b-8c43-3677686c821a","year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.814753Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:d210cbd67030f0ec659f348c75caabdf89bf2ea0bc41b191c2b0b1727d6a8efa","observation_id":"67fda46f-0282-43ae-ab8e-130dc8072787","resolution":{"observed_at":"2026-08-06T21:13:15.958182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T21:13:14.849487Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.849487Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:26eadd41267e95760f16e202b19eb5aebdeeb3c3e9f52c421c074141bc7fc7aa","observation_id":"37d0b883-01d8-4c91-8fb0-10d8a25cfbaa","resolution":{"observed_at":"2026-08-06T21:13:14.849487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07374","last_updated":"2025-02-18T05:20:33Z","snapshot_observed_at":"2026-07-06T20:34:39.536540Z","submitted_at":"2025-02-11T08:48:48Z","title":"LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07374","snapshot_observed_at":"2026-08-06T21:13:14.885294Z","title":"Llms can easily learn to reason from demonstrations structure, not content, is what matters! arXiv preprint arXiv:2502.07374, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.885294Z"},"links":{"cited_paper":"/paper/2502.07374","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:63c3e24c2b574661631609d76667b0fc436cb0cba93f02ce8a2a3df8ea543752","observation_id":"12671650-3fc0-4ac1-a651-65143299ec16","resolution":{"observed_at":"2026-08-06T21:13:14.885294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T21:13:14.920254Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.920254Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:836064f5861ebc329c4007f0ee6cd145629995e37e5ba7a8ec467d56ad987a57","observation_id":"7265002d-5809-4e71-8fea-62d52dd94b3e","resolution":{"observed_at":"2026-08-06T21:13:14.920254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T21:13:14.955840Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.955840Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:180ce6bf44d19ceb254414f79ea093a9129499af8f05d39c178fa29c53eb37b5","observation_id":"cf7ab677-32a9-444a-bad0-724cf9baecde","resolution":{"observed_at":"2026-08-06T21:13:14.955840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03610","last_updated":"2026-04-14T22:54:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-04T06:40:33Z","title":"Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03610","snapshot_observed_at":"2026-08-06T21:13:14.990922Z","title":"Orak: A foundational benchmark for training and evaluating llm agents on diverse video games","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:14.990922Z"},"links":{"cited_paper":"/paper/2506.03610","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:f581bc49f966912af2f2f99138a256684f15dee3497b93ad0ab917b667161eec","observation_id":"e6de8796-08e3-4c08-83e8-a16d9920ca50","resolution":{"observed_at":"2026-08-06T21:13:14.990922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T21:13:15.027217Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.027217Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:74e2fd97004823282a29f8236c361465841d0ff6c323f0d8c06690f8c4ada7e4","observation_id":"c5723c9a-921d-4b84-8298-04b430d1952d","resolution":{"observed_at":"2026-08-06T21:13:15.027217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.934452Z","title":"Amortized planning with large-scale transformers: A case study on chess","venue":null,"work_id":"c9da8789-ee4c-4ca4-91cb-3d23f4ae3fce","year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.062066Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:7d872e604d0deae6b3852fec52a8cac9ba6ce8dca97b7b35d1f56710eb84cfc8","observation_id":"720c2cf2-b5e0-4e70-ab0c-5b5526cd2638","resolution":{"observed_at":"2026-08-06T21:13:15.941797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T21:13:15.096866Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.096866Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:b369005168c54edd3abcfdbdbe6c9ff44cecbc2a8b443dcfe9eeb971e8ac68d8","observation_id":"bf7edc7d-f230-4347-9a5c-06a11217689c","resolution":{"observed_at":"2026-08-06T21:13:15.096866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T21:13:15.133788Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.133788Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:cc6488374f4fbdd90565109c4c01a48c25b1f48a0b1e3f6dbf386c19124ba2f6","observation_id":"f464150f-8539-46dd-9e52-8aaf5f9616dc","resolution":{"observed_at":"2026-08-06T21:13:15.133788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T21:13:15.168117Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.168117Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:ea1281b25e19f4d6c71665b77504b3ebf78f146a4a3d1fdb70297fb4e236260a","observation_id":"9dd87893-dd80-4af9-8fa7-5460330dd696","resolution":{"observed_at":"2026-08-06T21:13:15.168117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-06T21:13:15.204837Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.204837Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:562fa85014387c72885e1ca1124f2249d3f91e4a60c819cbb652c66bc3b090e0","observation_id":"9e9e4522-fbce-4ae5-ac6d-afa829209472","resolution":{"observed_at":"2026-08-06T21:13:15.204837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.240659Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.240659Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:e4ccae26dc31f04988987e555d0536b0c3a166fc94f48067997d70d7da2f356b","observation_id":"ac25e364-83af-4805-bc3c-61e9b5e52045","resolution":{"observed_at":"2026-08-06T21:13:15.240659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06655","last_updated":"2025-02-28T11:58:28Z","snapshot_observed_at":"2026-07-06T19:48:15.021550Z","submitted_at":"2024-11-11T01:42:56Z","title":"Explore the Reasoning Capability of LLMs in the Chess Testbed","version":2},"cited_work":{"arxiv_id":"2411.06655","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.06655","snapshot_observed_at":"2026-08-06T21:13:15.632627Z","title":"Explore the Reasoning Capability of LLMs in the Chess Testbed","venue":"cs.CL","work_id":"9714dd70-fb49-4758-aafe-ac7ae633aaf5","year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.275175Z"},"links":{"cited_paper":"/paper/2411.06655","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:9d7cb6493a342afdf0e1ab3c214c088904c6a0500b549e03b4c44fec47b0b32a","observation_id":"32e410e0-aecd-43f8-b37e-3f295d39d486","resolution":{"observed_at":"2026-08-06T21:13:15.641036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-06T21:13:15.311542Z","title":"Reinforcement learning for reasoning in large language models with one training example","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.311542Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:1e34ef8d7984a6f2667ea9b6ee084c8c9b7b88e33e9b1383e9ebc430a583657b","observation_id":"d94fe74a-0bdd-4957-91ea-b8875bf22864","resolution":{"observed_at":"2026-08-06T21:13:15.311542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T21:13:15.347231Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.347231Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:614da0b31edff62d6454bb6a11a971229955afb28824437a557bd4d7d5b9caef","observation_id":"1e8cd449-4306-4088-8306-33b72a2f453f","resolution":{"observed_at":"2026-08-06T21:13:15.347231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T21:13:15.383047Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.383047Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:467688d9aab721bbc7f3ffc3f8f54b749718cfb71f951c2edafae44ec6776394","observation_id":"a3dbd584-e7dc-47d8-80f3-c14f00d2d54f","resolution":{"observed_at":"2026-08-06T21:13:15.383047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19655","last_updated":"2025-02-27T00:54:38Z","snapshot_observed_at":"2026-08-07T17:44:33.774224Z","submitted_at":"2025-02-27T00:54:38Z","title":"Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19655","snapshot_observed_at":"2026-08-06T21:13:15.388077Z","title":"Med-rlvr: Emerging medical reasoning from a 3b base model via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.388077Z"},"links":{"cited_paper":"/paper/2502.19655","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:7feb06b30370841a9fadce86a792de8d816a1bd5a33b057824bb85fe7c771264","observation_id":"ffb13532-71c1-4418-b679-f952e7921f18","resolution":{"observed_at":"2026-08-06T21:13:15.388077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01230","last_updated":"2024-04-01T16:50:54Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T16:50:54Z","title":"LLM as a Mastermind: A Survey of Strategic Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01230","snapshot_observed_at":"2026-08-06T21:13:15.393896Z","title":"Llm as a mastermind: A survey of strategic reasoning with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.393896Z"},"links":{"cited_paper":"/paper/2404.01230","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:03a2ddd52c0f47fe53980f280e62951fd35f57e33d5bb554d83710ab565e50d2","observation_id":"30d2e018-9101-4a3e-b509-31e9071a9cfa","resolution":{"observed_at":"2026-08-06T21:13:15.393896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.907071Z","title":"Complete chess games enable LLM become a chess master","venue":null,"work_id":"84b8a001-c64c-4905-bb66-a88dec39fa46","year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.399974Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:5efc67528ddb7e8a30421a6557b47b23517a9ffca9ffac09a3d0316df20198ed","observation_id":"27f828f5-7772-42e0-878a-8a4b404ad8a7","resolution":{"observed_at":"2026-08-06T21:13:15.912353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19557","last_updated":"2025-02-26T20:50:11Z","snapshot_observed_at":"2026-08-07T17:44:55.814616Z","submitted_at":"2025-02-26T20:50:11Z","title":"Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19557","snapshot_observed_at":"2026-08-06T21:13:15.405997Z","title":"Distill not only data but also rewards: Can smaller language models surpass larger ones? arXiv preprint arXiv:2502.19557, 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.405997Z"},"links":{"cited_paper":"/paper/2502.19557","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:3627c3d55ba7c5335b892b055d0ad652183eb2ff647708eef469d4f97dc533dc","observation_id":"2e6717eb-45a6-40a0-ab59-0e9be9669c13","resolution":{"observed_at":"2026-08-06T21:13:15.405997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-06T21:13:15.411620Z","title":"Absolute zero: Reinforced self-play reasoning with zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.411620Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:a7fc022247ff3fbc65527619fe28b814f6ca1561764f110c867ccfbd7bd18b90","observation_id":"3d424eeb-176a-41e2-9fe5-0ff6b21aa5d9","resolution":{"observed_at":"2026-08-06T21:13:15.411620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-07T16:06:46.405251Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-06T21:13:15.416519Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.416519Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:870b81436d1a16ddf043a870ff5c1b73472870cce5477845ab69acc6d9ddb01b","observation_id":"cbb9ee45-ebdf-46fe-9dd0-c32d2aec739b","resolution":{"observed_at":"2026-08-06T21:13:15.416519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T21:13:15.421675Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.421675Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:79049732228896d86525d90ecd1a98c41c8fb3734a023a5488e7f870b56135ab","observation_id":"325fed64-2de9-4f52-a07f-19e0f6dd0cb4","resolution":{"observed_at":"2026-08-06T21:13:15.421675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.427861Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.427861Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:1024b67b5dceaaf23aae5dfdb5b86fc42018b0e48bdf0cefba88b9393053e264","observation_id":"5f8ed20e-7cc6-4427-a66c-026994472dbf","resolution":{"observed_at":"2026-08-06T21:13:15.427861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.433040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.433040Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:c4b6583ea3cb8a87ff1ac17fe4267ab923dced08704c4eca7f2ad1c9853d1d49","observation_id":"fbae588f-ffbb-4ce6-8647-1327ecf9de9e","resolution":{"observed_at":"2026-08-06T21:13:15.433040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:15.438371Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.438371Z"},"links":{"citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:754131c2783d96ab67e545b6f8f8bfa7a33fa98c98fb0b3b2e1cab1bdbf49946","observation_id":"a4c06d96-8721-4c7a-93a9-4a33430379b9","resolution":{"observed_at":"2026-08-06T21:13:15.438371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T16:07:47.854815Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2507.00726."}