{"as_of":"2026-08-08T00:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:947522524f6f8cbd532cc587cfd5a165cf901bcd02e23695be10663df9b85083","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07492/citation-record","integrity":"/paper/2607.07492/integrity","json":"/paper/2607.07492/citation-record.json","paper":"/paper/2607.07492"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.738","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When is tree search useful for LLM planning? it depends on the discriminator","venue":null,"work_id":"a958d9e0-174a-426a-981c-5540e143127f","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:a5ece5763637994de26b58d8c51a43b58e8f3828903de2dd44b1bbe7bb44ab8d","observation_id":"04efd97e-4c87-4693-b3da-09fefec4eec1","resolution":{"observed_at":"2026-07-09T09:26:08.766551Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.777583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.777583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":"2305.11738","doi":"10.48550/arxiv.2305.11738","metadata_source":"pith","pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","venue":"cs.CL","work_id":"dcdfa0ce-7ed4-4614-acd9-8bdbf491fc26","year":2023},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:7a079f3b2f4ed9961823dfdd577ad8a92bb4924d7f8b332a5e67d914ff935ac0","observation_id":"a16fe72f-3fb7-4006-8bab-092a40233808","resolution":{"observed_at":"2026-07-09T09:26:08.785673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:37.02582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:37.02582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-06T11:34:00.528900Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":"2404.03683","doi":"10.48550/arxiv.2404.03683","metadata_source":"pith","pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stream of search (sos): Learning to search in language","venue":"cs.LG","work_id":"a07f8e1c-30f0-4943-bb3c-40ea42cde6c7","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:cdd77f257ebaf9841ad3e2b136939e173f5ad6966e148dffacfff36d2b8694aa","observation_id":"528fae0e-a982-4944-9f53-70f1a8d68583","resolution":{"observed_at":"2026-07-09T09:26:08.687243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:37.268371+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:37.268371+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:a9defe2d225194933a1a9a0bfb94efcac373cceec7235e08c5373b311d4efb86","observation_id":"8c2bb982-28d4-484d-a387-3f1bb133d009","resolution":{"observed_at":"2026-07-09T09:26:08.719227Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.507","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":"59168056-5ef3-4558-8ed6-3024921b4fb3","year":2023},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:f1916476d7d2d4515af0a55f854b7fb83e25e543d994da9db9f0d9fa4475e642","observation_id":"712ec4db-f69d-44e6-b7b8-23d371193dda","resolution":{"observed_at":"2026-07-09T09:26:08.704694Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:37.824555+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:37.824555+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":"2310.01798","doi":"10.48550/arxiv.2310.01798","metadata_source":"pith","pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","venue":"cs.CL","work_id":"f63b261b-ef16-40f5-993b-9d37b1a51b92","year":2023},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:79f4c1fcab4878a8815b1f4fa01f5e403822c8a3f1790cabc34090255dcd1f17","observation_id":"39ec3e35-f6c6-4910-8042-1819539f62d3","resolution":{"observed_at":"2026-07-09T09:26:08.758906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.048248+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.048248+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00713","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When can LLMs actually correct their own mistakes? A critical survey of self-correction of LLMs","venue":"Transactions of the Association for Computational Linguistics","work_id":"c367510c-e463-4efb-a7e8-ea77090b4a50","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:40b49d2e067ffcca6a0c4862b528c3cf9eee3371a7339871ad0a8a3901999b98","observation_id":"f633b95b-6d56-452b-bbda-536be2d83a10","resolution":{"observed_at":"2026-07-09T09:26:08.781721Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.341233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.341233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:913e79bffda9e986dad4686f31c6c83ca0a0fed47d7ae5c79f44368bdde41001","observation_id":"28e80778-acf0-44fc-8fb5-1a0dab638af4","resolution":{"observed_at":"2026-07-09T09:26:08.725748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2409.12917","doi":"10.48550/arxiv.2409.12917","metadata_source":"pith","pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","venue":"cs.LG","work_id":"3ac87f3c-6dc4-492a-bbfb-8cdc05a15706","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:9d240b5673049b876c122a42c96827423c775012b248f4b69586dc211d046121","observation_id":"5e4dd129-b271-4f5a-907d-f1278642043e","resolution":{"observed_at":"2026-07-09T09:26:08.745714Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.810784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.810784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14083","last_updated":"2024-04-26T21:05:19Z","snapshot_observed_at":"2026-08-03T17:46:43.973917Z","submitted_at":"2024-02-21T19:17:28Z","title":"Beyond A*: Better Planning with Transformers via Search Dynamics Bootstrapping","version":2},"cited_work":{"arxiv_id":"2402.14083","doi":"10.48550/arxiv.2402.14083","metadata_source":"pith","pith_arxiv_id":"2402.14083","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"10 Lucas Lehnert, Sainbayar Sukhbaatar, Paul Mcvay, Michael Rabbat, and Yuandong Tian","venue":"cs.AI","work_id":"a284115a-a737-4c30-880b-739fceb5d4e3","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2402.14083","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:2b561373a5913567c293eda0411903d969bb7fa790228c6515c3d904b74b7364","observation_id":"e6f72bb4-d634-4582-b432-7cf52f4f9d92","resolution":{"observed_at":"2026-07-09T09:26:08.773805Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:39.067449+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:39.067449+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":"2303.17651","doi":"10.1007/s10664-008-","metadata_source":"pith","pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","venue":"cs.CL","work_id":"59181e7f-e58e-45d3-8146-4477a9f53d5a","year":2023},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:83e1d3af2b242e4cd0119adce1fda1bec14c633b35f64ba4f343e4069f0d1da2","observation_id":"f3afc76f-deaf-4123-898a-688eec3811dd","resolution":{"observed_at":"2026-07-09T09:26:08.701903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-07T12:10:53.303603Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":"2407.18219","doi":"10.48550/arxiv.2407.18219","metadata_source":"pith","pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recursive introspection: Teaching language model agents how to self-improve","venue":"cs.LG","work_id":"1b29a5c4-1809-42c9-a008-9080646e27e1","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:6392db6b5f25c95aa8238ee6646d8613e9ce538692457b1db62b0381781040a3","observation_id":"b1eb2a18-cfed-4797-8be5-27b3bd8b044f","resolution":{"observed_at":"2026-07-09T09:26:08.739496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:39.539028+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:39.539028+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07052","doi":"10.48550/arxiv.2504.07052","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qin, T., Alvarez-Melis, D., Jelassi, S., and Malach, E","venue":"ArXiv.org","work_id":"0f83d387-aa2a-466c-8753-3be2fe992b38","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:c9df951dbba07dbb8dc831c6ddebc51a4094ea694ad3c0ec96b8b8b7c444082d","observation_id":"febfa471-d05b-48ab-abe9-dd8d53fcd2fa","resolution":{"observed_at":"2026-07-09T09:26:08.712699Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:39.780701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:39.780701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:d95140335de983d58719b9b40f1302994ac58071d1e15a8385836612ecae22ea","observation_id":"07f73784-95e0-4cbd-8408-e75d5948032c","resolution":{"observed_at":"2026-07-09T09:26:08.755245Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15865","last_updated":"2025-07-26T07:05:22Z","snapshot_observed_at":"2026-08-06T17:47:14.624128Z","submitted_at":"2025-07-13T16:18:23Z","title":"From Reasoning to Super-Intelligence: A Search-Theoretic Perspective","version":2},"cited_work":{"arxiv_id":"2507.15865","doi":"10.48550/arxiv.2507.15865","metadata_source":"pith","pith_arxiv_id":"2507.15865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From reasoning to super-intelligence: A search- theoretic perspective","venue":"cs.AI","work_id":"1d63687d-b3ad-441f-9269-5fe05d48640b","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2507.15865","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:8dfb528428edbd0250e27c3476496fbfd57ab3d25e0c831772349deef0d0a81a","observation_id":"98b87332-a28c-4333-8ba7-ddb08456fe8f","resolution":{"observed_at":"2026-07-09T09:26:08.691022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:40.24371+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:40.24371+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2303.11366","doi":"10.1109/cvpr42600.2020","metadata_source":"pith","pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","venue":"cs.AI","work_id":"778f739e-5f55-4961-8a2a-e4736a2757f4","year":2023},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:fb391afcfbee660ee924fd953b6b44c020378d41515c1613b01c443dfecc597f","observation_id":"f3adb9db-3608-400c-8937-ba8c2c1783d1","resolution":{"observed_at":"2026-07-09T09:26:08.722253Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09918","last_updated":"2025-07-11T03:52:42Z","snapshot_observed_at":"2026-08-05T13:59:17.022236Z","submitted_at":"2024-10-13T16:53:02Z","title":"Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces","version":3},"cited_work":{"arxiv_id":"2410.09918","doi":"10.48550/arxiv.2410.09918","metadata_source":"pith","pith_arxiv_id":"2410.09918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dualformer: Controllable fast and slow thinking by learning with randomized reasoning traces.arXiv preprint arXiv:2410.09918","venue":"cs.AI","work_id":"6eb060c6-ed90-4d84-90ac-6ef48e6e0bba","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2410.09918","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:27db210f81de56d45e0329d0598b63a1c44490c3f91346dfdd723f5ebe4a7abb","observation_id":"f8a8195d-db19-4b5c-977a-b3aa8e89fe20","resolution":{"observed_at":"2026-07-09T09:26:08.742525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:40.776601+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:40.776601+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12253","last_updated":"2024-12-10T18:19:29Z","snapshot_observed_at":"2026-08-05T22:35:55.296192Z","submitted_at":"2024-04-18T15:21:34Z","title":"Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing","version":2},"cited_work":{"arxiv_id":"2404.12253","doi":"10.48550/arxiv.2404.12253","metadata_source":"pith","pith_arxiv_id":"2404.12253","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.12253 , year=","venue":"cs.CL","work_id":"bfbcc382-9c9b-4d33-978d-ed13e626dfb7","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2404.12253","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:652ca9dfb8212c7a190dd1e941d26b445362f6dfdbd1568463038124892dc031","observation_id":"a8d8d45b-d57b-4936-ad1d-e84a32ad4dce","resolution":{"observed_at":"2026-07-09T09:26:08.777500Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:40.993352+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:40.993352+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:71cfd5e601d15855491682f2efb13393c95657aebc806f276033fd3c81f842e0","observation_id":"99e4dd5d-e16b-42c9-b22a-a741252bfbe9","resolution":{"observed_at":"2026-07-09T09:26:08.736301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04404","last_updated":"2025-02-06T08:52:43Z","snapshot_observed_at":"2026-08-05T03:12:32.063864Z","submitted_at":"2025-02-06T08:52:43Z","title":"Step Back to Leap Forward: Self-Backtracking for Boosting Reasoning of Language Models","version":1},"cited_work":{"arxiv_id":"2502.04404","doi":"10.48550/arxiv.2502.04404","metadata_source":"pith","pith_arxiv_id":"2502.04404","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step back to leap forward: Self-backtracking for boosting reasoning of language models","venue":"cs.CL","work_id":"33a1c847-eebe-4da8-ba19-4365f0a85c4d","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2502.04404","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:e058b84efb8a8ba2d40d2b79528fe156450a66718ead0e507a5b5c9dd2ad0672","observation_id":"8ec762a6-6cd1-4d8f-869c-aa544ee39612","resolution":{"observed_at":"2026-07-09T09:26:08.732361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:41.491834+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:41.491834+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.10601","doi":"10.48550/arxiv.2305.10601","metadata_source":"pith","pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","venue":"cs.CL","work_id":"07adb06e-4ed5-4ec5-a7ae-ff288fd214fb","year":2023},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:ae5e77b6388bbf1eb2916c56259dc96d4cb2f2ac3275645f790141138309d2ea","observation_id":"4f060ae9-68da-414f-b53b-e3e3177154f7","resolution":{"observed_at":"2026-07-09T09:26:08.770187Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:14.037057+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:14.037057+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:a65801e1507cbc85664ebd29a931692f2f895e26016405677caaa1a85443449f","observation_id":"ffb1fdfd-b29b-429a-a97f-2cfa26290d4c","resolution":{"observed_at":"2026-07-09T09:26:08.698382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24273","last_updated":"2025-05-30T06:49:00Z","snapshot_observed_at":"2026-08-07T18:34:20.398845Z","submitted_at":"2025-05-30T06:49:00Z","title":"How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2505.24273","doi":"10.48550/arxiv.2505.24273","metadata_source":"pith","pith_arxiv_id":"2505.24273","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How much backtracking is enough? exploring the interplay of sft and rl in enhancing llm reasoning","venue":"cs.AI","work_id":"531d83c6-0670-45ed-a1d9-69830d44a94e","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2505.24273","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:2ed0d3bae080f5e01142923e14411810926e81caacdd2b61e75aa6ac5114bc34","observation_id":"3260f571-67dd-4554-845e-87cabc304fec","resolution":{"observed_at":"2026-07-09T09:26:08.683519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.249697+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.249697+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00417","last_updated":"2025-07-01T04:10:15Z","snapshot_observed_at":"2026-08-07T07:50:07.171627Z","submitted_at":"2025-07-01T04:10:15Z","title":"ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context","version":1},"cited_work":{"arxiv_id":"2507.00417","doi":"10.48550/arxiv.2507.00417","metadata_source":"pith","pith_arxiv_id":"2507.00417","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context","venue":"cs.AI","work_id":"76b10c50-034a-4ee0-93cf-f14a25a8cda7","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2507.00417","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:bcfd621e1341cd5279080c1c68e0e5b35f3293fd39f4d7983b54550ecb9035d9","observation_id":"1df115b3-2ae8-47a6-b2a7-1af672e9dc49","resolution":{"observed_at":"2026-07-09T09:26:08.708526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.511953+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.511953+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20561","doi":"10.48550/arxiv.2505.20561","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond markovian: Reflective exploration via bayes-adaptive rl for llm reasoning","venue":"ArXiv.org","work_id":"531c5dec-0260-414f-91d3-24dab723434f","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:58b8a3b66380325a9ee9885e66a269f9615f85fbb14f1bf727833325d5e1e2ff","observation_id":"29b89142-652b-45e5-aa93-9bb432f2a561","resolution":{"observed_at":"2026-07-09T09:26:08.752027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.733574+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.733574+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":"2501.17161","doi":"10.48550/arxiv.2501.17161","metadata_source":"pith","pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","venue":"cs.AI","work_id":"258dd934-025c-47f5-b4f6-5a0c1c338cc6","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:2cca1ca45c8dbc0d4d5b731b5b331075c1aecabd505a838cf1596cd6cac3dad1","observation_id":"c9fc3acb-9ac7-484e-abf1-17309c514171","resolution":{"observed_at":"2026-07-09T09:26:08.729345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":"2503.01307","doi":"10.48550/arxiv.2503.01307","metadata_source":"pith","pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","venue":"cs.CL","work_id":"f65a84bf-c5b4-4491-a618-18bb263c60e5","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:a13f34ff8af3a4c4c773a8d57f8822b8ef61a9a587d3554e0a7269b2d5c7084f","observation_id":"e020ec10-504d-4913-a94c-091ce6bde7df","resolution":{"observed_at":"2026-07-09T09:26:08.716011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10498","last_updated":"2023-11-26T01:15:41Z","snapshot_observed_at":"2026-07-06T13:23:11.566484Z","submitted_at":"2022-06-21T16:15:27Z","title":"PlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning and Reasoning about Change","version":4},"cited_work":{"arxiv_id":"2206.10498","doi":"10.48550/arxiv.2206.10498","metadata_source":"pith","pith_arxiv_id":"2206.10498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language models still can’t plan (a benchmark for llms on planning and reasoning about change)","venue":"cs.CL","work_id":"ac4a23f5-f300-4748-a75a-f0f29bcf6ee4","year":2022},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2206.10498","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:1a148ab52c9f620e3aca7d4b78c0b19aa28a0854c2e875afafacf3912909f96c","observation_id":"5d6a6729-a5ca-414c-aa49-15f52a989fe1","resolution":{"observed_at":"2026-07-09T09:26:08.694841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:43.429028+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:43.429028+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01817","last_updated":"2024-06-12T01:13:11Z","snapshot_observed_at":"2026-08-01T23:26:05.428862Z","submitted_at":"2024-02-02T14:43:18Z","title":"LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks","version":3},"cited_work":{"arxiv_id":"2402.01817","doi":"10.48550/arxiv.2402.01817","metadata_source":"pith","pith_arxiv_id":"2402.01817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llms can’t plan, but can help planning in llm-modulo frameworks","venue":"cs.AI","work_id":"84a8bc82-1248-4ee2-a5ca-15d73cdc12be","year":2024},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2402.01817","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:109f15eb57ee6539e05ce83e47bad5d31c2107199c6731c961ac4a33c692bb6f","observation_id":"5f69c0ca-ffff-49a8-bb4b-8aa467a6eecb","resolution":{"observed_at":"2026-07-09T09:26:08.762874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:43.666822+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:43.666822+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:26:09.352179Z","title":null,"venue":null,"work_id":"65593d04-3708-4d24-951b-4e0e8eacee4a","year":null},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:441f9686db7755df42e7c4f35a54f3a00e852a894dbec809d4fa4b0e16036d69","observation_id":"9f1d35d0-ab26-4ac4-8d09-224773124057","resolution":{"observed_at":"2026-07-09T09:26:09.353823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/ictai.2004.120","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 16th","venue":null,"work_id":"bce6c569-7206-4c07-a129-5f01c16bc965","year":2004},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:1772b57d8c96aee6cb2dff5b06f393ba973368effc55c7fc8a45449b9a5d6dea","observation_id":"e9d07a35-be41-449c-85cd-8224346feb51","resolution":{"observed_at":"2026-07-09T09:26:08.747988Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:43.892513+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:43.892513+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:24:45.915570Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":10,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.07492."}