{"as_of":"2026-08-12T13:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10e52d7f56caeaf9f500b558a0f2a9f9f27bfef4234f5d0672f5d16a09068285","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:32:05.187906Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T01:36:23.845366Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T01:36:24.154635Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"cited_work":{"arxiv_id":"2412.17397","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17397","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Available: https://arxiv.org/abs/2412.17397","venue":null,"work_id":"5bcdcda7-0e8e-4cec-ada5-e84b22cb1272","year":null},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2412.17397","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:5b606e2d094fb68b0affead733d0182798075dec7fb7896e58cf211df5c13add","observation_id":"20d65286-dcfe-4a98-bb6c-fa62cf15d1cf","resolution":{"observed_at":"2026-05-13T01:36:24.157579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17397/citation-record","integrity":"/paper/2412.17397/integrity","json":"/paper/2412.17397/citation-record.json","paper":"/paper/2412.17397"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.007464Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.007464Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:df61c853457d88afab27fb436b5e1e7729e53edbc485836022a0c999833ec60e","observation_id":"6139c537-2c34-45e4-8e74-2e0cbe47a633","resolution":{"observed_at":"2026-08-11T05:32:05.007464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.012085Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.012085Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:d0a0d608e9c018b0bb19e58e4511088e048ab43071756d982a19935e456a0e35","observation_id":"ef7f8bf7-0f0d-4e82-9a03-493d51278cba","resolution":{"observed_at":"2026-08-11T05:32:05.012085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-11T05:32:05.016894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.016894Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:cff2d4285d667e9e575449067f1cad54d100f42020c122305498430924be3ba0","observation_id":"6c59b594-4057-4559-a966-d31d539f04ed","resolution":{"observed_at":"2026-08-11T05:32:05.016894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08844","last_updated":"2023-07-11T18:29:12Z","snapshot_observed_at":"2026-07-06T15:27:25.253387Z","submitted_at":"2023-05-15T17:57:16Z","title":"RL4F: Generating Natural Language Feedback with Reinforcement Learning for Repairing Model Outputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08844","snapshot_observed_at":"2026-08-11T05:32:05.021572Z","title":"u rek, A. F.; Aky \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.021572Z"},"links":{"cited_paper":"/paper/2305.08844","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:2bf6a73f26984ca6bf7a6035a83dd1a9e95ac031843bd85de4ef1fdfcc6ce15c","observation_id":"716b68ea-4806-4bab-b082-434262358aff","resolution":{"observed_at":"2026-08-11T05:32:05.021572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T05:32:05.025822Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.025822Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:7a959110ee924286be637a3d85697ed658506bf34eff70344572cf08251cf12d","observation_id":"9ae8fbef-08ce-4121-a41a-c5cc708d1804","resolution":{"observed_at":"2026-08-11T05:32:05.025822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.030152Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.030152Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:b6af8222d854258788169c35f6432f8903aa7f1404e3e431082dc36b9214b14e","observation_id":"66c77d0e-e133-40d8-a43f-febd697f0b96","resolution":{"observed_at":"2026-08-11T05:32:05.030152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T05:32:05.033716Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.033716Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:d8771ec4a48be4b4af6468cb9688f2d9d3e2ef1d6af484064699f730f8c8ed4e","observation_id":"41634b16-a98d-4af0-8a17-582fc290f46a","resolution":{"observed_at":"2026-08-11T05:32:05.033716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-08-11T19:08:32.960639Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-11T05:32:05.037290Z","title":"A.; Chebotar, Y.; Xiao, T.; Irpan, A.; Levine, S.; Castro, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.037290Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:e3866bc8b76eb135f82c3b016906feea43f10fbc74e22238fdce9d31f0b13fd6","observation_id":"e6724a79-e296-4dd7-a083-36322016908b","resolution":{"observed_at":"2026-08-11T05:32:05.037290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.862097Z","title":null,"venue":null,"work_id":"07f2b47a-f827-4fd2-a7cd-2207ea4c07c0","year":2020},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.041677Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:686ebea636cfa1ebee91060f34fc0bbdb9712474e64a96f1a9d2ddc409088c20","observation_id":"81f014e3-d931-424a-a8a8-12e468bd6d2a","resolution":{"observed_at":"2026-08-11T05:32:05.866211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-11T05:32:05.045671Z","title":"J.; Wang, Z.; Wang, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.045671Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:d36f09a3904398cbf9d5f5412a76a9aa64ed7a7ff296e7133112602dab56b3ec","observation_id":"3c0ff638-9bb8-4f13-b778-5e620ca44c38","resolution":{"observed_at":"2026-08-11T05:32:05.045671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10963","last_updated":"2024-06-25T03:14:10Z","snapshot_observed_at":"2026-08-05T17:51:38.668510Z","submitted_at":"2024-02-13T20:16:29Z","title":"GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10963","snapshot_observed_at":"2026-08-11T05:32:05.050096Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.050096Z"},"links":{"cited_paper":"/paper/2402.10963","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:71f52b60c8ae214ce1a8277fcf816385aa4ce9495a176505a832bc5ab758ee7f","observation_id":"dbf429ce-cf85-401b-9596-23268c5f20e6","resolution":{"observed_at":"2026-08-11T05:32:05.050096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T05:32:05.054517Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.054517Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:b91fc8ca68006c6a6c7d3060ff6164c7305175d532fc0ebda2ecb4242da1ba9b","observation_id":"bcb1c06b-7139-42f8-81a7-08aa29e10fe8","resolution":{"observed_at":"2026-08-11T05:32:05.054517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.850377Z","title":null,"venue":null,"work_id":"067a4ed5-e74f-45dd-8da7-429370dbe6d7","year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.058941Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:9d1e92764052f73086037a515c3dbeef9a9b3b616f549225af34a7b84b04c37b","observation_id":"1842be97-7bc8-460b-a9ba-ba85042970e7","resolution":{"observed_at":"2026-08-11T05:32:05.854172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T05:32:05.062776Z","title":"Q.; Sablayrolles, A.; Mensch, A.; Bamford, C.; Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.062776Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:120f37ca7884e54b8cb859e98a13ac31b8c970323e4aa9f561bcc87379b8b639","observation_id":"65d61a2c-4590-4299-a8fe-b9d85fd0e639","resolution":{"observed_at":"2026-08-11T05:32:05.062776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.838373Z","title":null,"venue":null,"work_id":"4ce28dc5-eab6-4a82-bf36-b359ab055100","year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.066919Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:f27658a502b8a1816a0c48b51f4525606e7e42032e9d4d24639ae34d90b9831f","observation_id":"e7b1a721-e5af-48b7-b9d8-048a594e227d","resolution":{"observed_at":"2026-08-11T05:32:05.842298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.071278Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.071278Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:6a451637b31a05b8a759115aa3b42293ee3a118dafcad8434b68b66ba30c5e9e","observation_id":"74cf42fa-1b7a-4a0f-bf3a-6bb4590f3474","resolution":{"observed_at":"2026-08-11T05:32:05.071278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-11T05:32:05.075477Z","title":"D.; Singh, A.; Baumli, K.; Iqbal, S.; Bishop, C.; Roelofs, R.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.075477Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:97279e184d697fd86132b82fd0304315d6359136b117568ef423b590f8d7af82","observation_id":"68af0466-d675-43b6-a933-312d41ea6f2e","resolution":{"observed_at":"2026-08-11T05:32:05.075477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.818835Z","title":null,"venue":null,"work_id":"cfb6bc14-79b9-4075-9289-6a1775ead25e","year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.079473Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:e0a1a10f7def2ff5cde76c6b448d49230947f47664407c36ec97f3dbfe8929f3","observation_id":"c2b6c74d-03e9-4bf5-8291-ca00818a1fc7","resolution":{"observed_at":"2026-08-11T05:32:05.822646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-11T05:32:05.083498Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.083498Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:27eda6d490db63ec08d96db0c1be6010ca8dd3feb0bc745385944c3aeb28541a","observation_id":"87c9b8d4-ace4-4bca-b25c-80f786c7afcd","resolution":{"observed_at":"2026-08-11T05:32:05.083498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15028","last_updated":"2024-04-02T17:51:49Z","snapshot_observed_at":"2026-08-11T02:32:12.555267Z","submitted_at":"2023-09-26T15:57:57Z","title":"Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15028","snapshot_observed_at":"2026-08-11T05:32:05.087359Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.087359Z"},"links":{"cited_paper":"/paper/2309.15028","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:22ee0589657112b801f66379c3c816b9ef4eee7a369cdd226f17ae3b129d7429","observation_id":"6e460728-aeb0-42c6-b628-d7877ce4171a","resolution":{"observed_at":"2026-08-11T05:32:05.087359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.806595Z","title":null,"venue":null,"work_id":"d412320c-a974-48eb-a499-ce9081131b1d","year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.091033Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:19765a532fa3ca9db4320279a1fc472cdbfaa14195a2b1b5ac47e2f1d76a8a37","observation_id":"1c3b8cd5-0cd1-4746-8667-0f53affc4735","resolution":{"observed_at":"2026-08-11T05:32:05.811023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.094613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.094613Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:84d70c6de419920d4dddefb0fb355cf602029b01920d611325f9808045fe2e60","observation_id":"10f51c8c-cbf8-4e23-b0af-e854b271ee2a","resolution":{"observed_at":"2026-08-11T05:32:05.094613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01904","last_updated":"2024-02-04T12:15:18Z","snapshot_observed_at":"2026-08-12T02:58:43.877304Z","submitted_at":"2023-04-04T15:57:28Z","title":"REFINER: Reasoning Feedback on Intermediate Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01904","snapshot_observed_at":"2026-08-11T05:32:05.098268Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.098268Z"},"links":{"cited_paper":"/paper/2304.01904","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:3c81aa8117faed8c7f115f06d6d9a334962c43e83c133ca82ca70618e2e39170","observation_id":"087d3004-cef3-48f6-96e5-55305776a496","resolution":{"observed_at":"2026-08-11T05:32:05.098268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-07T12:10:53.303603Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-11T05:32:05.102208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.102208Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:890081a2027d73cd5c116a4f6f4d50d7ff500f29b8a112645d27955f58ccb2cd","observation_id":"c47a144d-ef43-4a36-b39b-70530ebf90d4","resolution":{"observed_at":"2026-08-11T05:32:05.102208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.106426Z","title":"D.; Ermon, S.; and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.106426Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:e9c0aff663a1293b5122976991769f24eef3151512d23ba29d849433d27c19c2","observation_id":"d6fe4b0d-cfa8-4917-ba07-97a6fb580142","resolution":{"observed_at":"2026-08-11T05:32:05.106426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.781494Z","title":null,"venue":null,"work_id":"d39fcd6b-1d4e-4090-b474-73ea9874ccf0","year":2011},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.109858Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:a4a910048f7935d50130a55e55241e574f546426e6c99f698a13ce80402c0452","observation_id":"590eabcc-daa2-4879-8a24-6f44dd336a21","resolution":{"observed_at":"2026-08-11T05:32:05.785053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14655","last_updated":"2024-12-02T12:37:46Z","snapshot_observed_at":"2026-07-06T18:18:43.328203Z","submitted_at":"2024-05-23T14:53:54Z","title":"Multi-turn Reinforcement Learning from Preference Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14655","snapshot_observed_at":"2026-08-11T05:32:05.113680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.113680Z"},"links":{"cited_paper":"/paper/2405.14655","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:dd13dca6edcf36c0a26bfe4ffd384fa7c3970f9467b12f9bccd2c5b48d2b0976","observation_id":"8f2afc7e-e1c1-42a0-adc0-1045b8ccbb5b","resolution":{"observed_at":"2026-08-11T05:32:05.113680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T05:32:05.117598Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.117598Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:608ea4be87ccb1ffd9a920a6313ddbbbdd35c5a5957bb1897c1e6dc4aab74db1","observation_id":"fc4032c3-1d91-45f8-9527-a34ed4c73115","resolution":{"observed_at":"2026-08-11T05:32:05.117598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-10T17:44:16.302071Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-11T05:32:05.121465Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.121465Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:c0d9d3326010e250cb7bd396f325a0746ff3abd845adbf4a946e447c13ab6f04","observation_id":"e2dd6853-cff5-4612-8f08-88757ad4fca9","resolution":{"observed_at":"2026-08-11T05:32:05.121465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-11T05:32:05.125316Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.125316Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:c6adc711517cce215844f9bfb7da52f092434bd948829dee72903d63c52dd346","observation_id":"fe3f1d92-ba3d-40d6-be20-3812083b914e","resolution":{"observed_at":"2026-08-11T05:32:05.125316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11871","last_updated":"2023-05-01T04:42:27Z","snapshot_observed_at":"2026-08-11T21:48:23.243901Z","submitted_at":"2022-06-05T18:38:42Z","title":"Offline RL for Natural Language Generation with Implicit Language Q Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11871","snapshot_observed_at":"2026-08-11T05:32:05.128971Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.128971Z"},"links":{"cited_paper":"/paper/2206.11871","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:653a044470826b11318fbabade59765f813f045ae2edd8c5792f640c3b5e97c2","observation_id":"d2f7f02e-3b18-485d-b1cd-f459a8631c03","resolution":{"observed_at":"2026-08-11T05:32:05.128971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13690","last_updated":"2024-12-23T17:32:21Z","snapshot_observed_at":"2026-08-05T19:05:54.552558Z","submitted_at":"2024-06-18T07:14:02Z","title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13690","snapshot_observed_at":"2026-08-11T05:32:05.132531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.132531Z"},"links":{"cited_paper":"/paper/2407.13690","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:2be0ced64eacb9802efc5eaf398a9ed8177a693a3d9f1e378d6235bdb790952a","observation_id":"8a40f0ab-ea8f-4ca9-8c65-e908bf7b7388","resolution":{"observed_at":"2026-08-11T05:32:05.132531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01560","last_updated":"2024-10-05T03:54:22Z","snapshot_observed_at":"2026-08-10T11:04:25.169116Z","submitted_at":"2024-10-02T14:00:09Z","title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01560","snapshot_observed_at":"2026-08-11T05:32:05.140190Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.140190Z"},"links":{"cited_paper":"/paper/2410.01560","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:1363322e7670d0c6dfca39f266a6acff9b7b5f7e93d1e23b92be3f919ab2d518","observation_id":"c4fd0710-afef-4a15-b087-da2858a9caff","resolution":{"observed_at":"2026-08-11T05:32:05.140190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-11T05:32:05.144130Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.144130Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:4b27531299655141a83a056284621a41c6e12bbf56214e209173eb2ea1e5710f","observation_id":"2aa358fe-ae80-4232-ac82-68d297a01d65","resolution":{"observed_at":"2026-08-11T05:32:05.144130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00053","last_updated":"2022-10-31T18:09:51Z","snapshot_observed_at":"2026-07-06T14:12:45.730577Z","submitted_at":"2022-10-31T18:09:51Z","title":"Generating Sequences by Learning to Self-Correct","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00053","snapshot_observed_at":"2026-08-11T05:32:05.148451Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.148451Z"},"links":{"cited_paper":"/paper/2211.00053","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:1befc6fcc3e9adae1e24c3f432bab004bbc3b4edf98bf38f98bde5ebef1aa04c","observation_id":"174d3ed4-ae9a-4391-a886-334acd0be3ba","resolution":{"observed_at":"2026-08-11T05:32:05.148451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.770498Z","title":"A.; Ostendorf, M.; and Hajishirzi, H","venue":null,"work_id":"2c308618-3286-4277-a516-629d8f4dba74","year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.153337Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:590bcefb2bdea968e5c1d3a81512a8958ac29eb1a31f6a01f330b3b9a3481ce3","observation_id":"f1af8582-daa7-4077-a3b8-63c3cd2b011f","resolution":{"observed_at":"2026-08-11T05:32:05.774600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-10T23:49:19.260833Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-11T05:32:05.157765Z","title":"P.; Kawaguchi, K.; and Shieh, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.157765Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:0dac1b0ceb84ded779cabd5ecd5be225d84c48669d364f40c570b9a3bfc2cd33","observation_id":"8af40692-2384-4830-b52c-7e7b4d258317","resolution":{"observed_at":"2026-08-11T05:32:05.157765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00633","last_updated":"2023-10-26T01:43:17Z","snapshot_observed_at":"2026-07-06T15:21:46.324091Z","submitted_at":"2023-05-01T02:37:59Z","title":"Self-Evaluation Guided Beam Search for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00633","snapshot_observed_at":"2026-08-11T05:32:05.161940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.161940Z"},"links":{"cited_paper":"/paper/2305.00633","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:303ca31320499c95bdfbb555df1a26a162a938ec8b57e75b2578fb80e08b848d","observation_id":"68b738bf-6638-44f4-8d49-efedbaff11b0","resolution":{"observed_at":"2026-08-11T05:32:05.161940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02392","last_updated":"2025-02-27T22:10:16Z","snapshot_observed_at":"2026-08-10T21:04:13.574769Z","submitted_at":"2024-09-04T02:41:04Z","title":"Building Math Agents with Multi-Turn Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02392","snapshot_observed_at":"2026-08-11T05:32:05.166120Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.166120Z"},"links":{"cited_paper":"/paper/2409.02392","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:1dc735e8a96409da89f2c792aefdba9743486dd7defe95fab35e284aa8b0b773","observation_id":"87c2715b-ed7d-4e77-8b7e-84faff3d4faa","resolution":{"observed_at":"2026-08-11T05:32:05.166120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:32:05.170329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.170329Z"},"links":{"citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:19d6b8872cc8798c4e10ce6bc962f330e65965844d5007d8d226e0552071fce1","observation_id":"c7adbc43-b337-4f3d-98d4-cdbd1ffc4ac7","resolution":{"observed_at":"2026-08-11T05:32:05.170329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-11T05:32:05.174422Z","title":"T.; Li, Z.; Weller, A.; and Liu, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.174422Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:fb7af4565f3b701f12e16ac1584d77fbb1a82093e3a5cb57a3dcc62212c34391","observation_id":"5b01707f-56f0-460b-bddd-0eb8ccca49de","resolution":{"observed_at":"2026-08-11T05:32:05.174422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17140","last_updated":"2024-06-06T03:59:24Z","snapshot_observed_at":"2026-08-09T12:17:47.402634Z","submitted_at":"2024-04-26T03:41:28Z","title":"Small Language Models Need Strong Verifiers to Self-Correct Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17140","snapshot_observed_at":"2026-08-11T05:32:05.179010Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.179010Z"},"links":{"cited_paper":"/paper/2404.17140","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:e6e76746a90d507d8b737ee9d78223b9313bac83aaea93aaed2f26a131655afb","observation_id":"1be35d6f-3f50-4936-88ef-3fd03c599e9a","resolution":{"observed_at":"2026-08-11T05:32:05.179010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-10T19:23:03.774922Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-11T05:32:05.183607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.183607Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:2124e4a2ead884537e0315a2185efde2240c62efe3fa3866a540e7a119c10367","observation_id":"9c14088f-63e6-409b-82e9-e14c9c121d84","resolution":{"observed_at":"2026-08-11T05:32:05.183607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16257","last_updated":"2023-12-29T15:36:05Z","snapshot_observed_at":"2026-08-12T08:03:28.227112Z","submitted_at":"2022-10-28T16:47:03Z","title":"Solving Math Word Problems via Cooperative Reasoning induced Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16257","snapshot_observed_at":"2026-08-11T05:32:05.187906Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T05:32:05.187906Z"},"links":{"cited_paper":"/paper/2210.16257","citing_paper":"/paper/2412.17397"},"observation_digest":"sha256:8a187afae8137b52e48b1408d3fbfaa4491d757de62a597fd74a5f2308e9783a","observation_id":"eda91110-2467-45dd-8607-670cd82758d6","resolution":{"observed_at":"2026-08-11T05:32:05.187906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17397","last_updated":"2024-12-23T08:51:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T19:08:40.776110Z","submitted_at":"2024-12-23T08:51:48Z","title":"Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2412.17397."}