Pith. sign in

Paper Citation Record · LEDGER

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning

As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2412.17397.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.17397 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T05:32:05.187906Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-13T01:36:23.845366Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-13T01:36:24.154635Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved43
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6139c537-2c34-45e4-8e74-2e0cbe47a633 · outbound

This paper cites , " * write output.state after.block = add.period write newline.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning , " * write output.state after.block = add.period write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.007464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.007464Z digest=sha256:abb4ef7337f4fcc46e7e70ac360be6fd4c97aa633a222a0a33e63ff7d05f333c

Observation ef7f8bf7-0f0d-4e82-9a03-493d51278cba · outbound

This paper cites write newline.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.012085Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.012085Z digest=sha256:9cfdcdea50d0308b20218bec1c93282b48c4ea80baa3c4c73260c4b136dce443

Observation 6c59b594-4057-4559-a966-d31d539f04ed · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.016894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.016894Z digest=sha256:a9cae8ee29b25a07252a9543790b6abbd1f5ce21373166aff0255a5706c528b7

Observation 716b68ea-4806-4bab-b082-434262358aff · outbound

This paper cites RL4F: Generating Natural Language Feedback with Reinforcement Learning for Repairing Model Outputs.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning RL4F: Generating Natural Language Feedback with Reinforcement Learning for Repairing Model Outputs

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.021572Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.021572Z digest=sha256:75a7966475559e4743743a50006218ace5da11a47bc8e7f41c8b97f44a9a9ae7

Observation 9ae8fbef-08ce-4121-a41a-c5cc708d1804 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Training Verifiers to Solve Math Word Problems

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.025822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.025822Z digest=sha256:2ec3a6f93b09ea6b7f88d06541af7b608c67ad92fb8cfe63fcd1149bdca5eb5e

Observation 66c77d0e-e133-40d8-a43f-febd697f0b96 · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.030152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.030152Z digest=sha256:85c20e7352f0e87d75cd8be41f4f02e3c2d20587b90969113cf31c2ad898cc8f

Observation 41634b16-a98d-4af0-8a17-582fc290f46a · outbound

This paper cites The Llama 3 Herd of Models.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning The Llama 3 Herd of Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.033716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.033716Z digest=sha256:573a1c8e026e86afdf9e90b45b74ef8ce0ff854940bd68896f04313127d8537d

Observation e6724a79-e296-4dd7-a083-36322016908b · outbound

This paper cites Stop Regressing: Training Value Functions via Classification for Scalable Deep RL.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Stop Regressing: Training Value Functions via Classification for Scalable Deep RL

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.037290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.037290Z digest=sha256:4b11987a91f32705dbfbcf6528f3b1fdac19ea8b890c60d72a9c5d972a3d40ac

Observation 81f014e3-d931-424a-a8a8-12e468bd6d2a · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-11T05:32:05.866211Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T05:32:05.041677Z digest=sha256:dbc6735c759d6861802d35f2f077f2e8593ea599b456eda317bd87685c974ec5

Observation 3c0ff638-9bb8-4f13-b778-5e620ca44c38 · outbound

This paper cites Reasoning with Language Model is Planning with World Model.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Reasoning with Language Model is Planning with World Model

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.045671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.045671Z digest=sha256:10b1994deee7940feea6796b29771205dc2bba7503922d74be28ad8e1737d794

Observation dbf429ce-cf85-401b-9596-23268c5f20e6 · outbound

This paper cites GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.050096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.050096Z digest=sha256:e3d5f5373c5efb716f42c2d63ce5ec8c9477ce727e969423a7e837f5623d4931

Observation bcb1c06b-7139-42f8-81a7-08aa29e10fe8 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Measuring Mathematical Problem Solving With the MATH Dataset

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.054517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.054517Z digest=sha256:a8c191208949958b33d0ea5277e1ffc8606bd2ed284735c3b6321ff3a821e599

Observation 1842be97-7bc8-460b-a9ba-ba85042970e7 · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-11T05:32:05.854172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T05:32:05.058941Z digest=sha256:6d389e3b6a0eb9a24c9bb140f8cfd0f1e898dde005232446412f5f9503c9dea6

Observation 65d61a2c-4590-4299-a8fe-b9d85fd0e639 · outbound

This paper cites Mistral 7B.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Mistral 7B

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.062776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.062776Z digest=sha256:4c2dc05bd7548e6d1d788f6c5e9376663d987a329b39c4965435846e054c620a

Observation e7b1a721-e5af-48b7-b9d8-048a594e227d · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-11T05:32:05.842298Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T05:32:05.066919Z digest=sha256:47d2477490e949d595152d2ce1afe14805089cd5d2693c13c0c53f37b52fe271

Observation 74cf42fa-1b7a-4a0f-bf3a-6bb4590f3474 · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.071278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.071278Z digest=sha256:4f87aa02790524b036edd7cea76103cc9bbce70b3d2a1f60d54781a81b7b2615

Observation 68af0466-d675-43b6-a933-312d41ea6f2e · outbound

This paper cites Training Language Models to Self-Correct via Reinforcement Learning.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Training Language Models to Self-Correct via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.075477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.075477Z digest=sha256:12cd8b8333930194f948bda83c7c2b1cfa05d5ec88a6857fe07e8c1db9e53dfe

Observation c2b6c74d-03e9-4bf5-8291-ca00818a1fc7 · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-11T05:32:05.822646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T05:32:05.079473Z digest=sha256:86ebeafbe4d4f6a4b1195218d822e92f42b1a8dc9d96d2fe45485f2abdfb495b

Observation 87c9b8d4-ace4-4bca-b25c-80f786c7afcd · outbound

This paper cites Let's Verify Step by Step.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Let's Verify Step by Step

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.083498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.083498Z digest=sha256:06386aea61317289a1b649c89dd4285e451fc529d1926fa0cbf6c2232f96b04b

Observation 6e460728-aeb0-42c6-b628-d7877ce4171a · outbound

This paper cites Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.087359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.087359Z digest=sha256:35395b405f5806a48890934f696468a0f7b6b9bc5d8d2feff4bf929aed2b5794

Observation 1c3b8cd5-0cd1-4746-8667-0f53affc4735 · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-11T05:32:05.811023Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T05:32:05.091033Z digest=sha256:984ef35539bd91e17be60dbdd34b876f62c491f0c04cc695a4729b59951901b9

Observation 10f51c8c-cbf8-4e23-b0af-e854b271ee2a · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.094613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.094613Z digest=sha256:37a55eb063f5048ed8c8c84e48ee946ec82678a232628909d0396428652e3524

Observation 087d3004-cef3-48f6-96e5-55305776a496 · outbound

This paper cites REFINER: Reasoning Feedback on Intermediate Representations.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning REFINER: Reasoning Feedback on Intermediate Representations

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.098268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.098268Z digest=sha256:779dca25c9b680482e8ee87bd36be369528b31e1fdc9516850ceca2fb16897cc

Observation c47a144d-ef43-4a36-b39b-70530ebf90d4 · outbound

This paper cites Recursive Introspection: Teaching Language Model Agents How to Self-Improve.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Recursive Introspection: Teaching Language Model Agents How to Self-Improve

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.102208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.102208Z digest=sha256:cca90fb110686d79ae2fd18ffaf20f2fe93ee79fd18237a25b39044e183bb848

Observation d6fe4b0d-cfa8-4917-ba07-97a6fb580142 · outbound

This paper cites D.; Ermon, S.; and Finn, C.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning D.; Ermon, S.; and Finn, C

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.106426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.106426Z digest=sha256:d1bf1457857db8585c3def09b159f1c720507f40f53fe7539fe07226ba23945f

Observation 590eabcc-daa2-4879-8a24-6f44dd336a21 · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-11T05:32:05.785053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T05:32:05.109858Z digest=sha256:d31fde2ca2f34543dca263673039078e07bccbe8edf66659b0e89cebc18bb68d

Observation 8f2afc7e-e1c1-42a0-adc0-1045b8ccbb5b · outbound

This paper cites Multi-turn Reinforcement Learning from Preference Human Feedback.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Multi-turn Reinforcement Learning from Preference Human Feedback

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.113680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.113680Z digest=sha256:9fb733eb095d20b2a0e105e32d2886d9184730d0e47dc34f7e8204fc9765fb4c

Observation fc4032c3-1d91-45f8-9527-a34ed4c73115 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.117598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.117598Z digest=sha256:ed3c1f6961e89e7aee4d1de4855525c4dc0c75db99606256c50a493e5d9f9f1f

Observation e2dd6853-cff5-4612-8f08-88757ad4fca9 · outbound

This paper cites Reflexion: Language Agents with Verbal Reinforcement Learning.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Reflexion: Language Agents with Verbal Reinforcement Learning

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.121465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.121465Z digest=sha256:91c0d263bad8cbf426b37af2e5add077a4e7d106eb7e9b745d67bc367dba7fcb

Observation fe3f1d92-ba3d-40d6-be20-3812083b914e · outbound

This paper cites Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.125316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.125316Z digest=sha256:f4e629022ea1e4fa6d9dfefcbced828403ce970fbc9dcd80e39dd3f56b45f67f

Observation d2f7f02e-3b18-485d-b1cd-f459a8631c03 · outbound

This paper cites Offline RL for Natural Language Generation with Implicit Language Q Learning.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Offline RL for Natural Language Generation with Implicit Language Q Learning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.128971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.128971Z digest=sha256:45eb9d848f4a5747967dce7d3ca5893174bbe3386452a0fc9438e3b7e61c8c8d

Observation 8a40f0ab-ea8f-4ca9-8c65-e908bf7b7388 · outbound

This paper cites DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.132531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.132531Z digest=sha256:8f29a773d0ecabd9c32f6abf1c96c16be2e3da39b5abd68935485b2859a053d5

Observation c4fd0710-afef-4a15-b087-da2858a9caff · outbound

This paper cites OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.140190Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.140190Z digest=sha256:56d1126201a2b5308c74213127714ee4f989a52e502a35fad20fc8da5b75e2a6

Observation 2aa358fe-ae80-4232-ac82-68d297a01d65 · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Solving math word problems with process- and outcome-based feedback

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.144130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.144130Z digest=sha256:3b4c7dcb129ba692611e94ab2289c3741b6aeb766209a07c688e4f3a5e578aff

Observation 174d3ed4-ae9a-4391-a886-334acd0be3ba · outbound

This paper cites Generating Sequences by Learning to Self-Correct.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Generating Sequences by Learning to Self-Correct

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.148451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.148451Z digest=sha256:8835b8bbf046709a04cb9a7b9ca0a4d3d7f6a8b4e39cb364c396316f7083c732

Observation f1af8582-daa7-4077-a3b8-63c3cd2b011f · outbound

This paper cites A.; Ostendorf, M.; and Hajishirzi, H.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning A.; Ostendorf, M.; and Hajishirzi, H

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:32:05.774600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-11T05:32:05.153337Z digest=sha256:0b143846f622599752b122f0dc07c5860713a2ea25ec4c03912aaa6d9d1da400

Observation 8af40692-2384-4830-b52c-7e7b4d258317 · outbound

This paper cites Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.157765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.157765Z digest=sha256:3b749a1b1247e22a98360a06dcf3fbbd882cf65115d02f24a37937a4285b694e

Observation 68b738bf-6638-44f4-8d49-efedbaff11b0 · outbound

This paper cites Self-Evaluation Guided Beam Search for Reasoning.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Self-Evaluation Guided Beam Search for Reasoning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.161940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.161940Z digest=sha256:9e01db0b98a9a3aba9d95ea056f1b8988244a3a42f0ef6f23e100fa78125df6f

Observation 87c2715b-ed7d-4e77-8b7e-84faff3d4faa · outbound

This paper cites Building Math Agents with Multi-Turn Iterative Preference Learning.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Building Math Agents with Multi-Turn Iterative Preference Learning

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.166120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.166120Z digest=sha256:c5aff8e90e7ed6865008fdd6e9a2eaeab3620b339567a50a3272d660d445cd98

Observation c7adbc43-b337-4f3d-98d4-cdbd1ffc4ac7 · outbound

This paper cites an unresolved cited work.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Unresolved cited work

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.170329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.170329Z digest=sha256:495bc80eddb64170c4d01906b90d58fd6050513e496d0c018d6bc7546791094b

Observation 5b01707f-56f0-460b-bddd-0eb8ccca49de · outbound

This paper cites MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.174422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.174422Z digest=sha256:7f36f80aa8b4ebd10b40fa6a26ec9d9d32876a883004229dca86ca07212204cb

Observation 1be35d6f-3f50-4936-88ef-3fd03c599e9a · outbound

This paper cites Small Language Models Need Strong Verifiers to Self-Correct Reasoning.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Small Language Models Need Strong Verifiers to Self-Correct Reasoning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.179010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.179010Z digest=sha256:ae702e2bb34e8d8c639625b6b5b62e27b41f0771d9a6aafb2fa015f4af3265e9

Observation 9c14088f-63e6-409b-82e9-e14c9c121d84 · outbound

This paper cites ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.183607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.183607Z digest=sha256:c592b7e09464d335b978ffb682753e66d9f18b90895206bd548f096b22dfc245

Observation eda91110-2467-45dd-8607-670cd82758d6 · outbound

This paper cites Solving Math Word Problems via Cooperative Reasoning induced Language Models.

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning Solving Math Word Problems via Cooperative Reasoning induced Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T05:32:05.187906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:32:05.187906Z digest=sha256:bedfc7bf8a56277572e05252c51d4f68f6ffb67e898517ddc310b2d8ee73b78f

Pith citing papers

Observation 20d65286-dcfe-4a98-bb6c-fa62cf15d1cf · inbound

From System 1 to System 2: A Survey of Reasoning Large Language Models cites this paper.

From System 1 to System 2: A Survey of Reasoning Large Language Models Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning

Reference 155

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:36:24.157579Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-13T01:36:23.845366Z digest=sha256:01165d4eba5ec6556adfaa291840aef8efe978991ddbd5eb8f8631fc48d4840a