Pith. sign in

Paper Citation Record · LEDGER

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning

As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.07492.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.07492 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-11T11:50:26.030339Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact20
  • verified fuzzy0
  • unresolved1
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch10

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 04efd97e-4c87-4693-b3da-09fefec4eec1 · outbound

This paper cites When is tree search useful for LLM planning? it depends on the discriminator.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning When is tree search useful for LLM planning? it depends on the discriminator

Reference 1

Resolution
verified exact
doi, observed 2026-07-09T09:26:08.766551Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:a5ece5763637994de26b58d8c51a43b58e8f3828903de2dd44b1bbe7bb44ab8d

Observation a16fe72f-3fb7-4006-8bab-092a40233808 · outbound

This paper cites CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.785673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:7a079f3b2f4ed9961823dfdd577ad8a92bb4924d7f8b332a5e67d914ff935ac0

Observation 528fae0e-a982-4944-9f53-70f1a8d68583 · outbound

This paper cites Stream of Search (SoS): Learning to Search in Language.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Stream of Search (SoS): Learning to Search in Language

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.687243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:cdd77f257ebaf9841ad3e2b136939e173f5ad6966e148dffacfff36d2b8694aa

Observation 8c2bb982-28d4-484d-a387-3f1bb133d009 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 4

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.719227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-11T11:50:26.030339Z digest=sha256:a9defe2d225194933a1a9a0bfb94efcac373cceec7235e08c5373b311d4efb86

Observation 712ec4db-f69d-44e6-b7b8-23d371193dda · outbound

This paper cites Reasoning with language model is planning with world model.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Reasoning with language model is planning with world model

Reference 5

Resolution
verified exact
doi, observed 2026-07-09T09:26:08.704694Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:f1916476d7d2d4515af0a55f854b7fb83e25e543d994da9db9f0d9fa4475e642

Observation 39ec3e35-f6c6-4910-8042-1819539f62d3 · outbound

This paper cites Large Language Models Cannot Self-Correct Reasoning Yet.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Large Language Models Cannot Self-Correct Reasoning Yet

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.758906Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:79f4c1fcab4878a8815b1f4fa01f5e403822c8a3f1790cabc34090255dcd1f17

Observation f633b95b-6d56-452b-bbda-536be2d83a10 · outbound

This paper cites When can LLMs actually correct their own mistakes? A critical survey of self-correction of LLMs.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning When can LLMs actually correct their own mistakes? A critical survey of self-correction of LLMs

Reference 7

Resolution
verified exact
doi, observed 2026-07-09T09:26:08.781721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:40b49d2e067ffcca6a0c4862b528c3cf9eee3371a7339871ad0a8a3901999b98

Observation 28e80778-acf0-44fc-8fb5-1a0dab638af4 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.725748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:913e79bffda9e986dad4686f31c6c83ca0a0fed47d7ae5c79f44368bdde41001

Observation 5e4dd129-b271-4f5a-907d-f1278642043e · outbound

This paper cites Training Language Models to Self-Correct via Reinforcement Learning.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Training Language Models to Self-Correct via Reinforcement Learning

Reference 9

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.745714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:9d240b5673049b876c122a42c96827423c775012b248f4b69586dc211d046121

Observation e6f72bb4-d634-4582-b432-7cf52f4f9d92 · outbound

This paper cites Beyond A*: Better Planning with Transformers via Search Dynamics Bootstrapping.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Beyond A*: Better Planning with Transformers via Search Dynamics Bootstrapping

Reference 10

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.773805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:2b561373a5913567c293eda0411903d969bb7fa790228c6515c3d904b74b7364

Observation f3afc76f-deaf-4123-898a-688eec3811dd · outbound

This paper cites Self-Refine: Iterative Refinement with Self-Feedback.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Self-Refine: Iterative Refinement with Self-Feedback

Reference 11

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.701903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:83e1d3af2b242e4cd0119adce1fda1bec14c633b35f64ba4f343e4069f0d1da2

Observation b1eb2a18-cfed-4797-8be5-27b3bd8b044f · outbound

This paper cites Recursive Introspection: Teaching Language Model Agents How to Self-Improve.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Recursive Introspection: Teaching Language Model Agents How to Self-Improve

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.739496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:6392db6b5f25c95aa8238ee6646d8613e9ce538692457b1db62b0381781040a3

Observation febfa471-d05b-48ab-abe9-dd8d53fcd2fa · outbound

This paper cites Qin, T., Alvarez-Melis, D., Jelassi, S., and Malach, E.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Qin, T., Alvarez-Melis, D., Jelassi, S., and Malach, E

Reference 13

Resolution
metadata mismatch
arxiv_id, observed 2026-07-09T09:26:08.712699Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:c9df951dbba07dbb8dc831c6ddebc51a4094ea694ad3c0ec96b8b8b7c444082d

Observation 07f73784-95e0-4cbd-8408-e75d5948032c · outbound

This paper cites Spurious Rewards: Rethinking Training Signals in RLVR.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Spurious Rewards: Rethinking Training Signals in RLVR

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.755245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:d95140335de983d58719b9b40f1302994ac58071d1e15a8385836612ecae22ea

Observation 98b87332-a28c-4333-8ba7-ddb08456fe8f · outbound

This paper cites From Reasoning to Super-Intelligence: A Search-Theoretic Perspective.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning From Reasoning to Super-Intelligence: A Search-Theoretic Perspective

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.691022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:8dfb528428edbd0250e27c3476496fbfd57ab3d25e0c831772349deef0d0a81a

Observation f3adb9db-3608-400c-8937-ba8c2c1783d1 · outbound

This paper cites Reflexion: Language Agents with Verbal Reinforcement Learning.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Reflexion: Language Agents with Verbal Reinforcement Learning

Reference 16

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.722253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:fb391afcfbee660ee924fd953b6b44c020378d41515c1613b01c443dfecc597f

Observation f8a8195d-db19-4b5c-977a-b3aa8e89fe20 · outbound

This paper cites Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Dualformer: Controllable Fast and Slow Thinking by Learning with Randomized Reasoning Traces

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.742525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:27db210f81de56d45e0329d0598b63a1c44490c3f91346dfdd723f5ebe4a7abb

Observation a8d8d45b-d57b-4936-ad1d-e84a32ad4dce · outbound

This paper cites Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing

Reference 18

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.777500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:652ca9dfb8212c7a190dd1e941d26b445362f6dfdbd1568463038124892dc031

Observation 99e4dd5d-e16b-42c9-b22a-a741252bfbe9 · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.736301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:71cfd5e601d15855491682f2efb13393c95657aebc806f276033fd3c81f842e0

Observation 8ec762a6-6cd1-4d8f-869c-aa544ee39612 · outbound

This paper cites Step Back to Leap Forward: Self-Backtracking for Boosting Reasoning of Language Models.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Step Back to Leap Forward: Self-Backtracking for Boosting Reasoning of Language Models

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.732361Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:e058b84efb8a8ba2d40d2b79528fe156450a66718ead0e507a5b5c9dd2ad0672

Observation 4f060ae9-68da-414f-b53b-e3e3177154f7 · outbound

This paper cites Tree of Thoughts: Deliberate Problem Solving with Large Language Models.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Tree of Thoughts: Deliberate Problem Solving with Large Language Models

Reference 21

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.770187Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:ae5e77b6388bbf1eb2916c56259dc96d4cb2f2ac3275645f790141138309d2ea

Observation ffb1fdfd-b29b-429a-a97f-2cfa26290d4c · outbound

This paper cites Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.698382Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:a65801e1507cbc85664ebd29a931692f2f895e26016405677caaa1a85443449f

Observation 3260f571-67dd-4554-845e-87cabc304fec · outbound

This paper cites How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.683519Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:2ed0d3bae080f5e01142923e14411810926e81caacdd2b61e75aa6ac5114bc34

Observation 1df115b3-2ae8-47a6-b2a7-1af672e9dc49 · outbound

This paper cites ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.708526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:bcfd621e1341cd5279080c1c68e0e5b35f3293fd39f4d7983b54550ecb9035d9

Observation 29b89142-652b-45e5-aa93-9bb432f2a561 · outbound

This paper cites Beyond markovian: Reflective exploration via bayes-adaptive rl for llm reasoning.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Beyond markovian: Reflective exploration via bayes-adaptive rl for llm reasoning

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-09T09:26:08.752027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:58b8a3b66380325a9ee9885e66a269f9615f85fbb14f1bf727833325d5e1e2ff

Observation c9fc3acb-9ac7-484e-abf1-17309c514171 · outbound

This paper cites SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training

Reference 26

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T09:26:08.729345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:2cca1ca45c8dbc0d4d5b731b5b331075c1aecabd505a838cf1596cd6cac3dad1

Observation e020ec10-504d-4913-a94c-091ce6bde7df · outbound

This paper cites Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.716011Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:a13f34ff8af3a4c4c773a8d57f8822b8ef61a9a587d3554e0a7269b2d5c7084f

Observation 5d6a6729-a5ca-414c-aa49-15f52a989fe1 · outbound

This paper cites PlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning and Reasoning about Change.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning PlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning and Reasoning about Change

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.694841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:1a148ab52c9f620e3aca7d4b78c0b19aa28a0854c2e875afafacf3912909f96c

Observation 5f69c0ca-ffff-49a8-bb4b-8aa467a6eecb · outbound

This paper cites LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-07-09T09:26:08.762874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:109f15eb57ee6539e05ce83e47bad5d31c2107199c6731c961ac4a33c692bb6f

Observation 9f1d35d0-ab26-4ac4-8d09-224773124057 · outbound

This paper cites an unresolved cited work.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-07-09T09:26:09.353823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:441f9686db7755df42e7c4f35a54f3a00e852a894dbec809d4fa4b0e16036d69

Observation e9d07a35-be41-449c-85cd-8224346feb51 · outbound

This paper cites Proceedings of the 16th.

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning Proceedings of the 16th

Reference 32

Resolution
verified exact
doi, observed 2026-07-09T09:26:08.747988Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-09T09:20:08.212837Z digest=sha256:1772b57d8c96aee6cb2dff5b06f393ba973368effc55c7fc8a45449b9a5d6dea

Pith citing papers

No inbound Pith citation observations are available.