Pith. sign in

Paper Citation Record · LEDGER

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning

As of 7 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2508.04848.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.04848 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T23:49:05.708180Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-11T01:49:15.136031Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T16:01:22.618150Z

Reference resolution

21 of 21 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch3

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4cd5b0c6-2b61-4a8b-802e-9cd4f7868183 · outbound

This paper cites Evaluating LLMs and Prompting Strategies for Automated Hardware Diagnosis from Textual User-Reports.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Evaluating LLMs and Prompting Strategies for Automated Hardware Diagnosis from Textual User-Reports

Reference 2

Resolution
metadata mismatch
local_arxiv, observed 2026-08-05T23:49:07.511703Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T23:49:02.285130Z digest=sha256:016c8265b2cadef0425210be8d12b745f7200bccfe442f013826e96f1d2c2e17

Observation 26e2ce09-01a4-4690-ac40-280bd2d77a25 · outbound

This paper cites an unresolved cited work.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-05T23:49:07.820130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T23:49:02.550966Z digest=sha256:650197dd27359a2b87f97ad023d9b07efedd1c724dc76c72f626056d60bd52f7

Observation 3a6443b6-1c35-4fb7-a39b-93fcaba8ab0b · outbound

This paper cites arXiv preprint arXiv:2503.12434.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning arXiv preprint arXiv:2503.12434

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:02.715209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:02.715209Z digest=sha256:6c782ae1569c52012fc75fdbe757d47a53f93484aa064f0fb28c25361b25ef5c

Observation cc53431a-943a-4af7-afb6-ffb268577a7a · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:02.929694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:02.929694Z digest=sha256:e4be82e68bfbc12efa0777091ce5089038d6bd74d0b5f85a9b88a1042306e01e

Observation eed7fb36-b81f-4e42-afde-45576bac2ccc · outbound

This paper cites VinePPO: Refining Credit Assignment in RL Training of LLMs.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning VinePPO: Refining Credit Assignment in RL Training of LLMs

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:03.216906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:03.216906Z digest=sha256:579d8d9681f5b30f4c4cb1425e27da5e5b2cff46fafcdd9eb384f14825a852ec

Observation c089ee1b-f9ea-4421-8d1d-ce90170f4779 · outbound

This paper cites LLM Post-Training: A Deep Dive into Reasoning Large Language Models.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning LLM Post-Training: A Deep Dive into Reasoning Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:03.474747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:03.474747Z digest=sha256:c666d298ddca45f5433e5074b0fbfa07fc4dbb1d4fe9f5401c8b48583e3fe079

Observation 5069f2cf-b853-4e39-a927-395baf2b1c31 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:04.041085Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:04.041085Z digest=sha256:9d34a5c270bc8a04cdf191fe5444691231154a0efc705924032bf6f73456f495

Observation 2a099c1a-ee77-4545-bebb-118df17d7438 · outbound

This paper cites Using Causality for Enhanced Prediction of Web Traffic Time Series.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Using Causality for Enhanced Prediction of Web Traffic Time Series

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-08-05T23:49:06.723730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T23:49:04.374494Z digest=sha256:11ca8b986ac9a3fd66c6a7b4244ca7515431ec56b6034e40496c136493e6fb8c

Observation 9453a80a-4f89-45ac-adb3-85b33cfdf8d6 · outbound

This paper cites What is the Alignment Objective of GRPO?.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning What is the Alignment Objective of GRPO?

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:04.813342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:04.813342Z digest=sha256:35a644e8172f52972c1ae91a72e774e8b3dc75e44af0205218ee8b84afe46531

Observation da8eb2be-757c-408d-9572-55982b3900b1 · outbound

This paper cites Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:05.025670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:05.025670Z digest=sha256:c34407c7291ed6499626263376267e95d51f198f860d4de7eb60636f9eb0d7a0

Observation 4dd15b6d-ed00-430b-b9bf-739dc07bb09e · outbound

This paper cites Training Large Language Models to Reason via EM Policy Gradient.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Training Large Language Models to Reason via EM Policy Gradient

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:05.199743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:05.199743Z digest=sha256:562cd2ca59937fdd72a82ad8bdf2a4d4e427658cfc4eef838ca81db09c8c8183

Observation b51dbaea-cabf-458e-bd33-21a885642e6d · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:05.395955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:05.395955Z digest=sha256:3c6f28c705578659386fb9a7a524bbf98c250b0d45ab816cd37aa89a168288f3

Observation 8197227e-d83e-46e8-b5bb-5485649366a8 · outbound

This paper cites arXiv preprint arXiv:2505.17508.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning arXiv preprint arXiv:2505.17508

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:05.541952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:05.541952Z digest=sha256:219e26fded2b29b2315e5b1b21a8b5befbfbaa5e31361e207f5cfa71f4416c56

Observation 8a413b4d-c7e9-4a91-b607-8b6cf0a66171 · outbound

This paper cites Monte Carlo Tree Search for Comprehensive Exploration in LLM-Based Automatic Heuristic Design.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Monte Carlo Tree Search for Comprehensive Exploration in LLM-Based Automatic Heuristic Design

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:05.708180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:05.708180Z digest=sha256:b1cf5a7ee06039b62226adc99fb016c14c037974521ddbdb7c6a35e0c8ab7431

Observation c5a07c9f-a069-4938-9dbe-c3d61df449e2 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Proximal Policy Optimization Algorithms

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:03.820612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:03.820612Z digest=sha256:51bd84e5ad504f56d173758de0d2f3eb1ad8905ccb85bc1c0015f4eea0bdac3c

Observation e9fbee50-7381-4d9e-9880-7e86a8620486 · outbound

This paper cites A Generic Method for Fine-grained Category Discovery in Natural Language Texts.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning A Generic Method for Fine-grained Category Discovery in Natural Language Texts

Reference 2019

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:49:07.013350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T23:49:04.213823Z digest=sha256:f70940297cc942b1e325d0ddf2c874f8cc05e954af28cc7099bafd86dd653d1e

Observation 10b799cd-fa19-409b-8e5e-13ff2688b4a9 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Measuring Massive Multitask Language Understanding

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:03.062950Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:03.062950Z digest=sha256:ae9f5c0c34420de324017350ef1ef52de7110f371e765917175bd2e2f4579e0d

Observation 9fdfde4a-26c7-4548-9b83-561e8375ee4e · outbound

This paper cites Paint4Poem: A Dataset for Artistic Visualization of Classical Chinese Poems.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Paint4Poem: A Dataset for Artistic Visualization of Classical Chinese Poems

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:03.658162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:03.658162Z digest=sha256:8ae94997efba055b890df00d4204fc5f01f4df56dbd9fdb28a8977215f835faa

Observation f8585f12-a48c-4d6d-b420-834437982951 · outbound

This paper cites Anti-Overestimation Dialogue Policy Learning for Task-Completion Dialogue System.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Anti-Overestimation Dialogue Policy Learning for Task-Completion Dialogue System

Reference 2022

Resolution
metadata mismatch
local_arxiv, observed 2026-08-05T23:49:06.307243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T23:49:04.536418Z digest=sha256:450347988e697320c12360d841f693abae8df9d86dd08da23ec45ba5ab436017

Observation 22c06452-16ca-4c32-b0ab-d55ec42d5471 · outbound

This paper cites Meta-Models: An Architecture for Decoding LLM Behaviors Through Interpreted Embeddings and Natural Language.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Meta-Models: An Architecture for Decoding LLM Behaviors Through Interpreted Embeddings and Natural Language

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:02.409134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:02.409134Z digest=sha256:ac799fcef3a9624f2bdc690173bf58fd5b932005d589e6973b3088281d5b34c5

Observation 6c9329a9-57f5-468f-aeec-0c66a4b91d01 · outbound

This paper cites Qwen2.5-VL Technical Report.

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning Qwen2.5-VL Technical Report

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T23:49:02.173108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:49:02.173108Z digest=sha256:d66157f9864c744ff296d48475354ee330367ca3ab4db569c84c7b43dd35e8c2

Pith citing papers

Observation b426df3d-129f-4e23-a706-9cb26d330ce0 · inbound

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs cites this paper.

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning

Reference 67

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:01:22.621931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-09T18:53:06.494640Z digest=sha256:6527f06fda8dd43b653c1f8cc097b1f78bdb2748910cf51260422d2cf19c7606

Observation b60805a6-808a-4981-b738-8bea31069308 · inbound

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs cites this paper.

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning

Reference 67

Resolution
verified exact
arxiv_id, observed 2026-05-11T01:50:51.662264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-11T01:49:15.136031Z digest=sha256:a7e0332a2c277dc3b42344d4f8e63dbbf0dbda8e4cd1774330487d20d1f349a2