Pith. sign in

Paper Citation Record · LEDGER

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL

As of 15 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 1 inbound Pith citation observation for arXiv:2605.28918.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.28918 v1

Coverage vector

measured 9 of 9 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-29T14:11:47.856066Z

measured 10 of 10 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-09T03:36:57.168246Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-09T03:45:55.318261Z

Reference resolution

9 of 9 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved9
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5e96102c-7d33-4607-8a60-2bd0c820096c · outbound

This paper cites an unresolved cited work.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:31121ed4b279fe28228aeaf8ae38e6295aa04f8df85012defb0d27d028aaa3a8

Observation cefbb69f-18e9-441e-983d-e887e732a203 · outbound

This paper cites an unresolved cited work.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:7a70f533d918f22dccc5887db164552e725e12381ad425d1d7982801dee29d87

Observation 1b8e9f04-052e-459b-847a-02d98514e5d3 · outbound

This paper cites an unresolved cited work.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:4b1f24c6074bee81dd15bb69a390bfc63158146d884c53292ffa90e0b360e4e9

Observation adfaf0e3-8a5c-4f29-bf1c-466cefd7394e · outbound

This paper cites e v e n t _ t e x t.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL e v e n t _ t e x t

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:eab0d7f8fb8f5d9e40011e9bbb402839345bc8179ae20f6f72a5ca21f5a997cb

Observation 70ecff3d-07d9-4f2c-a88d-566996804a0b · outbound

This paper cites an unresolved cited work.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL Unresolved cited work

Reference 5

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:5b2597d64375a73f962c6ecb53e079a440a73e4fa1a5d078f2e68cfda84a6df0

Observation 0e55c6d5-044a-4a97-9da0-7e8180ba09ce · outbound

This paper cites Self - c o n t a i n e d f unc ti on.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL Self - c o n t a i n e d f unc ti on

Reference 6

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:6d2c8ac94ce4a0f167d4d2878caca23650d4d8193d0d1600d354bcd002016847

Observation e43ae9c8-bcfc-4ef6-ac08-19a2ef329972 · outbound

This paper cites an unresolved cited work.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:417c3624fdb359557dc010effe4685569380d65d40491b623a13b0fd18854ddf

Observation 1c4a1080-33f6-4225-9bf9-791786cd2b92 · outbound

This paper cites an unresolved cited work.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL Unresolved cited work

Reference 8

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:58b7ebbf3e2cfedf04debc064e7478008c2bdf3a2e9c859cb82783b1f55b6417

Observation 205b4f62-bba6-4e64-8272-216f380bf1f7 · outbound

This paper cites k e y _ p i c k e d _ u p.

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL k e y _ p i c k e d _ u p

Reference 9

Resolution
unresolved
no resolver link, observed 2026-06-29T14:11:47.856066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T14:11:47.856066Z digest=sha256:7d9ddfdf1a80610e553c582ab1394bc55a902734d8090a2fef1872cf1ef28f37

Pith citing papers

Observation 182584ca-5e46-426e-a268-0f8f0e5f71e9 · inbound

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops cites this paper.

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL

Reference 96

Resolution
verified exact
local_arxiv, observed 2026-07-09T03:45:55.320802Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-09T03:36:57.168246Z digest=sha256:94d5ec95a2e4e9cbef7e9f12c197d253d50437cffc764e16ea79f38513837b59