Pith. sign in

Paper Citation Record · LEDGER

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning

As of 13 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.08158.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.08158 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T00:30:33.438380Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

21 of 21 outbound references displayed

  • verified exact8
  • verified fuzzy0
  • unresolved9
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch3

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 784c819c-c7f1-450e-ab28-661003ee0b00 · outbound

This paper cites Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al

Reference 10

Resolution
verified exact
raw_fallback, observed 2026-08-12T00:30:34.194365Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.348443Z digest=sha256:8d692ed0f23a7a1f45aedaf44ff945337b41b3ff0a10f50aa54f13ee6c7b12f3

Observation 621c1931-3a5a-4522-b387-072f2ac0beea · outbound

This paper cites Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang, Yingfeng Chen, Jianye Hao, Feng Wu, and Changjie Fan.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang, Yingfeng Chen, Jianye Hao, Feng Wu, and Changjie Fan

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.380419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.380419Z digest=sha256:985c2b7af4673eabfe382a23ce39dab727e5ddc962e31bfb664d057393532bfc

Observation 7def0c9b-206f-4f04-bbc5-6b2628a79826 · outbound

This paper cites Adaptive Reward Design for Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Adaptive Reward Design for Reinforcement Learning

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.983121Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.390291Z digest=sha256:6ec1215821218b6fbb68789e268ce218cb9a2158ccd59e0608680ab161240063

Observation b7ba16a5-905d-445e-8ee6-73f009a8f600 · outbound

This paper cites Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.920720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.405381Z digest=sha256:dfa64bfafbcc757b40d7f52f8a70ba21bfeded2263c703b930db45a442138ece

Observation 0959321e-ffc7-4aa6-a979-88646145f898 · outbound

This paper cites Automating Potential-based Reward Shaping with Vision Language Model Guidance.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Automating Potential-based Reward Shaping with Vision Language Model Guidance

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.897433Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.412241Z digest=sha256:152f4f09fb7b96a7f985a0d78edc80c840c5edf348eb23ecf32195b7742395ec

Observation 579c68f3-b3bb-4799-9081-306ad7477257 · outbound

This paper cites Offline Reinforcement Learning with Imputed Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Offline Reinforcement Learning with Imputed Rewards

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.805757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.423517Z digest=sha256:3f96aada800ba7ed28c624cbb7572aa2808f2362b5f2076e78de9a963978e833

Observation d28876a2-e138-4536-9f91-996396d4226d · outbound

This paper cites Training Language Models with Language Feedback.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Training Language Models with Language Feedback

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.428381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.428381Z digest=sha256:723a9e67589a6c42bb109f1c72c5eb6312ead61b4640489cdc5acd5d2ef86222

Observation e543a49e-7729-41aa-b6ff-7b9baa04723d · outbound

This paper cites Richard S.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Richard S

Reference 20

Resolution
metadata mismatch
raw_fallback, observed 2026-08-12T00:30:33.765031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.433432Z digest=sha256:bb7b14e1ffcd3376744df4f5feb61e4cf6eb99e513310def33a8c1a64a15c474

Observation e4585cba-288c-442f-b3ed-abab54946091 · outbound

This paper cites Preprint: arXiv:2503.15724.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Preprint: arXiv:2503.15724

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.438380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.438380Z digest=sha256:e60f25be774f47459b817d552f1b7493a4af76f6e1efffe0fdc1ab1f74e87c10

Observation 0ac6bbba-f328-4760-b7dc-0a49d7ae0571 · outbound

This paper cites SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning

Reference 2003

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.959833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.395422Z digest=sha256:23711fa7436880b34d183c7fba589f9e33b37f04366c34df2d9f73f8d7ccfa30

Observation 12c4f907-4d91-4413-a2da-1075344c9f3c · outbound

This paper cites Concrete Problems in AI Safety.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Concrete Problems in AI Safety

Reference 2004

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.337729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.337729Z digest=sha256:87cd5335669b34cba2b9c9a156aa06233fc2fd6fb5b758f7db9a138efbe6e224

Observation 06a4be0d-ce7c-44bc-8c1e-b0e5d628c28c · outbound

This paper cites Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity

Reference 2010

Resolution
metadata mismatch
local_arxiv, observed 2026-08-12T00:30:34.023186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.374603Z digest=sha256:6b79a8db9a69546ceff94bd117afd7af93435bceb6e9333841b3cd455992e016

Observation 4e5647f9-ed4c-4576-a22c-724cd380c882 · outbound

This paper cites Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning

Reference 2016

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:34.061337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.364295Z digest=sha256:35b9091daf40b65299342a13296c77a4ae8c43e7be85984a67f35141e7e8527a

Observation fccf0884-caea-4685-8570-debabaf3e1fa · outbound

This paper cites Vision-Language Models as a Source of Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Vision-Language Models as a Source of Rewards

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.353399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.353399Z digest=sha256:11fdf681ad881dd8c862b48f812e221fd01189e225ff9cbd8edec66e226245e9

Observation a9156aeb-e0e3-4b49-9afb-f427b7132c33 · outbound

This paper cites Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.369554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.369554Z digest=sha256:1808b2e3509a469d5249b85173408851ace1e512f53bb737b16d8cfe1d9f62d0

Observation 7cd305ff-1310-4359-90b9-744a94f37100 · outbound

This paper cites Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.385098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.385098Z digest=sha256:f2462f5eaefceb5756f42f777d4e50efbc0f20a67bc60e6f697b6e0f59a03532

Observation 53f5622c-5e08-43f4-855e-6d73c66e15bc · outbound

This paper cites Preprint: arXiv:2104.06411.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Preprint: arXiv:2104.06411

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.418659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.418659Z digest=sha256:79ed420f79b72014670d1e7a549918f6150e293732dc1f2afd2ceb69631f1a08

Observation 8d706fa9-bb33-4e1c-881f-420315478d9e · outbound

This paper cites 2022.1027340.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning 2022.1027340

Reference 2022

Resolution
malformed identifier
no resolver link, observed 2026-08-12T00:30:33.343177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.343177Z digest=sha256:4d43c430501b876d6193034d4ef81421820558a9b4c593d0f935ef692685c750

Observation dfafb29f-ee29-4220-a9a3-2eca840c1fcf · outbound

This paper cites InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.400576Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.400576Z digest=sha256:794ad79b8ac37b289f14c1637eaed6d8b2ab2bf03dce7bd82f64603d180837ee

Observation eb2dda5a-b769-4883-9785-8232e37977b4 · outbound

This paper cites Useful Policy Invariant Shaping from Arbitrary Advice.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Useful Policy Invariant Shaping from Arbitrary Advice

Reference 2024

Resolution
metadata mismatch
local_arxiv, observed 2026-08-12T00:30:34.083387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.358818Z digest=sha256:fa93783070ba437406815f878bb284c6a4b1b943e58d47a39c6ee49ef36da086

Observation 59c866d2-a085-43a9-be54-9e9d869c7020 · outbound

This paper cites AdrianK.AgoginoandKaganTumer.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning AdrianK.AgoginoandKaganTumer

Reference 2025

Resolution
verified exact
doi, observed 2026-08-12T00:30:33.487245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.332256Z digest=sha256:5dc8d825a7242bbf979162b22397291d80e77a923ad0af6ca911931e695dd6b3

Pith citing papers

No inbound Pith citation observations are available.