Pith. sign in

Paper Citation Record · LEDGER

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning

As of 13 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.08158.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.08158 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T00:30:33.438380Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

21 of 21 outbound references displayed

  • verified exact8
  • verified fuzzy0
  • unresolved9
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch3

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 784c819c-c7f1-450e-ab28-661003ee0b00 · outbound

This paper cites Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al

Reference 10

Resolution
verified exact
raw_fallback, observed 2026-08-12T00:30:34.194365Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.348443Z digest=sha256:6b241ef33876ecf4ef4f3f0cbd6ae3e3d8c0af8dbdd7453ab091d0baf00279a7

Observation 621c1931-3a5a-4522-b387-072f2ac0beea · outbound

This paper cites Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang, Yingfeng Chen, Jianye Hao, Feng Wu, and Changjie Fan.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang, Yingfeng Chen, Jianye Hao, Feng Wu, and Changjie Fan

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.380419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.380419Z digest=sha256:8b90261af2dfa623a89498c2c7f2a0760a7164c11a3a5fad34e0b4fdbb4edb19

Observation 7def0c9b-206f-4f04-bbc5-6b2628a79826 · outbound

This paper cites Adaptive Reward Design for Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Adaptive Reward Design for Reinforcement Learning

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.983121Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.390291Z digest=sha256:63c09ec7750ed16aa624c1f41f2b54ee474ced661eb0524d0eeb26ad50c12273

Observation b7ba16a5-905d-445e-8ee6-73f009a8f600 · outbound

This paper cites Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.920720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.405381Z digest=sha256:dae20883bf66c454dc6b7643e77c419dd3e48231af0c43678dee12e615204b17

Observation 0959321e-ffc7-4aa6-a979-88646145f898 · outbound

This paper cites Automating Potential-based Reward Shaping with Vision Language Model Guidance.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Automating Potential-based Reward Shaping with Vision Language Model Guidance

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.897433Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.412241Z digest=sha256:622e32c670632101c29ed2846cabd786bf120e53a11f59f4ef42d717b0dc9cc9

Observation 579c68f3-b3bb-4799-9081-306ad7477257 · outbound

This paper cites Offline Reinforcement Learning with Imputed Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Offline Reinforcement Learning with Imputed Rewards

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.805757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.423517Z digest=sha256:86ec640313bf0d7805dd5898aea8ea4d31a8a1b1372ef71159ada3c4ef9d48f9

Observation d28876a2-e138-4536-9f91-996396d4226d · outbound

This paper cites Training Language Models with Language Feedback.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Training Language Models with Language Feedback

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.428381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.428381Z digest=sha256:768a5371be44fa7f5b3b811ec417446b7f2f058728ebcf3aa0189b9eda3a48af

Observation e543a49e-7729-41aa-b6ff-7b9baa04723d · outbound

This paper cites Richard S.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Richard S

Reference 20

Resolution
metadata mismatch
raw_fallback, observed 2026-08-12T00:30:33.765031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.433432Z digest=sha256:735d64495253bc40d42954219898a46285a6411e845c7317e05c60476416c37f

Observation e4585cba-288c-442f-b3ed-abab54946091 · outbound

This paper cites Preprint: arXiv:2503.15724.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Preprint: arXiv:2503.15724

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.438380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.438380Z digest=sha256:5880fe2686b16bab90af1df316acb27b23dfa64eac8028690256451a0410e0cb

Observation 0ac6bbba-f328-4760-b7dc-0a49d7ae0571 · outbound

This paper cites SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning

Reference 2003

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:33.959833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.395422Z digest=sha256:ac5340df5fa19346da642da6219cf3fe12237294c5f741c699f97e29ea0784f4

Observation 12c4f907-4d91-4413-a2da-1075344c9f3c · outbound

This paper cites Concrete Problems in AI Safety.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Concrete Problems in AI Safety

Reference 2004

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.337729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.337729Z digest=sha256:2449f5d5479c047c5ca972fc3a7f0b08fb9a7c93d7be39ec7332c4fbb37ef21b

Observation 06a4be0d-ce7c-44bc-8c1e-b0e5d628c28c · outbound

This paper cites Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity

Reference 2010

Resolution
metadata mismatch
local_arxiv, observed 2026-08-12T00:30:34.023186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.374603Z digest=sha256:60a556c5ca2bd9df176c393a7b13b8d1217601679c2891dab959c1eef9d74284

Observation 4e5647f9-ed4c-4576-a22c-724cd380c882 · outbound

This paper cites Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning

Reference 2016

Resolution
verified exact
local_arxiv, observed 2026-08-12T00:30:34.061337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.364295Z digest=sha256:8cdee3665c08a32e2b3288da92836fffa3afb62f1a1465460a09c38bd44698ca

Observation fccf0884-caea-4685-8570-debabaf3e1fa · outbound

This paper cites Vision-Language Models as a Source of Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Vision-Language Models as a Source of Rewards

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.353399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.353399Z digest=sha256:071faa5740ca08cd6525ca0376404a3cb8c8758300be0b8693434b3852538f59

Observation a9156aeb-e0e3-4b49-9afb-f427b7132c33 · outbound

This paper cites Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.369554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.369554Z digest=sha256:aad954371541cc9591d93ebb385e0936a6a8969549512c2e35a9814ccc24d8a4

Observation 7cd305ff-1310-4359-90b9-744a94f37100 · outbound

This paper cites Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.385098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.385098Z digest=sha256:1c45ea8fdd968f651d7b1e63192518dd043a2f829228f5f371dd9ccf317067d7

Observation 53f5622c-5e08-43f4-855e-6d73c66e15bc · outbound

This paper cites Preprint: arXiv:2104.06411.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Preprint: arXiv:2104.06411

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.418659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.418659Z digest=sha256:39a3b5bc5c83ad2bb535cb10b22985711f3fb13f9729351afc337d932b0db123

Observation 8d706fa9-bb33-4e1c-881f-420315478d9e · outbound

This paper cites 2022.1027340.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning 2022.1027340

Reference 2022

Resolution
malformed identifier
no resolver link, observed 2026-08-12T00:30:33.343177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.343177Z digest=sha256:60e4b2d443ac18ef2e6f2bfe1b7faca27d763a42024d6e7c8ad5c0829aba2957

Observation dfafb29f-ee29-4220-a9a3-2eca840c1fcf · outbound

This paper cites InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-12T00:30:33.400576Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T00:30:33.400576Z digest=sha256:af09234f4bf8fd93b99cb2d87b7b645b1bbc7424d8823a6a195ecd2061c7265c

Observation eb2dda5a-b769-4883-9785-8232e37977b4 · outbound

This paper cites Useful Policy Invariant Shaping from Arbitrary Advice.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning Useful Policy Invariant Shaping from Arbitrary Advice

Reference 2024

Resolution
metadata mismatch
local_arxiv, observed 2026-08-12T00:30:34.083387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.358818Z digest=sha256:6b17bc80f1689d537a10ba2f6bd3ee6231dbeda4dcdf0df4ed0ee84ad38cee6e

Observation 59c866d2-a085-43a9-be54-9e9d869c7020 · outbound

This paper cites AdrianK.AgoginoandKaganTumer.

A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning AdrianK.AgoginoandKaganTumer

Reference 2025

Resolution
verified exact
doi, observed 2026-08-12T00:30:33.487245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-12T00:30:33.332256Z digest=sha256:97b9c8a096f59deca209bc58b3dd358feec6e708e113e700530d24017b1366f5

Pith citing papers

No inbound Pith citation observations are available.