{"as_of":"2026-08-13T07:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:adec1601b2f7cd186d27ace34fb3cbe1e9cd12eb3e0e4428ca6e4d58573903ff","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:30:33.438380Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08158/citation-record","integrity":"/paper/2608.08158/integrity","json":"/paper/2608.08158/citation-record.json","paper":"/paper/2608.08158"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8477.2023","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:34.186463Z","title":"Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al","venue":null,"work_id":"4f869fbf-3da6-42dc-8baf-d78d88292b03","year":2023},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.348443Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:5d0df63d0f7cf0d50bac55d2df545d2b04a309190d90a4128c634ec292ec52f3","observation_id":"784c819c-c7f1-450e-ab28-661003ee0b00","resolution":{"observed_at":"2026-08-12T00:30:34.194365Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.380419Z","title":"Yujing Hu, Weixun Wang, Hangtian Jia, Yixiang Wang, Yingfeng Chen, Jianye Hao, Feng Wu, and Changjie Fan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.380419Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:24d45d805ed31d048655918918a9441b546f38dbb269c154828d955c10aa911e","observation_id":"621c1931-3a5a-4522-b387-072f2ac0beea","resolution":{"observed_at":"2026-08-12T00:30:33.380419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2412.10917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10917","snapshot_observed_at":"2026-08-12T00:30:33.977487Z","title":"Adaptive Reward Design for Reinforcement Learning","venue":"cs.RO","work_id":"1fccfd03-6c8c-4005-afd8-0b4626e89868","year":2024},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.390291Z"},"links":{"cited_paper":"/paper/2412.10917","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:d028d334d05bd2b965d764bce8575f802b737dd7dd7647e2dd7b7f0e81a3a466","observation_id":"7def0c9b-206f-4f04-bbc5-6b2628a79826","resolution":{"observed_at":"2026-08-12T00:30:33.983121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01307","last_updated":"2025-02-03T12:32:50Z","snapshot_observed_at":"2026-08-13T00:47:18.407870Z","submitted_at":"2025-02-03T12:32:50Z","title":"Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.01307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.01307","snapshot_observed_at":"2026-08-12T00:30:33.915193Z","title":"Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning","venue":"cs.LG","work_id":"3517f1cb-5072-422b-b727-b1c3f8562f0b","year":2025},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.405381Z"},"links":{"cited_paper":"/paper/2502.01307","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:61c5091886b10909a9ced059d19da8e6f8ed869b54007a9a078229c291b04734","observation_id":"b7ba16a5-905d-445e-8ee6-73f009a8f600","resolution":{"observed_at":"2026-08-12T00:30:33.920720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"cited_work":{"arxiv_id":"2606.27180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.27180","snapshot_observed_at":"2026-08-12T00:30:33.891880Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","venue":"cs.LG","work_id":"c35a86cf-c8d7-4363-a288-74fab7fe8d0c","year":2026},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.412241Z"},"links":{"cited_paper":"/paper/2606.27180","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:da0f04596df738a635cf9ff38a8c000dc8bc472bd7be018ce6be4a442ec39625","observation_id":"0959321e-ffc7-4aa6-a979-88646145f898","resolution":{"observed_at":"2026-08-12T00:30:33.897433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10839","last_updated":"2024-07-15T15:53:13Z","snapshot_observed_at":"2026-08-12T23:21:53.704751Z","submitted_at":"2024-07-15T15:53:13Z","title":"Offline Reinforcement Learning with Imputed Rewards","version":1},"cited_work":{"arxiv_id":"2407.10839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.10839","snapshot_observed_at":"2026-08-12T00:30:33.799618Z","title":"Offline Reinforcement Learning with Imputed Rewards","venue":"cs.LG","work_id":"8fba5e96-f5b1-4c37-b39e-6422a7456fb0","year":2024},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.423517Z"},"links":{"cited_paper":"/paper/2407.10839","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:41733a16efa9df5b30eae5398e58cf278d3d675c18656d53556a0f010dd65a1d","observation_id":"579c68f3-b3bb-4799-9081-306ad7477257","resolution":{"observed_at":"2026-08-12T00:30:33.805757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14146","last_updated":"2022-11-17T14:12:14Z","snapshot_observed_at":"2026-08-12T13:13:08.544605Z","submitted_at":"2022-04-29T15:06:58Z","title":"Training Language Models with Language Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14146","snapshot_observed_at":"2026-08-12T00:30:33.428381Z","title":"Training language models with language feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.428381Z"},"links":{"cited_paper":"/paper/2204.14146","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:156ee2fc6103b12cc08f8696f3d2e39c969e68cc32d1a5c14b869fd7d584222e","observation_id":"d28876a2-e138-4536-9f91-996396d4226d","resolution":{"observed_at":"2026-08-12T00:30:33.428381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.11406","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.757561Z","title":"Richard S","venue":null,"work_id":"d5c7c1ad-a0e4-43d6-97c8-a7d63ff60c65","year":2025},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.433432Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:31ca417137180ef35ca6cd9b0ad204e25c8408ee3ec9feb01d81051104ac05b1","observation_id":"e543a49e-7729-41aa-b6ff-7b9baa04723d","resolution":{"observed_at":"2026-08-12T00:30:33.765031Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.438380Z","title":"Preprint: arXiv:2503.15724","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.438380Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:1dce4bb17dd153ddc80f7afa1c88e88394dd4359184bb89b98694661901c776b","observation_id":"e4585cba-288c-442f-b3ed-abab54946091","resolution":{"observed_at":"2026-08-12T00:30:33.438380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03201","last_updated":"2026-05-08T05:37:03Z","snapshot_observed_at":"2026-08-11T09:40:03.975638Z","submitted_at":"2026-02-03T07:13:26Z","title":"SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2602.03201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03201","snapshot_observed_at":"2026-08-12T00:30:33.954310Z","title":"SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning","venue":"cs.LG","work_id":"3bc194ff-ed9d-483a-84bd-afa4d4a5da9a","year":2026},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.395422Z"},"links":{"cited_paper":"/paper/2602.03201","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:46e40f230da7cf3945c3c625403fa3a47937d50e9fc8eb13ea38c65146f2b600","observation_id":"0ac6bbba-f328-4760-b7dc-0a49d7ae0571","resolution":{"observed_at":"2026-08-12T00:30:33.959833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-12T00:30:33.337729Z","title":"Concrete problems in AI safety","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.337729Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:058d73d61f17b26e0041693b2950298812e0a1f62f42eb059d4046ffeb7d85aa","observation_id":"12c4f907-4d91-4413-a2da-1075344c9f3c","resolution":{"observed_at":"2026-08-12T00:30:33.337729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09579","last_updated":"2022-10-18T04:21:25Z","snapshot_observed_at":"2026-07-06T14:07:00.019184Z","submitted_at":"2022-10-18T04:21:25Z","title":"Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity","version":1},"cited_work":{"arxiv_id":"2210.09579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.09579","snapshot_observed_at":"2026-08-12T00:30:34.017899Z","title":"Unpacking Reward Shaping: Understanding the Benefits of Reward Engineering on Sample Complexity","venue":"cs.LG","work_id":"d7cfa1dc-ea39-46bb-9460-355cdb6ebc87","year":2022},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.374603Z"},"links":{"cited_paper":"/paper/2210.09579","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:270b2db0ebf41aa5c29c0abb804d10bdb90811bb055e757ccb925aa95d858a8c","observation_id":"06a4be0d-ce7c-44bc-8c1e-b0e5d628c28c","resolution":{"observed_at":"2026-08-12T00:30:34.023186Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15194","last_updated":"2024-10-07T19:33:34Z","snapshot_observed_at":"2026-08-12T23:59:12.258145Z","submitted_at":"2024-05-24T03:53:57Z","title":"Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2405.15194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15194","snapshot_observed_at":"2026-08-12T00:30:34.056170Z","title":"Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning","venue":"cs.LG","work_id":"374598a4-45c9-46de-8731-cfc9265593f6","year":2024},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.364295Z"},"links":{"cited_paper":"/paper/2405.15194","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:9ac8deb7e15557bf61c73f5c73c6fed67bcf0f697e5f46dd8bce21de0de6c9a2","observation_id":"4e5647f9-ed4c-4576-a22c-724cd380c882","resolution":{"observed_at":"2026-08-12T00:30:34.061337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09187","last_updated":"2024-07-12T21:14:32Z","snapshot_observed_at":"2026-08-13T05:02:13.517613Z","submitted_at":"2023-12-14T18:06:17Z","title":"Vision-Language Models as a Source of Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09187","snapshot_observed_at":"2026-08-12T00:30:33.353399Z","title":"Vision-language models as a source of rewards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.353399Z"},"links":{"cited_paper":"/paper/2312.09187","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:0208760faefe0fa20b32e55e547c52a500f385336f3e60dff76c820b3e5de810","observation_id":"fccf0884-caea-4685-8570-debabaf3e1fa","resolution":{"observed_at":"2026-08-12T00:30:33.353399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12197","last_updated":"2024-10-16T03:39:26Z","snapshot_observed_at":"2026-08-12T22:22:12.838156Z","submitted_at":"2024-10-16T03:39:26Z","title":"Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12197","snapshot_observed_at":"2026-08-12T00:30:33.369554Z","title":"Forbes, Nitish Gupta, Leonardo Villalobos-Arias, Colin M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.369554Z"},"links":{"cited_paper":"/paper/2410.12197","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:2e92ca7003eeaa128dc00abdd00bfdbfd3703c31f4908b1fcf45fe535e2bf2ad","observation_id":"a9156aeb-e0e3-4b49-9afb-f427b7132c33","resolution":{"observed_at":"2026-08-12T00:30:33.369554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10215","last_updated":"2024-12-27T19:25:58Z","snapshot_observed_at":"2026-08-12T23:17:27.714661Z","submitted_at":"2024-07-22T09:28:12Z","title":"Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10215","snapshot_observed_at":"2026-08-12T00:30:33.385098Z","title":"Comprehensive overview of reward engineering and shaping in advancing reinforcement learning applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.385098Z"},"links":{"cited_paper":"/paper/2408.10215","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:f8e90e7a0f3bf70c5fed49e85ae639dfa61ccc42ba0eb1e75741e32624cd66cf","observation_id":"7cd305ff-1310-4359-90b9-744a94f37100","resolution":{"observed_at":"2026-08-12T00:30:33.385098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.418659Z","title":"Preprint: arXiv:2104.06411","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.418659Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:7b6c7a5d457143e4f8e0ace74c94cbee072e764fa22347f2d889575d6a1fab79","observation_id":"53f5622c-5e08-43f4-855e-6d73c66e15bc","resolution":{"observed_at":"2026-08-12T00:30:33.418659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.343177Z","title":"2022.1027340","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.343177Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:1a89ee1beb57bd0bbbbf5b2434282bd05502f4f779a81517e68fea343a987d98","observation_id":"8d706fa9-bb33-4e1c-881f-420315478d9e","resolution":{"observed_at":"2026-08-12T00:30:33.343177Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09345","last_updated":"2024-11-01T06:30:11Z","snapshot_observed_at":"2026-08-13T04:18:55.108251Z","submitted_at":"2024-02-14T17:49:07Z","title":"InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09345","snapshot_observed_at":"2026-08-12T00:30:33.400576Z","title":"InfoRM: Mit- igating reward hacking in RLHF via information-theoretic reward modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.400576Z"},"links":{"cited_paper":"/paper/2402.09345","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:79043d755491f261faa9484e05a06dc905cb6cf6221d255b81443c5473e74947","observation_id":"dfafb29f-ee29-4220-a9a3-2eca840c1fcf","resolution":{"observed_at":"2026-08-12T00:30:33.400576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01297","last_updated":"2020-11-02T20:29:09Z","snapshot_observed_at":"2026-07-06T10:11:05.543128Z","submitted_at":"2020-11-02T20:29:09Z","title":"Useful Policy Invariant Shaping from Arbitrary Advice","version":1},"cited_work":{"arxiv_id":"2011.01297","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01297","snapshot_observed_at":"2026-08-12T00:30:34.078197Z","title":"Useful Policy Invariant Shaping from Arbitrary Advice","venue":"cs.LG","work_id":"52cc399a-be27-45dd-a41f-be1e3ec3c615","year":2020},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.358818Z"},"links":{"cited_paper":"/paper/2011.01297","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:1e3a4a2cae60aa0d7877b66892f3c1c76b75c6d3571f4622563501fa30f6454e","observation_id":"eb2dda5a-b769-4883-9785-8232e37977b4","resolution":{"observed_at":"2026-08-12T00:30:34.083387Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i15.33679","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:30:33.481344Z","title":"AdrianK.AgoginoandKaganTumer","venue":null,"work_id":"d73c484b-640f-4db1-ac30-b2134d14d6a8","year":null},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.332256Z"},"links":{"citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:a79623e65aa22a152a90ee63fcec73e8650f1b08b82f099b5022dc1cdcf4b09f","observation_id":"59c866d2-a085-43a9-be54-9e9d869c7020","resolution":{"observed_at":"2026-08-12T00:30:33.487245Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T07:12:49.500382Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":9,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.08158."}