{"as_of":"2026-08-13T16:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6491134f9bbe6e0ec448e66b12ffbe67b23441440180251f4141a4cb78370c7d","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:37:31.607767Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:30:33.390291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:30:33.977487Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2412.10917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10917","snapshot_observed_at":"2026-08-12T00:30:33.977487Z","title":"Adaptive Reward Design for Reinforcement Learning","venue":"cs.RO","work_id":"1fccfd03-6c8c-4005-afd8-0b4626e89868","year":2024},"citing_paper":{"arxiv_id":"2608.08158","last_updated":"2026-08-08T14:35:29Z","snapshot_observed_at":"2026-08-13T16:14:00.407186Z","submitted_at":"2026-08-08T14:35:29Z","title":"A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:30:33.390291Z"},"links":{"cited_paper":"/paper/2412.10917","citing_paper":"/paper/2608.08158"},"observation_digest":"sha256:91c5fda875352dacc49b44cf2df1ddc985e85fd27a6113322e609c3f4dcd0af0","observation_id":"7def0c9b-206f-4f04-bbc5-6b2628a79826","resolution":{"observed_at":"2026-08-12T00:30:33.983121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10917/citation-record","integrity":"/paper/2412.10917/integrity","json":"/paper/2412.10917/citation-record.json","paper":"/paper/2412.10917"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:32.051880Z","title":"Control synthesis from linear temporal logic specifications using model-free reinforcement learning","venue":null,"work_id":"a214ab82-fdc6-4be4-8b31-2a31326c2ee8","year":2020},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.416772Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:7bb8c56b097463909495442e953862c4a320826acdd63498163989b61b14fc03","observation_id":"e8b4a402-f74d-4c99-b096-e5f8f7c13658","resolution":{"observed_at":"2026-08-11T15:37:32.056244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-11T15:37:31.422543Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.422543Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:12d9064999868017724f7f6981fcd4c0faaa0a0aafcf4fa19a09a123f5cfd433","observation_id":"5005d4f1-7527-460b-a175-e0e51bcb431c","resolution":{"observed_at":"2026-08-11T15:37:31.422543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:32.038134Z","title":"Overcoming exploration: Deep reinforcement learning for continuous control in cluttered environments from temporal logic specifications","venue":null,"work_id":"68da4c19-3151-4ab8-8d25-444b9e6e55ed","year":2023},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.427324Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:951564c2143cfe5d0be669ea24466bd311429427c5777da5996bde4050d19ea5","observation_id":"50838048-cec8-4079-b4fe-6631b96abc7d","resolution":{"observed_at":"2026-08-11T15:37:32.042967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:32.024455Z","title":"Learning minimally-violating continuous control for infeasible linear temporal logic specifications","venue":null,"work_id":"586ed12b-2ea1-4a6a-86a3-c225824a9884","year":2023},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.433079Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:bc1085be7257cf4f7b3ae7137577e4e22dff85975ee4b93c04860ea0c0c2139f","observation_id":"6028a52c-44e4-4ea1-9500-054d80fe0e5a","resolution":{"observed_at":"2026-08-11T15:37:32.029062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:32.012223Z","title":"Ltl and beyond: Formal languages for reward function specification in reinforcement learning","venue":null,"work_id":"1716c8b4-bbf5-436b-9e37-7092a2fc340f","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.440473Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:1f9f77d0c020400548750430cf5f70e4acccad22d3b2a0293a406143ee87bd96","observation_id":"a6937f62-cfca-4933-a5f8-f260ab2aaa7d","resolution":{"observed_at":"2026-08-11T15:37:32.016510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.996830Z","title":"Foundations for restraining bolts: Reinforcement learning with ltlf/ldlf restraining specifications","venue":null,"work_id":"dca6e4bb-cb54-4439-b7b5-ff379e172aeb","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.446769Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:88b6622f4fd4a100e5a8874e2a69d240a28b8ead947afc7f5e95d0ca99dc2b12","observation_id":"ccd9e90b-0801-42ff-9ef7-04b9a0d11362","resolution":{"observed_at":"2026-08-11T15:37:32.003421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.983149Z","title":"From language to goals: Inverse reinforcement learning for vision-based instruction following","venue":null,"work_id":"266f6e07-5c7b-4aa3-862c-2a358699e53f","year":2018},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.452848Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:b98048f632cbefe7686c7965effb531ad68d0e9410c9a23741c65ccb2a06f76c","observation_id":"3560acac-53cd-4c1e-93b4-015dc9c65932","resolution":{"observed_at":"2026-08-11T15:37:31.987526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.965985Z","title":"Reinforcement learning for temporal logic control synthesis with probabilistic satisfaction guarantees","venue":null,"work_id":"80e5b20c-42ae-4a2a-966a-55fa5713e7cf","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.458473Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:c249a13303bf1f2ff7276a3158679d5c3e03efcfcfe74c282d2b68033ce60f70","observation_id":"4c33d730-ac7d-4357-8f29-f7408f49d443","resolution":{"observed_at":"2026-08-11T15:37:31.971633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.947614Z","title":"Deep reinforcement learning with temporal logics","venue":null,"work_id":"b68005fc-a643-43ad-81f9-7ac9549dc014","year":2020},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.464583Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:a5dab9d073fad97516c516f76fa593197e579ba2c82b12cb3fe70c26c471280e","observation_id":"28d912a4-17f9-4163-96ae-cfc3421f9ada","resolution":{"observed_at":"2026-08-11T15:37:31.953462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.924301Z","title":"Reward machines: Exploiting reward function structure in reinforcement learning","venue":null,"work_id":"98bbda66-fd71-4308-a563-4b952e44f116","year":2022},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.472017Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:17f3432993190840ea6fa8dc4089eace945126926cdd178a71ea1a162b03f1ad","observation_id":"6c8af446-f2ec-41a3-947d-e3028e860199","resolution":{"observed_at":"2026-08-11T15:37:31.931948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.905520Z","title":"Temporal-logic-based reward shaping for continuing reinforcement learning tasks","venue":null,"work_id":"c05cc669-df2a-4106-a41a-49c95e598cc3","year":2021},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.481730Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:93769f9f0753d2f0f656fcec1fd3ac0bb19bf92b740fd3147c25a9e68d59ea4f","observation_id":"6a025cf4-3809-4f04-952d-b6f39dbbf243","resolution":{"observed_at":"2026-08-11T15:37:31.913149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.889356Z","title":"A composable specification language for reinforcement learning tasks","venue":null,"work_id":"9990b89c-4e99-4099-8dae-85df024eeb60","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.493989Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:01488d6c9ee0132ce9c209eb26cd0d2620d1b7548a4e239902b220aa6ca5f39f","observation_id":"55ee23ac-cc8d-4ced-833f-b07335c6ef3b","resolution":{"observed_at":"2026-08-11T15:37:31.893885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.872084Z","title":"Compositional reinforcement learning from logical specifications","venue":null,"work_id":"5344cd8d-42f5-467b-b75f-2e706f785229","year":2021},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.509070Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:5991894d2802a21bd406b25173afd2969d3dbe7771d67f5c9f9c006d1135508c","observation_id":"2e1da156-c139-4568-972f-3140e4b28b46","resolution":{"observed_at":"2026-08-11T15:37:31.879116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.857734Z","title":"Model checking of safety properties","venue":null,"work_id":"266b80a5-47ac-4c86-8c5c-ffd2cc78dbb4","year":2001},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.531591Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:4843a046e6c04295f4c2b8d6b62d2875736ee07a4bc88ba11cd6eca8bed4e353","observation_id":"990b3a30-54ab-490c-8476-c80992c7bf68","resolution":{"observed_at":"2026-08-11T15:37:31.862535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.843093Z","title":"Probabilistic planning with formal performance guarantees for mobile service robots","venue":null,"work_id":"e9d10ff8-b9c0-44af-aa7f-5a76054d9c23","year":2019},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.537253Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:52a075e81e4095464f12396716f1c1c424831407842dba463d556e2cca19725b","observation_id":"c8d86e92-4313-4978-9209-df85a676621b","resolution":{"observed_at":"2026-08-11T15:37:31.847530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.829399Z","title":"Reinforcement learning with temporal logic rewards","venue":null,"work_id":"1fe60098-14e5-474d-b65c-51725e11b8cf","year":2017},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.547114Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:53dbda3e1a4e3a218771e62ddaf401a5a1967f0c4a047f61b99ff2972d7b4426","observation_id":"e8bef7a2-3962-4188-bddf-15a9f20ee938","resolution":{"observed_at":"2026-08-11T15:37:31.833861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.552290Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.552290Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:4004c7ccd69645981a969caae0a5db92b7816959abb05b99c02cae84d07f4eef","observation_id":"4c2b5c61-fb91-46b8-9fda-e4254a406a0f","resolution":{"observed_at":"2026-08-11T15:37:31.552290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.556926Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.556926Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:c049749d8da8322093fffecd6697c94a0c2e0a5b33af871db66e597ccf79423f","observation_id":"d8fad458-da6e-45ce-b701-5681eb729509","resolution":{"observed_at":"2026-08-11T15:37:31.556926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.792185Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"7192063e-8ad5-4c5e-a82a-995eded9f95a","year":1928},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.561606Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:1fcc8e9e77b46eae9dba205fee504f646b5924f8449ae6185072f5469ac7d0b9","observation_id":"1a8b3ba6-fda5-4c02-a686-379596ee1bf7","resolution":{"observed_at":"2026-08-11T15:37:31.797080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.773289Z","title":"Algorithms for inverse reinforcement learning","venue":null,"work_id":"8adf3ac3-0e83-4fca-8647-639c46fcff7f","year":2000},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.570702Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:b37986deaea2ba5aba3946e3a1bcd83fb2fc664627e29d84d32bc42a7dd17cbf","observation_id":"c0e50507-434f-4da3-b512-3c9c80236a2b","resolution":{"observed_at":"2026-08-11T15:37:31.778765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.750268Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":"32c15bc6-ddb2-417e-9acf-f62272eac701","year":1999},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.584332Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:7473a8c8d0fbb21bf19dfbb569a0dedef01be2373211a112f81be47c56e596e7","observation_id":"08ec08ef-dc8d-42a8-80d9-42aabc55c140","resolution":{"observed_at":"2026-08-11T15:37:31.757627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.728544Z","title":"The temporal semantics of concurrent programs","venue":null,"work_id":"012b45ee-811d-4d23-824e-2d97a5b3b8a6","year":1981},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.588728Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:0e473fc145228d50eeddd7871d546e8658aa81a1d8386b307135c3aa047bd1be","observation_id":"38404a0c-da5b-459f-87bb-38bf87f9a166","resolution":{"observed_at":"2026-08-11T15:37:31.733684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.712729Z","title":"Stable-baselines3: Reliable reinforcement learning implementations","venue":null,"work_id":"367386d5-8fa7-4fd6-9e5f-926c82894e0a","year":2021},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.593564Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:901c73904b5b3ed66ee761b1e57ea0d6381a614dfd350061d8103ef749bb5628","observation_id":"b79e5b12-0680-40e0-9c64-691dae414074","resolution":{"observed_at":"2026-08-11T15:37:31.717040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T15:37:31.597864Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.597864Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:002ccc149176cd85c46fb0822a8a36de328f8e53facd06a7557364e91890e5ee","observation_id":"74e00a7c-6247-4e1e-9cee-cc5afc606738","resolution":{"observed_at":"2026-08-11T15:37:31.597864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.694202Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"749c448b-629a-455d-8a00-4bef9f54d7a0","year":2016},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.602369Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:d7329b630cab15f1c1f271c7d6f0a2372b17b15bd55dd45206db6db091450b7c","observation_id":"699c7cc4-085b-4d80-aa89-8ded6c4ed214","resolution":{"observed_at":"2026-08-11T15:37:31.701426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:37:31.607767Z","title":"A survey of preference-based reinforcement learning methods","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:37:31.607767Z"},"links":{"citing_paper":"/paper/2412.10917"},"observation_digest":"sha256:21c321ee103d42a0664d9bc83b39ba5e1d5946c56e7e8be4f53390ec967e5f59","observation_id":"f1af1b0f-3017-46e2-9fee-6bf33ef907e7","resolution":{"observed_at":"2026-08-11T15:37:31.607767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10917","last_updated":"2025-05-17T21:14:03Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T09:51:12.855901Z","submitted_at":"2024-12-14T18:04:18Z","title":"Adaptive Reward Design for Reinforcement Learning"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2412.10917."}