{"as_of":"2026-08-12T18:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7130fd43b2e6403eea1abc7ed124f1b63e027215f49ba5516f11855072da8c52","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:09:54.006504Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07177/citation-record","integrity":"/paper/2412.07177/integrity","json":"/paper/2412.07177/citation-record.json","paper":"/paper/2412.07177"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.173661Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.173661Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:c6908b622d4ab8e9154d0fa9eff9e8ba9a1e1d0880842fe23eece79926ad6861","observation_id":"f670229a-7884-4a60-a7c8-b7924ffe79e2","resolution":{"observed_at":"2026-08-11T19:09:53.173661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.182649Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.182649Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b63781ccddb27743d9676ce5f5cce05b867440c0c206f953650d0a18bbd121ba","observation_id":"5ce6d39f-ebc7-4668-9d47-185b987f835d","resolution":{"observed_at":"2026-08-11T19:09:53.182649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.189309Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.189309Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f23dc5f1f720c3dafaf93f402e8731620e3c5b6911c4f0d8e9f3d1cfda0e8127","observation_id":"bf6479eb-f08c-4c86-8f4c-3976865bd0b1","resolution":{"observed_at":"2026-08-11T19:09:53.189309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.196826Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.196826Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:df7b33d605f8e0d0e737adbe866f18917f0bf59456ab65543b839ebfc541a0a8","observation_id":"d9582fd8-9708-4b24-893a-6f74f4a45b4f","resolution":{"observed_at":"2026-08-11T19:09:53.196826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.206559Z","title":"and Ng, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.206559Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:2a8115c6830bc6488bc5f61433c99ea1f085bacbfc349f6a731e6848756a1853","observation_id":"e41861d2-2621-4006-a9d9-57e5d91e27e3","resolution":{"observed_at":"2026-08-11T19:09:53.206559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.214761Z","title":"and Ng, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.214761Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:091347c986d960dc480c5ac279896be4f2b3404b9d5880074f59d6eb487e54bc","observation_id":"089b4a0c-6696-494f-853d-b41283a0127d","resolution":{"observed_at":"2026-08-11T19:09:53.214761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.221622Z","title":"K., Littman, M., Precup, D., and Singh, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.221622Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:ef4e165c8a6da7049938f63c6b4b806be0afec152fa33ef18da8e0e606d1ec30","observation_id":"d9720b40-68cf-48ee-a7c9-0ee8239e1cf2","resolution":{"observed_at":"2026-08-11T19:09:53.221622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.229386Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.229386Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:4f7e8ca1e1bbf74910c79080a439292f1e525c798fd0c4195d9e9ce76d6c3967","observation_id":"adfd7db3-5749-44a6-8eba-ed931304f984","resolution":{"observed_at":"2026-08-11T19:09:53.229386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.235299Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.235299Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:8075a8c5a78409b76b5710004282d0f365f0980a91cb7af68a2876b4d13e84c7","observation_id":"be446dbb-fbc9-4be0-b634-f49cbfb80154","resolution":{"observed_at":"2026-08-11T19:09:53.235299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.242527Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.242527Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f28163f683273c5e95a8d8ed6ebabb33ebccdba139467e2c0449c5b9e32ed7a8","observation_id":"a8a3d86c-0c6a-499e-8b9d-b6123b1aacb4","resolution":{"observed_at":"2026-08-11T19:09:53.242527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08492","last_updated":"2019-01-24T16:44:16Z","snapshot_observed_at":"2026-07-06T07:28:48.758265Z","submitted_at":"2019-01-24T16:44:16Z","title":"Feudal Multi-Agent Hierarchies for Cooperative Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.08492","snapshot_observed_at":"2026-08-11T19:09:53.250041Z","title":"and Dayan, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.250041Z"},"links":{"cited_paper":"/paper/1901.08492","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:c2c3dbc0306483e47a1c2ad91eed72f054eecf9743628d5e22d3449bcdda10b0","observation_id":"6e22357e-ddb0-4685-bbcf-7166c49ae5ea","resolution":{"observed_at":"2026-08-11T19:09:53.250041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-11T19:09:53.255834Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.255834Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:6418890405cefa1ba2a0c2af0c981dc27e9a97783d5f2d9746afc1d1d60af079","observation_id":"4b3ede61-5ab0-4aaf-a747-cec72cf31152","resolution":{"observed_at":"2026-08-11T19:09:53.255834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.266861Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.266861Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f25c740301522f826d77591e67cb6d860e1b7adfd37e13154f8db9bf8155224b","observation_id":"e7324c04-d8f0-4e08-b7ba-719ab1f929be","resolution":{"observed_at":"2026-08-11T19:09:53.266861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-11T19:09:53.274117Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.274117Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:bb3eeee423e83d27cd4c43a8e014832206d985c230856c1ce96c76b8a6501fd4","observation_id":"4da7c10a-aab0-40f4-896d-aaaea15babd1","resolution":{"observed_at":"2026-08-11T19:09:53.274117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.283558Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.283558Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:259a58c6c6c5420fd26bfc4d2a4cb85a4140f06a782e4c67f4a3e6a0717454a0","observation_id":"add28bfa-6651-4b5e-a342-db45149cb1a9","resolution":{"observed_at":"2026-08-11T19:09:53.283558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04764","last_updated":"2020-11-17T19:09:57Z","snapshot_observed_at":"2026-07-06T10:13:06.905381Z","submitted_at":"2020-11-09T21:07:56Z","title":"Deep Reinforcement Learning for Navigation in AAA Video Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04764","snapshot_observed_at":"2026-08-11T19:09:53.289927Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.289927Z"},"links":{"cited_paper":"/paper/2011.04764","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:083a3b81c78db99a87f5877ca68b9dbe943ca413d56910b93b6a2cb5b344605d","observation_id":"91c3085d-16f1-4244-97b7-213c21c114fe","resolution":{"observed_at":"2026-08-11T19:09:53.289927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.300139Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.300139Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:eb7880cc66c82a30242ad07bb1acf4adf5ecb9383e1af720c9c22ed6b491f613","observation_id":"a974e33a-8fd6-4da6-96d7-8583e287f451","resolution":{"observed_at":"2026-08-11T19:09:53.300139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-11T19:09:53.307309Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.307309Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:5a0c9d6f6853fbc7d84b3e8e03d53a5cb5ac47fd4549961a4849328f2a0d3d56","observation_id":"595fc39b-f931-4b4d-abbb-d9a20d1d694f","resolution":{"observed_at":"2026-08-11T19:09:53.307309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-11T19:09:53.314188Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.314188Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:80306ed7cabcaf06a06ed68e959aa6397fe23111c16a9e320b1aaacb4d712364","observation_id":"dd3de39f-95d6-46ae-8a40-2e46c3625b5b","resolution":{"observed_at":"2026-08-11T19:09:53.314188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.09708","last_updated":"2019-06-18T19:47:07Z","snapshot_observed_at":"2026-07-06T07:41:06.398227Z","submitted_at":"2019-03-22T20:56:55Z","title":"Explaining Reinforcement Learning to Mere Mortals: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.09708","snapshot_observed_at":"2026-08-11T19:09:53.322858Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.322858Z"},"links":{"cited_paper":"/paper/1903.09708","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:b354c63f19981e5a0b7aa3e82dba1bbfda278c5b871d7421d755f91292495c71","observation_id":"7d1d635b-38b9-48a4-aaa5-f5256f9fa57f","resolution":{"observed_at":"2026-08-11T19:09:53.322858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.331142Z","title":"P., and Zaremba, W","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.331142Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:480d77843eb823bed1c7ff62747954ade8690bc40adbcd8c59020add53f11238","observation_id":"e341f36f-1766-48f1-9580-b6bfd63d85c2","resolution":{"observed_at":"2026-08-11T19:09:53.331142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.339566Z","title":"M., Baker, B., Chociej, M., Jozefowicz, R., McGrew, B., Pachocki, J., Petron, A., Plappert, M., Powell, G., Ray, A., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.339566Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:9c674939c3ff510defce2161bdf629f99ad9072a24ee78f6a572449592ffa39e","observation_id":"5d7f753a-6bbe-4747-acbc-fe25c17ebb63","resolution":{"observed_at":"2026-08-11T19:09:53.339566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.355859Z","title":"and Doshi, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.355859Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:d24f4e12d3bd8096b6b84f9214019c56ae49a1210e721f4662020087122ef6f8","observation_id":"d0a6d152-ee32-46e6-aa7b-c3f586a92ed5","resolution":{"observed_at":"2026-08-11T19:09:53.355859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06616","last_updated":"2018-06-19T17:19:29Z","snapshot_observed_at":"2026-08-07T12:09:31.557752Z","submitted_at":"2017-04-21T16:15:19Z","title":"Accurately and Efficiently Interpreting Human-Robot Instructions of Varying Granularities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06616","snapshot_observed_at":"2026-08-11T19:09:53.364279Z","title":"L., and Tellex, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.364279Z"},"links":{"cited_paper":"/paper/1704.06616","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:4dce1bbebf10696adec18f8083c09eba416603062ca63d1a047e3da841ab10f9","observation_id":"628072b7-53e6-49e4-a569-91408f889bcb","resolution":{"observed_at":"2026-08-11T19:09:53.364279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-11T19:09:53.371592Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.371592Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:d6d3ecd8b97264c5584d32f1c1ea81a66ed1d0afb56ccc938151373846e225cd","observation_id":"53131749-ec93-4df1-bf40-04dda5322d80","resolution":{"observed_at":"2026-08-11T19:09:53.371592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04178","last_updated":"2023-12-22T20:58:14Z","snapshot_observed_at":"2026-07-06T14:49:45.081117Z","submitted_at":"2023-02-08T16:36:40Z","title":"DynGFN: Towards Bayesian Inference of Gene Regulatory Networks with GFlowNets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04178","snapshot_observed_at":"2026-08-11T19:09:53.389663Z","title":"J., Wang, B., and Bengio, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.389663Z"},"links":{"cited_paper":"/paper/2302.04178","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f13572c484d90c473b71d073740a5c4559f414826480b95da4e05104c81710ee","observation_id":"13785aa4-9151-4ed9-91d5-cfab30392e51","resolution":{"observed_at":"2026-08-11T19:09:53.389663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.398571Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.398571Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:74cec71bb44c9b1e8dd2468cff6a5b00c19d160a4f3b2174f350f411fc086420","observation_id":"bbb50bcb-4d33-4ddd-8651-a3f00a12f6de","resolution":{"observed_at":"2026-08-11T19:09:53.398571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T19:09:53.405296Z","title":"L., Kiros, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.405296Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:80f8af7af6fa794351201d693ce15909186ce8bedc4328afaabccd58e132c5ba","observation_id":"5fd203ce-372e-46af-ab1d-4e7b8a4e940e","resolution":{"observed_at":"2026-08-11T19:09:53.405296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.412042Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.412042Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:98bc9cb7274f4355b6967bcc05be894addc7016f1e419f72abdfe6970f34b403","observation_id":"de6390a0-20a3-407b-91f7-316ce7f5691b","resolution":{"observed_at":"2026-08-11T19:09:53.412042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01946","last_updated":"2019-12-23T16:41:02Z","snapshot_observed_at":"2026-08-11T19:26:35.653372Z","submitted_at":"2018-06-05T22:01:51Z","title":"Learning to Understand Goal Specifications by Modelling Reward","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01946","snapshot_observed_at":"2026-08-11T19:09:53.418720Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.418720Z"},"links":{"cited_paper":"/paper/1806.01946","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:8c63f2cd9b438bb141ada5e8985918e6c9024a6ccb90a381e6747944b980fe8c","observation_id":"8b51f118-118b-4bce-9f9c-9d0bd1048d01","resolution":{"observed_at":"2026-08-11T19:09:53.418720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-11T19:09:53.425217Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.425217Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:43c19ace5ab5283895100d7fa725c63a833ef4d4ee9e499e736cd2601f771c3e","observation_id":"1972b0e1-6630-4a0f-bd70-08c3b8ddf945","resolution":{"observed_at":"2026-08-11T19:09:53.425217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.436472Z","title":"P., O’malley, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.436472Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:8a749fd3a9302c3ac5a84eeff89c12a839b8fcccee023ef3fb46ce83f27c2cf4","observation_id":"f65dbb71-f6f0-4ef5-91f6-5a2a5fc7896c","resolution":{"observed_at":"2026-08-11T19:09:53.436472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.443398Z","title":"and Narayanan, S","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.443398Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:cf151649ac57d508913009e5beb9f9eba4e192cc4bf2dbf538a42005b6433a05","observation_id":"5b4979f7-dcff-4dff-9d1f-43fb575db73d","resolution":{"observed_at":"2026-08-11T19:09:53.443398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.449852Z","title":"L., Waytowich, N","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.449852Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:1a67ce109d37dfc66ee73ce687fd6e597515d2fbfb46e89a5375ad358521e7e5","observation_id":"aa328edd-1c67-4763-b170-851b136f5d51","resolution":{"observed_at":"2026-08-11T19:09:53.449852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11731","last_updated":"2021-12-22T08:48:00Z","snapshot_observed_at":"2026-08-03T20:57:18.983852Z","submitted_at":"2021-12-22T08:48:00Z","title":"Graph augmented Deep Reinforcement Learning in the GameRLand3D environment","version":1},"cited_work":{"arxiv_id":"2112.11731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.11731","snapshot_observed_at":"2026-08-11T19:09:58.008125Z","title":"Graph augmented Deep Reinforcement Learning in the GameRLand3D environment","venue":"cs.LG","work_id":"9fc65f3f-7703-4ca7-a056-a33669ea5054","year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.455937Z"},"links":{"cited_paper":"/paper/2112.11731","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:771dba75e74705a4204862497cf8d2807cbaf6fc2d34dc5f70faf5a643df6dbf","observation_id":"c9f9c7dc-196f-4ed8-bad2-3f9bb884c6e4","resolution":{"observed_at":"2026-08-11T19:09:58.013775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.463071Z","title":"G., Candido, S., Castro, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.463071Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:21a8802fcedf5ad6810b0be02bb2e517b1c4ce7316c4b36c297184e541372f86","observation_id":"6c883da5-c171-4883-aee1-8d3402a55021","resolution":{"observed_at":"2026-08-11T19:09:53.463071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06887","last_updated":"2017-07-21T13:21:54Z","snapshot_observed_at":"2026-08-10T05:04:46.941947Z","submitted_at":"2017-07-21T13:21:54Z","title":"A Distributional Perspective on Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06887","snapshot_observed_at":"2026-08-11T19:09:53.481057Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.481057Z"},"links":{"cited_paper":"/paper/1707.06887","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:1e6962d1b840000ab973d7f86a141bf5a4fbaeccb6c4365b6e43c9adb686d873","observation_id":"889c3a95-3e21-460b-834e-2bfb943f18c6","resolution":{"observed_at":"2026-08-11T19:09:53.481057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.490833Z","title":"G., Naddaf, Y., Veness, J., and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.490833Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:8050533bc3a4c284826f2053ee74c255099b1fbf8084399c83993dbfc8fde9c2","observation_id":"2ccca836-b239-4653-986a-01eb009f15c3","resolution":{"observed_at":"2026-08-11T19:09:53.490833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.496335Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.496335Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:6b9bb049f2fbf5ede08f78fd841afc80dd947544ce8bfc63ca5092bdbb1ab5d2","observation_id":"1ee61b4a-6e58-4f43-953c-c0b5a7c81cbf","resolution":{"observed_at":"2026-08-11T19:09:53.496335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.502689Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.502689Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:20242366c834d8b7f49372a8c51b9dc966c6c23af0beb6163fb1ce826b253138","observation_id":"d72c8e5e-efd3-4fef-82ba-911ded7c3725","resolution":{"observed_at":"2026-08-11T19:09:53.502689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.508816Z","title":"J., Tiwari, M., and Bengio, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.508816Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:628229d1aa5eaace4bc52e71d7b06800ab90f5d885405f2b9a8af9b3cf55afb6","observation_id":"0c2d210c-b3ce-4eec-b8d6-079a4182122d","resolution":{"observed_at":"2026-08-11T19:09:53.508816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.515914Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.515914Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:c3064da681ae18ab9bb5a7d03ea0bf7f59d8a31a09c8090df45ae15c9cf7c8fb","observation_id":"04f0d674-0eb1-49b8-9c6b-a0e03efa5b1b","resolution":{"observed_at":"2026-08-11T19:09:53.515914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-11T19:09:53.525635Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.525635Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e18686572529f54ebb135df41e60fc08d84eb227218bb7bd71ba49c491357737","observation_id":"0c08540c-3345-488b-8f3e-b0a45aeda7af","resolution":{"observed_at":"2026-08-11T19:09:53.525635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.533327Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.533327Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:65c73224cac13d7beb6677f1d00d7bf3542564a232a43a11a8acccee24bc2896","observation_id":"ddfd02f1-1dd0-47ed-8614-3cccdf70e470","resolution":{"observed_at":"2026-08-11T19:09:53.533327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.540326Z","title":"R., Paolini, G","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.540326Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:5c2ec794c9e37cd29d114942a74b21484519fa43de12082107cd418880c40cac","observation_id":"46888275-f4a3-4d5b-aac9-e4832d064882","resolution":{"observed_at":"2026-08-11T19:09:53.540326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04623","last_updated":"2019-02-12T20:31:43Z","snapshot_observed_at":"2026-08-10T11:47:48.941696Z","submitted_at":"2019-02-12T20:31:43Z","title":"Value constrained model-free continuous control","version":1},"cited_work":{"arxiv_id":"1902.04623","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.04623","snapshot_observed_at":"2026-08-11T19:09:57.917836Z","title":"Value constrained model-free continuous control","venue":"cs.RO","work_id":"376d96f2-764c-4b09-8397-2149422e8de0","year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.547799Z"},"links":{"cited_paper":"/paper/1902.04623","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:03f09767c8ee88d49cde1bcc66066546e06941bab1ad04397a6a86dd5d6fe49f","observation_id":"81cc074e-07d3-4d19-a596-10041e5454f3","resolution":{"observed_at":"2026-08-11T19:09:57.928298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.557042Z","title":"B., Shah, J., Niekum, S., Stone, P., and Allievi, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.557042Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:462dabba1f0b12b1a8db3f8acf6e14df0b669a4c4d43477c5d4a0f89b91af367","observation_id":"9eca8b83-2bda-490f-884b-869f29da442b","resolution":{"observed_at":"2026-08-11T19:09:53.557042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.564946Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.564946Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:491fd18c63138befa3d4e1f882f732ff376997c611106c4086af6622d1160d7b","observation_id":"d16b75b8-bc84-4b85-853c-c0933d4b2282","resolution":{"observed_at":"2026-08-11T19:09:53.564946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.574458Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.574458Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:79f8d98508567e037747fe37910aad7935d7f7757d813d08a9fc0ed4cf10bb99","observation_id":"4eb1e295-03c8-4341-8886-743a9bd84f65","resolution":{"observed_at":"2026-08-11T19:09:53.574458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.581171Z","title":"D., Abel, D., and Dabney, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.581171Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:61d9797b80ebebe87aa26edcdbe64c38121c361d751fc52a93e4d8629ec304e0","observation_id":"992bda25-33e8-4904-a021-b0c9ff3f0139","resolution":{"observed_at":"2026-08-11T19:09:53.581171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-12T05:40:07.199512Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-11T19:09:53.593141Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.593141Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:bd82752544b71de342962b36ed7a74a9e6faf8ea9a9905722cba8875270205d7","observation_id":"7de053a7-3e23-4bf6-9bf8-26736579e514","resolution":{"observed_at":"2026-08-11T19:09:53.593141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06387","last_updated":"2019-07-09T03:51:47Z","snapshot_observed_at":"2026-08-11T06:17:40.521534Z","submitted_at":"2019-04-12T19:34:43Z","title":"Extrapolating Beyond Suboptimal Demonstrations via Inverse Reinforcement Learning from Observations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06387","snapshot_observed_at":"2026-08-11T19:09:53.600198Z","title":"S., Goo, W., Nagarajan, P., and Niekum, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.600198Z"},"links":{"cited_paper":"/paper/1904.06387","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:16b68054b60a819a270f8efa79fd81783fb2466f6c2d54699e5e69b128aaa863","observation_id":"14aa8807-f81d-43a9-be22-00705510bf67","resolution":{"observed_at":"2026-08-11T19:09:53.600198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.613259Z","title":"H., and Vaucher, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.613259Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:1ea1cc8b834fcb67f5bc7580ab6959c3a083a678b95c62aa05cfd98f4ef1cec9","observation_id":"239d6426-e858-4a33-b371-605d06227559","resolution":{"observed_at":"2026-08-11T19:09:53.613259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.620653Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.620653Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:8e0e639585ec5cc45e867061a34b616ce9bc60c1c07b2b43e8459e9f51155519","observation_id":"19bf22df-ddb1-4b32-8e56-758bfff2917a","resolution":{"observed_at":"2026-08-11T19:09:53.620653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06324","last_updated":"2020-11-27T17:27:30Z","snapshot_observed_at":"2026-07-06T10:03:59.250468Z","submitted_at":"2020-10-13T12:15:23Z","title":"Balancing Constraints and Rewards with Meta-Gradient D4PG","version":2},"cited_work":{"arxiv_id":"2010.06324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.06324","snapshot_observed_at":"2026-08-11T19:09:57.827366Z","title":"Balancing Constraints and Rewards with Meta-Gradient D4PG","venue":"cs.LG","work_id":"299d4fd9-865e-472c-abc4-840266f7b53e","year":2020},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.627582Z"},"links":{"cited_paper":"/paper/2010.06324","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:c4ef7594c4a7661a9cace6a803f78e45d156ced32ff6b1ec6d0285a9cf687dee","observation_id":"5b02448d-cd8d-4a4a-a6f3-040bad8b795c","resolution":{"observed_at":"2026-08-11T19:09:57.833406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.635035Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.635035Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e73c8a0dbc903897fca2cc634f6d656bb938db45a06f988cfbfb9d1b2a12f29a","observation_id":"02ff1b52-1fc7-4ddb-8da8-65787e12fc85","resolution":{"observed_at":"2026-08-11T19:09:53.635035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.642271Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.642271Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e8a2dfef096f569cbee98e37c113fdb0c356c10d29cdede7bf27d741722af357","observation_id":"7ee31b36-4e34-46c4-8b35-7772d11a96eb","resolution":{"observed_at":"2026-08-11T19:09:53.642271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.653902Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.653902Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:5a0c5aef7cc36bfc0b2ece2fd57f5fb17c830a0c40116e1600145e8858f5c8c0","observation_id":"26c6f9e7-cf8c-48d0-825a-abac7f9c29f7","resolution":{"observed_at":"2026-08-11T19:09:53.653902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.661473Z","title":"u rnkranz, J., H \\","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.661473Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:210c630498c297a826a77208b28231a5697cee05eca8b7be9b593dd1e5544704","observation_id":"c0a9aee7-44c5-43f6-b7f5-5097d89ab056","resolution":{"observed_at":"2026-08-11T19:09:53.661473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.667235Z","title":"G., and Singh, S","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.667235Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:0c82197ffde193d2da9090ad0c257f20d426657f0ef50e5ec172d2e95975de23","observation_id":"3b879b8c-1080-45df-8598-7506052ce900","resolution":{"observed_at":"2026-08-11T19:09:53.667235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08272","last_updated":"2019-12-19T15:44:33Z","snapshot_observed_at":"2026-08-08T23:50:48.318949Z","submitted_at":"2018-10-18T20:48:08Z","title":"BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08272","snapshot_observed_at":"2026-08-11T19:09:53.674314Z","title":"H., and Bengio, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.674314Z"},"links":{"cited_paper":"/paper/1810.08272","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:36b9cca9fc80f84ea82cb5a698bbae2c097b3cea797309ceaaf96520184ccdb8","observation_id":"ea2188bb-ae4b-4ce4-ad80-d572e4f02603","resolution":{"observed_at":"2026-08-11T19:09:53.674314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.681347Z","title":"and Kim, K.-E","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.681347Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:47e70cf85ead33b6ef5b4d9d00e6d72dde731a82cd164e8d4e0279d41d345df6","observation_id":"94e48b24-8898-4d09-8247-f5de408aea82","resolution":{"observed_at":"2026-08-11T19:09:53.681347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.687973Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.687973Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:5f4dcd1ab2a852dbdc03d629ce6a0ada4436f856900fac7e461514cbc0aad712","observation_id":"7edc8b98-99dc-4e0f-af39-9b949900490a","resolution":{"observed_at":"2026-08-11T19:09:53.687973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.696255Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.696255Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:a9cb7feed518667604a9da08cb3f2ecd1d9d66c44a1627ef9bc09994a15d4ff4","observation_id":"a65f529c-6fd3-4e2f-9358-2d9686dcad04","resolution":{"observed_at":"2026-08-11T19:09:53.696255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10031","last_updated":"2019-02-11T20:52:42Z","snapshot_observed_at":"2026-08-04T06:42:19.463125Z","submitted_at":"2019-01-28T23:14:58Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10031","snapshot_observed_at":"2026-08-11T19:09:53.703918Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.703918Z"},"links":{"cited_paper":"/paper/1901.10031","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:52cabf34b0429c20e5c4f6a94466b0e38c0be57a0eaa0f30d92985b26cdfb4e4","observation_id":"caead2f4-d565-4a16-b601-04a375a763eb","resolution":{"observed_at":"2026-08-11T19:09:53.703918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.712753Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.712753Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e1452904dfc1b5a2774c2d753171a587d32f4e1f435b68090730008c474437ad","observation_id":"44b13125-9c77-41dd-8aa1-5684c4b07b6a","resolution":{"observed_at":"2026-08-11T19:09:53.712753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.724470Z","title":"and Amodei, D","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.724470Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:43ed4f477a4b9de38fc22e2cafab5b04843f20e7f776c49bb47e91cddf1169dd","observation_id":"2758b84a-e19c-47c0-ba0c-8d85921589f9","resolution":{"observed_at":"2026-08-11T19:09:53.724470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.733769Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.733769Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:6843d6b78b98bb7ea94add18ee58f5788bfc378c6fb9bdf4f0484b242e194ff3","observation_id":"2d750245-79b7-4c5b-83e7-4fb08c060cd9","resolution":{"observed_at":"2026-08-11T19:09:53.733769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.743079Z","title":"and Niekum, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.743079Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:a3f5b192ca8b65d8bd6cd787a6895105298f7bd38666bb84cd47f3c88e083d1c","observation_id":"d5d4711a-99d6-4167-a660-35c939c1dfed","resolution":{"observed_at":"2026-08-11T19:09:53.743079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.752217Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.752217Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:9380adde2fafa44998fca06f3738f1928c9ea6454c1b6af942785bd978235ee9","observation_id":"85619297-2c24-467d-9076-c0fadba86258","resolution":{"observed_at":"2026-08-11T19:09:53.752217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.759937Z","title":"G., and Silver, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.759937Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:7ad6fc963f1b80a30bf7f3cfdbb704faec403fe608ca5ad0fc242a8f34389e8b","observation_id":"3780a273-9c48-4032-a1fb-c49de9d14ff4","resolution":{"observed_at":"2026-08-11T19:09:53.759937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.767064Z","title":"G., and Munos, R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.767064Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:677f4bde97249edb78ed02798e75c7db1e49c4deda484736b0801b20ddc9c0ab","observation_id":"16dcd7c3-7925-4efb-9112-b146b1a77c9f","resolution":{"observed_at":"2026-08-11T19:09:53.767064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-11T19:09:53.774090Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.774090Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:60c56a9cb10b4b0ca31b8c1837a393a8878fa6688b7a79417b8e80e7251ee1d9","observation_id":"f9562dfe-e4ee-4a2e-8b28-cb5b2815f8c0","resolution":{"observed_at":"2026-08-11T19:09:53.774090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03315","last_updated":"2025-02-19T18:52:54Z","snapshot_observed_at":"2026-08-12T14:11:42.481208Z","submitted_at":"2023-09-06T18:56:20Z","title":"Robotic Table Tennis: A Case Study into a High Speed Learning System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03315","snapshot_observed_at":"2026-08-11T19:09:53.789787Z","title":"B., Abelian, J., Abeyruwan, S., Ahn, M., Bewley, A., Boyd, J., Choromanski, K., Cortes, O., Coumans, E., Ding, T., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.789787Z"},"links":{"cited_paper":"/paper/2309.03315","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:95b78e8f648022985e8840134d365ae3bf0bf363c512c8d8c43b8f9dcd36a742","observation_id":"fac7ee7e-2ea4-4aea-85ff-8e0a3cfa6ad1","resolution":{"observed_at":"2026-08-11T19:09:53.789787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.799929Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.799929Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:da08f5149b66ee6189869a8cc65c6b9baff561c54bec949500406bd735a5aaa0","observation_id":"15297a9f-e93b-4ee4-9b89-b5847006731b","resolution":{"observed_at":"2026-08-11T19:09:53.799929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.810292Z","title":"and Dennis, J","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.810292Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:15921d86994d52865f6952baa9ddf335ff71b22b0b27485e1d31baf896558d6c","observation_id":"001f70bd-cbd3-49e0-916e-f6f2aeda4092","resolution":{"observed_at":"2026-08-11T19:09:53.810292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.818319Z","title":null,"venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.818319Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:31b9b39f5048cf941a8fae3ad9d8774a328e4ab4949a77eaa5dc5996e54edb17","observation_id":"27da0fd3-5053-4011-a8fc-d1c524a851e9","resolution":{"observed_at":"2026-08-11T19:09:53.818319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.823332Z","title":"and Hinton, G","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.823332Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:2c8da6d1332a4ff1858ea0099ec03af1b391429dbb9e86a6d0a6e9dacd28c06f","observation_id":"f3e78f71-fb45-4da2-8549-60d605283617","resolution":{"observed_at":"2026-08-11T19:09:53.823332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.829780Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.829780Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:7cf4fe5d84f0df3520e70fd65495a3071498de3cc8feeb7f90e1d2a040b7d069","observation_id":"6481a611-15a4-4696-8bf7-50a41fd79e94","resolution":{"observed_at":"2026-08-11T19:09:53.829780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.838358Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.838358Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:10eaa49b29e37f8326c92aee694ecbb3566177828d90bbd63668049e942aaa2c","observation_id":"a2c90d26-5996-498a-b768-75edae709482","resolution":{"observed_at":"2026-08-11T19:09:53.838358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.4839","last_updated":"2013-06-20T10:53:42Z","snapshot_observed_at":"2026-08-09T21:46:44.280239Z","submitted_at":"2012-05-22T08:36:41Z","title":"Off-Policy Actor-Critic","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.4839","snapshot_observed_at":"2026-08-11T19:09:53.847628Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.847628Z"},"links":{"cited_paper":"/paper/1205.4839","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:822bec9433f46a246ed256fd68d2645aaa77357136318aa2f0a9a133181fa97f","observation_id":"840cd487-d96a-4fdf-b43f-492de65b5755","resolution":{"observed_at":"2026-08-11T19:09:53.847628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.859480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.859480Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:f9d1b0714e049545a41ad797d40383d64616b5a4709ecdfd5b2734223689b24e","observation_id":"b7d33566-2f04-4e2a-bc4b-e8f91f0f4e92","resolution":{"observed_at":"2026-08-11T19:09:53.859480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09637","last_updated":"2021-07-28T12:49:43Z","snapshot_observed_at":"2026-07-06T11:11:12.398524Z","submitted_at":"2021-05-20T10:14:23Z","title":"Navigation Turing Test (NTT): Learning to Evaluate Human-Like Navigation","version":2},"cited_work":{"arxiv_id":"2105.09637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.09637","snapshot_observed_at":"2026-08-11T19:09:57.676819Z","title":"Navigation Turing Test (NTT): Learning to Evaluate Human-Like Navigation","venue":"cs.AI","work_id":"f16998fc-abe9-4de8-a0e1-eceadca50ae3","year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.867372Z"},"links":{"cited_paper":"/paper/2105.09637","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:a952ee20bd83ffe704731fd830c76b96939d04235e96dd32c6e7a21a70ccf423","observation_id":"f24761a7-93a9-4391-bcbd-ec185d154813","resolution":{"observed_at":"2026-08-11T19:09:57.685950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.874206Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.874206Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:4e8e724fa4f1551e47d6d4583400385d179c90d53120e3b0267305649b4c63ec","observation_id":"9ef83963-391c-4eb3-9626-493e391a1fad","resolution":{"observed_at":"2026-08-11T19:09:53.874206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.884208Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.884208Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:37e374eefae032922ce4bb1c2bc5103eea3e087e95a9e5bce775364a131211ae","observation_id":"119dc798-9155-4d1a-bdd8-c78ebf838a5c","resolution":{"observed_at":"2026-08-11T19:09:53.884208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.893045Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.893045Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:da20fe3a98449199c7d18f585417cf9e091172eb83c00b1fb9b761e38c796e8a","observation_id":"da1f14d4-daf7-49d3-8e4f-5fa224e7e0f5","resolution":{"observed_at":"2026-08-11T19:09:53.893045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.901334Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.901334Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:794669e1c5921c790173ba1dffd0f47d16da76d2951b8e773a83ced0ec70719f","observation_id":"d48b8830-6454-4c79-a88c-9a5f82028692","resolution":{"observed_at":"2026-08-11T19:09:53.901334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02224","last_updated":"2020-11-25T19:33:00Z","snapshot_observed_at":"2026-07-06T07:19:25.218264Z","submitted_at":"2018-12-05T21:00:44Z","title":"Adapting Auxiliary Losses Using Gradient Similarity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02224","snapshot_observed_at":"2026-08-11T19:09:53.907440Z","title":"M., Jayakumar, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.907440Z"},"links":{"cited_paper":"/paper/1812.02224","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:1e59f8c66eb1b23e4de49ff4037985a2f3474b435444045a552f63477446c177","observation_id":"4b3be87f-bb72-460c-a6e4-7105fdf137d7","resolution":{"observed_at":"2026-08-11T19:09:53.907440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.914874Z","title":"J., Li, J., Paduraru, C., Gowal, S., and Hester, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.914874Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:670331ca711c0d323e765d58d997acfcc06cd08f24ac392431b185b15e34c8bf","observation_id":"0c18a82c-181b-4524-abf1-92d04fec2c01","resolution":{"observed_at":"2026-08-11T19:09:53.914874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-07-06T07:49:17.886466Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-11T19:09:53.923218Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.923218Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:62b2a3f4c4bd24e6fa3fa1e09416b07c6c1a439903b79831d4c5e179afe3487b","observation_id":"f2f5c98f-554d-4115-8e66-ef28c1c9709f","resolution":{"observed_at":"2026-08-11T19:09:53.923218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.932442Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.932442Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:2f9a12593465cef2babc5d7057adf1d2045844a456c2c6f1ebc7ba7afe95945f","observation_id":"c92bf16c-a7b9-4c30-b04e-397ca3f3ed6f","resolution":{"observed_at":"2026-08-11T19:09:53.932442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.938774Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.938774Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:9e71c0c93ee87e67506a9b917f4e8326c5fe76803534e1332c4ac7fbe7618c1e","observation_id":"99be24b8-21b7-4ab8-ad38-9033571aafd8","resolution":{"observed_at":"2026-08-11T19:09:53.938774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.944887Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.944887Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:749c2529dcbba1493b6730952be350393970228edeb8878373acac7eeef097f9","observation_id":"f9c15b42-3b19-488e-b03c-07cbbd1e7e9c","resolution":{"observed_at":"2026-08-11T19:09:53.944887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.951291Z","title":"and Schuffenhauer, A","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.951291Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:96881a160fe02c59a285591dcf2e90ed74313a2356a7bb22ae8379a7a198eba7","observation_id":"faab6a52-19b8-4e91-bb55-212383f004b9","resolution":{"observed_at":"2026-08-11T19:09:53.951291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.958861Z","title":"and Gao, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.958861Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:372758103128d67b71c5bf028bbcbc87df567fcd45a57413ae4d744d71d1dda4","observation_id":"8c2c311c-7bfd-4269-bdc8-f213738306d2","resolution":{"observed_at":"2026-08-11T19:09:53.958861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06865","last_updated":"2019-02-28T18:32:24Z","snapshot_observed_at":"2026-07-06T07:33:58.446265Z","submitted_at":"2019-02-19T02:36:14Z","title":"Hyperbolic Discounting and Learning over Multiple Horizons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06865","snapshot_observed_at":"2026-08-11T19:09:53.965045Z","title":"G., and Larochelle, H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.965045Z"},"links":{"cited_paper":"/paper/1902.06865","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:771db3514d8f2142d7d122118d9f54387f3054d1df976b53d9ee8c695e95e1fa","observation_id":"9bb42d6f-36d9-44ee-80e2-991f392c92c2","resolution":{"observed_at":"2026-08-11T19:09:53.965045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00955","last_updated":"2023-06-01T01:24:53Z","snapshot_observed_at":"2026-08-11T05:19:23.228742Z","submitted_at":"2023-05-01T17:36:06Z","title":"Bridging the Gap: A Survey on Integrating (Human) Feedback for Natural Language Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00955","snapshot_observed_at":"2026-08-11T19:09:53.971554Z","title":"H., Bertsch, A., de Souza, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.971554Z"},"links":{"cited_paper":"/paper/2305.00955","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:19caebd5e7ee4931eb98237090b38952bff8d144963f292f7059325fde492241","observation_id":"2e84dc15-c216-4e34-9b02-16f2c88580e5","resolution":{"observed_at":"2026-08-11T19:09:53.971554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03852","last_updated":"2016-11-25T08:09:55Z","snapshot_observed_at":"2026-07-06T05:18:19.763133Z","submitted_at":"2016-11-11T20:53:45Z","title":"A Connection between Generative Adversarial Networks, Inverse Reinforcement Learning, and Energy-Based Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03852","snapshot_observed_at":"2026-08-11T19:09:53.984622Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.984622Z"},"links":{"cited_paper":"/paper/1611.03852","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e7c280f5dfe028885f8f1645aef0144b078c3636dac1c9ee6c025165e2c4e455","observation_id":"c3164b18-2f78-43eb-bf76-2278eabe7854","resolution":{"observed_at":"2026-08-11T19:09:53.984622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:53.995214Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:53.995214Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:515aac1c26d1b73ebd88c796fea3ce5c3b31bbc9fe6c6857b6bf1e5839b8e757","observation_id":"d6382932-a9f2-460d-b85a-2396b92285ca","resolution":{"observed_at":"2026-08-11T19:09:53.995214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:09:54.006504Z","title":"A., de Freitas, N., and Whiteson, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:54.006504Z"},"links":{"citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:627dbf88163b08e9db06b240b06873c01614f544314add82e6c671f96cd9db01","observation_id":"5ecfacdc-344f-4fdf-b7a1-031a4d44fca1","resolution":{"observed_at":"2026-08-11T19:09:54.006504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 0 inbound Pith citation observations for arXiv:2412.07177."}