{"as_of":"2026-08-21T15:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5e970eb73d5f8930da0a277680ada73c30470046ab98b702fe9ef326881ef7a","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:43:45.832423Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00989/citation-record","integrity":"/paper/2501.00989/integrity","json":"/paper/2501.00989/citation-record.json","paper":"/paper/2501.00989"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.709054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.709054Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:64278b35610c78a8fa5206b21c021edb58c6c63bac039c48f0b01c00cda0a914","observation_id":"24a7380b-2ca3-44c6-bc1f-2355497b3a6b","resolution":{"observed_at":"2026-08-10T22:43:45.709054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.712804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.712804Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:6b6063b7082a5ac0708d61edcc4a66d38bd4b746c27031ac4ae7bc93773bfa6a","observation_id":"cd6c57b4-feb6-4759-b7ed-0b2f80089874","resolution":{"observed_at":"2026-08-10T22:43:45.712804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.716232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.716232Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:4dadd4161de4368229ba33ef3cc6536abae7d19602bd67b67fa5a8935f3200e2","observation_id":"6b45d049-e07b-475e-ae3c-3231c7a91a7a","resolution":{"observed_at":"2026-08-10T22:43:45.716232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.189594Z","title":"T.; Suarez, F.; and Zhang, Y","venue":null,"work_id":"ebebc988-038d-4fe4-91ca-79a5899d7a20","year":2024},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.720648Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:9348e52d486b09b1b67196d740eb0208c88eff55ddfaa3c3ee78694dfe79df36","observation_id":"f8b26da0-1780-4078-8fce-0b5ca86d197c","resolution":{"observed_at":"2026-08-10T22:43:46.192989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.177048Z","title":null,"venue":null,"work_id":"a6cbda0b-71d3-4162-9550-8fb66ab35134","year":2020},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.725313Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:fabb99a55cffd4848daea44b938fe224d796e1a2c6cc44a8926856bc23f0f334","observation_id":"df629b8a-40f1-4575-a669-ba40a6bccd42","resolution":{"observed_at":"2026-08-10T22:43:46.180911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.729078Z","title":"G.; Naddaf, Y.; Veness, J.; and Bowling, M","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.729078Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:4efad2af34ca1f7cbf051330b3f0df160964c71ca4474f6d4eb57c0fcdac5091","observation_id":"630ad25f-91e4-464d-915d-0fcf3c612d09","resolution":{"observed_at":"2026-08-10T22:43:45.729078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.161505Z","title":null,"venue":null,"work_id":"b5bb70a6-99c5-4f80-97d0-f079b48f1bac","year":2021},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.733680Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:7bd606392ab67e6cea0afaf556a437712d39ff5554ae9a5331920c098222d01a","observation_id":"dfe946b6-0a5c-4147-8c50-2b5f83d078a4","resolution":{"observed_at":"2026-08-10T22:43:46.164770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.150704Z","title":null,"venue":null,"work_id":"4fcf959e-e6c7-4f62-aac2-a93480c8d34b","year":2023},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.736803Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:d04a1346b34e8c4533500807e858192a3692cfc0d4d51878888cdee5da86bf72","observation_id":"c354524d-19e4-4b9a-b44c-85252c2c9f05","resolution":{"observed_at":"2026-08-10T22:43:46.154364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.138668Z","title":"Z.; and Talwalkar, A","venue":null,"work_id":"a2b4694a-7c9f-4a93-8509-f293caa222a5","year":2021},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.740744Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:4f0717367e7becc3dca51318a5b9096e0078b1cf12f69ea98afabec5ab3e5c34","observation_id":"2d1b4ba3-f7c8-4b63-aa7a-312f42a8a2a2","resolution":{"observed_at":"2026-08-10T22:43:46.142437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09983","last_updated":"2023-12-18T14:05:56Z","snapshot_observed_at":"2026-08-16T14:34:19.274440Z","submitted_at":"2023-12-15T17:50:18Z","title":"Toward Computationally Efficient Inverse Reinforcement Learning via Reward Shaping","version":2},"cited_work":{"arxiv_id":"2312.09983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.09983","snapshot_observed_at":"2026-08-10T22:43:45.894859Z","title":"Toward Computationally Efficient Inverse Reinforcement Learning via Reward Shaping","venue":"cs.LG","work_id":"373bc9d0-1637-4261-a062-ab623fc702fb","year":2023},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.744171Z"},"links":{"cited_paper":"/paper/2312.09983","citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:0e04cbd7839f76b360b7195272391758233fc9d9b1d42d3671810e8760477736","observation_id":"2165bdd7-1d2a-4e57-ae6f-507a997b2644","resolution":{"observed_at":"2026-08-10T22:43:45.898525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.126725Z","title":"M.; and Kudenko, D","venue":null,"work_id":"a2da2774-9b91-47c1-bd0f-2ded72967bcf","year":2012},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.748284Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:8d5db9cd6abc80928a51c9407e1fb3351096eee7fdf8d8f3fc1d275f465bb8bc","observation_id":"1e577686-a759-4df0-bc51-1f24f252469d","resolution":{"observed_at":"2026-08-10T22:43:46.130261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.752551Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.752551Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:bf2fcaab650adf41d5407f426cd89b9f953317897db25cff594db2971b8f95c2","observation_id":"7e6bb2e4-d0a0-4da6-9377-da7f46607c16","resolution":{"observed_at":"2026-08-10T22:43:45.752551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.110098Z","title":null,"venue":null,"work_id":"03b6df25-d7ce-4a93-9d2b-6fe095691d7c","year":2015},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.756074Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:b728dd82f137555078b56aa56efa5c260f672e3b21096643ad4104e3430fb4ea","observation_id":"6e5691d1-438d-4820-9e51-94db31465a4f","resolution":{"observed_at":"2026-08-10T22:43:46.113511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.100121Z","title":null,"venue":null,"work_id":"77177a81-27b9-402b-8e4c-d156248655b9","year":2021},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.759092Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:8fbe21069877efbea4f180f36148a98550fefd520b5f9f2a13ca094a5177b4db","observation_id":"53d4365f-0c58-4a4a-b53e-f4706207012b","resolution":{"observed_at":"2026-08-10T22:43:46.103855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.086345Z","title":null,"venue":null,"work_id":"e91cc456-361a-4000-a986-c49b4dbea08c","year":2010},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.762081Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:f1ecbc2c7257ee43ed3accb648bc73e6273d83693b106e6cdf9f9de197de73c6","observation_id":"e86f0696-37f3-40e5-b93f-5430164d4e15","resolution":{"observed_at":"2026-08-10T22:43:46.090580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.075737Z","title":null,"venue":null,"work_id":"c8365461-70bb-443d-8e7d-9677d3ab7a08","year":2022},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.764626Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:ac0e0c52884c5c47f0e91744f657c2c5861ef8fb49aae2873a7fdca84d32ca1e","observation_id":"5c9a4280-5693-4484-a427-7305c61ad6ca","resolution":{"observed_at":"2026-08-10T22:43:46.078980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T22:43:45.767300Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.767300Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:f7f12d0276f95163b4fff3d713ea32d14fb5ba9dfd8358c8c3fa5c0678f6ef3c","observation_id":"6a4aa4b3-3ddb-4c4a-a5c5-a38bb0406492","resolution":{"observed_at":"2026-08-10T22:43:45.767300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.064846Z","title":null,"venue":null,"work_id":"c05ef27a-3d41-4015-a4fa-75d509a06b06","year":2020},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.771816Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:4ee981a183c86d37a88a2dbf6649327cfba0b54eebf858d07c0bbd52bcc7c29b","observation_id":"c62c4c17-589b-47d3-b058-de5aa20bd643","resolution":{"observed_at":"2026-08-10T22:43:46.068468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.053894Z","title":null,"venue":null,"work_id":"95531bff-5243-44e1-ba86-1bd7ede5e7ec","year":2022},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.774915Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:e8769c8bdffab9f263b0853962b5c1798e63605bd4018ac66038e026b42cbcdf","observation_id":"d253b2f6-f030-412a-8b07-b01a31e20267","resolution":{"observed_at":"2026-08-10T22:43:46.057591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.09570","last_updated":"2022-12-02T20:26:46Z","snapshot_observed_at":"2026-08-16T16:38:03.826455Z","submitted_at":"2022-08-20T00:37:55Z","title":"Calculus on MDPs: Potential Shaping as a Gradient","version":2},"cited_work":{"arxiv_id":"2208.09570","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.09570","snapshot_observed_at":"2026-08-10T22:43:45.867538Z","title":"Calculus on MDPs: Potential Shaping as a Gradient","venue":"cs.LG","work_id":"1894f0ef-3400-4da7-b43c-c536bae59584","year":2022},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.777927Z"},"links":{"cited_paper":"/paper/2208.09570","citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:e0b83bc1f2915b12d50657de7a44bc5486bbe12a00f84695404fac60b767199d","observation_id":"7e550c94-5c18-4e2a-bbac-664c91793911","resolution":{"observed_at":"2026-08-10T22:43:45.873177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.041837Z","title":null,"venue":null,"work_id":"2b7efdfb-9f73-47e3-bf60-515fcf973865","year":2021},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.781343Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:0e309c89b47ac76a8e39a296e9094086adde0198a5579067287ae0c060f6f4cc","observation_id":"f4fd9fb3-189f-48bc-8f0d-f53bfbc90285","resolution":{"observed_at":"2026-08-10T22:43:46.046001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03029","last_updated":"2025-02-28T12:21:00Z","snapshot_observed_at":"2026-08-16T13:28:15.654041Z","submitted_at":"2024-08-06T08:22:16Z","title":"Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03029","snapshot_observed_at":"2026-08-10T22:43:45.784485Z","title":"V.; Sima, K.; and Leong, T.-Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.784485Z"},"links":{"cited_paper":"/paper/2408.03029","citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:4a38eff3780446a168a1e6d782abe0844f49ca1f83c9e4038cc06e245ee45f41","observation_id":"8dee3306-c78d-4fc6-a8b5-9aa4e6afded6","resolution":{"observed_at":"2026-08-10T22:43:45.784485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.031062Z","title":null,"venue":null,"work_id":"c1696487-5a7e-4d19-83b2-de758855c525","year":1994},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.787838Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:896ec72c0e119da35d8b31abbbed9a49e73d6d1575049c3ac13d24c42c51a8af","observation_id":"ac4c0058-ad51-4e81-ac4c-a89ec94b83fc","resolution":{"observed_at":"2026-08-10T22:43:46.033926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.791785Z","title":"A.; Veness, J.; Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.791785Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:043689c1e5d92047e79fe55b5f70d63a587c779d5a3c1dab59a25c2732ea0432","observation_id":"2c3de4e9-3c0f-490a-aa0b-77a3fb595401","resolution":{"observed_at":"2026-08-10T22:43:45.791785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.013789Z","title":null,"venue":null,"work_id":"446d75de-e9b7-458e-a1cb-8b82c267c287","year":2024},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.795158Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:4d3be31c30ae65ba91fa2c01f96a871a0317c050b0b1a2bd8336303a8b1101ac","observation_id":"7fd0af0d-4edf-434e-b4c7-7a57bd8cb38f","resolution":{"observed_at":"2026-08-10T22:43:46.017673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:46.003291Z","title":"Y.; Harada, D.; and Russell, S","venue":null,"work_id":"e1d8057e-6ff5-42de-a26b-d818154c43a7","year":1999},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.798418Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:bb714f416985e40bb57d3ace348e5844181a70595588a63eeceef133820116c8","observation_id":"ea9492ed-5e34-4610-98a6-939f22487bd1","resolution":{"observed_at":"2026-08-10T22:43:46.006722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.802014Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.802014Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:a301392de96dc23aacc8b2dec3a1dbb4b16623ae336957d4c365355364cb98c3","observation_id":"99294597-3739-4c40-bb95-00960234cd05","resolution":{"observed_at":"2026-08-10T22:43:45.802014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.983852Z","title":null,"venue":null,"work_id":"8c24e424-370c-4595-961f-698eb3c6b60e","year":1998},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.806005Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:b5779623ab334281382c66c363b7b536200ffe65473f01f6309d5bf16e0ae87b","observation_id":"c00e9421-1944-404b-aaa8-465aee37e894","resolution":{"observed_at":"2026-08-10T22:43:45.988892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.809540Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.809540Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:bc0143cee757ddde4843c2d9583e476b23ce4fb81c0e6ccd926510faf0335b77","observation_id":"630d52c0-bd6c-4b3a-84f9-a15786ae0635","resolution":{"observed_at":"2026-08-10T22:43:45.809540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.962862Z","title":null,"venue":null,"work_id":"1c851a88-2f93-48c8-aa08-65eefc760975","year":2024},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.813095Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:63dc6a913de10af6173a598e896b2da396e71d041394efbe5e971aedbcdeba5d","observation_id":"9d426225-b8f0-49e2-b0d8-68955ba96c37","resolution":{"observed_at":"2026-08-10T22:43:45.966804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.951378Z","title":null,"venue":null,"work_id":"77bc6168-c32d-4899-be9b-cdae74ddab25","year":2003},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.816637Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:898d07deedf11d3b619e6c60a5da1162870112708b33aa63b702d0ce0ff32411","observation_id":"b94ec4bb-96a0-41ec-b584-6468a0c4b7b7","resolution":{"observed_at":"2026-08-10T22:43:45.954873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.940521Z","title":null,"venue":null,"work_id":"5accb5d6-8843-4ae7-a633-6f8b51d2f7c0","year":2022},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.820530Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:ae876ce545195ffe2ddfaff2c3bd0ac00c4b993c27e81a3cb121c95364a311f3","observation_id":"69f3a1b8-a24d-4cd9-b3b2-04fc21915783","resolution":{"observed_at":"2026-08-10T22:43:45.943296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.928294Z","title":null,"venue":null,"work_id":"bfcc4e94-71bc-4ca7-905d-072c59cd41c3","year":2021},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.823190Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:a9f7f4ea71089f94665d60b46b1022ac58524c3905ce023efee7d4b9cd815bc5","observation_id":"8c75109e-d08a-46dd-893d-e3616fee15e5","resolution":{"observed_at":"2026-08-10T22:43:45.932389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.916987Z","title":null,"venue":null,"work_id":"e2ab0ba1-3b55-498a-a9dd-0d5b49858c21","year":2021},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.825741Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:41b88c36d601b69abbca2a368ab8eb275febb274fb0a3c897265153737602130","observation_id":"81dcfb84-72ec-4eb1-9973-2822a4726d5a","resolution":{"observed_at":"2026-08-10T22:43:45.921561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.828353Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.828353Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:91d9cc33083aae843feab8d798837bc6520c5c8fa27e732a8824c410b502a28d","observation_id":"db3d696d-7bf3-400e-a563-003084c49b61","resolution":{"observed_at":"2026-08-10T22:43:45.828353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:43:45.832423Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:43:45.832423Z"},"links":{"citing_paper":"/paper/2501.00989"},"observation_digest":"sha256:b2d93a6ab0e2443dce245a3f77acf7c9e1da9fc4ac9f985e6d12b5cea0de9de9","observation_id":"5b8e2588-1a1d-4b16-9913-f5367ca11391","resolution":{"observed_at":"2026-08-10T22:43:45.832423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00989","last_updated":"2025-07-24T18:29:56Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-21T08:19:53.766350Z","submitted_at":"2025-01-02T00:40:55Z","title":"Bootstrapped Reward Shaping"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2501.00989."}