{"as_of":"2026-08-09T11:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05fc47bd65923159925b3d0050e8b73fa2ceaac21f626e2be831de05b813e566","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T05:46:03.704125Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08925/citation-record","integrity":"/paper/2607.08925/integrity","json":"/paper/2607.08925/citation-record.json","paper":"/paper/2607.08925"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Ames, Samuel Coogan, Magnus Egerstedt, Gennaro Notomista, Koushil Sreenath, and Paulo Tabuada","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:669aa2374d4f5f1f9d11c9b9f38743a7e292d274413f0dd0a0d9ee55694e8b1b","observation_id":"3218436a-3f43-4a88-a9ef-215fee392dff","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"ISBN 9781605585161","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:522bb375352c843901d0217a66d085159bd5642b7655633258604e7a09cadc24","observation_id":"374f5067-d0b1-4270-8333-5a612d899c26","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-07-06T06:20:24.181731Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Safe exploration in continuous action spaces.CoRR, abs/1801.08757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:3ee6537b872f7b076c7816043cf138b5be84a2be8e7e252d51e27bc3de21f84f","observation_id":"1ef3ff0c-df5d-4e33-82bc-da561075d2e6","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2019.xv.011","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mohammadhosein Hasanbeig, Alessandro Abate, and Daniel Kroening","venue":null,"work_id":"5feed32e-0d04-4f2f-93b8-d722bdef088d","year":2019},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:c2ad86ea8a165a31d277ea0c16f08e64820c59023731acb0dd9b7897a68fa996","observation_id":"6ff456a5-5f81-491e-a958-8b54531a3919","resolution":{"observed_at":"2026-07-13T05:49:23.740269Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:19:58.249204+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:19:58.249204+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Shengyi Huang, Rousslan Fernand Julien Dossa, Chang Ye, Jeff Braga, Dipam Chakraborty, Kinal Mehta, and Jo ao G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:4c5e5d6275bae90dfab85c7a3dccd763b57940241c36dfbf0589148745f58955","observation_id":"f32a5ce2-e4b7-44ed-9bd1-c20276b28357","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Choi, Michael Janner, Claire J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:b28e221b31333503ff50939612a50417d068a6cca470a05759c40a36ac7b3ab7","observation_id":"23c698ac-9b57-4aad-8d25-47142d5a8b12","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Ashish Kumar, Zipeng Fu, Deepak Pathak, and Jitendra Malik","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:7d658556a2ea017ef70d77409c5bf9277a0f99d4b1aa3d0678740c4bec04b3a0","observation_id":"561d899a-c361-4a7d-a6b1-30e1e74cffbe","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07517","last_updated":"2019-01-22T18:45:42Z","snapshot_observed_at":"2026-08-01T15:17:12.152372Z","submitted_at":"2019-01-22T18:45:42Z","title":"Robust Recovery Controller for a Quadrupedal Robot using Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1901.07517","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.07517","snapshot_observed_at":"2026-07-13T05:49:23.733820Z","title":"Robust Recovery Controller for a Quadrupedal Robot using Deep Reinforcement Learning","venue":"cs.RO","work_id":"fb957c62-7553-42bd-b9e5-8c7191b5cd6e","year":2019},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/1901.07517","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:b904297790cddea9c2b5d4e8c743cb8a6c33f54ffe100808c4f483776eb44fe7","observation_id":"66ea9a09-f858-46da-b009-5dc576c9b0d3","resolution":{"observed_at":"2026-07-13T05:49:23.735751Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Sanmit Narvekar, Bei Peng, Matteo Leonetti, Jivko Sinapov, Matthew E","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:76da5e461f96d5c5db0caec3350f68b23fc9705263a770c63ae79f1512d732ce","observation_id":"358108df-7596-4570-8fd8-9900570da405","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Xue Bin Peng, Erwin Coumans, Tingnan Zhang, Tsang-Wei Edward Lee, Jie Tan, and Sergey Levine","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:871d920182962daf2c3b322f2765c5f603a74a18ef72478d2425a19d141fd8ec","observation_id":"dccd144d-696a-4a93-96b5-cab7972b1249","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Xun Pua and Majid Khadiv","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:959771c56d65991a90f8ae0ee6f698d1b8d3637771219fc71aec35fdceffd479","observation_id":"2f8ac172-9061-47f4-a0bf-f0aaad2a9e55","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/humanoids58906","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:49:23.730844Z","title":"2024.10769799","venue":null,"work_id":"8b822184-e294-454a-8b4b-9dcf948906e2","year":2024},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:cb27ec91e0c64b381daf8003c69c0c7769d827a28a6aa280e7a4da790329a7e7","observation_id":"074112a7-aa09-4956-887b-1a17c04d10ff","resolution":{"observed_at":"2026-07-13T05:49:23.732396Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:19:59.963935+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:19:59.963935+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:1ca5870d1c145ea9bee7876916116d536c456e012a8dde8a2c173713d9f74265","observation_id":"61f99978-a860-4a60-828d-9d1ff0eeb965","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Trial without error: Towards safe reinforcement learning via human intervention","venue":null,"work_id":null,"year":2067},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:fdc39acfa7cb9bde45b4d420de7cb910bafb65cd6b4ebce6d471aa376b607c3f","observation_id":"7f1f459e-8eb2-4ee1-a0ac-7e6defe77733","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Proximal policy optimiza- tion algorithms.CoRR, abs/1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:29de62ecf76a911c1127b6c625ec461f627573e70b9f10ae7e9cdf593e9801a9","observation_id":"258d8482-dc10-4668-9ef7-1a446d1fb73c","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2023.xix.051","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, J","venue":null,"work_id":"655d3322-8e18-4dc4-bdc0-8009b3c600f8","year":2023},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:1f8bd44ab5235b0912bef14d4b621878847046851a0ed3c5ae5bab8bcec9c68b","observation_id":"71ae7c4e-07b1-4d91-9455-667a6c5dbe44","resolution":{"observed_at":"2026-07-13T05:49:23.761511Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:20:00.222498+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:20:00.222498+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14603","last_updated":"2020-10-27T20:53:20Z","snapshot_observed_at":"2026-07-06T10:09:10.434213Z","submitted_at":"2020-10-27T20:53:20Z","title":"Learning to be Safe: Deep RL with a Safety Critic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14603","snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Learning to be safe: Deep RL with a safety critic.CoRR, abs/2010.14603,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/2010.14603","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:b9b83081fe8d9f7b7ef2c17c9e4f79e234b3efa5d20c9c00743473a77ce95c78","observation_id":"47bd04e3-9676-486c-956f-e380a6bf15f0","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Sim-to-real: Learning agile locomotion for quadruped robots","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:04e9b31e89bc9f5d344ca8228f2e414b87303bc3bc3e6bf6b426f120c846a7ee","observation_id":"6fbf0afc-f137-487a-8e8e-33a50aeca87e","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-07T08:33:38.128537Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Chen Tessler, Daniel J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:967a0b8f915503984e7628603ce2915b17f5664de9605e72cae67c0c152a4b38","observation_id":"a91ff146-8d42-498a-bb9e-1893a6f293b2","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Emanuel Todorov, Tom Erez, and Yuval Tassa","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:29c9bbfb45e8eb16582b201ea383fc59f71d6084afd00163bd3677b6dfa3cc6b","observation_id":"56cdc0bd-9fc4-48a2-a58c-b8b6cc9060b6","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Mark Towers, Jordan K","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:0b554fdde754389f85786f7bb1005ec13c0214095637ec8d97fbb4004a560b9f","observation_id":"06645f40-c119-4ad3-a0dd-57568a859669","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"URLhttps://doi.org/10.24963/ijcai.2024/913","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:cddfb543ba131e2b8462e8fef2fb80b1f253c30f13478b7f752f73c36d3c2f7a","observation_id":"ffc01a51-20ed-4a4c-bfd2-176bcd8158ed","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Kevin Zakka, Yuval Tassa, and MuJoCo Menagerie Contributors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:194d80d0e9085d75b0e60bccab709d19691844863c7901c7dfb718a88b4b01ce","observation_id":"f6355c3b-f2b4-4c47-90bf-b0fef8aed300","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2023/763","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://doi.org/10.24963/ijcai.2023/763","venue":null,"work_id":"60a106af-052b-4d9c-9eed-10d5213ba065","year":2023},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:c046e602e9cf98d8fbdc8bc3c7e542fbc935d06c0e18ff2d8efb8e1c2331b4b6","observation_id":"4da7ee70-3e09-4f31-b7a0-41fbf86662a1","resolution":{"observed_at":"2026-07-13T05:49:23.749250Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:20:01.478306+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:20:01.478306+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Clipping bounds variance downstream of the singularity rather than removing it","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:9db005a546d4483baa2add84f8b3a90322e7b37abe47c759428d5f980bf2b030","observation_id":"2fe6394f-3268-4bcf-9cc2-11947860fb17","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:5be2d9b59763a08e68f8ce86484a12217a453809499b679d43522cb81af672d5","observation_id":"30d9b33d-1e35-4927-a0c1-db54f7ecacd9","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:9ca4a65f6eb17f5339adbcdedbe572f1758fc9b68c4aa1a5caf8754b50743bcc","observation_id":"7879240e-bc99-45df-b474-a43106d4cbba","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:2d3e6c3c73d01f6ba6cbd4fa99510a0e8ce5bd0c7946051dadd8fedc0409da62","observation_id":"281778e4-fe75-4cbe-b09f-56f2c4bb271f","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"CPO and PPO-Lagrangian additionally carry the constraint hyperparameters their objective requires (Section C.3)","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:32b7992e48cefb0d9304c9942e7e204d0c82673709e1f3eb0e57569497dc6a79","observation_id":"9722ad14-7b7e-44dd-89cf-5a72673eead8","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:1d527c31a014ca03b5810abf4d7d51d5146d298b2a53a743bda65ddf6f067bae","observation_id":"36000acf-9365-4be8-a4b0-19692dbfcb5d","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:8611c2ec968a300b9ce38804a37aa1954010581f94de3515aebca2f3bd44a6eb","observation_id":"5209fcc6-7cba-41d5-8ac8-b87faf89dc3e","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"global”). An alternative “per-segment","venue":null,"work_id":null,"year":2044},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:3f23b9363856f37a83a9de8f73b4c4eb3167d11e099eb32113db0dab295948e4","observation_id":"ea2c3ada-c1ea-42b8-a5d1-ffe5a9adc628","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:7a766d4e19930f88c8d0626430fe683f7dd3a2b754735bd910f136eeeba6c0c0","observation_id":"b2ce74f8-3002-4757-8960-f03e60a71d89","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2066},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:704b8e39434e8fcd69fb6d66219af2df136dfdd047fca99c99d656d46a0be353","observation_id":"a347c806-4456-4019-bf06-729146d76549","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T14:19:50.000556Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.08925."}