{"as_of":"2026-08-09T00:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:589d14da602449f71a48423aeb00feb4d891f7c4e42444eb7c3074da3888a33c","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:23:18.766484Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.20955/citation-record","integrity":"/paper/2510.20955/integrity","json":"/paper/2510.20955/citation-record.json","paper":"/paper/2510.20955"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:16.377418Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.377418Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:4441ad202e9377bbb303330cfa2e2d66def52bff9aaf307640cc98d25b3e0b5a","observation_id":"d002d5ba-f0b3-45eb-b9c1-d28f76f2ab0a","resolution":{"observed_at":"2026-08-04T08:23:16.377418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:16.450527Z","title":"Routledge, 1 edition, March 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.450527Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:fff99eb34a29f4d01101cef9b0bfc84af4a8690ddefd8fdea28b7847027d8c1a","observation_id":"e5679ba1-b9ca-4190-ad85-1b7305c34d1e","resolution":{"observed_at":"2026-08-04T08:23:16.450527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:16.582957Z","title":"CONSERV ATIVE SAFETY CRITICS FOR EXPLORATION","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.582957Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:abb5fd00a497c4073f86cce8960347b07a5afcf8e3adc125ba2b1f1792ca6a4b","observation_id":"fa6f2bd6-f182-4ac9-bf2d-4d4cf721afc1","resolution":{"observed_at":"2026-08-04T08:23:16.582957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14603","last_updated":"2020-10-27T20:53:20Z","snapshot_observed_at":"2026-07-06T10:09:10.434213Z","submitted_at":"2020-10-27T20:53:20Z","title":"Learning to be Safe: Deep RL with a Safety Critic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14603","snapshot_observed_at":"2026-08-04T08:23:16.668291Z","title":"Learning to be Safe: Deep RL with a Safety Critic, October 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.668291Z"},"links":{"cited_paper":"/paper/2010.14603","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:c0e01455493d1de1de1482491cf384f8beaa8d8e95131b9b6145e334eb89b1e4","observation_id":"8e12a26a-0b8f-4316-a43e-de9d1cb365ea","resolution":{"observed_at":"2026-08-04T08:23:16.668291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10765","last_updated":"2022-10-19T17:57:24Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:57:24Z","title":"When to Ask for Help: Proactive Interventions in Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10765","snapshot_observed_at":"2026-08-04T08:23:16.784317Z","title":"When to Ask for Help: Proactive Interventions in Autonomous Reinforcement Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.784317Z"},"links":{"cited_paper":"/paper/2210.10765","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:60211eeff676c4fc64288fddf9a610de7398119deff9d2413344776ddd1cd3b0","observation_id":"cf35bea8-2c67-4dfc-bef7-1fb15046095b","resolution":{"observed_at":"2026-08-04T08:23:16.784317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:16.953434Z","title":"Safe Exploration in Finite Markov Decision Processes with Gaussian Pro- cesses","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.953434Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:49c5f2542beeadb8d63e4efbdbc67bc7b789233d8403950fb1da611060efc3dd","observation_id":"12c2574e-a244-494b-af2e-738480f6f563","resolution":{"observed_at":"2026-08-04T08:23:16.953434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.06626","last_updated":"2020-08-15T02:20:23Z","snapshot_observed_at":"2026-07-06T09:47:22.472576Z","submitted_at":"2020-08-15T02:20:23Z","title":"Safe Reinforcement Learning in Constrained Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.06626","snapshot_observed_at":"2026-08-04T08:23:17.086576Z","title":"Safe Reinforcement Learning in Con- strained Markov Decision Processes, August 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.086576Z"},"links":{"cited_paper":"/paper/2008.06626","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:6b069d60399aaadc6fbdb32502f2bed5fae530aa151eca55f57d74ddfe347491","observation_id":"fdc35601-a69a-49eb-8b83-ff7e9319b0f3","resolution":{"observed_at":"2026-08-04T08:23:17.086576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.205448Z","title":"Safe Reinforcement Learning via Shielding.AAAI, 32(1), April 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.205448Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:d3085ab566b5ee4cb817cf57a35f186b9c72e8d82c95cd58955c0b28f5d14274","observation_id":"c6cb463e-ce38-44cc-9444-d781801f1e21","resolution":{"observed_at":"2026-08-04T08:23:17.205448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.285222Z","title":"Safe Reinforcement Learning with Nonlinear Dy- namics via Model Predictive Shielding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.285222Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:74ab405bbf653e170197200f5e459f93d7e4567fa91b78566ffb8cfc646b77aa","observation_id":"3582263d-2d16-4753-a0f0-9621a0cbf0a9","resolution":{"observed_at":"2026-08-04T08:23:17.285222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.380279Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.380279Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:33bc9cb5e7d158725c18fa1469cb572bd9a66876c97806ee72776495594b0b39","observation_id":"998d193a-75b9-4e03-bd13-e9465e87a9a5","resolution":{"observed_at":"2026-08-04T08:23:17.380279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.529192Z","title":"Don’t Do Things You Can’t Undo: Reversibility Models for Generating Safe Behaviours","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.529192Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:63b9a195bbb0b6dddfdca8d36deb81127212a90c5f126276a4d2ac083ed60701","observation_id":"490d46d0-bf0f-4fc8-b93d-e41402c77adb","resolution":{"observed_at":"2026-08-04T08:23:17.529192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.672838Z","title":"Cambridge University Press, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.672838Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:59b66d254738ec4d2dc533350f577606d5e2502e16b8cf6c389b3a62a862e76e","observation_id":"a9f65f6a-489d-4f6c-a1cb-a04375ead61a","resolution":{"observed_at":"2026-08-04T08:23:17.672838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.788317Z","title":"Provable Safe Reinforcement Learning with Binary Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.788317Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:17a6dcbeddf6e7cd0c4b2cf9aed3002f43a4c7f7a761c43dacf7109bfb451be3","observation_id":"54401f63-8d5d-4511-a70b-e178a217bf14","resolution":{"observed_at":"2026-08-04T08:23:17.788317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.931055Z","title":"Long- Term Safe Reinforcement Learning with Binary Feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.931055Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:24422df0db26a31110fe9d1539dbe88cadfd04bb34d9d7c6aa28609f227e921a","observation_id":"664222e5-c045-424b-a530-f2fe0d5345ba","resolution":{"observed_at":"2026-08-04T08:23:17.931055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.079016Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.079016Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:f2e9695b2935f231c53aafa7e6bd2f89b22ebb3f4358e5a26de85d17edb32356","observation_id":"264d2a0c-e579-41fc-b2b5-4d689e9e7c31","resolution":{"observed_at":"2026-08-04T08:23:18.079016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06782","last_updated":"2017-11-18T00:53:20Z","snapshot_observed_at":"2026-08-01T16:00:14.137282Z","submitted_at":"2017-11-18T00:53:20Z","title":"Leave no Trace: Learning to Reset for Safe and Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06782","snapshot_observed_at":"2026-08-04T08:23:18.222593Z","title":"Leave no Trace: Learning to Reset for Safe and Autonomous Rein- forcement Learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.222593Z"},"links":{"cited_paper":"/paper/1711.06782","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:3b894069319abd955f8afd9c168cdce3135dbf9164f29bc58e435e873a88fe01","observation_id":"8910cac7-dc28-4891-a1e6-64f93d882b89","resolution":{"observed_at":"2026-08-04T08:23:18.222593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.329391Z","title":"There is no turning back: A self-supervised approach for reversibility-aware reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.329391Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:d51076ac34fa03def2e83fdae513a0b75e985810d553518c9607a498125eb3e2","observation_id":"ecab50ad-98cc-4e6d-a1f7-812770ed790c","resolution":{"observed_at":"2026-08-04T08:23:18.329391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.446978Z","title":"Dy- namic model predictive shielding for provably safe reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.446978Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:b49c65daae42782c4034713440f064f15805dbdaece6a5265a1641798881eb43","observation_id":"a2e2688b-4d2a-429b-81a7-68c283a5e5da","resolution":{"observed_at":"2026-08-04T08:23:18.446978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.535761Z","title":"Rehg, and Evangelos A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.535761Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:95057089ff66790b8f3ec8630708b5daf50d0f6fa276328069321fa57735be29","observation_id":"ea34a4fd-7ac3-40de-baf5-94c87038145f","resolution":{"observed_at":"2026-08-04T08:23:18.535761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-04T08:23:18.615603Z","title":"Gymnasium: A standard in- terface for reinforcement learning environments.arXiv preprint arXiv:2407.17032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.615603Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:9dd3779dc5100b9e986e0db1c5240e31042420aadfec92212c9a84e42987bd9d","observation_id":"14589165-7326-40fa-86ab-bda16ccf679e","resolution":{"observed_at":"2026-08-04T08:23:18.615603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T08:23:18.680672Z","title":"Proximal policy optimization algorithms.ArXiv, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.680672Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:19e394f15611bcdc5f75c03a17d4e7bbd787d2887b32ea3671bce64070539eba","observation_id":"ffdf6320-4555-472b-a790-9f719672b14c","resolution":{"observed_at":"2026-08-04T08:23:18.680672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.766484Z","title":"Stable-baselines3: Reliable reinforcement learning implementations.Journal of Machine Learning Research, 22(268):1–8, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.766484Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:a4d015a933db7756d286d0b70a8f7a9622dd58ceba84fac9d8c10aa86dc23cbc","observation_id":"5651fbe5-046a-4a35-b287-724bf2bbf840","resolution":{"observed_at":"2026-08-04T08:23:18.766484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T22:56:39.434531Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2510.20955."}