{"as_of":"2026-08-13T15:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46cdac845389b4ecc05a41f2c00440f3e53823acbb8d0c18879d4b3467018393","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:20:56.545141Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11138/citation-record","integrity":"/paper/2412.11138/integrity","json":"/paper/2412.11138/citation-record.json","paper":"/paper/2412.11138"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.249835Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.249835Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:adf686dbc8fff88a3779d81f01b8770accf37773a0f0adce38290b698477a09c","observation_id":"f0800d1b-1221-4dde-9f03-2fb971020bf8","resolution":{"observed_at":"2026-08-11T15:20:56.249835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.456551Z","title":"Constrained policy optimization, 2017","venue":null,"work_id":"d837aa24-7ea2-400f-8c1c-e2973c3a54b0","year":2017},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.255303Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:884922112ac6dbed3c55b320ae51915e4561cc60208ea96ce55925a29415a40d","observation_id":"a360c338-1592-4384-8cbe-68d871306fc0","resolution":{"observed_at":"2026-08-11T15:20:57.460464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.442908Z","title":"Constrained Markov decision processes, volume 7","venue":null,"work_id":"b9470376-1e1a-4258-b403-1517a5728be2","year":1999},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.260145Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:cd9a600dbb4930be0642bfe90e3e8bf453a7ab452332de97da402f16c1d4a190","observation_id":"a71c32c2-d606-4952-b20a-8bda488a1571","resolution":{"observed_at":"2026-08-11T15:20:57.446656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09802","last_updated":"2022-02-06T08:59:29Z","snapshot_observed_at":"2026-08-11T17:30:20.448429Z","submitted_at":"2022-01-24T17:02:22Z","title":"Constrained Policy Optimization via Bayesian World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09802","snapshot_observed_at":"2026-08-11T15:20:56.263978Z","title":"Constrained policy optimization via bayesian world models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.263978Z"},"links":{"cited_paper":"/paper/2201.09802","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:4f2a4aecd3cd5c1107dce124505a17dd847a8616db2490f931304a0811cb269b","observation_id":"d9d7241f-bd17-43b4-910c-2346b9547840","resolution":{"observed_at":"2026-08-11T15:20:56.263978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.427843Z","title":"Robots that interact with humans: a review of safety technologies and standards","venue":null,"work_id":"e29f34ef-5452-4e18-88e8-8ebc9c824c7d","year":2017},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.269227Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:5f85e1eaf6947a573b312f8754f2ed720169b1240524f87549e29a545a380650","observation_id":"b5b70bcd-f0d2-40d2-b46a-593fd00d3b87","resolution":{"observed_at":"2026-08-11T15:20:57.433993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.273249Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.273249Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:a2474519f613d8e01c5d85785f667740457eac54b179a8b80c7a73fec4ee8012","observation_id":"cc377145-760d-4253-b4b2-f0818b5ed36c","resolution":{"observed_at":"2026-08-11T15:20:56.273249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08068","last_updated":"2020-05-16T19:18:10Z","snapshot_observed_at":"2026-08-11T00:03:43.916025Z","submitted_at":"2020-05-16T19:18:10Z","title":"Model-Augmented Actor-Critic: Backpropagating through Paths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08068","snapshot_observed_at":"2026-08-11T15:20:56.278127Z","title":"Model-augmented actor-critic: Backpropagating through paths","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.278127Z"},"links":{"cited_paper":"/paper/2005.08068","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:c52e05e7d1b28d3b4527f96f8b1cee2ef5474600dcc890b6ceada86176ad1581","observation_id":"feb4e2bc-1b61-424a-980b-d7003ef5fec4","resolution":{"observed_at":"2026-08-11T15:20:56.278127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.404420Z","title":"Augmented proximal policy optimization for safe reinforcement learning","venue":null,"work_id":"bf61980c-8ebb-49aa-a83d-458fea657d50","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.283465Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7eeec2bcd7aae5f4e4e2416cbe9a332c90ee94fc1086e8cfc61bc0980932f11b","observation_id":"940c8509-2d63-4ecf-9739-8d5275988a23","resolution":{"observed_at":"2026-08-11T15:20:57.408861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.290448Z","title":"Safe RLHF : Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.290448Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:043a8f9a37646a529dfd35a1c1bcb38eb0f2302e6f23ef9f031d3ee1c25d11c2","observation_id":"fa0132e8-2c18-4e22-a256-bf12ef92e5d8","resolution":{"observed_at":"2026-08-11T15:20:56.290448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.383710Z","title":"A differentiable physics engine for deep learning in robotics","venue":null,"work_id":"58d88a02-eb56-4eb2-b6ce-47532a9de954","year":2019},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.296012Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:2eaa5a91ba6c01cd2991d6bd5f7eb7b71119a7d64c407ffe928cc3a58fa7797b","observation_id":"69df94db-b3f8-4867-9d6b-23b7f539f038","resolution":{"observed_at":"2026-08-11T15:20:57.388846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.372402Z","title":"A., Farouk, H., and Mofreh, E","venue":null,"work_id":"2e51b8c2-a7bd-43ad-bd7c-5dd7344bb270","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.302087Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:04c0a796075c2b8fdc22313e7ce362ced8775afa53056950aa35db2c58dc3679","observation_id":"7e2fba4c-a9f7-4be6-bcaa-350a35f3c12b","resolution":{"observed_at":"2026-08-11T15:20:57.376244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.360740Z","title":"D., Frey, E., Raichuk, A., Girgin, S., Mordatch, I., and Bachem, O","venue":null,"work_id":"6270066f-165f-43d6-acd6-8411c2d1a8e5","year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.306751Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:a213d6fe382102d1c74fb9e6b50274263c5c89de91b825ba879137e04ef7d0cd","observation_id":"7ec16299-e684-4742-9a86-ad0a989acecd","resolution":{"observed_at":"2026-08-11T15:20:57.364745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11633-022-1395-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.593546Z","title":"A Review and Outlook on Predictive Cruise Control of Vehicles and Typical Applications Under Cloud Control System","venue":null,"work_id":"da0e51e5-bfa3-469d-81ee-5c4139518375","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.311323Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9fc9de5fb6815dd471af2327cb454ff7e568a4ab1563eba0d19c844ea5d882e5","observation_id":"998678a0-0f6a-4dc2-8e83-c9718926bce9","resolution":{"observed_at":"2026-08-11T15:20:56.597981Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.318141Z","title":"and Fern \\'a ndez, F","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.318141Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:fd662d2fff3b1d5ac75190cb582738e16d357b86131b22dfc992f9138c746f6d","observation_id":"6da0f8c1-27d8-4aa7-8fb6-e54e96503af9","resolution":{"observed_at":"2026-08-11T15:20:56.318141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.341359Z","title":"Bullet-safety-gym: A framework for constrained reinforcement learning","venue":null,"work_id":"f49e1e14-244f-4276-a700-6faf758f5247","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.322058Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:2bde1d372d206bbae1c2810ce68af45b829da160849c359ab0c35f20316a5f81","observation_id":"2c72b972-cdd9-4fbb-9475-3d4fc74d445a","resolution":{"observed_at":"2026-08-11T15:20:57.345538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.329222Z","title":"and Bhatnagar, S","venue":null,"work_id":"760914e5-a6ba-4c96-b094-eb8814f7fcd3","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.327290Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:bc6c03ad65dbb9ab0ba0faf5d25b315d936aaedca59678ca05d9d4b77c36b554","observation_id":"2bc3246a-e9f7-4e8a-9fbe-5c0dc54e1b5d","resolution":{"observed_at":"2026-08-11T15:20:57.333323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.309030Z","title":"Personalized robotic control via constrained multi-objective reinforcement learning","venue":null,"work_id":"21d833b4-3a0a-4e95-bc93-a01934c22d1c","year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.331700Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:01e17e3949be621d703a6332430ec927ef313ea6c293deae68600839615a8bbf","observation_id":"af741505-959b-40aa-86ed-88620819c127","resolution":{"observed_at":"2026-08-11T15:20:57.314490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00806","last_updated":"2025-08-26T17:27:30Z","snapshot_observed_at":"2026-07-06T12:43:02.968556Z","submitted_at":"2022-03-02T00:56:23Z","title":"Dojo: A Differentiable Physics Engine for Robotics","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00806","snapshot_observed_at":"2026-08-11T15:20:56.336180Z","title":"A., Cleac'h, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.336180Z"},"links":{"cited_paper":"/paper/2203.00806","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:16956207edc83dacd036aabb9a4ccc0754ef0428b99777d0f7e542a7860e134c","observation_id":"dd8f973c-9032-4d22-a699-aebf289f3952","resolution":{"observed_at":"2026-08-11T15:20:56.336180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.282088Z","title":"Deep differentiable reinforcement learning and optimal trading","venue":null,"work_id":"834c0f9e-b5f2-4ab7-b2bb-30a509616c47","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.341108Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:0091bf99c7a207bc9c0ce016704e69249c5501934db259bec7387f7a0bab1de6","observation_id":"542a055a-db30-4c96-9c4f-51a54f4500b6","resolution":{"observed_at":"2026-08-11T15:20:57.287611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-11T15:20:56.344908Z","title":"Ai alignment: A comprehensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.344908Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:0e3c06488da9163f6e8f694ac45cfdebd3dcb64e06aa3ba44f0a023059ea9fdc","observation_id":"d9df688e-ce39-4a8d-8168-6830c17bb556","resolution":{"observed_at":"2026-08-11T15:20:56.344908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12567","last_updated":"2024-10-06T15:42:14Z","snapshot_observed_at":"2026-08-13T10:54:00.397306Z","submitted_at":"2023-10-19T08:19:28Z","title":"Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12567","snapshot_observed_at":"2026-08-11T15:20:56.349062Z","title":"Safety-gymnasium: A unified safe reinforcement learning benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.349062Z"},"links":{"cited_paper":"/paper/2310.12567","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:ec780d8d83efb90c3fd84df48dce9ba23e9ab49cc4a38baa117c8bf546965fff","observation_id":"bbb0b150-bbd1-441f-988a-92c973798b93","resolution":{"observed_at":"2026-08-11T15:20:56.349062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09304","last_updated":"2023-05-16T09:22:14Z","snapshot_observed_at":"2026-08-13T11:41:50.164846Z","submitted_at":"2023-05-16T09:22:14Z","title":"OmniSafe: An Infrastructure for Accelerating Safe Reinforcement Learning Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09304","snapshot_observed_at":"2026-08-11T15:20:56.353163Z","title":"Omnisafe: An infrastructure for accelerating safe reinforcement learning research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.353163Z"},"links":{"cited_paper":"/paper/2305.09304","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:529f2a08750f97242f49ec7c195bdb92e054a215fb0e9cd650de1031e1f29c10","observation_id":"b1796f7d-c120-452b-b1a1-62d0045df476","resolution":{"observed_at":"2026-08-11T15:20:56.353163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02416","last_updated":"2024-11-02T10:01:38Z","snapshot_observed_at":"2026-08-13T04:27:27.483310Z","submitted_at":"2024-02-04T09:24:51Z","title":"Aligner: Efficient Alignment by Learning to Correct","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02416","snapshot_observed_at":"2026-08-11T15:20:56.357555Z","title":"Aligner: Achieving efficient alignment through weak-to-strong correction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.357555Z"},"links":{"cited_paper":"/paper/2402.02416","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9c155584acfb092b24b008b9bb3b7c334b7bbd1a5e143d58179473954d13f07c","observation_id":"fe97cd66-6674-40cc-8114-c2d85b8c6e79","resolution":{"observed_at":"2026-08-11T15:20:56.357555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.268903Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"aa4d1a2f-cd54-4b4a-a0f2-03f32e4eb252","year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.361653Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:67110818dd2d1b37f6b6b028aeb28e2aca55cc4dacaab87890c5211a9ef25b0f","observation_id":"ffc5257a-0570-4ec5-a019-8bb2b1a35488","resolution":{"observed_at":"2026-08-11T15:20:57.273181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.257778Z","title":null,"venue":null,"work_id":"bc905358-5c73-4772-a3f6-5ae7898e5e6e","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.365601Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:37e53a77caed0ed98c92d652e1739a8c8165eef408cfdabe6c178337b58ad2dd","observation_id":"0c3ca86f-84c8-49a4-a559-a0d2e92c2df0","resolution":{"observed_at":"2026-08-11T15:20:57.261362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.246011Z","title":"and Langford, J","venue":null,"work_id":"67693925-d829-46c3-894f-0fc596c9e655","year":2002},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.369026Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:182f6fcba2f0308a832431017fa63771c248f3f21558b91154f9a3cb55cfd9cb","observation_id":"1cbd7cbe-0eea-4de5-b983-a42d7b8e4fea","resolution":{"observed_at":"2026-08-11T15:20:57.249699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.234180Z","title":"C., Jain, R., and Nuzzo, P","venue":null,"work_id":"50d43103-c26e-4a38-8b6c-f743186ee9b3","year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.372814Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9000ccf99fefee92a2a2e32ff8c2c9e25cbcb770058ee52c55634ba2b4eccecf","observation_id":"ef741c55-a3d1-444e-949e-cf7bdb033418","resolution":{"observed_at":"2026-08-11T15:20:57.238206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.220325Z","title":"Reparameterization gradient for non-differentiable models","venue":null,"work_id":"a8be04bd-3ec3-476c-93d3-d098b2d2428c","year":2018},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.376100Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:78b1d17013330f73a59a731a3ed04597021dc82f14bb92374be6c30ee31713de","observation_id":"305c086e-6476-4c01-a751-90a7ed9ea8bc","resolution":{"observed_at":"2026-08-11T15:20:57.225583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.379471Z","title":"Constrained variational policy optimization for safe reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.379471Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:8095682aeed72b288944fb5385ce3c7ce429857bec3ffebda24bd395f2e8d10f","observation_id":"376d8cbb-5fde-4d28-bcf4-32f3a7da07f5","resolution":{"observed_at":"2026-08-11T15:20:56.379471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.383211Z","title":"An off-policy trust region policy optimization method with monotonic improvement guarantee for deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.383211Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:cd2720d1662da9bf287fc8310760db9f3841b8d46ce9fe6bc9371855036289db","observation_id":"c807d510-2679-498a-a0dd-ba2240b1b7dd","resolution":{"observed_at":"2026-08-11T15:20:56.383211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05803","last_updated":"2022-01-21T02:07:54Z","snapshot_observed_at":"2026-08-08T19:00:30.082098Z","submitted_at":"2021-11-10T16:51:04Z","title":"Gradients are Not All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.05803","snapshot_observed_at":"2026-08-11T15:20:56.386945Z","title":"D., Schoenholz, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.386945Z"},"links":{"cited_paper":"/paper/2111.05803","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:38ad847a10946b934021c1bee0ada8ffb4c2040509baf019f88b4cd599a86421","observation_id":"cbd0547a-70e9-47d5-906c-7bfe07d721c8","resolution":{"observed_at":"2026-08-11T15:20:56.386945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.199692Z","title":"Monte carlo gradient estimation in machine learning","venue":null,"work_id":"c19b8db9-d50e-4ba0-b4b2-f673c97ccbda","year":2020},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.390858Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:b9efbd68d2b9c93e1307fd21b10fc1a0fffcd7dc410b9d8c9f301488f8b76df4","observation_id":"2bc24076-c5a0-407f-b5b7-b541570fd9c8","resolution":{"observed_at":"2026-08-11T15:20:57.204095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.187226Z","title":null,"venue":null,"work_id":"45ae3364-a5b1-44fc-9e61-13cb14b33d4a","year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.394340Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7e530701ec99397677b86cc09cf61ec7ff46b24ee2e6d56e7a628880fa2f6d1b","observation_id":"49bd8828-605e-4244-a788-311f55409221","resolution":{"observed_at":"2026-08-11T15:20:57.191282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.174252Z","title":"A focused backpropagation algorithm for temporal pattern recognition","venue":null,"work_id":"f73215cd-4221-41f8-a1c5-3d7a3fdf648e","year":1995},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.398561Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:df8890ec078e082adc117b4c54408ad7b1e50594e7f925db70f5c3d2f64f6713","observation_id":"7acdd6df-4a9a-4ef2-bff5-8f5a322e9b8b","resolution":{"observed_at":"2026-08-11T15:20:57.178946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.161165Z","title":null,"venue":null,"work_id":"224d1b82-83d3-4c68-a319-6d8aba9d5822","year":2013},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.403481Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:3ca3a4381db0a14d449d3877f32a961abbc2b5efee6cab021154598f9fd8d95b","observation_id":"a63348ae-db32-4cce-ab11-1df098d90384","resolution":{"observed_at":"2026-08-11T15:20:57.165377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.144840Z","title":null,"venue":null,"work_id":"8b0b21b8-3657-4fdd-89bf-f452f21c7979","year":2020},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.407548Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:d57c31b6d96166193447199ccef8c2d57debcf3d76f196a3584f39eb509241c3","observation_id":"cbbc98fb-67aa-411f-bb0a-9dd7e69882c8","resolution":{"observed_at":"2026-08-11T15:20:57.151741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ifacol.2017.08.1649","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.577854Z","title":"Trajectory planning with miscellaneous safety critical zones**this work was supported by ffi - strategic vehicle research and innovation","venue":null,"work_id":"c9d42335-d1e5-4995-bd48-ee47d96ac9e4","year":2017},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.412556Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:c78357ca6257ea57f586f55bfe2a16fdfffd6b4019cc39c3dacf4a88e335b7b7","observation_id":"bf742935-2efa-4048-97d0-0bba24bf954d","resolution":{"observed_at":"2026-08-11T15:20:56.584281Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.130063Z","title":"M., Smaby, N., and Cutkosky, M","venue":null,"work_id":"4e2048b9-9293-4265-88f9-d5b18c0f9d63","year":2000},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.418519Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:2c853e8420918567e9a9928c594689538e4d4d29a65a998ec656384e6d5f464c","observation_id":"c1761bfb-2b04-466e-9cb2-61bcc64c4769","resolution":{"observed_at":"2026-08-11T15:20:57.134741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.423648Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.423648Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:81c5f4910a18087bfece4b416fb6f2dff0a6f9f4433ec56e75f90e27cee31dfd","observation_id":"712e9719-cd9b-4042-80e5-8bb490350a44","resolution":{"observed_at":"2026-08-11T15:20:56.423648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.107645Z","title":"Model-based reinforcement learning with scalable composite policy gradient estimators","venue":null,"work_id":"c33e0ea1-3eb8-413b-9c23-fc873ffa9e94","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.432253Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e3ced99f30eb1424c3f2224a496dfcefeb9a0ef627b0fc057ba9435500ea4a8b","observation_id":"139bfd47-8804-48ff-9cb5-13faf20c5b9b","resolution":{"observed_at":"2026-08-11T15:20:57.112583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.090782Z","title":"Model-based reinforcement learning with scalable composite policy gradient estimators","venue":null,"work_id":"cd02f067-fcbf-4e6d-bdc1-0fff6ee7c26f","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.437224Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:51fa8eed3794b4deb7ff5d4e4f9168e66e03891f547aef5d4f0fa678726c1b59","observation_id":"3114b496-2514-448b-852b-9f77beb9670a","resolution":{"observed_at":"2026-08-11T15:20:57.095465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.078761Z","title":"and Barr, A","venue":null,"work_id":"7408bb2d-b14f-4d1a-9794-5c800c5941a5","year":1987},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.441781Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:c70ecd78013475b541025f2da97af34734a2215dc932f73055313ccf179d475c","observation_id":"633aab94-066a-433e-8a49-dcfaa483f501","resolution":{"observed_at":"2026-08-11T15:20:57.082293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.062637Z","title":"E., Perescu-Popescu, L., and Mastorakis, N","venue":null,"work_id":"6a10a5eb-4a99-48fe-a946-679cea39a756","year":2009},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.446967Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9c46d94c4ecb0b782cdc62a268d4809a1d10a67ce0d3df7640280f418c0e3fed","observation_id":"682a5e1f-371a-4840-b23b-9977cfb85249","resolution":{"observed_at":"2026-08-11T15:20:57.067430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.451697Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.451697Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e686a1c865be7efdd92b038c8faceb2475a5c1f59fe35dabe1d8213005b6c100","observation_id":"efaa3de5-6dd0-45e0-9e11-2630796a9d4a","resolution":{"observed_at":"2026-08-11T15:20:56.451697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.456035Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.456035Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:409171f5aacf6e57843f81f19751ca27b5da455afb0effe3991afa499d3cc105","observation_id":"d5a0be68-f149-4d2b-a9ca-6fb830cd6854","resolution":{"observed_at":"2026-08-11T15:20:56.456035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-11T15:20:56.460994Z","title":"D., and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.460994Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:1d7587172d306e2d3acfe8d2d52b332e56271e9d954a725cf5322141ed10e4a3","observation_id":"5af2260d-6e97-4eb8-8543-0fd2555934bb","resolution":{"observed_at":"2026-08-11T15:20:56.460994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T15:20:56.465505Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.465505Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e1e6c3bccc9bd73e06fb21630e38fb50370ef117ecd38ed9491eef668504cbd3","observation_id":"4cb0e4ea-7af1-4b76-bb84-fdafd028042e","resolution":{"observed_at":"2026-08-11T15:20:56.465505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.470091Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.470091Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:bc767e864ff1c23871db767175a2e66ccb8861f75eb1be63dbaf6b30fc7fcdfb","observation_id":"3a617aa4-eb65-40b0-9b18-09692828d39e","resolution":{"observed_at":"2026-08-11T15:20:56.470091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07237","last_updated":"2019-05-17T14:36:48Z","snapshot_observed_at":"2026-08-10T08:47:05.046455Z","submitted_at":"2019-05-17T14:36:48Z","title":"TBQ($\\sigma$): Improving Efficiency of Trace Utilization for Off-Policy Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1905.07237","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.07237","snapshot_observed_at":"2026-08-11T15:20:56.672235Z","title":"TBQ($\\sigma$): Improving Efficiency of Trace Utilization for Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"78eacdd0-fec3-4231-a63e-819cc96b44b8","year":2019},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.473886Z"},"links":{"cited_paper":"/paper/1905.07237","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:80a0de5d33d80ade324dcd6a55ff5ef9756937a83b7d047f152474daaa5e1b61","observation_id":"30eb5d28-521f-42c7-9a2d-90b69df97748","resolution":{"observed_at":"2026-08-11T15:20:56.676622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.478429Z","title":"J., Guez, A., Sifre, L., Van Den Driessche, G., Schrittwieser, J., Antonoglou, I., Panneershelvam, V., Lanctot, M., et al","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.478429Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:3ac452a94491f3c2eaff7066e34ff8a109458085038a68810fcb0caee2057176","observation_id":"2164f7e4-e74d-4d9f-9cc3-e67046c62bb1","resolution":{"observed_at":"2026-08-11T15:20:56.478429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.482832Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.482832Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:2d9ce8603e4d0086b46d5e814ec45e155e51c1af25dd4940c4479b5f79cc1144","observation_id":"5d2a9931-94a1-4178-8e73-2206990cc789","resolution":{"observed_at":"2026-08-11T15:20:56.482832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.004394Z","title":null,"venue":null,"work_id":"61d57097-1d3d-454c-9253-8e2949f5d00d","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.486674Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9e7f408ee6c18e0b8d5b505a0c24b4a992ace8ce42dc5f492723b9b8f7dbe04c","observation_id":"e4475aa1-6272-45d6-8567-4328e096c74f","resolution":{"observed_at":"2026-08-11T15:20:57.008450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.989525Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":"9b588d61-49b5-4a4d-8837-c766eb53a9fc","year":2020},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.490259Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9bb6eda6fcbc7abd3d4c53c01b3154a087bd41fea06c624805f86fc81acc6103","observation_id":"3b87282a-bebf-4bd3-99f1-0c0868e88f05","resolution":{"observed_at":"2026-08-11T15:20:56.994990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.974959Z","title":"J., Simchowitz, M., Zhang, K., and Tedrake, R","venue":null,"work_id":"91549635-00f4-48e7-ae4e-5f78e6f542dd","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.494887Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:b1f5a77bdbe55796279c40fc224ed4a05ba52193db2c3da116698c7f352c19f8","observation_id":"70b62e8d-cedb-4af6-9ad0-e4ab9cc69157","resolution":{"observed_at":"2026-08-11T15:20:56.980047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.499664Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.499664Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7d51029cf43a38715d3458fed3440b6175aeac6f39e5e2d5ea5c9381466fa5e5","observation_id":"b60e1a78-6ea9-4152-85f0-a6a952922a4b","resolution":{"observed_at":"2026-08-11T15:20:56.499664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.952436Z","title":"W., Wang, T., Shang, Y., and Wu, Z","venue":null,"work_id":"2b1afb2b-1fbe-4c4b-8107-711d13241288","year":2000},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.505091Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9c461374fc1fdbdeffa0bf035ef6711897bb6cd54b6056cf28826e95561fd565","observation_id":"f5a7f6ff-f92e-4263-875e-631c4c3bad3c","resolution":{"observed_at":"2026-08-11T15:20:56.956471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.939756Z","title":"Development of a humanoid robot control system based on ar-bci and slam navigation","venue":null,"work_id":"7fbb9a01-9329-4443-9da8-b8954c8aae06","year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.509463Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:d1980140a56c0ce14b17df1e2fa0b87057d6963e3cf4bdd12174305d7674772f","observation_id":"a320c451-bbe7-4f3a-b23b-6681bab8ddc3","resolution":{"observed_at":"2026-08-11T15:20:56.943923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.927072Z","title":null,"venue":null,"work_id":"16c4e955-8c44-486c-9d66-df6bf6ed663a","year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.515075Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:ee57331d0fc0f8bf548bc261ea6b2e4c7ae335d2b733cb5c334977c15fbf4545","observation_id":"cd42231a-daa8-4f4a-9662-c64b4836664a","resolution":{"observed_at":"2026-08-11T15:20:56.931716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02346","last_updated":"2023-03-04T07:24:22Z","snapshot_observed_at":"2026-08-13T12:32:16.521602Z","submitted_at":"2023-03-04T07:24:22Z","title":"FluidLab: A Differentiable Environment for Benchmarking Complex Fluid Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02346","snapshot_observed_at":"2026-08-11T15:20:56.521513Z","title":"Fluidlab: A differentiable environment for benchmarking complex fluid manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.521513Z"},"links":{"cited_paper":"/paper/2303.02346","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:0ae5ae05c5ac073733c6a2f8e290b0e34dfadf63ad9f592daddc4443235e3533","observation_id":"39328285-6824-4b56-97bc-6b1ea74a029b","resolution":{"observed_at":"2026-08-11T15:20:56.521513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08025","last_updated":"2022-09-16T16:10:08Z","snapshot_observed_at":"2026-08-13T14:25:00.468330Z","submitted_at":"2022-09-16T16:10:08Z","title":"Trustworthy Reinforcement Learning Against Intrinsic Vulnerabilities: Robustness, Safety, and Generalizability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.08025","snapshot_observed_at":"2026-08-11T15:20:56.526507Z","title":"Trustworthy reinforcement learning against intrinsic vulnerabilities: Robustness, safety, and generalizability","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.526507Z"},"links":{"cited_paper":"/paper/2209.08025","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:26c8fa4af2ae84bf8dc1ba2cdec5a7d05d061c7ca58a3a7f8db55a11eb7f9602","observation_id":"9f83f98c-d743-4be3-8402-224876a928a8","resolution":{"observed_at":"2026-08-11T15:20:56.526507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03171","last_updated":"2018-02-09T08:46:21Z","snapshot_observed_at":"2026-08-03T07:18:12.736688Z","submitted_at":"2018-02-09T08:46:21Z","title":"A Unified Approach for Multi-step Temporal-Difference Learning with Eligibility Traces in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1802.03171","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.03171","snapshot_observed_at":"2026-08-11T15:20:56.626771Z","title":"A Unified Approach for Multi-step Temporal-Difference Learning with Eligibility Traces in Reinforcement Learning","venue":"cs.AI","work_id":"cbb82359-353f-46ee-8978-7c30ba893cea","year":2018},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.531090Z"},"links":{"cited_paper":"/paper/1802.03171","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:da08569087273a5dfd80462840289d7a46ea84f1915b1785dfbe5940f179db53","observation_id":"1df34a0f-ee63-4136-a3d1-302b68d056d5","resolution":{"observed_at":"2026-08-11T15:20:56.632413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.912610Z","title":"Constrained update projection approach to safe policy optimization","venue":null,"work_id":"5c46a6f6-74cb-4a6a-a305-df2d0a27efe5","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.536115Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:83ed7de83a32ed9c69f711706fa25e2d19b08f586ad6219f9fd0de85e20a2c40","observation_id":"73e89b4b-0b3d-413f-a788-dfa37e890dae","resolution":{"observed_at":"2026-08-11T15:20:56.917830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03152","last_updated":"2020-10-07T04:22:45Z","snapshot_observed_at":"2026-08-10T08:43:44.490290Z","submitted_at":"2020-10-07T04:22:45Z","title":"Projection-Based Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03152","snapshot_observed_at":"2026-08-11T15:20:56.540973Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.540973Z"},"links":{"cited_paper":"/paper/2010.03152","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7fcbced529d583a398db6569b82cdc45b909348f3081b37ae619bec5e40728ca","observation_id":"f7d4c6dd-6a6a-4971-9ab3-bf5fcb76046f","resolution":{"observed_at":"2026-08-11T15:20:56.540973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.896674Z","title":"First order constrained optimization in policy space","venue":null,"work_id":"0035dea0-58f0-43af-9c9c-3efbd59bc441","year":2020},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.545141Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:653321e144c9802becb65e064a5eacb124ccc5320a43c21e48c7264da6564e93","observation_id":"4b6b7e47-0add-45be-89ac-407b5fee5bee","resolution":{"observed_at":"2026-08-11T15:20:56.901732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T15:13:55.109460Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":4,"verified_fuzzy":28},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2412.11138."}