{"as_of":"2026-08-07T07:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0bbe670f0056fb9cc251ccfd91707012edadb687f21b83449d15bdeb38d37e22","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:35:33.330106Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09208/citation-record","integrity":"/paper/2509.09208/integrity","json":"/paper/2509.09208/citation-record.json","paper":"/paper/2509.09208"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.235570Z","title":"Constrained policy optimiza- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.235570Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:46faafec55c0d894f1ac77134f090dbeb2a2a581e7e4460b79d756a03bc423e6","observation_id":"95a53441-1ef7-442e-bc2a-cb941902f988","resolution":{"observed_at":"2026-08-04T19:35:33.235570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.330106Z","title":"We also conducted experi- ments using the MetaDrive simulator [Liet al., 2022 ]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.330106Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:dc62749be9950feb576bd1f1f09ac5a1d78b46deaf8985851634f2519fd8e1b1","observation_id":"52a8f122-addf-4e2d-b04a-435b0103722e","resolution":{"observed_at":"2026-08-04T19:35:33.330106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.245700Z","title":"Risk-constrained reinforcement learning with percentile risk criteria.Journal of Machine Learning Research, 18(167):1–51,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.245700Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:ba7fa4f49c1e43431ec90d12884576bed26453ae51c3a908ae16d3b88afc3b53","observation_id":"92f6143e-f2d5-46ba-81f8-651d4a92e068","resolution":{"observed_at":"2026-08-04T19:35:33.245700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.259379Z","title":"A general safety framework for learning-based control in uncertain robotic systems.IEEE Transactions on Automatic Control, 64(7):2737–2752,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.259379Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:b9f43ddbd0e1c16f4dc52e4e61d4d240d2e42302b907d95a4980939de0b29dd2","observation_id":"eb978cd1-26c8-4385-b799-bdafa0f612b5","resolution":{"observed_at":"2026-08-04T19:35:33.259379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.261426Z","title":"Exterior penalty pol- icy optimization with penalty metric network under con- straints","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.261426Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:5198b3c183d7141dc8d9e8f43679daea8993b91f6431a14ac30637541ff3afd1","observation_id":"66e6ae51-5f20-428c-9742-dab8e260c8b0","resolution":{"observed_at":"2026-08-04T19:35:33.261426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.268094Z","title":"Omnisafe: An infrastructure for accelerating safe reinforcement learn- ing research.Journal of Machine Learning Research, 25(285):1–6,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.268094Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:217c579ff7cf400eb8dcf5946a575bf3ac43ddbad6b68664000ba9ce13d84a6c","observation_id":"68734fb2-01db-4e23-bae1-dec886263353","resolution":{"observed_at":"2026-08-04T19:35:33.268094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.270031Z","title":"Doubly ro- bust off-policy value evaluation for reinforcement learn- ing","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.270031Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:10572c5a87d2ae6f473cbd8257c3608c258cd165639755e6e34616a0a2954138","observation_id":"328d2aea-eae0-4ec4-8c95-871cb8c32ff6","resolution":{"observed_at":"2026-08-04T19:35:33.270031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.276785Z","title":"End-to-end training of deep visuomotor policies.Journal of Machine Learning Re- search, 17(39):1–40,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.276785Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:aee18a9de6927d80c78eb39b10bc66f7447c1f847676eb80e549d32449da74af","observation_id":"252ec687-fbce-4651-8963-c9ce3940e728","resolution":{"observed_at":"2026-08-04T19:35:33.276785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.278849Z","title":"Metadrive: Composing diverse driving scenarios for generalizable re- inforcement learning.IEEE Transactions on Pattern Anal- ysis and Machine Intelligence, 45(3):3461–3475,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.278849Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:9b445200788515d65de6ec540fab766fe36db43f17e7163cd1e014e32978f446","observation_id":"93993193-d870-47b0-916b-140b5c9eeec9","resolution":{"observed_at":"2026-08-04T19:35:33.278849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.280812Z","title":"Ipo: Interior-point policy optimization under constraints","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.280812Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:c827e25e32c0e6370ec7184cc23ef342f4c3bee93104c0dc0d3f242845d0bec7","observation_id":"92526f50-13b8-4949-bc85-2053192b2e3a","resolution":{"observed_at":"2026-08-04T19:35:33.280812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.283481Z","title":"The law and ethics of high-frequency trading.Minn","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.283481Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:9e20153d48f17d634746ece2d4d2423ab9d0711f68216fdc562eb6103dd6cd57","observation_id":"03155a60-652d-48d2-a8f3-1b2858e230cc","resolution":{"observed_at":"2026-08-04T19:35:33.283481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.286703Z","title":"Chance-constrained dynamic pro- gramming with application to risk-aware robotic space ex- ploration.Autonomous Robots, 39:555–571,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.286703Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:6f03fa00e9e43a2884fcc8d908b4d84d0b0cd4e7bacd5c28c62b92d2ff5b1c1e","observation_id":"4316231b-44a0-4c3d-a49f-dcffc2de81c3","resolution":{"observed_at":"2026-08-04T19:35:33.286703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-07-06T08:26:47.571015Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-04T19:35:33.289482Z","title":"Benchmarking safe exploration in deep rein- forcement learning.arXiv preprint arXiv:1910.01708, 7(1):2,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.289482Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:94f63d9fccd7ce9691f6e2eedd6add0848fb194f8bb92e488c8d12517d75c6f9","observation_id":"1598ab19-b2c5-43fb-82f7-c67e9faca4b6","resolution":{"observed_at":"2026-08-04T19:35:33.289482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-04T19:35:33.294233Z","title":"Trust region policy opti- mization.arXiv preprint arXiv:1502.05477,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.294233Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:dfe6f2abd3c626dedec00256c8e0a45ab467669a54540c88a6da0e613fec41c1","observation_id":"59ee5433-572a-4d72-bcd9-7fc6a633777e","resolution":{"observed_at":"2026-08-04T19:35:33.294233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.296483Z","title":"Responsive safety in reinforcement learn- ing by pid lagrangian methods","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.296483Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:0747da4cfde36aa228fb2111dbc0d99914cb1631e396612a23413e26e44fa0eb","observation_id":"d20978f6-ef78-4a88-9f84-250785906017","resolution":{"observed_at":"2026-08-04T19:35:33.296483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-07-06T05:47:10.770104Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-04T19:35:33.299036Z","title":"Value-decomposition networks for cooperative multi-agent learning.arXiv preprint arXiv:1706.05296,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.299036Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:ad09696c9d204e284106398d2cd9f515791c34b50510e8c863d2093e17a0e0b0","observation_id":"1e281c07-29d1-42fe-9fe2-7bc6451d9406","resolution":{"observed_at":"2026-08-04T19:35:33.299036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.301563Z","title":"MIT press,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.301563Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:ea85acdc1106cd424a0c43e53b662e97ffe5f00c5670f0e0295906035c960119","observation_id":"89af7791-721c-43ec-81d8-3ff9c9f8001b","resolution":{"observed_at":"2026-08-04T19:35:33.301563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.304615Z","title":"Reward constrained policy optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.304615Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:d80b6f51813f568b019c51a8fd329c4024133d0f87f83334ebbf066b0e047d1c","observation_id":"0af87724-2aea-4df1-b2ed-7a98700a2a8c","resolution":{"observed_at":"2026-08-04T19:35:33.304615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.306999Z","title":"Projection- based constrained policy optimization.International Conference on Learning Representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.306999Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:ef4aa5ce2db2e1e7d72ab9a045e7506aaf1adb4544b0861a72baa6a0197e08d2","observation_id":"3da88d1b-5293-4cf6-a9c3-8a68470baecf","resolution":{"observed_at":"2026-08-04T19:35:33.306999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.309374Z","title":"Constrained update projection approach to safe policy optimization.Advances in Neural Information Pro- cessing Systems, 35:9111–9124,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.309374Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:e7135c7869fa5448d7b5b7f049affcd7d5908b9b3eb51e82c6cd4c97b8989a48","observation_id":"2b6ffabd-050d-47bf-a739-c4ea6c7affe7","resolution":{"observed_at":"2026-08-04T19:35:33.309374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.311273Z","title":"Convergent policy optimization for safe reinforcement learning.Advances in Neural Information Processing Systems, 32,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.311273Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:261d742f77ce2d2e52dc94fdc98f3af282212db0fe67135f7dbc84bfab28e434","observation_id":"b3188aa4-c4f0-41ca-a5ba-8d013d383bcf","resolution":{"observed_at":"2026-08-04T19:35:33.311273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.313763Z","title":"Reinforcement learning in healthcare: A survey.ACM Computing Surveys (CSUR), 55(1):1–36,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.313763Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:53e23b8c99f7d94184d1378211f6e8596ca0e143464b4b55a7034e75fe30a6bd","observation_id":"700e0552-a5f6-4792-93ef-7b4799ff5700","resolution":{"observed_at":"2026-08-04T19:35:33.313763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.316231Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games.Advances in Neural Information Processing Sys- tems, 35:24611–24624,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.316231Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:6d734a33facfc24e4e361b926a5e1d790d6ff76c7820cf5c7d68d054976fd063","observation_id":"8c4942c9-1fbf-44c3-8412-807359aa70f2","resolution":{"observed_at":"2026-08-04T19:35:33.316231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.318854Z","title":"First order constrained optimization in policy space.Advances in Neural Information Processing Sys- tems, 33:15338–15349,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.318854Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:6003450d065bd17726181de68408cfe4045769ddfbc771f93575acd06ec2bfdd","observation_id":"aa8c2496-165a-4616-8029-4d8d2ffdb9ff","resolution":{"observed_at":"2026-08-04T19:35:33.318854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.320745Z","title":"Penalized proximal policy optimization for safe rein- forcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.320745Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:a3bb9c07cb428711c40f6ef05a62eaf28b63c9bb6d58c3b719f51e56bc9fa4be","observation_id":"bb8119d5-a7cb-4654-81f8-785fa9f46316","resolution":{"observed_at":"2026-08-04T19:35:33.320745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.323026Z","title":"Evaluating model-free reinforcement learning toward safety-critical tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.323026Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:cdaba0ef2a0a258b8497f67b1ae1feace1943e1c05994163d77cb194c63f039f","observation_id":"90ad360b-aae8-4b5f-9216-ebe30b0d1246","resolution":{"observed_at":"2026-08-04T19:35:33.323026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.325727Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.325727Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:a3401e31ab9504c201b69c076dc104a0bcde4113f813ff90959d769465ed785c","observation_id":"5d9a9963-f392-473d-8c3f-0aba7a6b5bd4","resolution":{"observed_at":"2026-08-04T19:35:33.325727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.328059Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.328059Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:0ab1ecccd31e3a2a884c517c8fd98e026a4fce133e6ce4b3591edb5b5621cbd5","observation_id":"a380bf07-c3c3-4ec8-ae61-ac568aa8ef55","resolution":{"observed_at":"2026-08-04T19:35:33.328059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.274485Z","title":"Deep reinforcement learning for autonomous driving: A survey.IEEE Transactions on In- telligent Transportation Systems, 23(6):4909–4926,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.274485Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:66aaacb90c1b4ef979a7f7ea11fb86b1131323a3d1ca000d1529bd55a1601bf5","observation_id":"b9ebec16-e3f4-49ef-88fc-7a321e6128bc","resolution":{"observed_at":"2026-08-04T19:35:33.274485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.250837Z","title":"Augmented proximal policy op- timization for safe reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.250837Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:f7b9e5f3036916aadffaab75f14265ce670fb516bcc166baccac33116c07a6bc","observation_id":"2fae1680-ee90-429f-8558-5b3e8b73d0a9","resolution":{"observed_at":"2026-08-04T19:35:33.250837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.272178Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.272178Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:90976283791564a715220c69be3684aa71a294c624b1b4a8f16524e32bf6ee16","observation_id":"a952f2ee-ef59-40ac-a35e-c9e192aad329","resolution":{"observed_at":"2026-08-04T19:35:33.272178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.239265Z","title":"Routledge,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.239265Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:f41ed29069e0c8e93f6f28543e6f5f7f9db9d29a61dd495060c22c3a92da7162","observation_id":"f0d0627e-ccd6-4b22-a505-a29acc84d432","resolution":{"observed_at":"2026-08-04T19:35:33.239265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07289","last_updated":"2016-02-22T07:02:58Z","snapshot_observed_at":"2026-07-06T04:37:28.029641Z","submitted_at":"2015-11-23T15:58:05Z","title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.07289","snapshot_observed_at":"2026-08-04T19:35:33.248247Z","title":"Fast and accurate deep network learning by exponential linear units (elus).arXiv preprint arXiv:1511.07289,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.248247Z"},"links":{"cited_paper":"/paper/1511.07289","citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:11f4528532700546d54ec6177ac5b3a6716b14e0328c943882c59745946e4b41","observation_id":"b407b949-5a32-4bfd-bf24-2a9058e53444","resolution":{"observed_at":"2026-08-04T19:35:33.248247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T19:35:33.291635Z","title":"Prox- imal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.291635Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:f32442152e14654b7752878a8dc9e9a756ebb43f500c8220fc12efc0f856c327","observation_id":"810483af-9f18-4f90-9d26-a9093c06bbea","resolution":{"observed_at":"2026-08-04T19:35:33.291635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.256528Z","title":"Trustworthy artificial intelligence requirements in the autonomous driving domain.Computer, 56(2):29–39,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.256528Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:6d23dcc6395f8e85813f8605675f530fec86d7bd660c3433b15fe75ff30f2dc0","observation_id":"d54d7a10-f8a2-4646-8b43-a66f2cf5d361","resolution":{"observed_at":"2026-08-04T19:35:33.256528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.07483","last_updated":"2017-04-24T22:37:08Z","snapshot_observed_at":"2026-07-06T05:39:09.619914Z","submitted_at":"2017-04-24T22:37:08Z","title":"Continuously Differentiable Exponential Linear Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.07483","snapshot_observed_at":"2026-08-04T19:35:33.242544Z","title":"Continuously dif- ferentiable exponential linear units.arXiv preprint arXiv:1704.07483,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.242544Z"},"links":{"cited_paper":"/paper/1704.07483","citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:3aad3ed1d531e0fea6468e74d912228bec05b6e7d906c3d01ed012e3f8c4bb2e","observation_id":"028dc12d-cf81-4fe9-9fea-c2e75bbae4e8","resolution":{"observed_at":"2026-08-04T19:35:33.242544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.265931Z","title":"Safety gymna- sium: A unified safe reinforcement learning benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.265931Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:686479a6fd5e69b6b45f05236ddcb8293ca64dc09a222eb0fece5cef05931c83","observation_id":"67742a80-741a-421e-9d6b-3ffee382841c","resolution":{"observed_at":"2026-08-04T19:35:33.265931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.254104Z","title":"Natural policy gradient primal-dual method for constrained markov decision pro- cesses.Advances in Neural Information Processing Sys- tems, 33:8378–8390,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.254104Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:58fb4bb05d4220555caccd29c23615ec4903945146ef9404c5adc997b2c6e1e3","observation_id":"17694841-25c3-4539-942b-48e915c3b10d","resolution":{"observed_at":"2026-08-04T19:35:33.254104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:35:33.263507Z","title":"Bullet-safety-gym: A framework for constrained reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.263507Z"},"links":{"citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:f96e7f89cc97325acf497f1b902510a89f7b1a551c8d265aa43465f0b065d104","observation_id":"440be212-e38c-4ca0-a9a5-d1b7712cbf71","resolution":{"observed_at":"2026-08-04T19:35:33.263507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:48:35.170740Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2509.09208."}