{"as_of":"2026-08-18T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32bea22f6e7c00157e080433ddd1b15c6797ab6cf72869f408f8dd848878295e","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:18:18.685092Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10204/citation-record","integrity":"/paper/2608.10204/integrity","json":"/paper/2608.10204/citation-record.json","paper":"/paper/2608.10204"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:17.611611Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:17.611611Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:9679a5e074a1d902ae1e24a2d5499868532f1e0dc0f0b9e3e9bcd89d897de7c4","observation_id":"10b10e98-50eb-49bb-9ce7-81c21fff59e3","resolution":{"observed_at":"2026-08-14T04:18:17.611611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:17.638317Z","title":"Metadrive: Composing diverse driving scenarios for generalizable reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:17.638317Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:e3a834bab8249e61798b0817fe72aa5bb3a276c694049f6e9138201e2200c53f","observation_id":"2e38e038-6f10-444e-bcd8-fae6c37ef433","resolution":{"observed_at":"2026-08-14T04:18:17.638317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:17.686177Z","title":"Reinforcement learning in robotics: A survey,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:17.686177Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:57a6f48cbda78852f3af53e067b71a5fa83bc30f295871ef8ef3029c1ffdc04a","observation_id":"a9926449-e9f5-4944-ad6c-7542f4c73c04","resolution":{"observed_at":"2026-08-14T04:18:17.686177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:17.734749Z","title":"Altman,Constrained Markov decision processes","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:17.734749Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:ce31d0e8515fddd292acc95e3cb0b36653dc812c3cbeed6ebf1fe4d5763780b8","observation_id":"a7f3e378-c7d3-40bf-b3b8-1f3914037b05","resolution":{"observed_at":"2026-08-14T04:18:17.734749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:20.360670Z","title":"Responsive safety in rein- forcement learning by pid lagrangian methods,","venue":null,"work_id":"443a65e4-fcd0-40e4-bc2c-d6ece028becc","year":2020},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:17.784810Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:08884ce26d92498e166bb7c2ac6cb94b8e7fdae1290e6f53af3c2202c6cb42af","observation_id":"74ea29d0-8faa-42b9-b91e-27589e0afd6a","resolution":{"observed_at":"2026-08-14T04:18:20.386367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:20.296938Z","title":"Safe policies for reinforcement learning via primal-dual methods,","venue":null,"work_id":"bf2f5350-16c1-4e47-80f6-ad01a7ed6f10","year":2022},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:17.844751Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:7c54097c934bff7bc77efff8cdf7ae6bde22fc0ee61ffea3053d5fa7d4fa7b9a","observation_id":"5cff693b-2d6a-4cf2-835b-7489c820a726","resolution":{"observed_at":"2026-08-14T04:18:20.303537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:20.263841Z","title":"Triple-Q: a model-free algorithm for constrained reinforcement learning with sublinear regret and zero constraint violation,","venue":null,"work_id":"4f6410c3-20f0-484d-a3ff-8307f4c23b23","year":2022},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:17.904239Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:cd76bee2fe770214b05855a4dc35c4259b7242508ac677a088f2723d234679d4","observation_id":"12d1574a-c11f-4233-a768-21f351463218","resolution":{"observed_at":"2026-08-14T04:18:20.285379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:20.218026Z","title":"Provably efficient model-free algorithms for non-stationary CMDPs,","venue":null,"work_id":"747a3eca-b397-4f31-9f79-2930a7ea9fd0","year":2023},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:17.954758Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:3e746f795a7c98a68211edf77088270b5ce4fbb3344e8541eca5fa84eaaa06e8","observation_id":"0a6ec3c6-6c11-4b31-a68f-a4468e6dab8c","resolution":{"observed_at":"2026-08-14T04:18:20.254746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:20.140671Z","title":"Safe and efficient: A primal- dual method for offline convex cmdps under partial data coverage,","venue":null,"work_id":"e438588f-8eeb-4e67-84d7-d2bbc1cdbca3","year":2024},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.002316Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:9445bece006d919627dc4f8d9e5255d870f945b65853fd077269a86026307387","observation_id":"b0e41404-8994-4b66-b155-9cf607fe4701","resolution":{"observed_at":"2026-08-14T04:18:20.154076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:20.072698Z","title":"Provably efficient safe exploration via primal-dual policy optimization,","venue":null,"work_id":"a7ecc2af-f096-41c7-9c08-b59c68677c0a","year":2021},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.044752Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:2d5de7fa3a4009ad2b58ae98f28d0b723bae1603209f62fbf88f6005772860c0","observation_id":"2295f152-e0d3-4459-a2de-2ca8ba851e90","resolution":{"observed_at":"2026-08-14T04:18:20.091842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:20.010171Z","title":"An optimistic algorithm for online cmdps with anytime adversarial constraints,","venue":null,"work_id":"40c38dfe-8c10-4ba6-b25c-fc895cc5da9a","year":2025},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.074748Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:d5e78b6b3f0821832e07722afd0ff41e48cd62b08283685bf0f96999ec9b1044","observation_id":"8a3387d2-5153-44f6-afff-4116291a0503","resolution":{"observed_at":"2026-08-14T04:18:20.016276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.981013Z","title":"Constrained policy optimization,","venue":null,"work_id":"e11e6015-93f2-4789-bfb6-51f65435733b","year":2017},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.114750Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:8c53fd619c41053c140ca38d4878cea9a8bcf5c8be73fd32049f68ba8a1e0cb3","observation_id":"5c81a8c8-5790-4374-b34f-bf7ee6d0a1f2","resolution":{"observed_at":"2026-08-14T04:18:19.987125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.919791Z","title":"Projection- based constrained policy optimization,","venue":null,"work_id":"1a25cf28-6b7b-4abc-90ab-ed2343222f12","year":2020},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.154736Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:6c5a237315be1bdb316c308c06076620b348057b54a1fd8aa1769e0ad41811b5","observation_id":"d61b0c7e-0248-452c-a3e2-824191f92c3f","resolution":{"observed_at":"2026-08-14T04:18:19.935449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.849811Z","title":"First order constrained optimization in policy space,","venue":null,"work_id":"e46812b5-f9fd-4d4b-a8f5-61cea60d28a3","year":2020},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.174739Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:e171c6b8ff3c07bc8a0989f3f6b886e178e2d167eff9c8e73b3c45b576d81dc9","observation_id":"a96b4ffa-d668-493f-8705-5a53d89cbfe2","resolution":{"observed_at":"2026-08-14T04:18:19.874747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.780056Z","title":"Constrained update projection approach to safe policy optimization,","venue":null,"work_id":"b18a8014-585c-4b6f-9394-f1a587a57e1c","year":2022},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.218045Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:bdb7ad8de241d606e626d9fb3417b6860ca7fb69b85eda1df5867b253bb92a12","observation_id":"1773ba1a-a689-4e7e-9ba5-1698dd5d63df","resolution":{"observed_at":"2026-08-14T04:18:19.787414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.702740Z","title":"Crpo: A new approach for safe reinforcement learning with convergence guarantee,","venue":null,"work_id":"02f1f599-3008-4284-b215-c77af7809106","year":2021},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.252129Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:0d61c39c905a37dcaa344d8bae5637802b6d94a228ab29c120359a75504cb008","observation_id":"5fbecf50-96b8-4fd1-956a-6560ee042522","resolution":{"observed_at":"2026-08-14T04:18:19.744760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.674750Z","title":"Balance reward and safety optimization for safe reinforcement learning: A perspective of gradient manipulation,","venue":null,"work_id":"11c9bb57-9a28-4b1f-90bd-8fd1e2665f74","year":2024},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.295917Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:01b0a1d17efbfda61547495d6084db9b5bcab3750cb1ad5b0618de15c517f8e0","observation_id":"d00a5707-5713-4ac9-a1b3-849d61ddb0f8","resolution":{"observed_at":"2026-08-14T04:18:19.688124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.590717Z","title":"Enhancing efficiency of safe reinforcement learning via sample manipulation,","venue":null,"work_id":"005415bf-0258-43f3-82dd-45e2329a7f49","year":2024},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.313396Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:285b332f9c7950eea7943f93ac0eb42eefd156f2f94abb715a54840476c39c7b","observation_id":"4d803e81-1e17-4e34-9aad-c8e2dca5c8bd","resolution":{"observed_at":"2026-08-14T04:18:19.618194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.489243Z","title":"Gradient shaping for multi-constraint safe reinforcement learning,","venue":null,"work_id":"6c5a1fff-9670-4e52-aa2e-29d90c8f5533","year":2024},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.333619Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:165cd42e7652b9bbe5cd938f4ce7c8e075e08d065fa7a9fac9a4c16f592f236e","observation_id":"c1ff5d35-686b-4895-96f6-257a6b804b5a","resolution":{"observed_at":"2026-08-14T04:18:19.519688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-14T04:18:18.373663Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.373663Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:3ff46d4942661af60c638fb930bc3bdb9d7c0011c9e70ca940c64d3b98fb8b91","observation_id":"25f95649-afec-4334-8810-b788610e90f5","resolution":{"observed_at":"2026-08-14T04:18:18.373663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-14T19:10:15.765536Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-14T04:18:18.414100Z","title":"Reward constrained policy optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.414100Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:88e0f001836216de3f657acf1955151294767b3034b3c17307834008d8b633fa","observation_id":"d913a37e-862d-42ad-9ecb-da71dcc6bc99","resolution":{"observed_at":"2026-08-14T04:18:18.414100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14758","last_updated":"2024-04-15T13:44:11Z","snapshot_observed_at":"2026-08-16T14:24:17.929668Z","submitted_at":"2024-01-26T10:33:38Z","title":"Off-Policy Primal-Dual Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14758","snapshot_observed_at":"2026-08-14T04:18:18.465113Z","title":"Off-policy primal-dual safe reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.465113Z"},"links":{"cited_paper":"/paper/2401.14758","citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:f2162059f1d8c364ca8cec80fb8a4664ee842af3d3151adecbe9910f31b69686","observation_id":"70f41fff-2e27-4050-a97e-5e3821b9ef89","resolution":{"observed_at":"2026-08-14T04:18:18.465113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14216","last_updated":"2023-05-23T16:33:55Z","snapshot_observed_at":"2026-08-16T15:30:33.510021Z","submitted_at":"2023-05-23T16:33:55Z","title":"Constrained Proximal Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14216","snapshot_observed_at":"2026-08-14T04:18:18.507270Z","title":"Constrained proximal policy optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.507270Z"},"links":{"cited_paper":"/paper/2305.14216","citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:bcfb79f87faa89d05911b0fb2a1d5d382febb1eb6a98d34cc4148aea7035b5dd","observation_id":"d7f6727f-04c3-4f0f-965a-6c3a705457ba","resolution":{"observed_at":"2026-08-14T04:18:18.507270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.395432Z","title":"Policy gradient methods for reinforcement learning with function approximation,","venue":null,"work_id":"0d158ac2-793e-41e0-9975-c56a8a899388","year":1999},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.555032Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:b7c0559794f31dce493233b44cd35a13a536fb0e5ad8d6c7bc999b10901da449","observation_id":"f1a80751-9b09-418b-b1ec-8a866bb4d9c9","resolution":{"observed_at":"2026-08-14T04:18:19.419344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:18.605434Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.605434Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:97887eea55a6748b2e2a10a4ec7bf09f2d813befbea2a00acd9edc58b4319d06","observation_id":"c95c6dd2-3f9a-49a4-b2cd-ff258b8a4565","resolution":{"observed_at":"2026-08-14T04:18:18.605434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:18.654752Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.654752Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:df90ec99c4766e18ce8c8af89674401db051526514ba73564299a6912e71b8c7","observation_id":"a2f22536-bd7b-408d-ba36-ec556e44e324","resolution":{"observed_at":"2026-08-14T04:18:18.654752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:18:19.171466Z","title":"Omnisafe: An infrastructure for accelerating safe reinforcement learning research,","venue":null,"work_id":"510b4859-76a3-4fee-aa76-92a43dbd617b","year":2024},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.685092Z"},"links":{"citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:8b69444bf64addf7ccb855d8d096aa52795195a7e901fe2cf9ee56adc6c9bcac","observation_id":"fd535ee1-ffba-435b-a9f9-64d464da01ac","resolution":{"observed_at":"2026-08-14T04:18:19.204882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2608.10204."}