{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fa3ae9f4c8041b1308b8da884eaa89dc5874bab1d9fd3bb2a4957d01b1c4f66","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:07:09.566879Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:37:41.630698Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T11:35:19.078046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00700","snapshot_observed_at":"2026-08-05T12:37:41.630698Z","title":"Central path proximal policy optimiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-06T14:25:47.738315Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.630698Z"},"links":{"cited_paper":"/paper/2506.00700","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:8abc165b1052c09973d4d61e97a2c00073e6fd22d6c068395fa9ab25a80fa15c","observation_id":"7a1ef6a6-4859-4cd6-84de-2a19d6439ba4","resolution":{"observed_at":"2026-08-05T12:37:41.630698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2506.00700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00700","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Central path proximal policy optimization","venue":null,"work_id":"94555858-e38c-45e6-8f9b-1771dd4ec335","year":2025},"citing_paper":{"arxiv_id":"2604.18578","last_updated":"2026-04-30T14:35:55Z","snapshot_observed_at":"2026-08-02T22:04:13.250695Z","submitted_at":"2026-04-20T17:59:01Z","title":"Bounded Ratio Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T04:50:11.020901Z"},"links":{"cited_paper":"/paper/2506.00700","citing_paper":"/paper/2604.18578"},"observation_digest":"sha256:1e79a0699aa15e7f82c074ea8a883e766b89a13862069c9c0bb66ac685a240c3","observation_id":"d095a95e-6a3c-48b7-817c-c5acf95f3998","resolution":{"observed_at":"2026-05-10T11:35:19.079386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00700/citation-record","integrity":"/paper/2506.00700/integrity","json":"/paper/2506.00700/citation-record.json","paper":"/paper/2506.00700"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:10.418334Z","title":"A safe exploration approach to constrained Markov decision processes","venue":null,"work_id":"e4a514a6-ee85-4acc-b727-103f24ee5b29","year":2024},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.931227Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:3def744fb832019568e77c652852e74d09cd2995f9012945a73ad7eda246f8bf","observation_id":"074502be-9dda-46de-81e9-5d3b8d32d5fd","resolution":{"observed_at":"2026-08-07T12:07:10.495244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.12228","last_updated":"2022-06-18T22:00:03Z","snapshot_observed_at":"2026-08-06T04:47:25.140177Z","submitted_at":"2021-12-22T21:12:28Z","title":"Direct Behavior Specification via Constrained Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2112.12228","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.12228","snapshot_observed_at":"2026-08-07T12:07:10.111817Z","title":"Direct Behavior Specification via Constrained Reinforcement Learning","venue":"cs.LG","work_id":"f1b70300-77ba-42a7-a3a2-606205f0b9a3","year":2021},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.093230Z"},"links":{"cited_paper":"/paper/2112.12228","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:40666196c0caa1923008fd5779f8e7592af309fc5bd1b38663d1dff35fa56902","observation_id":"78af1034-67c6-4a9f-8fd3-24376f09bebb","resolution":{"observed_at":"2026-08-07T12:07:10.187120Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.03964","last_updated":"2020-07-08T08:43:14Z","snapshot_observed_at":"2026-07-06T09:36:24.838522Z","submitted_at":"2020-07-08T08:43:14Z","title":"Responsive Safety in Reinforcement Learning by PID Lagrangian Methods","version":1},"cited_work":{"arxiv_id":"2007.03964","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.03964","snapshot_observed_at":"2026-08-07T12:07:09.808968Z","title":"Responsive Safety in Reinforcement Learning by PID Lagrangian Methods","venue":"math.OC","work_id":"335b691a-515b-4a03-be1d-bf7b31503217","year":2020},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.280854Z"},"links":{"cited_paper":"/paper/2007.03964","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:757849fea0924c27b9d7abb720a8446f9a22f8b27ab7237ad947de49112bdb51","observation_id":"4faecdac-4fa9-411c-a493-11ed459e1bb1","resolution":{"observed_at":"2026-08-07T12:07:09.904564Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14508","last_updated":"2024-03-21T16:02:52Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T16:02:52Z","title":"Constrained Reinforcement Learning with Smoothed Log Barrier Function","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14508","snapshot_observed_at":"2026-08-07T12:07:09.385071Z","title":"Constrained Re- inforcement Learning with Smoothed Log Barrier Function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.385071Z"},"links":{"cited_paper":"/paper/2403.14508","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:b33e977c9c88edc621aa58c2a5a7b0de0eeba10715fde47139847f156d9e0c0c","observation_id":"d55bf51f-2cc4-4f0f-8774-b0fda9159b60","resolution":{"observed_at":"2026-08-07T12:07:09.385071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/517","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:09.673275Z","title":"Yiming Zhang, Quan Vuong, and Keith Ross","venue":null,"work_id":"cd753ca5-77b9-4973-ada1-4acc535df759","year":2022},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.480957Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:29be5e52d4398bae9820cfe00319f8ffb148fa146f520f0bf98448b3b17cdad0","observation_id":"d3628220-eedf-49dc-a3a3-71f7824ecd61","resolution":{"observed_at":"2026-08-07T12:07:09.751998Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:10.267864Z","title":"surrogate advantage trick","venue":null,"work_id":"e515b109-d18c-4218-bde8-e343a61f95d8","year":2023},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.566879Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:9c18c28266d792c539c34d56c13809f73a20095959b6e9e2f6803cd914ed26ff","observation_id":"5d638274-83d0-44c6-8aef-e4d9f5cc284b","resolution":{"observed_at":"2026-08-07T12:07:10.352342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T12:07:09.141595Z","title":"John Schulman, Sergey Levine, Philipp Moritz, Michael I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.141595Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:4e6081651540f7f66a7edcef063b55077f9b553ef222f52b8b12ad32af21538b","observation_id":"da807287-27f3-458c-99d7-ddad26648efb","resolution":{"observed_at":"2026-08-07T12:07:09.141595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:10.585342Z","title":"Dimitri P Bertsekas","venue":null,"work_id":"78e14604-225a-429c-9b9c-9fcad3a38cb2","year":2017},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.578032Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:35ec6bfda7101dd99d858a07ef2ba48b1ecba00495f81b1497f8575c2debd8a9","observation_id":"d1d34400-fb63-46a9-b893-1e669deacd40","resolution":{"observed_at":"2026-08-07T12:07:10.664488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10031","last_updated":"2019-02-11T20:52:42Z","snapshot_observed_at":"2026-08-04T06:42:19.463125Z","submitted_at":"2019-01-28T23:14:58Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10031","snapshot_observed_at":"2026-08-07T12:07:08.633497Z","title":"Robert M Corless, Gaston H Gonnet, David EG Hare, David J Jeffrey, and Donald E Knuth","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.633497Z"},"links":{"cited_paper":"/paper/1901.10031","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:b9788d802683f4c2d25e587c732915a016d71620918299e7e8c1f2b0d9472b95","observation_id":"3f78ce86-e4d7-4720-8ad6-c368ea7bfc38","resolution":{"observed_at":"2026-08-07T12:07:08.633497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:08.702350Z","title":"Jincheng Mei, Chenjun Xiao, Bo Dai, Lihong Li, Csaba Szepesvári, and Dale Schuurmans","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.702350Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:4a13f9d46e451b132b090399c3f477ff73b404738a3b252eeb400227b0667b5a","observation_id":"2f5a27ad-336f-436e-9782-1670098eb2d9","resolution":{"observed_at":"2026-08-07T12:07:08.702350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-07T12:07:08.990567Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.990567Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:70c57376470f78a76f6167bc787a4f03817a593d59555195c7ae54f396b93844","observation_id":"6ba153c4-cc06-4dc8-bf5c-d9d8f999b133","resolution":{"observed_at":"2026-08-07T12:07:08.990567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-07T12:07:08.844809Z","title":"A unified view of entropy-regularized Markov decision processes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.844809Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:6aeb5f01d4bd8994ee4b0b121c8393718070a604c997f25d356242ad2daa70e1","observation_id":"4b21ca17-83c7-407c-bef8-f3c3fc4823e1","resolution":{"observed_at":"2026-08-07T12:07:08.844809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04558","last_updated":"2024-06-07T00:13:31Z","snapshot_observed_at":"2026-08-04T09:33:11.707216Z","submitted_at":"2024-06-07T00:13:31Z","title":"On PI Controllers for Updating Lagrange Multipliers in Constrained Optimization","version":1},"cited_work":{"arxiv_id":"2406.04558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04558","snapshot_observed_at":"2026-08-07T12:07:09.965625Z","title":"On PI Controllers for Updating Lagrange Multipliers in Constrained Optimization","venue":"cs.LG","work_id":"375a3c23-c124-4691-ab75-d50ad502bd50","year":2024},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.219280Z"},"links":{"cited_paper":"/paper/2406.04558","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:95a82d0f1cec75ea5ca137e17f97822a3edd0c9bb10dc656a5d41255c93def1b","observation_id":"9eb6c714-6dfd-4a21-b04b-ee6f1af7c67d","resolution":{"observed_at":"2026-08-07T12:07:10.017454Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02957","last_updated":"2025-08-15T12:29:02Z","snapshot_observed_at":"2026-07-06T19:45:25.884330Z","submitted_at":"2024-11-05T09:55:50Z","title":"Embedding Safety into RL: A New Take on Trust Region Methods","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02957","snapshot_observed_at":"2026-08-07T12:07:08.760132Z","title":"Johannes Müller and Semih Cayci","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.760132Z"},"links":{"cited_paper":"/paper/2411.02957","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:549bdcbe6f3a89180d79c087ca276cdafb09b480f880c502dd69a3e93a2530dc","observation_id":"fc27e03e-c0c5-4d02-a012-6a3d05bf8902","resolution":{"observed_at":"2026-08-07T12:07:08.760132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:57:38.052488Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 2 inbound Pith citation observations for arXiv:2506.00700."}