{"as_of":"2026-08-03T04:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3ab613c9ea55c40232270b175ee60571c253be4afc04c7bd239d5084a500593","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T15:58:27.229351Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:12:07.125494Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T09:45:40.502853Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"cited_work":{"arxiv_id":"2509.12833","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.12833","snapshot_observed_at":"2026-07-01T09:45:40.502853Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","venue":"cs.LG","work_id":"59ffe6f8-5a83-4890-a206-74f01197ec73","year":2025},"citing_paper":{"arxiv_id":"2604.25508","last_updated":"2026-04-28T11:14:00Z","snapshot_observed_at":"2026-08-03T01:29:15.650303Z","submitted_at":"2026-04-28T11:14:00Z","title":"Dyna-Style Safety Augmented Reinforcement Learning: Staying Safe in the Face of Uncertainty","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T16:34:33.155628Z"},"links":{"cited_paper":"/paper/2509.12833","citing_paper":"/paper/2604.25508"},"observation_digest":"sha256:acfb3f15c3df3b600ae789e2ee49cab831d17a96f567be5556c1fe6638ef37d1","observation_id":"0df37d30-5c17-4231-9f6b-c51e40a48a88","resolution":{"observed_at":"2026-05-11T23:36:39.984535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"cited_work":{"arxiv_id":"2509.12833","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.12833","snapshot_observed_at":"2026-07-01T09:45:40.502853Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","venue":"cs.LG","work_id":"59ffe6f8-5a83-4890-a206-74f01197ec73","year":2025},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/2509.12833","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:ac69cb0c03d294004846bfd7763dfde40b34aa34fb8c1a73231e418f821c46c6","observation_id":"20ef1545-8009-4f72-abe6-15934da4e59f","resolution":{"observed_at":"2026-07-01T09:45:40.504080Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.12833/citation-record","integrity":"/paper/2509.12833/integrity","json":"/paper/2509.12833/citation-record.json","paper":"/paper/2509.12833"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-07-06T06:20:24.181731Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":"1801.08757","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-07-04T08:49:42.797142Z","title":"Safe Exploration in Continuous Action Spaces","venue":"cs.AI","work_id":"37508fc3-1b06-4d54-bc21-6f6ac3917c07","year":2018},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:536add17579ad894bddf4e41c4213c86cd22a44077059e2db7eb5a3dada4806e","observation_id":"ecb2a73e-c959-408e-b241-acc9a4a73f1f","resolution":{"observed_at":"2026-05-18T16:01:34.683098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01353","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:09:57.336591Z","title":"Differentiable nonlinear model predictive control.arXiv preprint arXiv:2505.01353","venue":null,"work_id":"fba56204-cd6a-46bc-88f6-9fc3cc6bf2e8","year":2024},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:aa37bf281ee620687a3436219c148cf90767c892ec45c4bb2b08a83d04dc7b01","observation_id":"7c51347c-554b-4c1f-81fa-2dcdcf7e46ba","resolution":{"observed_at":"2026-05-18T16:01:34.669220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:e6d849fc7ffb95f115746444914cff3925c6157b3fc105a9db7187c9be5f072b","observation_id":"73480cc4-5f45-4c84-aeea-4c1447930d07","resolution":{"observed_at":"2026-05-18T16:01:34.691712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"425cc101-ba6e-476d-9dba-90d8eec9b21f","year":1928},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:e360962ee25e77582971d1fb85d7828dd0c3ea3be4cd24de0530fd67fdc054c9","observation_id":"6c4cdfa7-2043-4786-80f0-3cbda840d0c3","resolution":{"observed_at":"2026-05-18T16:02:42.413773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.00362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:36:26.334217Z","title":"Fsnet: Feasibility-seeking neural network for constrained optimization with guarantees.arXiv preprint arXiv:2506.00362","venue":null,"work_id":"23b2ffa6-15ba-424c-b693-e3f300ba9b80","year":2025},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:30068ece7bd11e67d245192788ee7c567f269a4d475b726f8c1e0f15676e864c","observation_id":"4ed0a580-c6ab-4aa2-aee3-e294c5baba0a","resolution":{"observed_at":"2026-05-18T16:01:34.697150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-07-11T03:57:46.887146Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:5b727c2a58060cc8cc0440df4bdd88e7000427ec45a0642d060b772ce3e6e61c","observation_id":"e88586be-d83e-46cc-9911-6811e9b76bc3","resolution":{"observed_at":"2026-05-18T16:01:34.687253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:dff3a106089656dc3727af0b41999c285fc2324af636a92f2cf777a7736dc380","observation_id":"d8845c75-f0be-4e56-9102-5ad1b74d35ab","resolution":{"observed_at":"2026-05-18T16:01:34.673750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01665","last_updated":"2026-05-07T07:15:27Z","snapshot_observed_at":"2026-08-02T21:48:00.489948Z","submitted_at":"2025-06-02T13:35:03Z","title":"Leveraging Analytic Gradients in Provably Safe Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2506.01665","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01665","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging Analytic Gradients in Provably Safe Reinforcement Learning","venue":"cs.LG","work_id":"59db4202-c62b-401b-85ab-b20e06d57c61","year":2025},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"cited_paper":"/paper/2506.01665","citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:bdec878ada2a5f4bea9f379b07c50bd33cf29c73f2d5892906c0cd205ff129b7","observation_id":"35bfc727-ca6e-4a3a-96c3-95add16b4c5b","resolution":{"observed_at":"2026-05-18T16:01:34.678415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cd73342b-6872-49ea-973c-d3180f0a8a92","year":2020},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:72cdc2afc22133321d0f78c21cf7d2b209c76498081ed9f132f95b51f5e43759","observation_id":"3231029e-e74c-4abe-b916-d316b705794f","resolution":{"observed_at":"2026-05-18T16:02:42.416405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7f2f3f86-a949-4fd4-bd29-02e606f85cbe","year":2002},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:4a437fc34a59991422a922e45dfb19fcf628e1a6c51eda4fcb0bda81cb1178ab","observation_id":"a49a52ea-1d9c-4f57-a673-612badec4535","resolution":{"observed_at":"2026-05-18T16:02:42.403860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"∫ ˜X ∫ U","venue":null,"work_id":"07024a6a-f3e5-49fa-bc27-75485fb389ec","year":2021},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:dfbd679a99edd0f423e3e30836734430f4bf39ac4b7203d2fe8624717df072c3","observation_id":"d563fcf4-d564-4be3-b07a-ce3c05cdc46c","resolution":{"observed_at":"2026-05-18T16:02:42.410567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The environment has the state x= [ ϑ,˙ϑ ]T and the dynamics ˙x= ( ˙ϑ g ℓsin(ϑ) +1 mℓ2u ) ,(53) wheregis gravity andm,ℓare the mass and the length of the pendulum, respectively","venue":null,"work_id":"91355e3e-e1d6-4c4e-ba23-4c8f1ed59582","year":2024},"citing_paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:27.229351Z"},"links":{"citing_paper":"/paper/2509.12833"},"observation_digest":"sha256:619b84a24931538ff3a27bfa011255a6a8d440889b70f3b1e4e9fb1e3f4929e9","observation_id":"38d69e1c-4123-4f09-90cf-ef54cebc6df4","resolution":{"observed_at":"2026-05-18T16:02:42.407647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.12833","last_updated":"2026-04-16T08:25:21Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T22:30:02.223630Z","submitted_at":"2025-09-16T08:56:38Z","title":"Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":7,"verified_fuzzy":3},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 2 inbound Pith citation observations for arXiv:2509.12833."}