{"as_of":"2026-08-08T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df44ed547d4f08f5d9b88b2b169de0fcc9215af1297a175b78ea58f5c3c392b4","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:21:29.954534Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05953/citation-record","integrity":"/paper/2506.05953/integrity","json":"/paper/2506.05953/citation-record.json","paper":"/paper/2506.05953"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T10:21:29.928004Z","title":"Robotics and Autonomous Systems 131, 103568","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.928004Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:b1162b82952509e1a9b5bfbaa790ccf5ad837a5ec731bef4ab84716c32362493","observation_id":"1af85dc5-728c-4ef0-b73e-d409453afb69","resolution":{"observed_at":"2026-08-07T10:21:29.928004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11513","last_updated":"2026-05-01T12:34:37Z","snapshot_observed_at":"2026-07-06T19:03:56.484389Z","submitted_at":"2024-08-21T10:44:57Z","title":"Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11513","snapshot_observed_at":"2026-08-07T10:21:29.937676Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.937676Z"},"links":{"cited_paper":"/paper/2408.11513","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:056ae5e1d90505a1e95171337ebcbdd0bbb2453a077ee03fa7201128da3e043d","observation_id":"a224fb8b-1410-48fe-9a42-989f10280e04","resolution":{"observed_at":"2026-08-07T10:21:29.937676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.151849Z","title":null,"venue":null,"work_id":"530bb34d-e82b-46f6-a228-08e6850144cf","year":2022},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.954534Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:5ab7fafe63f8224b2b2c5ed09b84d16f4c8dc925610cd9a8ef6f3425e5ac18d7","observation_id":"6091738d-e883-4ec0-96d1-66569de17fed","resolution":{"observed_at":"2026-08-07T10:21:30.156809Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.221599Z","title":null,"venue":null,"work_id":"1b231961-c75e-4021-8983-fe7026db094e","year":2021},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.733240Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:e15e4a7c108a870f6781fab503fd2d5dd47f18fa9bda3a182db273510f868786","observation_id":"65f17fcb-8643-478e-b787-55678502f56e","resolution":{"observed_at":"2026-08-07T10:21:30.226107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.180077Z","title":null,"venue":null,"work_id":"cf11c1b5-6fe6-42bb-96d4-5f3ee83eb519","year":1940},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.945891Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:ccce215f991c35b1a1206e4d98e5b6d982fe85ebccdd4590cdf26303b86fb511","observation_id":"1c0e0e6c-6364-41b6-b6ab-16f999295e79","resolution":{"observed_at":"2026-08-07T10:21:30.184116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.193087Z","title":null,"venue":null,"work_id":"54645b4f-7005-48fe-bbec-a43dcb33ed5d","year":2025},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.941700Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:27d74b1d91e0dee0edca20b515e5aaeeebbda2f01cac281cc7d3b067d24211ad","observation_id":"3bff57d4-77ba-4980-b962-88df74cf03af","resolution":{"observed_at":"2026-08-07T10:21:30.197055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.07900","last_updated":"2020-05-24T21:30:54Z","snapshot_observed_at":"2026-07-06T07:09:04.739736Z","submitted_at":"2018-10-18T05:25:11Z","title":"Policy Gradient in Partially Observable Environments: Approximation and Convergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.07900","snapshot_observed_at":"2026-08-07T10:21:29.414918Z","title":"Courier Corporation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.414918Z"},"links":{"cited_paper":"/paper/1810.07900","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:b0914a83a12470b704633611331aa6055d78dc80acd6d3bc28f0ac3dafcc1e1f","observation_id":"8e3dabbf-8f89-4c53-80c7-b30bff4f7e6c","resolution":{"observed_at":"2026-08-07T10:21:29.414918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.235854Z","title":"Journal of Optimization Theory and Applications 153, 688–708","venue":null,"work_id":"197fe567-804c-4d44-a9b8-a243795513ec","year":2022},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.487809Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:e557780ca9f29773a13941772c8e3048b295122fee71841f01fffddd8b933c8e","observation_id":"d7531016-6d4f-4552-8e16-26323277461b","resolution":{"observed_at":"2026-08-07T10:21:30.240836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-07-06T06:20:24.181731Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-07T10:21:29.646248Z","title":"arXiv preprint arXiv:1801.08757","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.646248Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:eec86df12d328d09ebe7b16dbce090165a591c82926b0245e9c5203a30aaf5b1","observation_id":"4271e805-bac3-4047-b529-7c02f71a29ea","resolution":{"observed_at":"2026-08-07T10:21:29.646248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:29.828608Z","title":"Advances in Neural Information Processing Systems (NeurIPS) 33, 8378–8390","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.828608Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:8387b8993278c0e8c068f3cd571739a23866e3a6be7c718fae511d0f17e43a7a","observation_id":"23eb6839-ec15-461b-983d-65b88833db7d","resolution":{"observed_at":"2026-08-07T10:21:29.828608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00552","last_updated":"2022-02-03T20:48:15Z","snapshot_observed_at":"2026-07-06T12:03:55.626372Z","submitted_at":"2021-10-31T17:46:26Z","title":"Policy Optimization for Constrained MDPs with Provable Fast Global Convergence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00552","snapshot_observed_at":"2026-08-07T10:21:29.933220Z","title":"arXiv preprint arXiv:2111.00552","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.933220Z"},"links":{"cited_paper":"/paper/2111.00552","citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:7bc9eaafce14fc77d9686d4f2490e3797ba54d2c4294ed1b8b36a6e8a56c494c","observation_id":"701ec355-c83d-4a44-a034-63684c786d0b","resolution":{"observed_at":"2026-08-07T10:21:29.933220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.166590Z","title":null,"venue":null,"work_id":"1dc70231-f45b-4271-a5aa-fe0c40656270","year":1909},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.950115Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:c79bf448e2a23d681c9e8ea7b1b9d2b577c66f0a0b895c2b04b09da26fe1a3d7","observation_id":"0dee27c5-8433-4924-9ad7-512cb59a7cf7","resolution":{"observed_at":"2026-08-07T10:21:30.170599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:21:30.206497Z","title":"11506–11533","venue":null,"work_id":"d757576c-d2a4-4f16-bf74-11970190d696","year":2020},"citing_paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:21:29.920865Z"},"links":{"citing_paper":"/paper/2506.05953"},"observation_digest":"sha256:aae6c5a0348f9267126af4a42b892c0d754b234844c20e71846b4a9f28b390ad","observation_id":"5d26c38f-73b2-439c-9214-e1e4b74089e0","resolution":{"observed_at":"2026-08-07T10:21:30.211143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05953","last_updated":"2025-06-06T10:29:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:59:39.805679Z","submitted_at":"2025-06-06T10:29:05Z","title":"Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2506.05953."}