{"as_of":"2026-08-20T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e28c51f013e4dd9f88804bd0afa51ef36be2531a3320c8318ab28b6085433cc","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:47:08.802211Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1909.02769/citation-record","integrity":"/paper/1909.02769/integrity","json":"/paper/1909.02769/citation-record.json","paper":"/paper/1909.02769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.043808Z","title":null,"venue":null,"work_id":"9c61a73c-0e0d-4320-8740-40f5ad2e6287","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.736214Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:62aca711587418099c81fa7878c964ebfcb8cdc3497646081c6ffd088c47b6a2","observation_id":"27ae6628-b5af-497e-821a-4d18c8f20f7f","resolution":{"observed_at":"2026-08-14T04:47:09.046718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.034110Z","title":null,"venue":null,"work_id":"f0c082e9-abd6-4212-ac19-b92930d3a21f","year":2000},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.739625Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:4ef1d257a4544fa90fbc71f1bd9c41bea0d51e2edacadcbb36e46daa4bfb0aab","observation_id":"c1a6a39d-480f-4387-98c7-627952f0d949","resolution":{"observed_at":"2026-08-14T04:47:09.038264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.968027Z","title":"The only difference is the approximation ter m which we bound in E.5","venue":null,"work_id":"f7baa87e-3bcf-4738-bf1f-0c7120eda2a0","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.763760Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:1299cb0688b3e85a6654d48f088b6477d50649b38e434a14fe8ff3b2bccbbb81","observation_id":"58988014-eee5-4149-ade9-6d1a1516382f","resolution":{"observed_at":"2026-08-14T04:47:08.971284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.959112Z","title":"non- euclidean, unregularized vs","venue":null,"work_id":"71885f83-7392-4d7d-98f9-df8514301f7c","year":1997},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.767172Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:c0e9668c8de82f85ae4cd0d85ba7c3a682c247bf039b61887d155cff2fc680fa","observation_id":"efe63d85-b522-4406-89aa-b57a39700d16","resolution":{"observed_at":"2026-08-14T04:47:08.962357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.024886Z","title":null,"venue":null,"work_id":"62d87054-c624-4aae-89d0-b0c7ecca6d6b","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.743335Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:240106463302981e382fc3c4c2b7528d164c593bc1f0d89833728a842d8eb7b6","observation_id":"66b59133-8b8c-4b5e-b803-0dbdf0920770","resolution":{"observed_at":"2026-08-14T04:47:09.028033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.015480Z","title":"WhereCω,1 = √ A,Cω,3 = 1 for the euclidean case, and Cω,1 = 1,Cω,3 = logA for the non-euclidean case","venue":null,"work_id":"104a94b3-e108-4fe3-8546-2d84f9038ebe","year":2017},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.746609Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:3df9ee3483271af6e543710b522ae27f14ae8ccf05ece964260deaf4c9f98369","observation_id":"cf7e8417-522e-4b0a-80d2-971ec7c92fd0","resolution":{"observed_at":"2026-08-14T04:47:09.019274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.005844Z","title":null,"venue":null,"work_id":"5bfb1b59-79cf-438e-b3e4-7557a9cd3d4a","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.750296Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:95260b976fa7c4f58998f78ed6fffd2212e50e5bb69f9f4853938b34088564c7","observation_id":"f5f13223-a89d-4191-a53a-e76c138f82c6","resolution":{"observed_at":"2026-08-14T04:47:09.009673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.996249Z","title":"WhereCω,1 = √ A,Cω,3 = 1 for the euclidean case, and Cω,1 = 1,Cω,3 = logA for the non-euclidean case","venue":null,"work_id":"aa666a5f-5eb4-48cc-8aa4-c28497747a2d","year":2017},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.753588Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:73835a7ec1b8905d855ea7ce9a497455078778c777cf242bd315a8b094be3d7b","observation_id":"c20aa758-a173-4606-9e3f-cbf8d46b7bfb","resolution":{"observed_at":"2026-08-14T04:47:08.999885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.986233Z","title":null,"venue":null,"work_id":"dc6ef874-9d38-4b5a-ac3a-78864e501f5b","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.757324Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:fa9f23c1d6f7e9f355d4fdfc0192d7590cfaed15abac181d8a0df42886ccb76f","observation_id":"93ae11a8-afaf-4ca8-b46b-b59d64516109","resolution":{"observed_at":"2026-08-14T04:47:08.989294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.977001Z","title":"(a) In Lemma 20 we deal with the sampling error","venue":null,"work_id":"d738511c-c84d-44ba-8c0a-3c3a80291409","year":2003},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.760535Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:3aa16c4ac9701e55cc005b53099af9e672e48c1bef7150b5aacaac282eb4367c","observation_id":"55445983-088c-42e4-8b83-bd4efb7d2177","resolution":{"observed_at":"2026-08-14T04:47:08.980478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.950033Z","title":"In the next lemma we combine the results of Lemmas 20 and 21 to b ound the overall approximation error due to both sampling and truncation","venue":null,"work_id":"3b59af01-55e9-415f-baa9-1fa23c04ae8c","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.770555Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:bb3381bc39a1d933618a584bd7cc3652486be5e3df7678f3aeae1dcb3ea81d62","observation_id":"bc1c9d44-33f3-4d05-ac71-25770abd81ac","resolution":{"observed_at":"2026-08-14T04:47:08.953319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.940932Z","title":null,"venue":null,"work_id":"8d0c94f4-d7a9-4fa6-9366-637dd4cfd66b","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.773935Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:5ed8e600164349235414fcb5234ec9fdf1c7ea672a3e02e4685f2eadde056253","observation_id":"2371636e-77e1-4d26-8d7d-b4a8e3a8b8c7","resolution":{"observed_at":"2026-08-14T04:47:08.943964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.931051Z","title":null,"venue":null,"work_id":"c7f3679e-5377-420c-8cbf-52bd01e08db9","year":2017},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.777023Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:8ba63de730bb06501473d13c2ad0cf6f1e5bcb05e58c8b1e4385b587bbf6999b","observation_id":"7ca7e3c4-653a-4f59-95e5-16ee2c79b86a","resolution":{"observed_at":"2026-08-14T04:47:08.934522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.921463Z","title":"The statement holds by the properties of 1 2‖·‖2 2 and thus holds for both the uniform and exact versions","venue":null,"work_id":"e6ca9553-1f14-4bf4-8e2d-998baac9b997","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.780702Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:a4a7186e4b7b09dd2c5709450cd6ff6c015bfbdd916adb159e8386291ac0161a","observation_id":"62d802c8-6992-4a0e-a69e-e22e78dfc04a","resolution":{"observed_at":"2026-08-14T04:47:08.925105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.912407Z","title":"For the non-euclidean case,ω(·) = H(·) + logA","venue":null,"work_id":"3d84f1cc-5b4e-4e26-8b38-10655ed8e8ce","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.784197Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:7cfd81ee60d8fe4fa6e052f47b1b7b72f907ce25d1498bc0a017133ab40b9966","observation_id":"d2405a42-66bd-41a8-915e-09c220d835ba","resolution":{"observed_at":"2026-08-14T04:47:08.915618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.901575Z","title":"(74) By the ﬁrst order optimality condition, for any state s and policyπ, ⟨∇ω (s;πk+1)−∇ω (s;πk),πk+1(·| s)−π⟩≤ tk⟨ˆqπk λ (s,·) +λ∇ω (s;πk),π−πk+1(·| s)⟩","venue":null,"work_id":"c7cb945a-d6ce-4c36-8ed2-c79394f3eb48","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.787314Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:9b93f01f6086e2285f508e6896d9bcbaa607ec1e29c54f36e4067c7277d6e181","observation_id":"7af65408-fd5b-41c9-81ff-c184dc7bcb28","resolution":{"observed_at":"2026-08-14T04:47:08.905881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.891866Z","title":null,"venue":null,"work_id":"7e5a0f76-1f78-4776-94b7-60ab8509a21b","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.790347Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:f12f0d762fb4e94339c78180bc7386e2307f2886fa48e8d57352fb551ce48495","observation_id":"9fcd234b-5d1a-41c7-8ca8-0320372afaca","resolution":{"observed_at":"2026-08-14T04:47:08.894985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.880998Z","title":null,"venue":null,"work_id":"9307ce41-72a0-4a6b-aa5e-0c040d349dc9","year":2014},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.793510Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:934c6c480e4a4e5c067473ab3bc98ede45d7d7bf143cbf8619a003047d1e7851","observation_id":"2e951eae-63c9-452b-88ed-3cce9ab743b6","resolution":{"observed_at":"2026-08-14T04:47:08.884098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.871114Z","title":null,"venue":null,"work_id":"fdba1e98-f546-4a91-bb90-b87bdc9f556e","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.796489Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:0189c2215509d521f187cbc3006a3fe945777afb5c3ce83f51ef95de29fbf62c","observation_id":"53fd9995-616f-4611-974f-e82590d9addd","resolution":{"observed_at":"2026-08-14T04:47:08.874335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.861676Z","title":null,"venue":null,"work_id":"b00010df-d894-4db7-b94d-f367ba351750","year":null},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.799331Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:47bc5e5822590c1a743d65bbc69deb884fef7ca0a6621fdda86c28cea73142ff","observation_id":"f4280a46-45a2-414a-a43e-a4c2de889c7b","resolution":{"observed_at":"2026-08-14T04:47:08.865014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:08.849351Z","title":null,"venue":null,"work_id":"22123739-31fd-4e2f-918c-9f95b0f68504","year":2017},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.802211Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:a0826f50792898aeac46fd3652485418e9e863a9376a47e95e79274a1bf8935e","observation_id":"d5a6da65-0c71-48dc-a40c-69e899bcc0af","resolution":{"observed_at":"2026-08-14T04:47:08.854823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10306","last_updated":"2023-02-27T21:48:13Z","snapshot_observed_at":"2026-08-20T02:26:07.760783Z","submitted_at":"2019-06-25T03:20:04Z","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.10306","snapshot_observed_at":"2026-08-14T04:47:08.728735Z","title":"In ICML, volume 2, 267–274","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.728735Z"},"links":{"cited_paper":"/paper/1906.10306","citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:e4346811499ce37f2ec77f8e8d0f21697c5cf1ef3dac883da220ab164aac7a77","observation_id":"ece489f0-733e-4085-8d4b-11e9f78920b1","resolution":{"observed_at":"2026-08-14T04:47:08.728735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:47:09.052487Z","title":"MIT press","venue":null,"work_id":"f08b5ec3-94b0-4161-8eed-82269278cb70","year":2000},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.732647Z"},"links":{"citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:77ba1148dea94d0877932f31ff9eaf1f9f8ae4f6bcc9be1efa48aa986068ce13","observation_id":"806d2a1e-f687-4559-a210-8c6646ad89f1","resolution":{"observed_at":"2026-08-14T04:47:09.055634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01786","last_updated":"2022-06-20T01:01:28Z","snapshot_observed_at":"2026-08-18T17:48:45.731224Z","submitted_at":"2019-06-05T02:12:22Z","title":"Global Optimality Guarantees For Policy Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01786","snapshot_observed_at":"2026-08-14T04:47:08.724414Z","title":"arXiv preprint arXiv:1906.01786","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T04:47:08.724414Z"},"links":{"cited_paper":"/paper/1906.01786","citing_paper":"/paper/1909.02769"},"observation_digest":"sha256:348c5c3b82a9e160a69b1fa19e9adef0cc120992fdd21b3c1769bc36b7d0c625","observation_id":"51e97a6a-4784-4ae1-a00a-61754fd6ac25","resolution":{"observed_at":"2026-08-14T04:47:08.724414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1909.02769","last_updated":"2019-12-12T17:07:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T21:11:11.657692Z","submitted_at":"2019-09-06T08:43:38Z","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:1909.02769."}