{"as_of":"2026-08-16T12:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87f89e34aa0b7ceda019381fec280123fa2070339ccc8f7b9f46701810e822d8","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:47:00.466159Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.08379/citation-record","integrity":"/paper/1908.08379/integrity","json":"/paper/1908.08379/citation-record.json","paper":"/paper/1908.08379"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1705.10528","last_updated":"2017-05-30T10:07:31Z","snapshot_observed_at":"2026-08-14T20:57:21.454230Z","submitted_at":"2017-05-30T10:07:31Z","title":"Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10528","snapshot_observed_at":"2026-08-14T11:47:00.199339Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.199339Z"},"links":{"cited_paper":"/paper/1705.10528","citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:09f35b7a8b46d611d9877592acd80838925776195ef05d2351ee4bb2f41c0b15","observation_id":"c0622a28-0221-4059-bcb0-06077b7047cb","resolution":{"observed_at":"2026-08-14T11:47:00.199339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.223552Z","title":null,"venue":null,"work_id":"4a10d419-e089-49be-aa56-355669b3e76a","year":1974},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.247482Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:dbdcddf5337931a85d41726bcbc8051c01a212fc82850a716b6fe5cd450065e1","observation_id":"f7a629dd-683e-47b0-ab95-ab1bd2d34ead","resolution":{"observed_at":"2026-08-14T11:47:01.228320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.175146Z","title":"A comprehensive survey on safe reinforce- ment learning","venue":null,"work_id":"503fb4fa-4edf-4e49-9bb9-1f08587da32d","year":2015},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.262981Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:31a908848f96b2de8e3277831c2f5096ece954bc7fbf249b44fa9aabc0306a35","observation_id":"6885c0a8-87ad-4c34-99eb-9d5749067e16","resolution":{"observed_at":"2026-08-14T11:47:01.180579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.158730Z","title":"Risk-sensitive reinforcement learning applied to control under constraints","venue":null,"work_id":"2afd175b-060b-4d12-a0a4-9355364c8bd1","year":2005},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.269387Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:aaf170cf2415e3eb27e5723ec039e449de7809604f79b8b83b95baa7ca5867dd","observation_id":"5b494833-b55a-46a9-b9e4-fe4c6a965886","resolution":{"observed_at":"2026-08-14T11:47:01.164611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.143477Z","title":"Likelihood ratio gradient es- timation for stochastic systems","venue":null,"work_id":"486cf34b-7688-4c16-9300-fe1ee5c1516d","year":1990},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.275005Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:9ef38c3b291ad161d4ada97ce73cd15c39886941d0de808a3c0abc1d2fa137e3","observation_id":"8dd704f5-210b-4d8e-a26e-adc390be3ede","resolution":{"observed_at":"2026-08-14T11:47:01.148182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.107827Z","title":"Risk-sensitive markov decision processes","venue":null,"work_id":"8f673106-4e40-4e24-950c-d070905a7f4f","year":1972},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.285914Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:989e578cff7d50fbf67a3448ad80d888d3179144f3b3a813c2ca3522e9090e7c","observation_id":"87f247a4-1757-4668-a409-092835200307","resolution":{"observed_at":"2026-08-14T11:47:01.114364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.994881Z","title":"Func- tional value iteration for decision-theoretic planning with general utility functions","venue":null,"work_id":"9cd9c171-7561-4aff-8db0-d57022fca6b9","year":2006},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.317425Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:fb1cf752aa49a54c92a3d14995d46018081865040b53600cd3d7ad15e0581305","observation_id":"f1d830a1-cbc2-4f20-bc2a-93589db2b562","resolution":{"observed_at":"2026-08-14T11:47:01.000834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1104.5601","last_updated":"2011-04-29T11:39:40Z","snapshot_observed_at":"2026-08-15T06:37:34.835804Z","submitted_at":"2011-04-29T11:39:40Z","title":"Mean-Variance Optimization in Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1104.5601","snapshot_observed_at":"2026-08-14T11:47:00.333595Z","title":"Mean-variance optimization in markov decision pro- cesses","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.333595Z"},"links":{"cited_paper":"/paper/1104.5601","citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:50ee19c4d144a38a1124fee64036445e32b2b156e5e1a2df8f5dfc235e63bd33","observation_id":"92173d96-c6d8-4931-8b53-7c840677d645","resolution":{"observed_at":"2026-08-14T11:47:00.333595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.4810","last_updated":"2012-07-06T20:56:23Z","snapshot_observed_at":"2026-08-15T00:59:22.243502Z","submitted_at":"2012-05-22T06:02:09Z","title":"Safe Exploration in Markov Decision Processes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.4810","snapshot_observed_at":"2026-08-14T11:47:00.351643Z","title":"Safe exploration in markov decision pro- cesses","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.351643Z"},"links":{"cited_paper":"/paper/1205.4810","citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:5f79fc0c3c0b31cf8bc9c023e84a6435f06ac3895967bcfbd0c7b5808b7d1389","observation_id":"864485fc-1928-468d-a3e3-b0f4becf540b","resolution":{"observed_at":"2026-08-14T11:47:00.351643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1203.3497","last_updated":"2012-03-15T11:17:56Z","snapshot_observed_at":"2026-08-15T04:16:15.373594Z","submitted_at":"2012-03-15T11:17:56Z","title":"Parametric Return Density Estimation for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1203.3497","doi":null,"metadata_source":"pith","pith_arxiv_id":"1203.3497","snapshot_observed_at":"2026-08-14T11:47:00.511343Z","title":"Parametric Return Density Estimation for Reinforcement Learning","venue":"cs.LG","work_id":"5c0f1176-ce30-4627-a10f-f87ca69d3085","year":2012},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.358479Z"},"links":{"cited_paper":"/paper/1203.3497","citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:c3f312f29db72c4e0829a26d84d079f49c464f4d71b190a5dd028c3d20a7ecac","observation_id":"366feeb0-c411-4045-b945-5c9f6fee9dd1","resolution":{"observed_at":"2026-08-14T11:47:00.520175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.927151Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":"194d98b3-87ed-4e14-9d96-3e2971e425d2","year":1999},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.365822Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:80e671c8f8779c02844a83afbf33e3993799d3902d38af400188beaf46abdf89","observation_id":"49cffd99-260f-496f-a1bc-ca950d320464","resolution":{"observed_at":"2026-08-14T11:47:00.932894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.908769Z","title":"Markov chains","venue":null,"work_id":"e8fe5069-99bd-417a-99e2-34a8568baabf","year":1998},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.371883Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:8583ecd5dc67b0fefedc70b73fa4634e8f9166ef8c7c7307c44e7c442715733e","observation_id":"422180c0-9576-4cf1-9040-5734e0319dac","resolution":{"observed_at":"2026-08-14T11:47:00.914052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.878161Z","title":"Evaluation: from preci- sion, recall and f-measure to roc, informedness, markedness and correlation","venue":null,"work_id":"78630dc8-4f69-42d8-95af-582e0c4f93f5","year":2011},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.397172Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:422bdbba09aacd5c777c194d1340007b481c234a618df8d3730087c0b9a053a7","observation_id":"80b9dabf-59c1-41ee-ac76-8122aa2ad39d","resolution":{"observed_at":"2026-08-14T11:47:00.883270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.857017Z","title":"Actor-critic algorithms for risk- sensitive mdps","venue":null,"work_id":"1e7470cc-ca0e-4a94-82c2-e79cee1ab832","year":2013},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.403592Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:a3c61c284fbb45717fe2675d60f388b73728b84c0c92a158596d1a506e759055","observation_id":"6d394dd3-f44e-4bad-a12a-7656b895fecb","resolution":{"observed_at":"2026-08-14T11:47:00.865002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.837915Z","title":"Markov decision pro- cesses","venue":null,"work_id":"900592e2-f077-49aa-9582-a0271fc533a1","year":1994},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.411002Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:a566a514eb0cb7e422214431c273b76f3da7088de2d9be4112beb564742f0077","observation_id":"aea5fe12-e1ec-4d56-9f28-027a2e8a4bbd","resolution":{"observed_at":"2026-08-14T11:47:00.843434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.797515Z","title":"Td algorithm for the variance of return and mean-variance reinforcement learning","venue":null,"work_id":"3aa6bcc9-d5e9-4894-ab54-f43f936c27dc","year":2001},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.423786Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:020501c37c254c8b40841e01032cd06819225208a9b3d46a1761904e8b2c5f8a","observation_id":"fbd94178-7446-4867-a208-bb48b5074749","resolution":{"observed_at":"2026-08-14T11:47:00.802809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.780816Z","title":"Lectures on stochastic program- ming: modeling and theory","venue":null,"work_id":"f88c1800-000e-457b-8ddf-d084b916e98b","year":2009},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.430564Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:0e792a0b26c087ed98c9e683fce11df780494ea047fe20ba4a44c8f38ee188af","observation_id":"115460b0-48e8-41f0-9303-9c9092644f2b","resolution":{"observed_at":"2026-08-14T11:47:00.786428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.691030Z","title":"Temporal difference methods for the variance of the reward to go","venue":null,"work_id":"86121fec-2dd3-4281-b3d8-d64845e193a1","year":2013},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.460172Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:cb43fb29e5fe0e864be68865284d5761f94d06b3a3d5b636d7cc229fe49df0fe","observation_id":"60c9b40d-6e7d-4333-af3c-1fa87fb43545","resolution":{"observed_at":"2026-08-14T11:47:00.696648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.670093Z","title":"The gambler’s ruin ap- proach to business risk","venue":null,"work_id":"12d0f955-38e8-456c-8a71-4b9b464b3d35","year":1976},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.466159Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:c80d72544adcc333882d53deddd54218669bcfa274fd1f341a561e4515edd9e6","observation_id":"1d70e6be-1833-424a-8977-010079b7e4bf","resolution":{"observed_at":"2026-08-14T11:47:00.676757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.976907Z","title":null,"venue":null,"work_id":"2350c18f-c787-42e5-964e-4ff39524414e","year":1999},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1186,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.322177Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:c0edb03b706e9baf091b6244b79591574c62edb71d5693e114a6641cb0116dca","observation_id":"fbdd48ab-eb9d-43d0-aae3-f6c5ab4cb10c","resolution":{"observed_at":"2026-08-14T11:47:00.982440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.085986Z","title":"Dynamic probabilistic systems: Markov models, volume","venue":null,"work_id":"7fa820c2-bd55-46b8-afee-698de224394c","year":2012},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1972,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.290889Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:ac3629fd792424647f78cb0c52ec890deebdd4b2108e3c69bd31a9706813e3c6","observation_id":"9e94c784-f3a5-42a1-9e30-acec831f94d4","resolution":{"observed_at":"2026-08-14T11:47:01.090805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.207813Z","title":"Percentile performance criteria for limit- ing average markov decision processes","venue":null,"work_id":"d61720cf-8c77-424c-b381-ab7c58879788","year":1995},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1974,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.252471Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:3b39822df6ba649c6452191d2881856d8f6ae51c36ed5aaaa7a2eb02973f28e0","observation_id":"d0cb7324-dce7-49bf-bf05-d3ffd12d5fa2","resolution":{"observed_at":"2026-08-14T11:47:01.212764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.442291Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1982,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.442291Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:2825ab767ecda5257e1875338594ca69d449384bafce0009501a82abe3a69b4f","observation_id":"47e56ef4-44d9-4e50-8ad3-296d7d0ff9cc","resolution":{"observed_at":"2026-08-14T11:47:00.442291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.709621Z","title":"Policy gradients with variance related risk criteria","venue":null,"work_id":"dc7481a3-05e9-419a-93f1-866c80d551aa","year":2012},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.454787Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:a4c3f036c661be84834fc3bf60ea9c60a5f9a06a4b90e22e4f27b2f3b278b9b2","observation_id":"e5516cde-bf17-4998-86c7-643b5d37f6c1","resolution":{"observed_at":"2026-08-14T11:47:00.715771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.126771Z","title":"Deep learning, vol- ume","venue":null,"work_id":"0637967b-187f-4ae3-8193-7ea1821b727f","year":2016},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1990,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.281120Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:2151f9839c952c358299159fa74f9237c19bbc8da1aa4d4a49c337a9cd357231","observation_id":"24f94fc6-a7ea-4083-a22b-da5919f98226","resolution":{"observed_at":"2026-08-14T11:47:01.132329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.818065Z","title":"Optimization of conditional value-at-risk","venue":null,"work_id":"d6024ee1-b16b-40ac-9c23-19e5fbcdec04","year":2000},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.416480Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:ad614acae23530f60cb71631af75682fccc6498aeca5579ed34828144be691de","observation_id":"fc743c7c-1e30-4516-a20a-4fe2e007a427","resolution":{"observed_at":"2026-08-14T11:47:00.824826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.191470Z","title":"Monte Carlo: concepts, algorithms, and applications","venue":null,"work_id":"5b3e6101-896a-4b43-9a41-7af797ff9f4f","year":2013},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.257427Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:f113460bc075ef95e64759d9d72832c7439b17d9a972aaba355a4f195579dbf5","observation_id":"7533c659-cf4a-4c3d-949a-65991729e8dd","resolution":{"observed_at":"2026-08-14T11:47:01.196498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.893445Z","title":"Safe policy iteration","venue":null,"work_id":"b838cfff-f670-46f6-8906-56bd4cec08a8","year":2013},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.384923Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:7aab7268ce9b9d500c74cbdd11611c1d346fc440e09482e5c38b4f2327b613a7","observation_id":"fe836923-52ea-4ca8-991f-ffbd96e51f10","resolution":{"observed_at":"2026-08-14T11:47:00.898308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.306236Z","title":"Safe policy search for lifelong reinforce- ment learning with sublinear regret","venue":null,"work_id":"764ee568-9d24-4052-93d9-6183b5ef663f","year":2015},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.211287Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:b7fca4a30ef6ee545b0a426c16f18d4932c66665fd3b8ad82deecb1be4c08e70","observation_id":"3e7b3fcc-7d6c-457f-9554-80bac6e4a827","resolution":{"observed_at":"2026-08-14T11:47:01.311760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.043399Z","title":"Stochastic approximation and recursive algorithms and applications, volume","venue":null,"work_id":"d0fe7d67-3075-4431-b43b-cfed22e21737","year":2003},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.307149Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:5a09447fcfb88dca26eea45998c79a464939d9325f62807904a666539c65c699","observation_id":"9659f2d8-4bff-4b40-9f93-49a21b1bd4c9","resolution":{"observed_at":"2026-08-14T11:47:01.048918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.271826Z","title":"Dy- namic programming and optimal control, volume","venue":null,"work_id":"bbd22b42-5455-4420-85ab-df1bc535d276","year":2005},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.229344Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:ced341cec63bcd54d9bd92aa22116a1521a7584ccb1e12efdb19c507c32e253e","observation_id":"99ac038d-8fbf-4f59-85c3-b88876d70d80","resolution":{"observed_at":"2026-08-14T11:47:01.276668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.346266Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.346266Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:77d65338ec471f21757c19d4b07c9c410346d742df1288f33e905eb98a8f730c","observation_id":"7ad29f28-d649-425d-ac96-107b5674b402","resolution":{"observed_at":"2026-08-14T11:47:00.346266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.019127Z","title":"Deep learning","venue":null,"work_id":"35717a1e-ee7e-4c4f-9176-51a9b3c1f982","year":2015},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.312797Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:c61d9b2a0145ea0b9553b8f3e027fcfd2c3a19fa2cda76bedbb755959c368c94","observation_id":"f102fa1f-3323-4da0-a0df-28fd66af8027","resolution":{"observed_at":"2026-08-14T11:47:01.026874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.256037Z","title":"Model predictive control","venue":null,"work_id":"bbfe16cb-7776-498f-85b0-70828a5b01a0","year":2013},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.235823Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:1f829d93b94bb2b549cb776961a4e52b7dbbc7f4b6eb1a66678a3586fee611c1","observation_id":"82567b9a-80e6-4a58-ae6f-01dd20053b60","resolution":{"observed_at":"2026-08-14T11:47:01.261361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1207.1391","last_updated":"2012-07-04T16:15:31Z","snapshot_observed_at":"2026-08-15T15:49:30.847763Z","submitted_at":"2012-07-04T16:15:31Z","title":"Existence and Finiteness Conditions for Risk-Sensitive Planning: Results and Conjectures","version":1},"cited_work":{"arxiv_id":"1207.1391","doi":null,"metadata_source":"pith","pith_arxiv_id":"1207.1391","snapshot_observed_at":"2026-08-14T11:47:00.586876Z","title":"Existence and Finiteness Conditions for Risk-Sensitive Planning: Results and Conjectures","venue":"cs.AI","work_id":"46d5757f-424e-4c6b-ba54-8fe374b016f1","year":2012},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.328004Z"},"links":{"cited_paper":"/paper/1207.1391","citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:b6d82ab06d8dea8e1fa6ccf6cb16f8d114eb09d9be5faa324cbc3e1d42d6e72b","observation_id":"c4994c29-6bdb-441c-a921-5c0017937f81","resolution":{"observed_at":"2026-08-14T11:47:00.594354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.759234Z","title":"The variance of discounted markov decision processes","venue":null,"work_id":"ae9773a4-ee33-4151-9c31-3e2ab766709c","year":1982},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.436188Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:e32ca6b2cbe97011e829dd11cce597577f2ba0b325e5c6be4cb40e4faefe4662","observation_id":"98a3397f-b14f-427d-b44e-c62e1e69eb7c","resolution":{"observed_at":"2026-08-14T11:47:00.766084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.958894Z","title":"Risk-sensitive reinforcement learning","venue":null,"work_id":"d95e183f-6a5f-400e-8fe6-7898bbda4a1a","year":2002},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.340096Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:276cedb7f85a1e2a0b3f83d60c6ebcab9838183d9898060db02f7bc37a546c05","observation_id":"d88b01fb-298f-40c1-a244-7d19c6fc2aef","resolution":{"observed_at":"2026-08-14T11:47:00.965665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T11:47:00.296273Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.296273Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:6f91fad1e3709e48aee85749dabb95c22b59c400a6517bc7738b7a8145be8356","observation_id":"a8c73675-244b-4b88-bef3-af6ef33686bd","resolution":{"observed_at":"2026-08-14T11:47:00.296273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.238472Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":"aad5a47f-bbca-4860-a35b-a9dc3021209a","year":2017},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.241793Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:a1ec6164dcac788bc09c24c079222b0d9fbba89c0df24b9981f97374f6d2ca3a","observation_id":"f8cda374-623a-4141-b2c3-32946a77b97b","resolution":{"observed_at":"2026-08-14T11:47:01.243517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.065450Z","title":"Actor-critic algorithms","venue":null,"work_id":"196e7589-c4cc-4476-a58b-e73b3e3cb143","year":2000},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.302243Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:e38f97176ddd8b77ba17fa0ecec1162e136a95153f7210daba916933a37fe54b","observation_id":"f758d6f8-8c2f-47db-b1aa-d75bdddf43f3","resolution":{"observed_at":"2026-08-14T11:47:01.072180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-14T11:47:00.216670Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.216670Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:741bda6009109776c7beafd6c86042e6c247026020da59c747363485fd67763f","observation_id":"1b2a7ee7-e7c6-4da9-b510-610e36ec7c36","resolution":{"observed_at":"2026-08-14T11:47:00.216670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.288629Z","title":"Inﬁnite-horizon policy-gradient estimation","venue":null,"work_id":"3b049c74-4169-4620-b460-9b29f1147f93","year":2001},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.223403Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:6e0cb852b1403753c9777b8e7fd5fbcb602264de01e3feed48c3bed09a3c2f49","observation_id":"667f2c22-fb2c-40f6-b2e6-5872d5282a4e","resolution":{"observed_at":"2026-08-14T11:47:01.294961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:01.322912Z","title":"Constrained Markov decision processes, volume","venue":null,"work_id":"8be4570f-0591-44c2-b284-4b2dc3520d96","year":1999},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.205811Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:18e1d87f0a05839adba5fd9d82399e9bcf06c08fe5df5044adcd95a65302b4d7","observation_id":"c953d1a8-b7ee-4404-bf53-d5e7271a4d22","resolution":{"observed_at":"2026-08-14T11:47:01.328689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:47:00.729457Z","title":"Learning to predict by the methods of temporal differences","venue":null,"work_id":"0189cb9b-1041-4e87-b2b1-2ec34fc70bc0","year":1988},"citing_paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T11:47:00.448620Z"},"links":{"citing_paper":"/paper/1908.08379"},"observation_digest":"sha256:7125c312e6af6a699c160b345e53b490851eeb7d77591ddb82066de469c36ae1","observation_id":"111b9753-ed5f-4a49-8c6d-1349bb516e05","resolution":{"observed_at":"2026-08-14T11:47:00.734699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.08379","last_updated":"2019-08-22T13:50:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:42:27.958180Z","submitted_at":"2019-08-22T13:50:31Z","title":"Practical Risk Measures in Reinforcement Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:1908.08379."}