{"as_of":"2026-08-11T06:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1af18c6504e342c833de93d5078e1ef4e746c6d0995e381ab71d0a6e16105250","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:09:08.965688Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:52:16.912981Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:56:16.626906Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.03900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03900","snapshot_observed_at":"2026-07-01T21:56:16.626906Z","title":"and Ku, H","venue":null,"work_id":"5f8da0b8-e366-47c9-95ba-396e5d21c5bd","year":null},"citing_paper":{"arxiv_id":"2606.04029","last_updated":"2026-06-06T23:43:36Z","snapshot_observed_at":"2026-08-09T04:19:11.332111Z","submitted_at":"2026-06-01T19:40:10Z","title":"Position: Deployed Reinforcement Learning should be Continual","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:52:16.912981Z"},"links":{"cited_paper":"/paper/2507.03900","citing_paper":"/paper/2606.04029"},"observation_digest":"sha256:6df941460a15d6b0f05ff953d5027e454ab2ae0d5f4eec8e838b868de2b88313","observation_id":"7230b9cf-49f5-4521-825d-c050ed5b3d97","resolution":{"observed_at":"2026-07-01T21:56:16.628195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.03900/citation-record","integrity":"/paper/2507.03900/integrity","json":"/paper/2507.03900/citation-record.json","paper":"/paper/2507.03900"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:00.906755Z","title":"Spectral measures of risk: A coherent representation of subjective risk aversion","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:00.906755Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:b47053d80d443797c2979775a8b70308ed3d67185bc4bd3aad21eb85d30dd285","observation_id":"4219a721-e37a-4fa8-a3bc-4ac5913ac001","resolution":{"observed_at":"2026-08-06T20:09:00.906755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.787218Z","title":"Kakade, Jason D","venue":null,"work_id":"76ed56fe-c579-4d01-9ff5-a2501816d9b8","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.031571Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:225b0b28b1778b528bab45f47518b18c61ebff31328bfef030582495070c6f95","observation_id":"818dda2a-6161-435f-ac6a-b30e1a9e1610","resolution":{"observed_at":"2026-08-06T20:09:20.861936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.635781Z","title":"An Optimistic Perspective on Offline Reinforcement Learning","venue":null,"work_id":"629d13c1-ac0f-469b-bd5e-417acf0a5258","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.190995Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:c0fdda66f35e0cd00547b412146d997732e3564568c1f6f848481d8adf45b429","observation_id":"5f44cbee-17ab-4308-a6df-0c9aecfb9cc0","resolution":{"observed_at":"2026-08-06T20:09:20.721182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.eswa.2017.06.023","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Expert Systems with Applications","work_id":"573af30d-9a8c-458f-802d-706d5edf0821","year":2017},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.349277Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:109b19fa93ae2a0f2abf7b0bcd58a57ad6dfe7439ca47ef87d80346f61469ae5","observation_id":"cf4b3243-800d-403e-aed4-5491e391eb64","resolution":{"observed_at":"2026-08-06T20:09:10.698147Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.32171","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:13.505940Z","title":"Monotonic Quantile Network for Worst-Case Offline Reinforcement Learning","venue":null,"work_id":"0291739a-ec16-4c3f-b6bd-17326a086788","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.472655Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:43404f86c4efe7a9f3b4545d21ea618a53fce7d6c6a5317c485d8d41ac8919c5","observation_id":"e16a79df-3a9e-4966-b1f7-0501435841e5","resolution":{"observed_at":"2026-08-06T20:09:13.594508Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.477322Z","title":"Hoffman, David Budden, Will Dabney, Dan Horgan, Dhruva Tb, Alistair Muldal, Nicolas Heess, and Timothy Lillicrap","venue":null,"work_id":"abcd01fd-91f1-4743-99e4-067cbe83cfdf","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.614027Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:2cc0cbdfd91e6a4d21f5160f786eda384b3925456a5d8317fde9cf13482f4339","observation_id":"2c94b283-49b8-4bb6-908f-fa894c4d63c0","resolution":{"observed_at":"2026-08-06T20:09:20.565400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00186-021-00746-w","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:03:45.533247Z","title":"Minimizing spectral risk measures applied to Markov decision processes","venue":"Mathematical Methods of Operations Research","work_id":"5b156368-88ab-443a-b2b8-8b9ae78743aa","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.731072Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:056ffbde45d8a14c98587c53320b81390332e0af110191d42efe932ddedf07a0","observation_id":"e3ec32b7-685b-410a-ba77-ed2b5b53250a","resolution":{"observed_at":"2026-08-06T20:09:10.457411Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00186-011-0367-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:03:45.533247Z","title":"Markov Decision Processes with Average-Value-at-Risk criteria","venue":"Mathematical Methods of Operations Research","work_id":"9e5a5890-bb5d-40e0-b021-dd51d7d253f9","year":2011},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.882570Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:f4a8dcc54c7d0db4c74c91ec76985db1f79fd8ba655effd0cc17c69e069191c4","observation_id":"d8549def-12b3-4bb3-8c0a-434b396d7cae","resolution":{"observed_at":"2026-08-06T20:09:10.126479Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2013.0601","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:13.229697Z","title":"More Risk-Sensitive Markov Decision Processes","venue":null,"work_id":"a44c084b-3fb0-40dd-8469-755a70da1e5d","year":2014},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:01.977237Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:d97c7e230f1b31d4340cc922e4381337f70869bccaa64b986e5c54639cf269bb","observation_id":"a5043075-a4d4-4af5-9951-42440171f472","resolution":{"observed_at":"2026-08-06T20:09:13.319843Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.315469Z","title":"Bellemare, Will Dabney, and R \\'e mi Munos","venue":null,"work_id":"213fcbb5-e825-479d-9a9b-bc9b20ef3df9","year":2017},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.093022Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:95bff460383d0964164f12cd02fcc20b0aaf9da2fc44ad9d866eb0a0d70d66c6","observation_id":"11d0c8aa-8e73-41e2-8ba8-8f0c9a30fd9a","resolution":{"observed_at":"2026-08-06T20:09:20.407563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:02.177952Z","title":"Bellemare, Will Dabney, and Mark Rowland","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.177952Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:7c67c517586dd5d8e91dab686a9bb24e6e728a24e584038266bad0735e94db8d","observation_id":"95b15776-8282-46da-aebe-959c05c6cc67","resolution":{"observed_at":"2026-08-06T20:09:02.177952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.10376","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:12.912407Z","title":"Ziebart, and Marcello Restelli","venue":null,"work_id":"81b35591-e62d-4c8d-961c-2e1d50cb2892","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.319842Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:cd4f77374dbd4d39c2e1450d762e1a88e032bd424f4c6ba09185746f9877f819","observation_id":"4cc39029-f341-4571-a305-74d6bc06725e","resolution":{"observed_at":"2026-08-06T20:09:13.000302Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:20.128588Z","title":"JAX : Composable transformations of Python + NumPy programs, 2018","venue":null,"work_id":"8e2309b8-39fa-48b6-9ddf-b2aca4317de8","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.432682Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:0930f73e8f08b4115cfb34282239847438d7dd1493cab756d8e80512f2b309be","observation_id":"a682904f-ff2a-4185-b67c-be850ef8606c","resolution":{"observed_at":"2026-08-06T20:09:20.191891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2013.65798","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:12.595940Z","title":"Stochastic optimal control with dynamic, time-consistent risk constraints","venue":null,"work_id":"86349031-966d-45c8-9152-d2ad99fce7db","year":2013},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.560824Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:306d278855f16c6cf1c7565f2c8f117b492004f9fa743054619c183380761ddd","observation_id":"eff56d07-4d40-4dd6-8669-2ee6b540eff4","resolution":{"observed_at":"2026-08-06T20:09:12.723585Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.966164Z","title":"Risk- Sensitive and Robust Decision-Making : A CVaR Optimization Approach","venue":null,"work_id":"3aa27466-8dab-4799-b0f9-6eab20e3fa80","year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.683924Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:2a219e344c37535419b759a6e7568db1b6abd976da5eb305fdb5c68624ebd60c","observation_id":"06b74b07-ca31-4c9a-9ef3-150118f5cd76","resolution":{"observed_at":"2026-08-06T20:09:20.028618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.835854Z","title":"Risk- Constrained Reinforcement Learning with Percentile Risk Criteria","venue":null,"work_id":"1a6d7ae3-9805-4ed6-b216-45af488228cc","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.823461Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:ee546112ffeae3215c6890729b311cfa3229fafd44e4379a6ccfe6c456e82e07","observation_id":"66647590-cea9-47e0-b73f-441c2ffc856c","resolution":{"observed_at":"2026-08-06T20:09:19.895986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:02.930157Z","title":"Reinforcement learning with dynamic convex risk measures","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:02.930157Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:35ccb4df230edf0b334ad14033518d1746b4f1ed2b2b49c90cb2e511c615437e","observation_id":"2dbbcb24-cbc6-4052-962b-124805143fee","resolution":{"observed_at":"2026-08-06T20:09:02.930157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.698610Z","title":"Implicit Quantile Networks for Distributional Reinforcement Learning","venue":null,"work_id":"1028257b-6ad6-4c4a-bfa4-41a5269e0fc5","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.075941Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:d913ff42f73cc0a1b3212c96bf21855aa11b79635cf9cf0cec66e410a66690c9","observation_id":"f0d4630e-f1df-4103-928c-1698dae99d38","resolution":{"observed_at":"2026-08-06T20:09:19.766023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:03.263587Z","title":"Distributional Reinforcement Learning With Quantile Regression","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.263587Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:2895b2a563b4090ad0217366d4804eda52e8e591fd3f3429e5f01cb3537f067b","observation_id":"4c4d812c-2be4-4cb1-914c-c7f7486ced76","resolution":{"observed_at":"2026-08-06T20:09:03.263587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2006.37752","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:12.200927Z","title":"Clinical data based optimal STI strategies for HIV : A reinforcement learning approach","venue":null,"work_id":"d7a4be42-680c-4171-ac45-5343d2d42462","year":2006},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.407058Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:f20e3ed6579f671887de0b832780c27db9460dd76bc43fc6f3531ee14c6e5676","observation_id":"d3b18462-f364-4668-b48c-54c630043f1d","resolution":{"observed_at":"2026-08-06T20:09:12.348618Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.591113Z","title":"D4RL : Datasets for Deep Data-Driven Reinforcement Learning , 2021","venue":null,"work_id":"14771004-52d7-4b03-acfe-25259e088cfe","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.540504Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:62efc589883a5ac5def960a0e82f9445c5c2ba8d7703c31028bedab5af3a4164","observation_id":"f318aac4-4250-4d1c-ab86-fc6724e616f0","resolution":{"observed_at":"2026-08-06T20:09:19.653166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.450669Z","title":"A Minimalist Approach to Offline Reinforcement Learning","venue":null,"work_id":"67099c8c-2569-45f5-8c31-20c4edcdde03","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.718762Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:3aef39f5fef724d5149a5c8870ff42c837e36f3f5c5c8566d8f3d4928f18f8fb","observation_id":"b074b5e5-4fc5-4b3d-be5e-3fc1e8740605","resolution":{"observed_at":"2026-08-06T20:09:19.511250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.305149Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","venue":null,"work_id":"ea2fa113-7348-43f5-818c-cbc520ec531f","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:03.855924Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:1975be72dab92fbca739b3d0260453cc3c9254dbe60f1e15ec6d4bea3e2ad1e4","observation_id":"67d9525d-59fa-4196-94f1-8a2d12febab0","resolution":{"observed_at":"2026-08-06T20:09:19.361603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:19.101814Z","title":"Off- Policy Deep Reinforcement Learning without Exploration","venue":null,"work_id":"ce99d6c1-60bb-4dd4-a164-c098ef304c64","year":2019},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.086235Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:4672c24ecc2d2d68d327fdbdd977b8b1ac91ee6af594aec76fcf9dc800a97c8f","observation_id":"628e5ce1-a411-4814-a049-f01fa970edbf","resolution":{"observed_at":"2026-08-06T20:09:19.219022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.909593Z","title":"Klein, William Dabney, and Jonathan P","venue":null,"work_id":"393d8581-e3c4-4fbf-a914-380e340ad8d0","year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.319782Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:45d8c5c8a5a5ab66b4222b6479637b4b9309d3a8eb26a0bd362379593ae06483","observation_id":"755f5532-968d-4271-9d68-5e4309cc0476","resolution":{"observed_at":"2026-08-06T20:09:19.016606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.676969Z","title":"Efficient Risk-Averse Reinforcement Learning","venue":null,"work_id":"ebbdc3db-8da5-48dc-bc9c-941b8f55f326","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.475325Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:04235d39cbe90687f92fff5b3626259e491f9e5dff261b7035c1e0a0694a1b9e","observation_id":"38c7fddf-fc6f-4957-bd34-7568f01b7fc4","resolution":{"observed_at":"2026-08-06T20:09:18.790336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.476149Z","title":"Soft Actor-Critic : Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":null,"work_id":"d67a9ce4-2e22-4ffa-a37a-71eec67c1666","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.621013Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:c129ad5ed9525ca1f90849879264c08cb7862b4a8cf49fb457f48d8e41a73d3e","observation_id":"11fd4a65-f29a-486f-a461-75690ac637dc","resolution":{"observed_at":"2026-08-06T20:09:18.566734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.372261Z","title":"Double Q-learning","venue":null,"work_id":"8f7925e9-7cbb-4c20-a711-09873561e7f0","year":2010},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.756123Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:9930b33cb014e461e68ca4e08b9d51899a85f4f915d951fa92eb2a24dd8b72ce","observation_id":"bfe34753-ee71-4ce3-bba5-3d3acae318f0","resolution":{"observed_at":"2026-08-06T20:09:18.375462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.332295Z","title":"On a relationship between distorted and spectral risk measures","venue":null,"work_id":"2fa6fe80-c914-40f1-8335-cae89dfa86ca","year":2006},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:04.878707Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:41dbe5584ca1429f013269cf375aa894edaa73d88be360336081472c5176cf77","observation_id":"c3b6e7d6-5116-4c3f-a30c-7808a9fe745e","resolution":{"observed_at":"2026-08-06T20:09:18.367029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:18.110745Z","title":null,"venue":null,"work_id":"3ef853bf-dcda-42c9-80a2-295f7f358931","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.050796Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:65ed4a4b0b163541de5e3f855d82601e67a29b79c5c11a0bcc3fc78cace47867","observation_id":"47bd0b89-4219-4fc7-a950-2f93ca6d08f1","resolution":{"observed_at":"2026-08-06T20:09:18.235835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:05.113204Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.113204Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:a2929ab2ee3c8111f0564e7851e47dd0bf5aec9309b5fc163ff61fd400690689","observation_id":"e55e4fc8-e5b2-475e-bc04-d29c4e29121e","resolution":{"observed_at":"2026-08-06T20:09:05.113204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.902713Z","title":"Approximately Optimal Approximate Reinforcement Learning","venue":null,"work_id":"5acf7239-b005-4c76-92aa-cff403540cbf","year":2002},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.222826Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:2fbf8a686a9e89c4f148be448d49a6ffb4ef1fe940583c4210184ec99baaf55a","observation_id":"2b9ce50d-c8ec-4978-b790-d3188f79e63e","resolution":{"observed_at":"2026-08-06T20:09:17.999079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.676842Z","title":"A Natural Policy Gradient","venue":null,"work_id":"7aaeb809-df6c-425b-9604-40f748100b25","year":2001},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.343379Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:dbcdc30e33e3179f8733fe29a062487dc74404e3a91ea4acd829d19c5a841086","observation_id":"666ea40f-6b55-43d1-b4d0-c91e0abb7959","resolution":{"observed_at":"2026-08-06T20:09:17.805535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:05.467312Z","title":"Being Optimistic to Be Conservative : Quickly Learning a CVaR Policy","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.467312Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:c7bee70d84b634be469a107bce231008b9197b2395c004db02b044f25bb176c1","observation_id":"8420dfe2-352f-483d-aa5f-fb3b53d5ed68","resolution":{"observed_at":"2026-08-06T20:09:05.467312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.519660Z","title":"Spectral- Risk Safe Reinforcement Learning with Convergence Guarantees","venue":null,"work_id":"7835b445-629b-42f9-bb49-b7d263220e60","year":2024},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.567256Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:c2801121ec9680421b724f36eaf6a992d11e13e35a0f101734a19899d3e97117","observation_id":"1fbb0463-481e-47c3-ad87-cfb5e2a29a67","resolution":{"observed_at":"2026-08-06T20:09:17.593249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.340903Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","venue":null,"work_id":"a1ff07c1-389f-488f-b5b9-9ad4347f204e","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.707458Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:df7e07df9d660d21cffbb5a5d6482a978d0e9859fd70c31b680887c599eb28c6","observation_id":"af0e3352-b28e-4541-a2af-f2e1c6c8d27b","resolution":{"observed_at":"2026-08-06T20:09:17.406774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.182805Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","venue":null,"work_id":"f7b401e5-b04c-49e4-a66a-46358d0fd820","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.831653Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:da89da9a970f3d46b8733c8f46decde6ea88c017fb6a598edd5a2478ba7f602e","observation_id":"df73e2a6-93fd-4b06-a25d-689241a433e5","resolution":{"observed_at":"2026-08-06T20:09:17.266832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:17.012668Z","title":"Offline Reinforcement Learning : Tutorial , Review , and Perspectives on Open Problems , 2020","venue":null,"work_id":"1808ee5c-fb8a-4d07-b7c9-d2b863975854","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:05.928906Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:23d9ee1734ba9158c401609e350c812abdc7f71f71fa7d8dd1030b22c740fa40","observation_id":"dfdb5793-2f79-4f88-8a23-fb97153644ce","resolution":{"observed_at":"2026-08-06T20:09:17.115164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.818871Z","title":"Distributional Reinforcement Learning for Risk-Sensitive Policies","venue":null,"work_id":"9f642272-011b-4631-b881-3feea5e0a0e8","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.039648Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:8e6a203c7673520818668d78b6002a4ee829b3e3cc6151c0a43535d249f37099","observation_id":"5b8132a9-4a92-4a6d-8562-5d75b52cc8c9","resolution":{"observed_at":"2026-08-06T20:09:16.888918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.626846Z","title":"DSAC : Distributional Soft Actor Critic for Risk-Sensitive Reinforcement Learning , 2020","venue":null,"work_id":"0d5259e6-57cf-4fda-ada2-6a58f6ac08fa","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.208255Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:95735838b0f7c3a543e1a81526b7c320825a3eb07c9fceb1396dfb4b8e535e14","observation_id":"6e58cb62-bddb-460b-a196-10d16ce67132","resolution":{"observed_at":"2026-08-06T20:09:16.706738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.530793Z","title":"Conservative Offline Distributional Reinforcement Learning","venue":null,"work_id":"04343ad9-762f-49a5-9136-9680a66829f2","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.307890Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:d6f0d2b040abb0e4099ed273df7eabfc5cb027cc2873cea4f5e3a4bd5838117a","observation_id":"12309041-de66-4a08-a9c3-56567b2f6854","resolution":{"observed_at":"2026-08-06T20:09:16.559075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.309498Z","title":"On the Global Convergence Rates of Softmax Policy Gradient Methods","venue":null,"work_id":"41d88092-7133-4889-90fe-c1f6e694ba62","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.444387Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:7a437896dee3f23142ae1f49865ccb8f6dece0fb838dcf7ffc1eafd89b692a0b","observation_id":"e2c2af76-719e-418e-9004-bf869e60037f","resolution":{"observed_at":"2026-08-06T20:09:16.431390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:06.548162Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.548162Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:ddd986ba52db9e5d76887b195cdaa31557d6c290969ad5d4ff729430d95df9d2","observation_id":"f8cd50fd-868c-45bb-9c70-f97198bb71b4","resolution":{"observed_at":"2026-08-06T20:09:06.548162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:16.116073Z","title":"Beyond CVaR : Leveraging Static Spectral Risk Measures for Enhanced Decision-Making in Distributional Reinforcement Learning","venue":null,"work_id":"b1c6621c-5833-4099-9afe-133e59867524","year":2025},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.621353Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:82a05bde38eeaad5b15e082d31c05728d878830d73e942afaa98808d59f22c15","observation_id":"82e90c22-a28a-411b-9793-d579fc8a3d17","resolution":{"observed_at":"2026-08-06T20:09:16.226896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.898822Z","title":"Nonparametric return distribution approximation for reinforcement learning","venue":null,"work_id":"a2406298-c815-48ea-86b8-b3450b022957","year":2010},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.739855Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:228afadc5d8041415c211c78f8c73fbe34b78c521b1dc39ef323f132b573142a","observation_id":"e13a8b29-bd97-4f3a-8d67-b989c55a6775","resolution":{"observed_at":"2026-08-06T20:09:16.004464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.616003Z","title":"AWAC : Accelerating Online Reinforcement Learning with Offline Datasets , 2021","venue":null,"work_id":"43a01226-5034-40c9-95f2-9e40a328a377","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:06.875633Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:5c9af52739ce5b6f047f90c6febf229addeef7eb8267c0f250fbf713c1239ae1","observation_id":"ebf41783-9baf-4f9e-b7ab-c841a2cbe4cb","resolution":{"observed_at":"2026-08-06T20:09:15.777513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.11357","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:11.899256Z","title":"An intelligent financial portfolio trading strategy using deep Q-learning","venue":null,"work_id":"69ec7aba-4295-42fa-a002-96267739916f","year":2020},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.010839Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:c82ef11e495ba937b4b2ace56ce21d014826937167a42f1e54c83bd38ce96f82","observation_id":"45f624a7-f1b1-4bd8-95a9-daf925ae741f","resolution":{"observed_at":"2026-08-06T20:09:12.014681Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.eswa.2018.02.032","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Pendharkar and Patrick Cusatis","venue":"Expert Systems with Applications","work_id":"6fb0f60a-ef7a-4247-bd05-e4b50a0edf4b","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.102726Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:9d72556294a50066050c222abbc19e0e5e2aa553355eb337dc749532e5c3e89b","observation_id":"ad62c8db-799a-4ed8-abaa-8f7a2d0b7a3a","resolution":{"observed_at":"2026-08-06T20:09:09.853490Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.332436Z","title":"Advantage- Weighted Regression : Simple and Scalable Off-Policy Reinforcement Learning , 2019","venue":null,"work_id":"aed2ff34-7f76-47e4-bd78-cf3c73c61efa","year":2019},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.157603Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:470cafdd6b961c9acf8f46491704c4d44d3b0ed57d5e9a1f9c93830aba291d17","observation_id":"c2c396cc-98a1-4615-8478-863477a0475a","resolution":{"observed_at":"2026-08-06T20:09:15.459637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.0747","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:11.519180Z","title":"Pflug and Alois Pichler","venue":null,"work_id":"f19398b2-479e-4fc7-b954-846c041fcb92","year":2016},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.221355Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:b80c1f62fa3d8be2260e64ddcf5dbbcb3a54bb618ce0882cddf3eefe7dd58270","observation_id":"f9e397af-2269-43dc-8b8e-f40d17050400","resolution":{"observed_at":"2026-08-06T20:09:11.663550Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:07.334040Z","title":"Premiums and reserves, adjusted by distortions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.334040Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:da90d71d1f960d53dfe9a97380910927051121cc212b33ee97e0856dcb337672","observation_id":"058d69ea-34d7-412d-9d0c-83a9d3e37ce8","resolution":{"observed_at":"2026-08-06T20:09:07.334040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.182915Z","title":"Optimizing Return Distributions with Distributional Dynamic Programming , 2025","venue":null,"work_id":"a676d329-e2c6-405b-a896-465e9d66e47d","year":2025},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.439899Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:cf1da87a86acac9564598cbbc2db6ad619d4949beb694f183e088821b21fb2f6","observation_id":"3f7f53aa-6cd6-4966-9a89-6e583c8bc049","resolution":{"observed_at":"2026-08-06T20:09:15.269547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:07.541870Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.541870Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:11197a03d1b3f12678cfc3eed33cdb433193f3b25cea0f625b88f6b01f6a5935","observation_id":"bbd05617-b64d-4890-a3bc-f1c9d3462292","resolution":{"observed_at":"2026-08-06T20:09:07.541870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:15.003615Z","title":"One Risk to Rule Them All : A Risk-Sensitive Perspective on Model-Based Offline Reinforcement Learning","venue":null,"work_id":"30471319-74df-4c51-8266-6282a0e24047","year":2023},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.620283Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:076e7457aa1b45b6543acb5597ac04ffff7de75a927b87fa09ca97f529de528b","observation_id":"1f1442fb-baf4-4661-a3dc-ee71377204e0","resolution":{"observed_at":"2026-08-06T20:09:15.078965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.848946Z","title":"Trust Region Policy Optimization","venue":null,"work_id":"8b906811-c6cc-478b-99a6-62a1b0993d5d","year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.698024Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:7ab44257fda990260da7aa47eef02990e7ba07e32fac45f18645451c95f93c67","observation_id":"c6a59a7f-5799-4cf5-9e62-5e91edb7cf2a","resolution":{"observed_at":"2026-08-06T20:09:14.950080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.670536Z","title":"Ruszczy \\'n ski","venue":null,"work_id":"94fb9698-e85c-4962-aa22-9752b22c43d8","year":2014},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.775821Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:9945525c88b711ba0762139d298dfa8fb20c04bfe27990138b25141ec84103ab","observation_id":"84ad0e20-4878-4bfa-93c8-92aa4f31b27d","resolution":{"observed_at":"2026-08-06T20:09:14.744203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.527547Z","title":"Deterministic Policy Gradient Algorithms","venue":null,"work_id":"815d16c8-6026-4253-987a-29fba5447f11","year":2014},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.904865Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:26cf7fda6734cb5e97df89bcdce828a3b4f579c8014f3aef351be2162dcda823","observation_id":"5fbafa98-15d1-4798-8bda-d13f2527dc89","resolution":{"observed_at":"2026-08-06T20:09:14.593706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.389809Z","title":"Sutton and Andrew G","venue":null,"work_id":"58f82030-f4a1-4069-92ef-003ff038b047","year":2018},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:07.948153Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:eebeee614117bb493c0f7520fcff20d5971d0088e0a529f7cad895cd93f1291a","observation_id":"3a26e391-bf0e-4aad-899a-2df5b30612ee","resolution":{"observed_at":"2026-08-06T20:09:14.465030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.190552Z","title":"Policy Gradient Methods for Reinforcement Learning with Function Approximation","venue":null,"work_id":"ff6f64a8-c8a4-46d9-bd4f-bd74bf1bae15","year":1999},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.013284Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:493725244a1bdeb82ceca7f9674ee48a80811f5080bee0a5a8b0ac65a97c97b6","observation_id":"f0560e98-05c7-436c-b7af-c5716d45e054","resolution":{"observed_at":"2026-08-06T20:09:14.285068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:14.016961Z","title":"Policy gradients with variance related risk criteria","venue":null,"work_id":"46787c6d-11a1-4c76-9a87-5191f96eed19","year":2012},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.105147Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:15bd41a72d05162aa6b9401404140106177152b7c33f35173537388724b59d1f","observation_id":"869fb5a0-7ee4-4bdb-b35e-8aeae9ad8065","resolution":{"observed_at":"2026-08-06T20:09:14.082329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v29i1.9561","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Optimizing the CVaR via Sampling","venue":null,"work_id":"3e7abdd6-ea78-4735-9dcf-38b3d0fe26fd","year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.195484Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:e51e8c250be453e040ac879973230494262f317f57bb2b4bcb4cfba948757a9e","observation_id":"409acc79-75b6-4116-821e-614534134b9c","resolution":{"observed_at":"2026-08-06T20:09:09.605858Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.260691Z","title":"Sequential Decision Making With Coherent Risk","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.260691Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:a6adf782970882b653d21e2bcef2ab54a3b579ac181d8d4c1e29a65c9606658e","observation_id":"9262ecb2-9e1a-46db-8f5a-d5d29b34a444","resolution":{"observed_at":"2026-08-06T20:09:08.260691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.361397Z","title":"MuJoCo : A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.361397Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:21cc2f86f0e6cf8a5adcf25d2d0d1b00e96d2ab921dc37c603dab6b4d31670b4","observation_id":"2196e995-8326-4bc4-aa9b-bf9056b694c9","resolution":{"observed_at":"2026-08-06T20:09:08.361397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.452063Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.452063Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:48aee85836cd7d0ac58497712640f3836b2cfb0a6b0a7d3a5967b7deef5b246f","observation_id":"1ae47d57-2f70-4a4a-a488-11ecffc0c1e9","resolution":{"observed_at":"2026-08-06T20:09:08.452063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:13.742046Z","title":"Risk- Averse Offline Reinforcement Learning","venue":null,"work_id":"70c48b0e-fee0-4226-8733-ca2bdc7b0210","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.536696Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:7dafcc8571cf0a0b585f8afc7e48e6a450d0f9f4295e30b478720ff9b96e935c","observation_id":"fcd58df1-a2eb-4870-82d2-7083fc360ccd","resolution":{"observed_at":"2026-08-06T20:09:13.889984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.11680","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:10.885818Z","title":"Risk-sensitive policies for portfolio management","venue":null,"work_id":"babdc357-8c54-4cae-8e11-7037e531f631","year":2022},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.625089Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:57dc93b12be17de8234d263ea940252cec14316e31aae5347deb8637cf51878b","observation_id":"bb26b307-7329-4857-adaa-188115dff86b","resolution":{"observed_at":"2026-08-06T20:09:11.045884Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.722702Z","title":"Insurance pricing and increased limits ratemaking by proportional hazards transforms","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.722702Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:ea6e56ee00b060d5d3881ac40b24b337cc49fe0a162a8c2a05153037216e14ab","observation_id":"f101390c-fa33-406e-be30-25a145180aa3","resolution":{"observed_at":"2026-08-06T20:09:08.722702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/253675","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Journal of Risk & Insurance","work_id":"ec038b4b-b6a6-4146-b00c-7fd77ef3349a","year":2000},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.807810Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:7f840246622c25ab4be6560cec1447a6e390019df6107243ec8b768a8f5c0dd6","observation_id":"73482005-bdb5-48b3-bc3e-a7c67ed59d91","resolution":{"observed_at":"2026-08-06T20:09:09.347148Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:09:08.878012Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.878012Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:fec998d9b1435f3f25c6c86c8994d39104a9c999c5ad01a2247760170fd45bcf","observation_id":"be656925-48e4-4fe1-af11-e43f396d85fb","resolution":{"observed_at":"2026-08-06T20:09:08.878012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i12.17302","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Mean- Variance Policy Iteration for Risk-Averse Reinforcement Learning","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"320ce899-4b13-4b58-97c1-486a58a69319","year":2021},"citing_paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T20:09:08.965688Z"},"links":{"citing_paper":"/paper/2507.03900"},"observation_digest":"sha256:9c27ff68e1302bc72be3e9c7333c0db108431a599acb219182dfd751e11b84f2","observation_id":"5d659ce4-0d20-4870-997c-75df4fbdbe73","resolution":{"observed_at":"2026-08-06T20:09:09.121529Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.03900","last_updated":"2025-07-05T04:41:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T08:18:36.337574Z","submitted_at":"2025-07-05T04:41:54Z","title":"Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":15,"verified_exact":9,"verified_fuzzy":40},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2507.03900."}