{"as_of":"2026-08-08T05:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1d37b9fcf8a8bc6ad74237d2ed47e0367c282a9e46fd5a2f95fa9b570e52142","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:26:53.058645Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T09:56:20.351339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T09:57:00.793817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"cited_work":{"arxiv_id":"2505.19058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19058","snapshot_observed_at":"2026-07-10T09:57:00.793817Z","title":"Distributionally Robust Deep Q-Learning","venue":"cs.LG","work_id":"3f0ced19-0fb2-44de-8b8e-711cd16301a1","year":2025},"citing_paper":{"arxiv_id":"2606.20356","last_updated":"2026-06-18T15:20:00Z","snapshot_observed_at":"2026-07-06T23:55:29.991442Z","submitted_at":"2026-06-18T15:20:00Z","title":"Robust $Q$-learning for mean-field control under Wasserstein uncertainty in common noise","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T15:59:25.061726Z"},"links":{"cited_paper":"/paper/2505.19058","citing_paper":"/paper/2606.20356"},"observation_digest":"sha256:4779324c340627f8cae66d109aa2a58a9a2ba0dadb6d8c6daaee0118260a8a50","observation_id":"1aaa4507-cffe-4cfc-8c0a-8764e250a890","resolution":{"observed_at":"2026-07-04T05:29:35.432393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"cited_work":{"arxiv_id":"2505.19058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19058","snapshot_observed_at":"2026-07-10T09:57:00.793817Z","title":"Distributionally Robust Deep Q-Learning","venue":"cs.LG","work_id":"3f0ced19-0fb2-44de-8b8e-711cd16301a1","year":2025},"citing_paper":{"arxiv_id":"2607.08291","last_updated":"2026-07-09T09:34:50Z","snapshot_observed_at":"2026-08-05T06:22:37.565887Z","submitted_at":"2026-07-09T09:34:50Z","title":"Robustness in Sequential Decision Making under Evolving Uncertainty: Evidence from High-Frequency Market Making","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-07-10T09:56:20.351339Z"},"links":{"cited_paper":"/paper/2505.19058","citing_paper":"/paper/2607.08291"},"observation_digest":"sha256:01959317135489de048c8049d2f8b7e7b6f0bbe7f0eccdad1931ceb9b7c2d849","observation_id":"8e06f30b-2c3b-48d9-8ffd-d411166a95ae","resolution":{"observed_at":"2026-07-10T09:57:00.795026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19058/citation-record","integrity":"/paper/2505.19058/integrity","json":"/paper/2505.19058/citation-record.json","paper":"/paper/2505.19058"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.819502Z","title":"Investigating the parameters of the beta distribution","venue":null,"work_id":"67b73a70-ceef-4434-8692-73bf20c22fe1","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.148084Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:a9272f3aaf6ff23a1b9be14d63f9149225f30d4cb2e501dbd8b19d198ba1197b","observation_id":"d56f98fb-9fae-4388-a4fb-338b43c8f91d","resolution":{"observed_at":"2026-08-07T14:26:59.823780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.805583Z","title":"Infinite dimensional analysis: a hitchhiker’s guide","venue":null,"work_id":"41adbbb3-7bf1-4082-ad1f-2e5a045010b9","year":2006},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.212428Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:f06edf3fd8715fa52942118142512bfc1f9ce05ef46d88f2966cf966a21b54d9","observation_id":"9ac03d49-301b-462e-aa0e-f29bd48cd45e","resolution":{"observed_at":"2026-08-07T14:26:59.810211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.792132Z","title":"Computational aspects of robust optimized certainty equiv- alents and option pricing","venue":null,"work_id":"b0637214-0dc8-4247-a9b5-e2a634cf8c9a","year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.343157Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:edc017a50656f15ca1dff0ae499a5ad0a706ea2d049edc1051381801955fcb73","observation_id":"b7f522da-e813-468e-a6b7-fbdbc4005c9e","resolution":{"observed_at":"2026-08-07T14:26:59.797222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.777832Z","title":"On the theory of dynamic programming","venue":null,"work_id":"459952a0-5948-4372-9e20-d4910a889bd4","year":1952},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.437965Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:1cc0ba59e49527c48339a97946d1791acd6a246823a5b02f7168807bc32a0f0f","observation_id":"c17de44c-bf89-4428-b2f5-f41e89f22035","resolution":{"observed_at":"2026-08-07T14:26:59.783436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-07T14:26:47.529254Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.529254Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:ca7a99328e0df02681e17550e1bab4e84f53baf508bf61ccc9947d1f5505ecb3","observation_id":"ae0c3ccc-57a8-4ac0-b321-2fa2e0c1c04d","resolution":{"observed_at":"2026-08-07T14:26:47.529254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.764585Z","title":"Convex optimization","venue":null,"work_id":"52cda15c-9e81-4614-896c-6efb46cf2896","year":2004},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.603514Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:51fa5c2de371810d42f7682dcb1cf1eda660f2e34cd3dd7aa4b05ee639937e2a","observation_id":"fc8655b3-0994-46f6-b078-75faa5cf58a5","resolution":{"observed_at":"2026-08-07T14:26:59.768872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.753078Z","title":"Distributionally robust Markov decision processes and their connection to risk measures","venue":null,"work_id":"5d1af4c9-8ed7-46c3-a751-de6b7a7ca50c","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.723448Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:a41b04e9eb31cbe89f5262c529fbff92c09b3fafe8676fd6e304516038ab8b11","observation_id":"335e8b6a-d2cc-430c-a794-e6c70c8e712c","resolution":{"observed_at":"2026-08-07T14:26:59.756832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.741010Z","title":null,"venue":null,"work_id":"a0656a4a-d9fe-4b9b-bb3a-451bb077fdf8","year":2001},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.813404Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:048a69133cda8ef5bfe1b92a902a09992cb3de584f936646f8dbab36b3d7a1fc","observation_id":"1461b9f8-e872-4b1c-8a58-f98767d84ecf","resolution":{"observed_at":"2026-08-07T14:26:59.745726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.725951Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport, 2013","venue":null,"work_id":"f4873aa6-e407-4ebe-805a-2057cef850a6","year":2013},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.913194Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:6e5471774759144b7bbf0b818d33f7f7668bd6bce54b07284933ad98ba841374","observation_id":"c8bb8b23-9445-48d0-bd0c-0f859f07c0a6","resolution":{"observed_at":"2026-08-07T14:26:59.730603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.04259","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.135866Z","title":"Robust Q-learning for finite ambiguity sets","venue":null,"work_id":"075d2374-7048-40d0-875b-e0823ea90990","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:47.992530Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:508622e8b9ccad6b4e095d5f9f6a1c0f91149a8fc7494f0e9efe6294194c1963","observation_id":"836e6293-d9a6-4848-a7b4-c4090a822da9","resolution":{"observed_at":"2026-08-07T14:26:54.193985Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06654","last_updated":"2023-03-12T13:03:28Z","snapshot_observed_at":"2026-07-06T15:02:04.131913Z","submitted_at":"2023-03-12T13:03:28Z","title":"Twice Regularized Markov Decision Processes: The Equivalence between Robustness and Regularization","version":1},"cited_work":{"arxiv_id":"2303.06654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.06654","snapshot_observed_at":"2026-08-07T14:26:53.861116Z","title":"Twice Regularized Markov Decision Processes: The Equivalence between Robustness and Regularization","venue":"cs.LG","work_id":"69282a33-3bd5-4b3e-a884-85b48cdaa065","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.113813Z"},"links":{"cited_paper":"/paper/2303.06654","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:9e202b48fd66f617cab121e7db93cb07b0da5590f06048993709644a2bb36037","observation_id":"757a9a1a-eb1b-4fc5-b04e-5637ca04f287","resolution":{"observed_at":"2026-08-07T14:26:53.921863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-07-06T10:48:42.637397Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-08-07T14:26:48.211513Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.211513Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:8644e0a542f3658094d0454285803373f434fcefdeda3801df2b0135035515df","observation_id":"016885b5-6336-4a61-83bc-6130eab112a1","resolution":{"observed_at":"2026-08-07T14:26:48.211513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.712731Z","title":"A theoretical analysis of deep Q-learning","venue":null,"work_id":"8e0d8c9f-789b-42b2-bc8c-ae00bc2f1c6d","year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.312156Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:49fc91d0a0e5b643ad72cb307283d60e5d3661f93b887477c38aad2f670a3961","observation_id":"6ebf42a6-9e34-4417-be0d-d482898157cd","resolution":{"observed_at":"2026-08-07T14:26:59.717657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.699000Z","title":"In- terpolating between optimal transport and mmd using Sinkhorn divergences","venue":null,"work_id":"743684e0-349e-40da-9b5d-00fd15926d76","year":2019},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.411547Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:be32deb96b43bf57e29bd9f35a0b5249ed03b08db67008db803b6527023fea50","observation_id":"383dc3d1-25d8-4bb0-b7dc-22b3084143b2","resolution":{"observed_at":"2026-08-07T14:26:59.703610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.684224Z","title":"Sample complexity of Sinkhorn divergences","venue":null,"work_id":"c0afae55-beec-44a8-af85-051762536f80","year":2019},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.498761Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:2eb617f4a461c316ecaba36e24d0097de62ffe82516498caf9cf935d75b7fc24","observation_id":"742e4c8e-f8e8-491c-8a58-6d57f19be4c7","resolution":{"observed_at":"2026-08-07T14:26:59.689706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.671451Z","title":"Stability of entropic optimal transport and Schr¨ odinger bridges","venue":null,"work_id":"b9cc3da4-6268-4acb-9eb8-d181bd9e7134","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.596240Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:52cd635b6ab5ce7c5e62588c42431c36ed107e746f2c2818cb502b6a940d1416","observation_id":"61f552e5-ee19-46ee-931f-1072e7e14675","resolution":{"observed_at":"2026-08-07T14:26:59.675743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.658847Z","title":"Robust Markov decision processes: Beyond rectangularity.Mathematics of Operations Research, 48(1):203–226, 2023","venue":null,"work_id":"ff55ac02-c7e1-49e2-8e5f-4303ae9c9fed","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.650603Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:9b8794bd5fea48d48d320bc528e63843672c516a30fb0c9882f13bf71873d3a8","observation_id":"80cc6a39-69e5-4015-b210-74594bae82a9","resolution":{"observed_at":"2026-08-07T14:26:59.663234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.645827Z","title":"Double Q-learning","venue":null,"work_id":"56965676-0e49-4435-8fa7-1cb0850b10ae","year":2010},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.760252Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:395a665abf2c832d658e024304f6a831eaffeb11267f712b6d70d2050bccee19","observation_id":"f6bfc4ed-785b-4e05-9a94-c43e1aedc790","resolution":{"observed_at":"2026-08-07T14:26:59.650585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:48.845231Z","title":"Universal approximation of an unknown mapping and its derivatives using multilayer feedforward networks","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.845231Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:a4a5754bec3d827a1deeebfd9efffd81cbd4db35b7fd334bcc266f5e03eadf6f","observation_id":"14cce011-4b45-4032-9112-e2dbd88ecc1b","resolution":{"observed_at":"2026-08-07T14:26:48.845231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:48.908999Z","title":"Learning to utilize shaping rewards: A new approach of reward shaping","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.908999Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:2a0fd8bceafb7b00fecd1ffd6fe5843ec316f37aecd5adf6e456f894efccaee8","observation_id":"b10a21ee-df77-4096-b7eb-947881c8ce83","resolution":{"observed_at":"2026-08-07T14:26:48.908999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.614965Z","title":"Robust dynamic programming","venue":null,"work_id":"43305a4e-c03b-46d4-a8cc-c44bfeb4b4d4","year":2005},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:48.942188Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:da22a131d4e0fc95a10857ee911f0055558ade18034d65305ae58c4b4fcb4c7d","observation_id":"c468e487-5adc-4025-a1aa-9d4ca6407773","resolution":{"observed_at":"2026-08-07T14:26:59.619185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:49.009637Z","title":"Probability essentials","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.009637Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:87435e085ca997c79d2de93eb87eb4f83955e4f772853f0c0083ea459c7a01e3","observation_id":"54768045-e007-48f4-b640-1e1cf17b974a","resolution":{"observed_at":"2026-08-07T14:26:49.009637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:49.077557Z","title":"Universal approximation with deep narrow networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.077557Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:677ab4785fba6b5e31c569f1a006a3ad6abaeaf026ecd30c36f78a2adfcc728d","observation_id":"44bda2c0-d2e0-465a-95df-957062227227","resolution":{"observed_at":"2026-08-07T14:26:49.077557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.579531Z","title":"Probability theory: a comprehensive course","venue":null,"work_id":"bd35ec3e-c5d2-4438-8a53-e109d03eb352","year":2013},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.194831Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:36955ed83d6c2489e56a8a9e93da9e82be9191b9e5d1f18c617a1d53dcca683a","observation_id":"5daadba4-6eb4-4020-a685-1df0d1095287","resolution":{"observed_at":"2026-08-07T14:26:59.586840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13642","last_updated":"2023-01-31T13:54:23Z","snapshot_observed_at":"2026-08-07T19:30:42.625842Z","submitted_at":"2023-01-31T13:54:23Z","title":"An Efficient Solution to s-Rectangular Robust Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"2301.13642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.13642","snapshot_observed_at":"2026-08-07T14:26:53.640499Z","title":"An Efficient Solution to s-Rectangular Robust Markov Decision Processes","venue":"cs.LG","work_id":"1b19003a-7340-4365-b59b-574931d347d9","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.284674Z"},"links":{"cited_paper":"/paper/2301.13642","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:ef84cd37dd0f3e3eccc985c39f5e7b20017d8f677c817f3730a1dc6bd904e35b","observation_id":"2196972d-d2b4-4108-97d5-1b9403556f1d","resolution":{"observed_at":"2026-08-07T14:26:53.737945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.564130Z","title":"Playing fps games with deep reinforcement learning","venue":null,"work_id":"53e68334-bcd1-4c4a-a832-3fb3b6655e72","year":2017},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.444931Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:849019925221695ba5167311a9c06a62259b01020a66a56aadf82880318d2c80","observation_id":"7514de8d-3eea-48f6-971f-ef12ca6fd1ec","resolution":{"observed_at":"2026-08-07T14:26:59.570408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:49.568230Z","title":"Policy gradient algorithms for robust MDPs with non-rectangular uncertainty sets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.568230Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:a80aac1cd4993f95683222c8b9053a75c5fa31fe42602218cda1c8dda39cf124","observation_id":"eb124f69-56be-46e8-bf84-c9cdfc65cddb","resolution":{"observed_at":"2026-08-07T14:26:49.568230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.439612Z","title":"On the efficiency of entropic regularized algorithms for optimal transport","venue":null,"work_id":"311121df-0f31-44b2-910c-7ad468c0263a","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.722090Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:0752f48f5e83207c5be6068175ba66ee6fec0cce240bdabea12906160259a30d","observation_id":"cc11521d-e1d2-4be7-b7f0-b84df17fb853","resolution":{"observed_at":"2026-08-07T14:26:59.547637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:59.144584Z","title":"Distri- butionally robust Q-learning","venue":null,"work_id":"ae965ef9-8ea4-4d7e-85a5-ee7315bf5a1d","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.840858Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:596244d3718e53dc0f9a9cf85854b0ee55de728ff9cc1acdd702ab16dc23e818","observation_id":"c7092ac4-6b7b-4725-93a5-afb950f7fa7c","resolution":{"observed_at":"2026-08-07T14:26:59.293038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:49.934758Z","title":"Generative model for financial time series trained with MMD using a signature kernel","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:49.934758Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:556199d5637a5a6903b92e11d04de77fa1fe26c0e420314793b65f5a991384f5","observation_id":"2e2e4b44-ad3f-4779-b02b-8752d1864697","resolution":{"observed_at":"2026-08-07T14:26:49.934758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:58.691567Z","title":"Robust MDPs with k-rectangular uncertainty.Mathematics of Operations Research, 41(4):1484–1509, 2016","venue":null,"work_id":"f1bf0b32-7a38-4232-8874-1e46d9154d8b","year":2016},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.014471Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:e4558c875abbef069b300c7781ecb0f7bfab27a0399c82e98918c7d64ef6aecf","observation_id":"e7ebd7b1-035f-4e75-9410-b57014f7b327","resolution":{"observed_at":"2026-08-07T14:26:58.911349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:58.410938Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"7a681dcb-f4d8-4dd0-bb14-2f81e51e98a4","year":2015},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.133260Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:fc870bce9066dd7d53f41551914ef3c71e7f9dc7b128dd6bcd51661006813f86","observation_id":"8e1c0b4b-89f1-4d19-ae29-31fa38fe1ceb","resolution":{"observed_at":"2026-08-07T14:26:58.541563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09532","last_updated":"2026-05-07T09:57:24Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T16:21:32Z","title":"Robust SGLD algorithm for solving non-convex distributionally robust optimisation problems","version":4},"cited_work":{"arxiv_id":"2403.09532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09532","snapshot_observed_at":"2026-08-07T14:26:53.377291Z","title":"Robust SGLD algorithm for solving non-convex distributionally robust optimisation problems","venue":"math.OC","work_id":"ecdced07-8c7c-4fdc-9e04-7775579b93e2","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.237029Z"},"links":{"cited_paper":"/paper/2403.09532","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:3102007ccc0c7a6443f7d66eb2732785a56f8f15b448988cd1d95035aa35f707","observation_id":"d33f3249-3bb9-4739-af78-1e972bea358f","resolution":{"observed_at":"2026-08-07T14:26:53.421784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14759","last_updated":"2025-07-07T05:23:41Z","snapshot_observed_at":"2026-08-06T08:19:36.276569Z","submitted_at":"2024-10-18T09:53:20Z","title":"Universal approximation results for neural networks with non-polynomial activation function over non-compact domains","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14759","snapshot_observed_at":"2026-08-07T14:26:50.329080Z","title":"Universal approximation results for neural networks with non-polynomial activation function over non-compact domains","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.329080Z"},"links":{"cited_paper":"/paper/2410.14759","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:9f65d60291eb31cccf0048dc4bb2922ebf605fc390c2a825ef01e472dc4a47ae","observation_id":"de0a5a18-4943-49b3-87de-d696a478000b","resolution":{"observed_at":"2026-08-07T14:26:50.329080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:58.195040Z","title":"Neural networks can detect model-free static arbitrage strategies","venue":null,"work_id":"f53e3ced-f8ba-450f-be0b-b99c3315a1c1","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.440013Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:53542f9f8a43c59b698789d4991bfd3c99f70d3621a79eacbf4ccd647ed89a2c","observation_id":"c1a5b965-ff5d-465a-bfc0-3bcb47d4fa5e","resolution":{"observed_at":"2026-08-07T14:26:58.294955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.924170Z","title":"Robust Q-learning algorithm for markov decision processes under Wasserstein uncertainty","venue":null,"work_id":"a032e3aa-44aa-4798-835f-c9e9a21c7785","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.518778Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:7817de6a6fdce06d1c81a29e062524b2535eced57792796313bd961e8872fddd","observation_id":"8042d1d6-830d-4a55-9209-fbb9db4e4e27","resolution":{"observed_at":"2026-08-07T14:26:58.082779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05230","last_updated":"2025-05-05T16:34:16Z","snapshot_observed_at":"2026-07-06T17:56:57.822421Z","submitted_at":"2024-04-08T06:53:05Z","title":"Non-concave stochastic optimal control in finite discrete time under model uncertainty","version":2},"cited_work":{"arxiv_id":"2404.05230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05230","snapshot_observed_at":"2026-08-07T14:26:53.197306Z","title":"Non-concave stochastic optimal control in finite discrete time under model uncertainty","venue":"math.OC","work_id":"680fdfd5-50ab-46ec-8e06-cd5b464e96c2","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.619941Z"},"links":{"cited_paper":"/paper/2404.05230","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:924fe252944f9947215737cede944bfbef95f85d8e19406f354e9ad87585ff40","observation_id":"a298fc5b-8367-49f9-a359-13bf6d74ecac","resolution":{"observed_at":"2026-08-07T14:26:53.268456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.522922Z","title":"Markov decision processes under model uncertainty.Mathematical Finance, 33(3):618–665, 2023","venue":null,"work_id":"c76dc8f2-8c52-45fa-addb-cdd2806c166d","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.701032Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:be1dca0e7ee7075bd9f6d28450129559dee4b224dcfcbc7432d9a3aef8dff125","observation_id":"d9cd9e9c-8e3a-42e0-a377-cd107430d60b","resolution":{"observed_at":"2026-08-07T14:26:57.698534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.404894Z","title":"Robust control of Markov decision processes with uncertain transition matrices","venue":null,"work_id":"8f03dbba-52ee-4306-9370-849d38abaab2","year":2005},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.787033Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:d04ec56b4ed59fb6245586b8ca15a8e3571dfea50c071caa17119adfbe8a861c","observation_id":"2afa2ddc-496e-4315-bb2f-1cf669188761","resolution":{"observed_at":"2026-08-07T14:26:57.465811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:50.872266Z","title":"Introduction to entropic optimal transport","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.872266Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:d8fec1acde558e17b58cdc5f3007a58eea5656645edd57ad6501fc1b2434a724","observation_id":"f2560ea4-7670-4b2b-a2bf-adbff400a0d5","resolution":{"observed_at":"2026-08-07T14:26:50.872266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.236549Z","title":"Robust reinforcement learning using offline data","venue":null,"work_id":"b918145b-2296-479b-a0a8-64313677bf35","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:50.954796Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:662218379434d732c62cf437acf4f4117c5eb33b38b67e89334bdc9d71e0dc21","observation_id":"b2049884-5728-4488-b3a3-ba753efab79c","resolution":{"observed_at":"2026-08-07T14:26:57.328939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:57.104924Z","title":"Approximation theory of the MLP model in neural networks","venue":null,"work_id":"7ba2235e-cf31-4baf-b381-ba159ee76166","year":1999},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.087991Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:e8e3c3f3516a1a486e87f0872ab28dcf9c9499c357217e94257354ce3b196ffd","observation_id":"eea69139-5433-4db7-a707-11bffd83a295","resolution":{"observed_at":"2026-08-07T14:26:57.165931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05659","last_updated":"2019-08-13T00:43:41Z","snapshot_observed_at":"2026-07-06T08:14:39.851659Z","submitted_at":"2019-08-13T00:43:41Z","title":"Distributionally Robust Optimization: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.05659","snapshot_observed_at":"2026-08-07T14:26:51.197695Z","title":"Distributionally robust optimization: A review","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.197695Z"},"links":{"cited_paper":"/paper/1908.05659","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:9a94553700ad0e21b77c74cd5b70496bbf177b62654fc29ea2810276a6abe0d9","observation_id":"ddba481d-1872-4c3d-8d0d-08a0d80b2ec0","resolution":{"observed_at":"2026-08-07T14:26:51.197695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.963459Z","title":"Distributionally robust model-based reinforcement learning with large state spaces","venue":null,"work_id":"79c2473e-ddf3-476a-93c7-1ae0279cd41c","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.293275Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:ff5597af038699d1cdda85fce17a0e001c38b85e3ef870ff9c40b18523468b8d","observation_id":"8cbb9b91-566c-43a2-b474-e6d9ec509828","resolution":{"observed_at":"2026-08-07T14:26:57.038771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.798469Z","title":"Principles of mathematical analysis , volume 3","venue":null,"work_id":"117bdd4f-be5a-451d-aca5-15e908475c74","year":1964},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.344975Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:15f905ae50901452de0e431a0accdf96cc87b41b59a77b7909677aa76b26c5e5","observation_id":"c1040ac8-a747-415d-883d-d2afbf624f0f","resolution":{"observed_at":"2026-08-07T14:26:56.883665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.718205Z","title":"Structural estimation of Markov decision processes","venue":null,"work_id":"48de1b3b-04f5-4633-915c-2aaf46da61ad","year":1994},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.495132Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:af0aaa45479786c08b050f65c474ae913cd375b7d016461f5029fb4f55bd548b","observation_id":"e4022c2a-03d7-4696-aefe-c7f312d7cf30","resolution":{"observed_at":"2026-08-07T14:26:56.753591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.568577Z","title":"Universal approximation using feedforward neural networks: A survey of some existing methods, and some new results","venue":null,"work_id":"7230e93e-39df-4606-9060-ead97bb201a5","year":1998},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.592726Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:1a5bc9e28c6ddce621506fa74e19085e710712a93d00750f786282381c184b33","observation_id":"de461997-29b7-4fbc-b4f7-2c936034e59a","resolution":{"observed_at":"2026-08-07T14:26:56.643022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.431524Z","title":"A relationship between arbitrary positive matrices and doubly stochastic matrices","venue":null,"work_id":"f16e7ba4-5669-467d-8a6a-089d421e3882","year":1964},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.691369Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:480b6fd4c24d8341e4fdb29b2cbc782df855cd49bda33c3134057263d1e6a5b0","observation_id":"e5d9e8fa-928a-4bf0-bce8-48391be90837","resolution":{"observed_at":"2026-08-07T14:26:56.488784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08708","last_updated":"2019-06-14T04:58:55Z","snapshot_observed_at":"2026-08-07T12:40:15.807786Z","submitted_at":"2019-02-23T00:13:42Z","title":"Distributionally Robust Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.08708","snapshot_observed_at":"2026-08-07T14:26:51.760331Z","title":"Distributionally robust reinforcement learning","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.760331Z"},"links":{"cited_paper":"/paper/1902.08708","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:82bd199c0a246bb9db973c6db2278973d2383409e0bb703a1e1627bba8a8459c","observation_id":"66540415-4f95-4bf3-ab46-6545ddfb849a","resolution":{"observed_at":"2026-08-07T14:26:51.760331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:51.830034Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.830034Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:7ad413dd60cb24892ff9b3246e524e7b05580d9544152131098b8d3988514eda","observation_id":"94800049-d17f-4781-8b6f-e4ea6e729172","resolution":{"observed_at":"2026-08-07T14:26:51.830034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12958","last_updated":"2023-01-16T16:36:08Z","snapshot_observed_at":"2026-07-06T08:32:54.818165Z","submitted_at":"2019-10-28T20:40:37Z","title":"Sinkhorn Divergences for Unbalanced Optimal Transport","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12958","snapshot_observed_at":"2026-08-07T14:26:51.926466Z","title":"Sinkhorn divergences for unbalanced optimal transport","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.926466Z"},"links":{"cited_paper":"/paper/1910.12958","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:b8d61926eb9d3c10b090a1c3b1953a0900f2472d8d21d3e28dedff67d0f301c7","observation_id":"daddacaa-5731-4c90-af39-38eaa04cb3cb","resolution":{"observed_at":"2026-08-07T14:26:51.926466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.224120Z","title":"Deep reinforcement learning: From Q-learning to deep Q-learning","venue":null,"work_id":"f12abdac-7c93-4863-9b73-7ac123e2de98","year":2017},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:51.997657Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:506c1f73f1cbc8cbc1af3049bdf9ede65f0d5ef860de20e3b24c1bf6d6134fd6","observation_id":"90a94789-bcdc-4323-8563-707e0907b41c","resolution":{"observed_at":"2026-08-07T14:26:56.330805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:56.060756Z","title":"Deep reinforcement learning with double Q-learning","venue":null,"work_id":"b4e1a803-3348-4b83-a587-b9765613cb69","year":2016},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.063423Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:90e136fc8a6ee17cd7877d57c4024783eb8f5f8ac8d709d30c829625db79ae79","observation_id":"9eb8acb0-7ace-4c7a-a575-38fa53266750","resolution":{"observed_at":"2026-08-07T14:26:56.157590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.863674Z","title":"Springer, 2009","venue":null,"work_id":"1be55456-3118-4143-9197-41cca9168067","year":2009},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.124396Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:76c6347e4ffdcd09e20288768927463b39d679859dd94cff52b54e9332cb30e0","observation_id":"c2722181-b1d1-4d24-a021-bab0144a683b","resolution":{"observed_at":"2026-08-07T14:26:55.978372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11926","last_updated":"2025-03-26T16:30:42Z","snapshot_observed_at":"2026-08-02T11:14:43.562416Z","submitted_at":"2021-09-24T12:40:48Z","title":"Sinkhorn Distributionally Robust Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11926","snapshot_observed_at":"2026-08-07T14:26:52.197351Z","title":"Sinkhorn distributionally robust optimization.arXiv preprint arXiv:2109.11926, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.197351Z"},"links":{"cited_paper":"/paper/2109.11926","citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:54f17b7d59c2bb7c038c2739af492cdac1eccd4770ff56709941a1fee57eb2f0","observation_id":"8a7301d0-28a0-4060-9ebc-8fe544c6c5b7","resolution":{"observed_at":"2026-08-07T14:26:52.197351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.692185Z","title":"Policy gradient in robust MDPs with global convergence guarantee, 2023","venue":null,"work_id":"11666016-495c-4c87-90ce-40d32f8d46e3","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.283186Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:02193315edeb0fffdabf398a401d92c39b0ee4551c1ea8d15c42e4b983b5aa68","observation_id":"d1c9673b-498d-493f-aa91-e2d8a0a25d65","resolution":{"observed_at":"2026-08-07T14:26:55.774906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.486457Z","title":"A finite sample complexity bound for distribu- tionally robust Q-learning","venue":null,"work_id":"9f35d510-c0e9-4ab1-a6df-c06f94a1d4f0","year":2023},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.364238Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:1c9029bbf73bbf8cbddc4091f9ec76f88576e006f4cde3904a34558f1fa77ee4","observation_id":"5a9ea900-7541-46ae-8ad3-2da91d988d08","resolution":{"observed_at":"2026-08-07T14:26:55.587589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.334070Z","title":"Sample complexity of variance-reduced distribu- tionally robust Q-learning","venue":null,"work_id":"d65dedbc-3679-461d-a88b-f3bee5b7f4c3","year":2024},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.436747Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:43bf07dfa56c12e38958b65544f0d0ed3385d23f000a9dc8b45e00e46b95eb17","observation_id":"1fdd2e0b-7b1d-4ce1-9e14-8bbca4e226fd","resolution":{"observed_at":"2026-08-07T14:26:55.405979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:52.508548Z","title":"Online robust reinforcement learning with model uncertainty","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.508548Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:8ab937bf5fc12c8d541ff30c387b37869c0410d627645b766b20c0babb1d0e29","observation_id":"e46641e0-b583-4a1a-a953-2f322065ca27","resolution":{"observed_at":"2026-08-07T14:26:52.508548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:55.147069Z","title":"Policy gradient method for robust reinforcement learning, 2022","venue":null,"work_id":"33608a4b-628a-4c1e-a76c-414382c4b5f3","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.591503Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:78f32bf782bd77fd666ea2638aee2ecf2b696fddd6e4d0e2875e59b1fefcb79b","observation_id":"a4a41a19-4422-4fd5-ae3a-fdaa96631e48","resolution":{"observed_at":"2026-08-07T14:26:55.215824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:52.659845Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.659845Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:de5eb993c02a8164f6247edf2fbf64af92c862205e085b0823eb8fe4319c7401","observation_id":"0848a997-d20d-44f5-984c-55c6e2a6e9e0","resolution":{"observed_at":"2026-08-07T14:26:52.659845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.995656Z","title":"Robust Markov decision processes","venue":null,"work_id":"9744f97c-0cc6-499e-8e1c-d4975557dc22","year":2013},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.749919Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:3c602c102800233e08c60459fbad2e2a9c1a5d154085b6d41f37e3245758d9f6","observation_id":"33fe3bf7-a23e-473b-bd21-36faa5913b7a","resolution":{"observed_at":"2026-08-07T14:26:55.057577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.809968Z","title":"Distributionally robust Markov decision processes","venue":null,"work_id":"a93b3cbc-8fd1-46be-9253-2ee66d69b8ce","year":2010},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.836265Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:8d37dae30424942a014b01edb9a704e36aaf48a61f32f858902881b56955af76","observation_id":"1b3e7aef-70fb-45c3-88bd-798f2076fa29","resolution":{"observed_at":"2026-08-07T14:26:54.909557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.651076Z","title":"A convex optimization approach to distributionally robust Markov decision processes with Wasser- stein distance","venue":null,"work_id":"90114e46-e400-4c58-b462-7bbd5e04b44e","year":2017},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.904606Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:25a0fc6ee0b7d30ebbc7e4048b67ab37edc86a369407c82a4f517588640a997d","observation_id":"fc240353-9188-43fd-8ea5-ac5677b2b03d","resolution":{"observed_at":"2026-08-07T14:26:54.728296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.462318Z","title":"Wasserstein distributionally robust stochastic control: A data-driven approach","venue":null,"work_id":"aadd789e-83c9-4640-8e2c-cbaabd4636ba","year":2020},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:52.969979Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:f11738f15ceb581c4ea117f99ce613bc78e7c271e2071ed547d135725942f1a0","observation_id":"8158a332-f577-4700-bfb1-88cf205a7ebc","resolution":{"observed_at":"2026-08-07T14:26:54.550806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:54.308845Z","title":"On linear optimization over Wasserstein balls","venue":null,"work_id":"ca8d11e8-5ecd-4438-9cb7-8827e1f70f03","year":2022},"citing_paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:53.058645Z"},"links":{"citing_paper":"/paper/2505.19058"},"observation_digest":"sha256:74c6ddf3dd68fcf097be7e0923b9471d0507ede1d61914416c162ad6e3b2c39e","observation_id":"1e5f6c2c-bf72-44e7-87f3-7a550d9b32ce","resolution":{"observed_at":"2026-08-07T14:26:54.369542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19058","last_updated":"2025-05-25T09:22:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:18:47.204343Z","submitted_at":"2025-05-25T09:22:06Z","title":"Distributionally Robust Deep Q-Learning"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":5,"verified_fuzzy":43},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2505.19058."}