{"as_of":"2026-08-08T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce223108379dc98c2def15e98545d1293cea7d4cbfe693bdc3ba782f209e4427","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:16.530086Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18044/citation-record","integrity":"/paper/2505.18044/integrity","json":"/paper/2505.18044/citation-record.json","paper":"/paper/2505.18044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:27.312089Z","title":"Improved algorithms for linear stochastic bandits.Advances in Neural Information Processing Systems, 24, 2011","venue":null,"work_id":"1f5d3bf8-f534-43a1-9e62-1b27da42184e","year":2011},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.019563Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:9757a73288f832a3fd86613b59f56a902b872656490631e7e757a2e0e1499ac7","observation_id":"dc186288-6cb8-4ced-95f5-554b82e2a0c9","resolution":{"observed_at":"2026-08-07T14:44:27.385792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:27.082043Z","title":"Model-based rein- forcement learning with value-targeted regression","venue":null,"work_id":"18e0761d-8e83-42c3-a159-b29d99d7c5df","year":2020},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.070077Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:1a7449a3d072fcbd7f8fda95f50526d8c840ae92c924610f82f8f4d9fd03e8f2","observation_id":"bb835027-f4f9-4f05-93ca-afff8eca1798","resolution":{"observed_at":"2026-08-07T14:44:27.195035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:26.854003Z","title":"Robust reinforcement learning using least squares policy iteration with provable performance guarantees","venue":null,"work_id":"4fe4df6c-be18-447f-bde5-fcdcb07e82cf","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.135324Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:994968e49c4aa436c35d33e2499a4d43391d2a873e598ce5cba456204b4b35c4","observation_id":"38a13ecd-1e1d-4364-8365-9ae7148b5933","resolution":{"observed_at":"2026-08-07T14:44:26.981351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:26.704233Z","title":null,"venue":null,"work_id":"0dea36ef-9455-4a7a-a384-6eeb5b81ed87","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.254486Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:4384c6bf5207a418753b0f12c11e1cf929f7b00fc1864c84389f761496eea92d","observation_id":"00956383-db3a-4030-bb26-9b74abc7e6f1","resolution":{"observed_at":"2026-08-07T14:44:26.789328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:26.453389Z","title":"Provably efficient exploration in policy optimization","venue":null,"work_id":"90fd20a1-08fc-4ce7-ba8c-66b1cfd427e1","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.322725Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:4d2747501f43ef36e4adae49a9d1508dc561c1de02f8fd9df3b5fc73ff3c8292","observation_id":"1dd62c58-047c-4ffc-8b5b-baf919b0cf50","resolution":{"observed_at":"2026-08-07T14:44:26.541681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13187","last_updated":"2025-03-08T06:36:16Z","snapshot_observed_at":"2026-08-07T18:08:55.682886Z","submitted_at":"2025-02-18T12:57:29Z","title":"A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13187","snapshot_observed_at":"2026-08-07T14:44:10.442723Z","title":"A survey of sim-to-real methods in rl: Progress, prospects and challenges with foundation models.arXiv preprint arXiv:2502.13187, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.442723Z"},"links":{"cited_paper":"/paper/2502.13187","citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:8e3d51aaacc0787ef65280e0396733a22703c08c274ab1ce92907a08ac0a4e5b","observation_id":"3f20851a-ba71-43a7-af1d-095e670e23a8","resolution":{"observed_at":"2026-08-07T14:44:10.442723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:26.167210Z","title":"Off-dynamics reinforcement learning: Training for transfer with domain classifiers","venue":null,"work_id":"257d2385-d8ba-4715-9e00-e643f4544f07","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.544737Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:61415d7f469602740e504a0faa14c0542b090e56ddc3d1b84700b4683cec53c0","observation_id":"19a16ae0-0857-41d3-ae1b-e2da5c47ff67","resolution":{"observed_at":"2026-08-07T14:44:26.293774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:25.862138Z","title":"Birkhauser Boston Inc., 1989","venue":null,"work_id":"c08a9c59-ac74-4a74-8355-14b9de75cf96","year":1989},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.646720Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:7136817a564c51a1d5bc6cc05641f1c41734bb35ab775b30480a01aba48dcded","observation_id":"54623bc2-edaa-4cb8-993d-1db9562a20cc","resolution":{"observed_at":"2026-08-07T14:44:25.988409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:25.599440Z","title":"Robust markov decision processes: Beyond rectangu- larity.Mathematics of Operations Research, 48(1):203–226, 2023","venue":null,"work_id":"1ead0f2e-b473-4579-afe1-a68c35eed8cb","year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.741252Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:0b443c97ad388dafa98ea5096e9e7963bbb8df870c64646cec4f9b5f7faeffe1","observation_id":"7ab5c91c-f782-4b02-9065-0bc0a743a499","resolution":{"observed_at":"2026-08-07T14:44:25.708718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:25.297908Z","title":"Off-dynamics reinforcement learning via domain adaptation and reward augmented imitation","venue":null,"work_id":"a8b07fe7-bcad-44b1-964b-10d82b5f0063","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.836792Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:d741a9b05739622c7220343761abe1bd6de92d1c35f0b965dd13f9b49f40cdc3","observation_id":"3fa3af11-b595-4805-931b-4d939d270587","resolution":{"observed_at":"2026-08-07T14:44:25.473463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.965179Z","title":"Kullback-leibler divergence constrained distributionally robust optimization.Available at Optimization Online, 1(2):9, 2013","venue":null,"work_id":"8723657a-b607-463d-9330-a4920e67e4bc","year":2013},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:10.941541Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:c5b1bfaca9fc350358461dff69aa5c03de4b25cbf54f06a39631a62024465d26","observation_id":"8cf0cc27-d3e2-42cc-94fc-00e9988764f3","resolution":{"observed_at":"2026-08-07T14:44:25.114752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.715883Z","title":"Robust dynamic programming.Mathematics of Operations Research, 30(2): 257–280, 2005","venue":null,"work_id":"f5e4546e-8b72-4668-a61a-bad8ee21102d","year":2005},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.093164Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:c74f3a831b10c480a58a4398ff1bd518b94d5cb03e8fbd59d53dbd211de1e7db","observation_id":"26f5d310-fae8-4dec-9df9-918a18143f24","resolution":{"observed_at":"2026-08-07T14:44:24.825016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.526739Z","title":"Model-based reinforcement learning with value-targeted regression","venue":null,"work_id":"83257459-fffa-433d-a5db-29f527ef5af2","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.207448Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:a6b16c577a87d848d5032f769aca288912446e1263a426cd4052e46226dbd483","observation_id":"1133a7aa-aac7-4269-9920-365395c561b4","resolution":{"observed_at":"2026-08-07T14:44:24.634036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.302977Z","title":"Reinforcement learning in robotics: A survey","venue":null,"work_id":"4d4627ed-e3e2-44f4-86e6-fecc4be3048e","year":2013},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.315068Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:23ad71319574825e507a5724884f70d4a064f16ce45147a5b2fc1384fc3f964e","observation_id":"9681b5ac-3886-4ad9-a7e8-705f2973edb4","resolution":{"observed_at":"2026-08-07T14:44:24.415638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.108432Z","title":"The transferability approach: Crossing the reality gap in evolutionary robotics.IEEE Transactions on Evolutionary Computa- tion, 17(1):122–145, 2012","venue":null,"work_id":"8e26cc62-4104-4586-8bf8-569cc85fbc02","year":2012},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.487182Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:1d46ada21ef7332c2368a307b3725c823905ddde13c4dbba8a4ad14b69c8ac77","observation_id":"a8f9b543-73ed-47b2-be81-feb4db80c716","resolution":{"observed_at":"2026-08-07T14:44:24.211608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.907295Z","title":"Improved algorithm for adversarial linear mixture mdps with bandit feedback and unknown transition","venue":null,"work_id":"679e9009-d33b-4b38-82f5-335e42f8a96f","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.642883Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:6381868b71fce6efd81e531505f1e69c5696b257886352b4483bd583cd64df56","observation_id":"537e3031-7b53-4ac4-84f6-ac234e66cc16","resolution":{"observed_at":"2026-08-07T14:44:23.992506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:11.789167Z","title":"Policy gradient algorithms for robust mdps with non-rectangular uncertainty sets.arXiv preprint arXiv:2305.19004, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.789167Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:6a2e0263866aa0d89652fea8daa24f97e021342d548e63cd99af6e43b5bb0a5a","observation_id":"9e4b0ec0-dad0-4e2b-8215-312c05ec1e7f","resolution":{"observed_at":"2026-08-07T14:44:11.789167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.677903Z","title":"Distributionally robust off-dynamics reinforcement learning: Prov- able efficiency with linear function approximation","venue":null,"work_id":"2c154d68-6ec7-4f90-ad7e-89e772bf6704","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.853527Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:6c45651ae6b603f851f6df9c6cb77c9e387eae7155b4e3fbc2802673d567123b","observation_id":"c0a9d7d5-2e5b-490a-9ce1-c4a8d716093d","resolution":{"observed_at":"2026-08-07T14:44:23.793901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.481757Z","title":"Minimax optimal and computationally efficient algorithms for distributionally robust offline reinforcement learning","venue":null,"work_id":"7d098a6f-3806-41a9-b1ca-6c6df4d52934","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:11.967284Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:fbcbff5603ef8002b50e7586c9dc6f4d98539cb3336c31dd72ed6faf0257f64a","observation_id":"0dc062d7-014f-4736-813b-841708978fd2","resolution":{"observed_at":"2026-08-07T14:44:23.553624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20521","last_updated":"2024-09-30T17:21:15Z","snapshot_observed_at":"2026-07-06T19:24:43.745786Z","submitted_at":"2024-09-30T17:21:15Z","title":"Upper and Lower Bounds for Distributionally Robust Off-Dynamics Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20521","snapshot_observed_at":"2026-08-07T14:44:12.083195Z","title":"Upper and lower bounds for distributionally robust off-dynamics reinforcement learning.arXiv preprint arXiv:2409.20521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.083195Z"},"links":{"cited_paper":"/paper/2409.20521","citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:73de6bc7fb76959985698aba08d16a7751a9b6b39661bf036ae49f6bbe196251","observation_id":"63daded1-ac5d-49ab-99aa-5b63af275ba0","resolution":{"observed_at":"2026-08-07T14:44:12.083195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.346575Z","title":"Distributionally robust reinforcement learning with interactive data collection: Fundamental hardness and near-optimal algorithms","venue":null,"work_id":"c81e7986-c388-4cdc-beaa-aff4dfacec59","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.199629Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:77f76033c9c5233556631d4736426cf48475e03c5f7cb05a3546ec4df5de14f4","observation_id":"95e6eb6c-acaa-4371-9d67-69ea426d175c","resolution":{"observed_at":"2026-08-07T14:44:23.385864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06620","last_updated":"2023-01-27T14:08:06Z","snapshot_observed_at":"2026-08-05T08:00:27.753001Z","submitted_at":"2022-09-14T13:17:59Z","title":"Distributionally Robust Offline Reinforcement Learning with Linear Function Approximation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06620","snapshot_observed_at":"2026-08-07T14:44:12.293596Z","title":"Distributionally robust offline reinforcement learning with linear function approximation.arXiv preprint arXiv:2209.06620, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.293596Z"},"links":{"cited_paper":"/paper/2209.06620","citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:faa99cbe52b48c3221d0294865466270d08fd26ae65caba89e733b01eee5a5e2","observation_id":"b85144d0-96dd-4589-b3c1-7a46c22f8c9f","resolution":{"observed_at":"2026-08-07T14:44:12.293596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.261103Z","title":"Finite mixture models.Annual review of statistics and its application, 6(1):355–378, 2019","venue":null,"work_id":"82486b93-80d3-4e46-84aa-aef1425ef2d8","year":2019},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.397984Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:4af00789b74160e00e7bbee53e2f689489fd4b03c4a684e4207a714bb4548c92","observation_id":"0c3ffa72-4d05-4171-ad13-ea9788ec4a94","resolution":{"observed_at":"2026-08-07T14:44:23.288836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.212794Z","title":"A simplex method for function minimization.The computer journal, 7(4):308–313, 1965","venue":null,"work_id":"273be59e-1dbf-40dd-b466-7c56c0f03099","year":1965},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.495205Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:1a04caffb419ec9b290d56655484b742fa666a491822c0dd6117795e18505191","observation_id":"44bb74d5-08e3-42dd-ae8a-af04cf923cc2","resolution":{"observed_at":"2026-08-07T14:44:23.223487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.122131Z","title":"Robust control of markov decision processes with uncertain transition matrices.Operations Research, 53(5):780–798, 2005","venue":null,"work_id":"7afa2cf4-d638-4611-bd73-837adaff8cf6","year":2005},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.579883Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:d4064ef5eeba408363a5e62d6a407000fcd0f68c872b2beca333b126245039fb","observation_id":"67835c7f-4f71-4a3e-97e5-8b9fc42752ed","resolution":{"observed_at":"2026-08-07T14:44:23.169848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.870876Z","title":"Robustness in markov decision problems with uncertain transition matrices.Advances in Neural Information Processing Systems, 16, 2003","venue":null,"work_id":"bfd4e7e6-4eb1-4750-bd3a-a858aab20260","year":2003},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.671049Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:30024b87fdea6ed14c65c074b816b5d79621f331e34e05a8bfcebe7fe14ac504","observation_id":"839e7291-ab3a-497e-8e24-f86eb3b3790a","resolution":{"observed_at":"2026-08-07T14:44:23.014790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12282","last_updated":"2019-03-15T17:58:23Z","snapshot_observed_at":"2026-08-04T12:14:43.752072Z","submitted_at":"2018-10-29T17:51:46Z","title":"Assessing Generalization in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12282","snapshot_observed_at":"2026-08-07T14:44:12.736776Z","title":"Assessing generalization in deep reinforcement learning.arXiv preprint arXiv:1810.12282,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.736776Z"},"links":{"cited_paper":"/paper/1810.12282","citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:245459e80cc15a0685dddd80c679e01fb6058b59bc903c4eb58dcba9d7c9bc28","observation_id":"18d66843-81be-44cc-aa87-48dd55c772f0","resolution":{"observed_at":"2026-08-07T14:44:12.736776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.616761Z","title":"Bridging distributionally robust learning and offline rl: An approach to mitigate distribution shift and partial data coverage","venue":null,"work_id":"f8a04e44-8d2e-4dc3-9b17-60a4cff863db","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.810675Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:59dbaf0f730643a9286e7b4b69d4bbddee6c2aeaf628e2ab67c432ff437e4981","observation_id":"4142db4e-26e7-4179-b4b9-ce97031e44e5","resolution":{"observed_at":"2026-08-07T14:44:22.701706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.448118Z","title":"The infinite gaussian mixture model.Advances in Neural Information Processing Systems, 12, 1999","venue":null,"work_id":"b5bf8c2a-8630-4d6c-b0af-b8b7a73d143c","year":1999},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.922041Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:5883b54afb7d4838ca89b7260a20202124948f4644ab80214dd7544ecb0eefa0","observation_id":"e8fd1073-752e-49a0-92fe-9ccba380a9ab","resolution":{"observed_at":"2026-08-07T14:44:22.533967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.243240Z","title":"Gaussian mixture models.Encyclopedia of biometrics, 741(659-663): 3, 2009","venue":null,"work_id":"8676ac7c-4311-4da4-ad2e-d82282d282c3","year":2009},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:12.982231Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:caeb812f11428493b9f97b4da00dd4a8b159a18a746d615b43911467de6b9b05","observation_id":"45337095-b368-4d61-abe8-bec4486f2fed","resolution":{"observed_at":"2026-08-07T14:44:22.342941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:22.097763Z","title":"Markovian decision processes with uncertain transition probabilities.Operations Research, 21(3):728–740, 1973","venue":null,"work_id":"5091ae4c-65aa-4830-a50f-b18cbf4b8a08","year":1973},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.089462Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:af59fdfd905a5f9027980c3b07ee3bbafd17cb07b03b39d55039b8d6c3888ee6","observation_id":"e64b59e7-8913-4b22-a6da-19a224eb9698","resolution":{"observed_at":"2026-08-07T14:44:22.165116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.937484Z","title":"Distributionally robust model-based offline reinforcement learning with near-optimal sample complexity.Journal of Machine Learning Research, 25(200):1–91,","venue":null,"work_id":"aab1f5f2-de09-4dc4-b33e-62faa91280e7","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.224367Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:ff93ff52bcd807965f80fd39582bf15864a3963cc7c1fe50d1a4b677a93b692d","observation_id":"942aebe0-2956-4962-aff9-008cd03e2f88","resolution":{"observed_at":"2026-08-07T14:44:22.019192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.721925Z","title":"The curious price of distributional robustness in reinforcement learning with a generative model.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"9eb65698-51d5-43ba-802b-f1324b4cbf7b","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.360333Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:a791344528a27920a98a21ce2f5c35bead6ca49f32289bf416c19af7f7b6e077","observation_id":"ac69338f-c324-45ef-b6b7-b78ecf2e27b3","resolution":{"observed_at":"2026-08-07T14:44:21.820136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:13.540609Z","title":"Robust offline reinforcement learning with linearly structuredf-divergence regularization.arXiv preprint arXiv:2411.18612, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.540609Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:6ea95963a890b2022f53ab83922b258dcda0bd793bb3fa0c164269674624f0ad","observation_id":"1bc9241f-01ad-4e82-9451-126cbac39427","resolution":{"observed_at":"2026-08-07T14:44:13.540609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.521694Z","title":"Pessimistic model-based offline reinforcement learning under partial coverage","venue":null,"work_id":"341c8e71-5bba-49d4-a581-5e56b8f8cf6e","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.759936Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:80bcdc4acb9705f17383c82aac7100ec0155b3c9521c3829c0c08f3ea4f023d8","observation_id":"b1cf2ff8-fe45-4251-b08c-791f50ab0925","resolution":{"observed_at":"2026-08-07T14:44:21.615475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.349821Z","title":"Sample complexity of offline distributionally robust linear markov decision processes","venue":null,"work_id":"229b474e-ffc2-4ff2-8b10-ffbaed90a4f6","year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:13.955582Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:3e812d56d69e98aeda5d71770935432d07c39a08d179c009eadd243c14161453","observation_id":"3e8d53b8-5bfb-4d31-816b-e06f9bef2976","resolution":{"observed_at":"2026-08-07T14:44:21.435252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:14.180938Z","title":"Return augmented decision transformer for off-dynamics reinforcement learning.arXiv preprint arXiv:2410.23450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.180938Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:5be568adbea7f07116f6ae8f554df60dafcb3037cc0e4208724a27fb9454b0e3","observation_id":"48e2cbd0-62f7-4b33-aa0d-c0db5afc2550","resolution":{"observed_at":"2026-08-07T14:44:14.180938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.240896Z","title":"Robust markov decision processes","venue":null,"work_id":"492c2ef3-fdf7-4efd-9a9a-557cb1253f5e","year":2013},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.366644Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:b632972f5422170c551acf47e19d9c4231aac11a2c3b903e4a1e89423f87df11","observation_id":"e85e83e1-f41d-410e-990b-32bc20e4b662","resolution":{"observed_at":"2026-08-07T14:44:21.282437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:21.024089Z","title":"Mutual alignment transfer learning","venue":null,"work_id":"4a67e622-eb73-4b22-8daf-90a6aded9009","year":2017},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.512261Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:f422f5f82a2e8e68416c6b27ccf83f0d75c41ebcbcd710b8db9e550dba2f7be6","observation_id":"5cd48174-e78c-4762-9c2e-2fc32074bb3d","resolution":{"observed_at":"2026-08-07T14:44:21.148819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:20.694948Z","title":"The robustness-performance tradeoff in markov decision processes","venue":null,"work_id":"5a0abf72-1b92-4bbc-aa53-a0b4785e4b45","year":2006},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.695106Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:0b9ee37e0c19430e4de716e25d03cdd495918e1d5c444f867381e86c58d50d35","observation_id":"f019cdc2-eb5f-4a4f-b270-8c78b598182f","resolution":{"observed_at":"2026-08-07T14:44:20.851485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:20.430864Z","title":"Improved sample complexity bounds for distributionally robust reinforcement learning","venue":null,"work_id":"c2f98723-2f1d-4f1a-b36b-e4c362ed2bf8","year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:14.854406Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:b703f16675c08b33997d363cbb18f978b3d70d4dedc8c21ec27ee8d49c7b96e8","observation_id":"4c789318-dc3a-46c2-942a-78328245af70","resolution":{"observed_at":"2026-08-07T14:44:20.560793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:20.181275Z","title":"Toward theoretical understandings of robust markov decision processes: Sample complexity and asymptotics.The Annals of Statistics, 50 (6):3223–3248, 2022","venue":null,"work_id":"4a51bd94-cd24-4e61-b492-013f08c5d603","year":2022},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.061034Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:8d744d1edc6738946962f81ea4c7efc7e812bfac328b0b480e1784cd4f485622","observation_id":"48fe2c9b-761c-4683-95c9-cbe1ca36377a","resolution":{"observed_at":"2026-08-07T14:44:20.325566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:19.939675Z","title":"Reward-free model-based reinforcement learning with linear function approximation.Advances in Neural Information Processing Systems, 34:1582–1593, 2021","venue":null,"work_id":"d6325a17-50a4-44e6-b23f-db3d23519ddf","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.218794Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:dffa4439d0bb90c3bc606cfdba217e8ff9799e8816929603076da0e6f2f1edd7","observation_id":"9ea4557c-3d4f-4c06-8821-0998a738ab90","resolution":{"observed_at":"2026-08-07T14:44:20.071385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:19.556108Z","title":"Learning adversarial linear mixture markov decision processes with bandit feedback and unknown transition","venue":null,"work_id":"00a90741-7a31-428b-957e-962f6ec04c88","year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.452113Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:6e83c0dfe1614293d5c6a08091c2b6705da3f7baf184e1e569742f921427d4cd","observation_id":"c9bd51f5-0c82-4c63-b83e-3b55b28179df","resolution":{"observed_at":"2026-08-07T14:44:19.715374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:19.135689Z","title":"Sim-to-real transfer in deep reinforcement learning for robotics: a survey","venue":null,"work_id":"834b8e4b-d137-4801-a7e6-6941b12469c6","year":2020},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.598520Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:db17d3190002a537c839ef3f591b646127240453bed790244d667a4ac15ba5e3","observation_id":"64543293-787a-4e7d-9421-ba5098cc83b2","resolution":{"observed_at":"2026-08-07T14:44:19.344128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:18.775510Z","title":"Nearly minimax optimal reinforcement learning for linear mixture markov decision processes","venue":null,"work_id":"46b31d66-fea6-4063-a570-76e9fba134f2","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.708272Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:79be48d6a1d5f6f0d94f8353b2995e991ef0c7d5983573b97386a996b36e316f","observation_id":"c31db8ea-24ae-41f8-9c98-2f9ac1ce89a9","resolution":{"observed_at":"2026-08-07T14:44:18.984048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:18.467622Z","title":"Provably efficient reinforcement learning for discounted mdps with feature mapping","venue":null,"work_id":"072956bb-963a-47c6-bf41-c5a874594517","year":2021},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:15.877799Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:2ab0fc39c275eaf63cb8a4bd1015c678e13ee621c43404d8c091656114ea42db","observation_id":"e07a3f5e-17ce-4ad3-bd72-8388f5f6787a","resolution":{"observed_at":"2026-08-07T14:44:18.616950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:18.082477Z","title":"Natural actor-critic for robust reinforcement learning with function approximation","venue":null,"work_id":"be4bce5b-cffb-4c99-87fa-dbb0e55d6f62","year":2023},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:16.093379Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:e2de6d48e79d73d82d7fcc286c7b850a227735e999528db3427b435ba5ccb43f","observation_id":"749cdfc5-2079-4a84-9f5c-0edfc4defa36","resolution":{"observed_at":"2026-08-07T14:44:18.244415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:17.716676Z","title":"Finite-sample regret bound for distributionally robust offline tabular reinforcement learning","venue":null,"work_id":"47675792-0562-45f5-ad6a-fbd5041985b9","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:16.285333Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:161733b1a727745bc7720cc10fb396af09007b5072ede71e5014a59373574930","observation_id":"e0055a81-ecff-4ada-b7a5-12dacbbec727","resolution":{"observed_at":"2026-08-07T14:44:17.858529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:17.312400Z","title":"Time- constrained robust mdps.Advances in Neural Information Processing Systems, 37:35574–35611,","venue":null,"work_id":"bfd8ede8-6dfc-4f82-af23-4c1a1761305d","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:16.401146Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:7cd1d2ba22c35c04fd58a985e4002875acba7a1717a643feae56a523559c93cf","observation_id":"832614ab-83b0-4b22-b97b-5e9906b73a12","resolution":{"observed_at":"2026-08-07T14:44:17.527348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:17.030394Z","title":"A.1 Proof of Theorem 3.4 Proof","venue":null,"work_id":"87634f63-90f5-49b5-a148-0bd0a7413af7","year":null},"citing_paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:16.530086Z"},"links":{"citing_paper":"/paper/2505.18044"},"observation_digest":"sha256:8e9216e35f43384037369a220abb3e97f0ac7dac5fe5ba51173b32ad032803e3","observation_id":"5a065462-4302-4047-8c1a-f3386aceef79","resolution":{"observed_at":"2026-08-07T14:44:17.145142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18044","last_updated":"2025-05-23T15:48:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:34:07.865481Z","submitted_at":"2025-05-23T15:48:11Z","title":"Linear Mixture Distributionally Robust Markov Decision Processes"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2505.18044."}