{"as_of":"2026-08-09T23:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3d90a5b456aebb3a3caa60fe11e10fe2e14e1c19d84d4446524606657863703","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:28:45.036484Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19002/citation-record","integrity":"/paper/2505.19002/integrity","json":"/paper/2505.19002/citation-record.json","paper":"/paper/2505.19002"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.936913Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:37.936913Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:8fac79157158beb03021e876f5fd6fc7daa7bf706d7d5df42237b356ca8ef62d","observation_id":"99701860-d7a5-4519-bf1c-c4c62d053410","resolution":{"observed_at":"2026-08-07T14:28:37.936913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.039135Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:38.039135Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:9e3116219039874867809ef526a40055f05704fe8a61c9279af6ac70e78a9957","observation_id":"f0e73df3-f5a1-477b-908c-d2ce1d01c67c","resolution":{"observed_at":"2026-08-07T14:28:38.039135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:57.151536Z","title":null,"venue":null,"work_id":"10503f1c-bf29-46bf-9cbb-c66d0b9e849e","year":2022},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:38.180791Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:7d6f1d6535cdc9ac1f7d37212fa692850364419603b92c3a18ae4340ccc8c8c3","observation_id":"9821c6b0-05cd-4c49-80dd-16b0a2aa82e8","resolution":{"observed_at":"2026-08-07T14:28:57.250274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:56.908995Z","title":null,"venue":null,"work_id":"da3ef0d3-0abc-4bd4-b6e5-9d453babcddf","year":1986},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:38.255599Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:3d19f50c8ee1fc3c5ff0bb38b045ae52ad465bee6eac790a8f20b70e5f0e78db","observation_id":"71eb6981-cd84-4902-befe-9a1bdd22d63e","resolution":{"observed_at":"2026-08-07T14:28:57.019410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:56.707742Z","title":null,"venue":null,"work_id":"7269b505-feae-443c-9a8a-bdbbe02fc112","year":2018},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:38.383579Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:7c598936d32ac00638b12de76f52ef535e3cc95996c10852b5585a45e1b37ec7","observation_id":"9c125de8-e6cf-48ff-a349-ad1348ebd310","resolution":{"observed_at":"2026-08-07T14:28:56.799927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:56.401736Z","title":null,"venue":null,"work_id":"cecda8cf-f451-44d8-bf25-6a2c3918da14","year":2024},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:38.522385Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:9433c51519d2f4e8d3f1fa4509106491056c51e61a821d085513afcdbd0fa40b","observation_id":"e81d5493-7b0c-4b82-a1fc-7e758937459f","resolution":{"observed_at":"2026-08-07T14:28:56.556621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:56.163767Z","title":null,"venue":null,"work_id":"60caa0b0-f1c3-4420-85ea-4d1370528413","year":2019},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:38.650485Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:b6b07f85e59c9b89f827825ce15e6aa23c7b010eebef9c6fd97ced4e380a8251","observation_id":"d7313cbf-daf9-446f-b91b-117085dd1357","resolution":{"observed_at":"2026-08-07T14:28:56.302536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13152","last_updated":"2024-06-26T03:39:39Z","snapshot_observed_at":"2026-08-06T20:03:12.495286Z","submitted_at":"2023-01-30T18:29:35Z","title":"STEEL: Singularity-aware Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13152","snapshot_observed_at":"2026-08-07T14:28:38.798613Z","title":"Qi, and R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:38.798613Z"},"links":{"cited_paper":"/paper/2301.13152","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:6fde691361ea3bbd17d73f7e9d7ab56e3d67b058ee6040b2881589bb5ef73595","observation_id":"4ebe2b46-3254-4a7d-98a8-3f17e77346b2","resolution":{"observed_at":"2026-08-07T14:28:38.798613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:55.909518Z","title":null,"venue":null,"work_id":"0375d1c8-cbc7-4248-a6c4-102894d33afd","year":2002},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:38.939129Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:52ce6e3429be8b4c7ec20d2740b1ced613f066bf644ae8a1d619822235bdc0ec","observation_id":"c170ed35-d3bc-46d4-a1ff-3871c594919f","resolution":{"observed_at":"2026-08-07T14:28:56.007740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:55.655367Z","title":"Geurts, and L","venue":null,"work_id":"5a5fd3b9-e5f9-4a0e-9b52-aab86def01dc","year":2005},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:39.046707Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:7889446023885cc152a6a799ef12ee8f6f4320e35ee5b2fdd1df8149d45f0c5d","observation_id":"60e32809-7430-4148-b1f3-0bcd91ecc82e","resolution":{"observed_at":"2026-08-07T14:28:55.794274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T14:28:39.226745Z","title":"Kumar, O","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:39.226745Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:a0f24857b55b1af907d30c0829d9922d69b4d2382b72109e8b581cf77a38154f","observation_id":"fecb2668-4647-4436-863e-7c89ae43de2f","resolution":{"observed_at":"2026-08-07T14:28:39.226745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T14:28:39.355009Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:39.355009Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:f60d28557eb66f61e6896077f79b8b27cab75ace367ba037cdea8b63effdefa9","observation_id":"6429a876-1341-4dac-b32d-f10146cf9b5f","resolution":{"observed_at":"2026-08-07T14:28:39.355009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:55.370828Z","title":null,"venue":null,"work_id":"f0c3d081-0461-43b8-b575-f5f116d124b6","year":2021},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:39.509393Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:17eeda5feb1f1b3ab93b92937c54c3b239b2cfb0218138feec2a08df295417a5","observation_id":"bad278c7-37fe-42fc-95cc-bd0370df7f71","resolution":{"observed_at":"2026-08-07T14:28:55.507828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:55.159719Z","title":null,"venue":null,"work_id":"9b8b6d7c-3a74-43e0-989e-1aa4762cd87e","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:39.678987Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:0c5db293786233bfaddfdd01d6e0a3f052fe0ce8d7624b6d8e07bda0cd77f47e","observation_id":"645a845d-c875-4ef4-81c5-6137f04d4656","resolution":{"observed_at":"2026-08-07T14:28:55.270751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09900","last_updated":"2025-06-05T01:50:31Z","snapshot_observed_at":"2026-08-04T20:05:34.384992Z","submitted_at":"2022-12-19T22:43:08Z","title":"Policy learning \"without\" overlap: Pessimism and generalized empirical Bernstein's inequality","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09900","snapshot_observed_at":"2026-08-07T14:28:39.800402Z","title":"without","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:39.800402Z"},"links":{"cited_paper":"/paper/2212.09900","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:82b7bf0484dd9162e779c24c764f4dc6af66357981886a7b1a0e1147a18e1d97","observation_id":"a33bc208-27f6-4cd9-b831-28489c7966f3","resolution":{"observed_at":"2026-08-07T14:28:39.800402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:54.937550Z","title":"Yang, and Z","venue":null,"work_id":"c57fedd2-fbea-4d28-bb07-b0f8b003b410","year":2021},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:39.967853Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:a817c68ea2af4bded40e24ac81b55e21ae0456f14e7058cf5220cf1c7bfcc98b","observation_id":"6a86d18d-3515-485e-a07f-81a6732ffad8","resolution":{"observed_at":"2026-08-07T14:28:55.065832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:54.751268Z","title":null,"venue":null,"work_id":"39c869fa-56a6-423c-9b30-5781e958d010","year":2002},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:40.102144Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:a5f63548425c43013880bfc51d9eb3513356cedb0fe20bf306bd05b15f1101e7","observation_id":"fbe3824e-8f47-479f-9246-12f0e15cf401","resolution":{"observed_at":"2026-08-07T14:28:54.844614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:54.461371Z","title":null,"venue":null,"work_id":"ea62ab65-1175-4df6-8fb8-46942dc85522","year":2001},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:40.228709Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:344c84fa6f148d5c69665a7b764541a5c4a1b6791c8d57ad80970611cb4585f3","observation_id":"8af24646-485f-46cb-8e3c-56ba55d1887d","resolution":{"observed_at":"2026-08-07T14:28:54.590785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:54.249112Z","title":"Rajeswaran, P","venue":null,"work_id":"36939d43-b6f2-4728-8abe-696d04f96b88","year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:40.351419Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:f2829937ceba3b25c5ebb356a9acb2176bab3d6432553977a0715025c3283f02","observation_id":"c5c1d08f-7322-42bd-affd-adbc77525ee2","resolution":{"observed_at":"2026-08-07T14:28:54.361890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:54.012154Z","title":null,"venue":null,"work_id":"750c4fcd-c4d5-46e6-a47f-a2818eeb4fe2","year":2014},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:40.485615Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:7f3bb7d5d07dc42f3de2bfb5caee7b9044fa569cebf2f14396522aae252ddab5","observation_id":"dcad40ad-9cdd-48ab-b6b8-00aabd78b12c","resolution":{"observed_at":"2026-08-07T14:28:54.108956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:53.764824Z","title":"Zolna, Y","venue":null,"work_id":"c6c5ef99-b552-4fc6-a569-35e29f8013cb","year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:40.615672Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:f86212d396962859121ee75edc433d413b49d9713467747907c921256c12a95e","observation_id":"38461ea0-756f-4039-9c4e-62738c0297ff","resolution":{"observed_at":"2026-08-07T14:28:53.858404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:53.558882Z","title":null,"venue":null,"work_id":"10fddee9-6a25-4181-8b39-845f3015f63c","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:40.740155Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:3419070053d0088005024e011ebc3755cb3f6d7d648406350ca0af4bf29a36ef","observation_id":"b1a99c68-e931-4ddd-b07e-61d80242b9ea","resolution":{"observed_at":"2026-08-07T14:28:53.672146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:53.303037Z","title":null,"venue":null,"work_id":"5b4373dd-4b02-42bd-abab-ab3ec2a3dd8f","year":2013},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:40.901587Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:979db5c93dc1476896e3ac7442d9bce2ff0c68acff10bafa5c5f8775a234f61a","observation_id":"eccf748a-e09f-445b-a675-6d0793f56565","resolution":{"observed_at":"2026-08-07T14:28:53.450113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T14:28:41.046807Z","title":"Kumar, G","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.046807Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:cde8bc6176a1c7794724221fd25267ce11ae8de32f9475a7160503bd43b57a79","observation_id":"c76397c6-f9e7-454c-926f-cfff88c31828","resolution":{"observed_at":"2026-08-07T14:28:41.046807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:53.070771Z","title":null,"venue":null,"work_id":"8d594170-e0ec-476b-8448-2ca31601b8e2","year":2024},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.171724Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:9cf3ffe703a9cf3dd94f4d0a38ddc7bc9eb482f59908b77434502b7d69949e04","observation_id":"e983a0b9-61fa-4b6b-97da-269b919d1803","resolution":{"observed_at":"2026-08-07T14:28:53.196644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:52.830436Z","title":"Zhou, and R","venue":null,"work_id":"f39cec84-ff1f-45d1-b2b8-d263f200410b","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.310645Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:a47d3e1599f770c3e375e8a9c0abc371d78b08d6b3dec175ff0c3c515e7f9012","observation_id":"127d3ecf-b8fe-4854-b9aa-841769404d31","resolution":{"observed_at":"2026-08-07T14:28:52.925678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:52.574799Z","title":null,"venue":null,"work_id":"5593b3d6-3ce8-4296-821c-d29ae0723641","year":2022},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.393759Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:3b268a3d8d155ecf3964fd000271aacebf693889f65cffac70b5ce51a1d879eb","observation_id":"33d75495-4c97-4310-9767-eea3cc7d5c2d","resolution":{"observed_at":"2026-08-07T14:28:52.722306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:52.339167Z","title":"Pogosyan, S","venue":null,"work_id":"48c3f3ff-d1b4-44aa-9550-a325c5c9c0c4","year":2013},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.477973Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:d01c2b914fbbdb721b76793f22794134c97fbddcfd9715d69c2122322d0c62ab","observation_id":"6bfdb06c-e426-4153-8b9a-410f5517bef8","resolution":{"observed_at":"2026-08-07T14:28:52.468941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02581","last_updated":"2025-03-01T12:55:13Z","snapshot_observed_at":"2026-08-06T07:06:33.911763Z","submitted_at":"2023-10-04T04:57:35Z","title":"Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02581","snapshot_observed_at":"2026-08-07T14:28:41.567710Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.567710Z"},"links":{"cited_paper":"/paper/2310.02581","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:c28cebbe6553278600fb8da4a634de3eea9c190e0ab85416d9fb5648aeb6e16d","observation_id":"25183d71-fd7f-4130-8817-1822819b9378","resolution":{"observed_at":"2026-08-07T14:28:41.567710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:52.135573Z","title":"Swaminathan, A","venue":null,"work_id":"d6b22d48-0013-4956-8e79-602d5e7b6a0d","year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.695359Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:51d3d68de808223f3aa20535d7af429937dbe9d11e895e57b12e816ac3edfb29","observation_id":"37ccdb60-6a77-4422-9398-579ac402fa6e","resolution":{"observed_at":"2026-08-07T14:28:52.250748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:51.903787Z","title":null,"venue":null,"work_id":"8f8a6831-f254-4f89-bcb4-883def6b2c9a","year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.794393Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:e25ea614a71075e443310bb2bc6b5c6fbd32b542b3652482d8da385870eb311d","observation_id":"48239ab6-cb8e-4a74-9456-59210da79243","resolution":{"observed_at":"2026-08-07T14:28:52.026860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07353","last_updated":"2020-08-17T14:26:18Z","snapshot_observed_at":"2026-07-06T09:47:48.007337Z","submitted_at":"2020-08-17T14:26:18Z","title":"On the Sample Complexity of Reinforcement Learning with Policy Space Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07353","snapshot_observed_at":"2026-08-07T14:28:41.882921Z","title":"Wen, and X","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.882921Z"},"links":{"cited_paper":"/paper/2008.07353","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:f52a6bef5b2fbbcba67a9fd70c05ffe605ba2c681047a5b39cb8447f5fcda9a9","observation_id":"73aa90c8-ba05-405b-b920-f852d6bc3aa3","resolution":{"observed_at":"2026-08-07T14:28:41.882921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:51.660701Z","title":"Gilron, S","venue":null,"work_id":"f58ed6d0-db4a-43dd-959b-9479fabcba91","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:41.994961Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:d0cffedeff8b9ed9ffb52ec2f59edef204a37eb813a1b25a2e7de12fd5161db4","observation_id":"05bb4ab3-b68c-4711-b8a2-082db11450db","resolution":{"observed_at":"2026-08-07T14:28:51.782463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:51.329500Z","title":null,"venue":null,"work_id":"688e0d03-b775-48aa-b849-2a97b28c5a5b","year":2024},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.089577Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:7730752f741b35279f3811b9247af1b1123764320c9f239a48a5bb5d4725aa39","observation_id":"dc0e4f90-7e54-4493-83f5-f1da2aec25b5","resolution":{"observed_at":"2026-08-07T14:28:51.477087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:51.075763Z","title":null,"venue":null,"work_id":"909debce-9661-4f2d-bdb8-4eb19edb8434","year":2012},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.209714Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:599e2846caa6383654fa4288bad69a7a915ca9e17a5982ed94865c100e0fe89f","observation_id":"f21f92ed-0e4b-4bb3-abd4-4e73647403f2","resolution":{"observed_at":"2026-08-07T14:28:51.203211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:50.843601Z","title":null,"venue":null,"work_id":"28dcb74a-ffe5-49b3-890f-849353b33bf5","year":2007},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.290825Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:e0c258f853258cdf705a24ba1415c7f99c45c38f77a2f9116d2ddbf79ff8e027","observation_id":"019fba24-78d8-4b4c-a10a-5d9e3bcbb7ad","resolution":{"observed_at":"2026-08-07T14:28:50.922182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:50.579937Z","title":null,"venue":null,"work_id":"09baeba7-a5fb-4800-97f5-f6cbbd37cd8d","year":2008},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.400930Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:37630e39db8f3e4bb95a924034cee9a46d516d49941b3d4d35815ea81a1e7562","observation_id":"0eda664c-e47f-40d6-b53b-5d9285f6e9f8","resolution":{"observed_at":"2026-08-07T14:28:50.686027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:50.258984Z","title":null,"venue":null,"work_id":"ebfb4ff4-0978-4840-ae54-15f56aeeb2b2","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.487562Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:6d91c9e5c8b778316ab6284d24d716f1a41a47379e9971a4e43c2ef4d8abac28","observation_id":"8a50c41a-5308-4242-a27d-dfd577f58744","resolution":{"observed_at":"2026-08-07T14:28:50.405140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:50.029758Z","title":null,"venue":null,"work_id":"29302584-4be1-48af-a666-17185431ade4","year":2005},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.592262Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:1e837d85f5a1a882c309037547ca738a6a1381cc8bf9d137968c792754402921","observation_id":"adea0d2d-cbbf-413f-a857-e65d4ec5dc1b","resolution":{"observed_at":"2026-08-07T14:28:50.120874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:49.787926Z","title":null,"venue":null,"work_id":"264b7088-8f23-47de-b416-d9934bcc4f5a","year":2024},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.712853Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:dfcd4e26259f4702e87ed8de6a4c2928ff10335b0322adf12ef3d16c1a2a43ef","observation_id":"685d8228-8a5c-43c4-8172-798b7a0ae1b1","resolution":{"observed_at":"2026-08-07T14:28:49.895424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:49.388973Z","title":"Zhang, W","venue":null,"work_id":"a4a18305-8824-4854-9428-4dd932fd65e3","year":2022},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.802507Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:a1e3c8916258aebf17e2d34d13e3e200f13dfef2cfc475e4ced85e71f0f51986","observation_id":"530d3269-cb13-4011-b961-13263010636e","resolution":{"observed_at":"2026-08-07T14:28:49.533109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:49.075284Z","title":null,"venue":null,"work_id":"9f655f62-e2ce-41b3-969e-97cf00c1ea72","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:42.910136Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:9d7a2f90c807650d88006c8880c5f3ed8e36bd3273457c822888cfaea6b9be17","observation_id":"9e3d4bc2-1f05-4d93-8ba3-924e40ecb855","resolution":{"observed_at":"2026-08-07T14:28:49.211361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:48.857174Z","title":null,"venue":null,"work_id":"93021854-1c73-4d5b-8cb8-b67167e8ff6a","year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.035009Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:6a9427e4a0b9b876802250611153d98a0148bac0aa66e18151143a0b2271070e","observation_id":"ab69acd3-d127-4f75-b8bf-0526ca9ca715","resolution":{"observed_at":"2026-08-07T14:28:48.943611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:43.157235Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.157235Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:a4756cdd3e0c43d2dee8dc6ab0f23f140fe109e97b49a53bab31cafc7f155385","observation_id":"9d8bd769-3430-436e-9059-cf931d838a70","resolution":{"observed_at":"2026-08-07T14:28:43.157235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02981","last_updated":"2022-07-24T23:49:47Z","snapshot_observed_at":"2026-07-06T10:38:42.987304Z","submitted_at":"2021-02-05T03:20:39Z","title":"Finite Sample Analysis of Minimax Offline Reinforcement Learning: Completeness, Fast Rates and First-Order Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.02981","snapshot_observed_at":"2026-08-07T14:28:43.256958Z","title":"Imaizumi, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.256958Z"},"links":{"cited_paper":"/paper/2102.02981","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:0ac93bcd6424398ebcefab2b0eb4815aac4291a4c61a220abdd5244ca930fce0","observation_id":"1d6aa5ed-ee94-4e47-a15b-e1279b4242e3","resolution":{"observed_at":"2026-08-07T14:28:43.256958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:48.622656Z","title":null,"venue":null,"work_id":"d8fdf5b4-ffeb-4903-be2d-fc46fe141d6c","year":2022},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.344777Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:46927c850bc5dd8233c6d075dae530de51d0667caa9e1f135de64addb1a4d768","observation_id":"27fdadc1-b5eb-4595-b1f3-d184932d905d","resolution":{"observed_at":"2026-08-07T14:28:48.741183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11841","last_updated":"2024-03-18T14:51:19Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:51:19Z","title":"Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data","version":1},"cited_work":{"arxiv_id":"2403.11841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.11841","snapshot_observed_at":"2026-08-07T14:28:45.237082Z","title":"Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data","venue":"stat.ML","work_id":"9e581f58-c05d-4e52-a5c2-92a1bfa76911","year":2024},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.440171Z"},"links":{"cited_paper":"/paper/2403.11841","citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:4c98c3c24b02f71083a2366b533c49a9feaa7f2d22955d609169ad1dedc43654","observation_id":"4e0a3fd1-f9d0-489b-b201-af777aa3ddc5","resolution":{"observed_at":"2026-08-07T14:28:45.310256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:48.368178Z","title":"Qi, and R","venue":null,"work_id":"cc1d9a81-4e07-4659-84e5-98581b73fdfb","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.546569Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:2e12a1e4934d82edd2af8c7d5c667b7a401cab20d853388311eb1ad4c8eda7b7","observation_id":"6d058ed4-02a2-4e04-b0eb-43a14f154dea","resolution":{"observed_at":"2026-08-07T14:28:48.474622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:48.099753Z","title":null,"venue":null,"work_id":"c6d8a8df-e8e2-4f83-8fc8-f8ba55eb0707","year":1992},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.679055Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:adc4e3e70a07191a5be21cc37ea3361c7e34034b571e286097ef8a3e420f387e","observation_id":"7cae2f61-7ad1-4077-bb0a-b904cbc3f14c","resolution":{"observed_at":"2026-08-07T14:28:48.253023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:47.828053Z","title":null,"venue":null,"work_id":"6401345f-73d5-401c-850a-f05a62467d86","year":2024},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.762845Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:8e5a289ee775b0812a98f334210d00eb14051afd0ce3ac6c7c8b348d1fce4028","observation_id":"962e6983-c9b3-4fac-aea5-a0da3b4ca402","resolution":{"observed_at":"2026-08-07T14:28:47.968674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:47.582699Z","title":"Levine, and O","venue":null,"work_id":"8884f90c-2bf9-429f-a869-6d54cb898b98","year":2022},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.856847Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:74d4757f6c975b05e020ce0081e39324221fa5115366285308dc798b4b6da553","observation_id":"fc6ce3aa-8435-4594-931f-69aae7b9550d","resolution":{"observed_at":"2026-08-07T14:28:47.719874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:47.307883Z","title":null,"venue":null,"work_id":"0144b328-4822-4a02-9151-e8c5ebae1913","year":2021},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:43.964585Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:a711dc530925260a6cae99d54e721d411e1b544366b53f93c710baa276c12088","observation_id":"f1411628-f282-483f-9c5b-f0c5438c2cea","resolution":{"observed_at":"2026-08-07T14:28:47.451523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:47.067518Z","title":null,"venue":null,"work_id":"73416bd1-f8d8-4724-b9f4-fdfaa8eb4846","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:44.069549Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:ef85595eb589763875255cf37ed09b3bccb375914958e57e42b745e17f5ad735","observation_id":"754d8c1f-ca35-4a3f-9f49-208d97dfff2b","resolution":{"observed_at":"2026-08-07T14:28:47.186402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:46.823356Z","title":null,"venue":null,"work_id":"bf05a248-4cf0-4570-af13-237c9f21b366","year":2022},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:44.213152Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:799db32201ff2729f318ab0065258c4c10ec6be06cf1b8fbdcb28690e9bfa510","observation_id":"9e8d988d-f8f7-49c2-96f3-c00efc09b07e","resolution":{"observed_at":"2026-08-07T14:28:46.935926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:46.622750Z","title":"Kumar, Y","venue":null,"work_id":"e8c92927-c763-4a8f-813c-a683ca48f179","year":2022},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:44.284209Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:0b3cc72aace8af64588d9c207cc189a060bf321243a768d199c76f9ea27cdb58","observation_id":"4c0f40ec-c9d1-432f-9589-555eb41acd2d","resolution":{"observed_at":"2026-08-07T14:28:46.724458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:46.387627Z","title":"Thomas, L","venue":null,"work_id":"2656ca33-8bc7-4e0c-b6ed-08ad014046d1","year":2020},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:44.392273Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:db80014a585a7c2a6fa5f6111bb598d300d08d8276d5ccc7b6d49ac30c95f364","observation_id":"f8dbd09d-c964-4f72-bdec-041b23118a72","resolution":{"observed_at":"2026-08-07T14:28:46.490758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:46.174640Z","title":null,"venue":null,"work_id":"6e76c2fa-b1d4-454b-b4d7-e2cbbc67e3d0","year":2019},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:44.518642Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:ec0b7051274762396e64cbd1c72695b22312d8b060e607d3e05d32f8a22d52a8","observation_id":"8dd568f2-ae44-4cc2-a1d3-cabb155ed5e6","resolution":{"observed_at":"2026-08-07T14:28:46.272248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:44.635383Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:44.635383Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:3a0878864a397c686c642946e2fe5d59943df9eaa8d82cee23a4bb6a81db1d2c","observation_id":"24c7a0c3-6138-41dd-9dd2-301c39ff353f","resolution":{"observed_at":"2026-08-07T14:28:44.635383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:45.923948Z","title":null,"venue":null,"work_id":"86d3cdfa-474a-4aab-a132-324c5830139d","year":2024},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:44.780597Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:423df66ed15fbd7c1406b9fa0cb0d3600c0ef5c3bafd5a923a19540f4e8e4536","observation_id":"65d115b8-b914-4359-9b1d-5a742998bc2c","resolution":{"observed_at":"2026-08-07T14:28:46.040662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:45.692432Z","title":"Zhu, and A","venue":null,"work_id":"86fad71b-9ee8-4676-b088-0660b3bbb596","year":2024},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:44.917322Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:6a9594f2cf401e98664314ccafd4d92959a9c10b0ace20b5aa854e1bd367f62d","observation_id":"1f167cd3-1a22-4a72-97a8-3af97810b653","resolution":{"observed_at":"2026-08-07T14:28:45.815329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:45.483925Z","title":null,"venue":null,"work_id":"18c1dfcb-cb25-4410-a6b7-b30601af41f3","year":2023},"citing_paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:28:45.036484Z"},"links":{"citing_paper":"/paper/2505.19002"},"observation_digest":"sha256:1436ce8b4020e65ec4e69b23ee10293a8b8b06471841b15beaa510df5d375cd4","observation_id":"60538fa8-48c7-4515-967f-93c138b3bb16","resolution":{"observed_at":"2026-08-07T14:28:45.571579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19002","last_updated":"2025-05-25T06:47:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:19:44.954656Z","submitted_at":"2025-05-25T06:47:36Z","title":"Semi-pessimistic Reinforcement Learning"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.19002."}