{"as_of":"2026-08-08T06:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7054efc4326175543628c417d18adb844bdce91410f6f0a53f8e1b9a99a5236","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:22:27.653919Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08417/citation-record","integrity":"/paper/2506.08417/integrity","json":"/paper/2506.08417/citation-record.json","paper":"/paper/2506.08417"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:23.652759Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.652759Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:e879946262bf0723e7b72302cdd151f327c95cfaabd403409bbbb217851100da","observation_id":"b2727ca4-f5f9-430c-bae1-d53ed89ade7b","resolution":{"observed_at":"2026-08-07T05:22:23.652759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:23.687083Z","title":"Uncertainty-based offline reinforcement learning with diversified q-ensemble","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.687083Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:f518e9acc2b7934cec120799f9cb6baa5c5c6f346e94790c4c0fa0e7bfcf5657","observation_id":"04f87bd3-0ea1-41e8-bf93-3fa6826f2fb7","resolution":{"observed_at":"2026-08-07T05:22:23.687083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.621878Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"dc0e37e3-d299-4174-bb3a-4728c5581397","year":2008},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.746503Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:6870fa0d0926d18e65bc12ac4f112bacde0e3e35d41fc63f9e2e91a82cb3ea14","observation_id":"b62d4df3-f0fa-4a6b-9e96-2a1417d4dbb4","resolution":{"observed_at":"2026-08-07T05:22:28.626467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.606682Z","title":"Manifold topology divergence: a framework for comparing data manifolds","venue":null,"work_id":"9b3d17b8-b6ba-48dd-ac2b-4c7c93879462","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.776646Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:423debf0f7d361c98ec7137a75d3a7b152b195beea9307fef27fa18bd8e7b631","observation_id":"0012dfda-f904-4179-9f74-4956d0a95440","resolution":{"observed_at":"2026-08-07T05:22:28.611573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:23.848799Z","title":"Laplacian eigenmaps and spectral techniques for embedding and clustering","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.848799Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:b518fc456d5a2318c5dbc2331bdc58dac96ba979f9957ee69fe50715b19c9120","observation_id":"77245729-e20d-448a-8673-a1ab89bc83d5","resolution":{"observed_at":"2026-08-07T05:22:23.848799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12173","last_updated":"2019-10-31T14:38:51Z","snapshot_observed_at":"2026-08-05T03:57:38.412174Z","submitted_at":"2019-05-29T01:49:32Z","title":"On the Inductive Bias of Neural Tangent Kernels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12173","snapshot_observed_at":"2026-08-07T05:22:23.919649Z","title":"On the inductive bias of neural tangent kernels, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.919649Z"},"links":{"cited_paper":"/paper/1905.12173","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:efb5d59fbd35d35cf1c133eb786b744f880bad9865aeb227d9cdc846940caa99","observation_id":"ad686d95-9820-434d-8f85-954a04ad2cb1","resolution":{"observed_at":"2026-08-07T05:22:23.919649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.581774Z","title":"Flows for simultaneous manifold learning and density estimation","venue":null,"work_id":"baf1bc7b-3159-4c9a-8c4e-953fb853dc6f","year":2020},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:23.989185Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:39dd2869a96ca6eba148a2daf8afdebb075beb587344ae6c190eadbf9489031a","observation_id":"77b6dbda-ac72-4049-bbe7-f8caf6c48683","resolution":{"observed_at":"2026-08-07T05:22:28.586125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T05:22:24.040414Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.040414Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:290c5be182ef44c468547f18ad3c96b876ab846b7c955612f5511429edcc56a0","observation_id":"36370ff4-c1f4-4016-bb26-f32426d32543","resolution":{"observed_at":"2026-08-07T05:22:24.040414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:24.097958Z","title":"Bail: Best-action imitation learning for batch deep reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.097958Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:c3acf359a93352d008490c6346972352e7c8cd012088e396796a88827c943d3e","observation_id":"edfe8984-2ac4-41d4-864d-aa29aaf70d34","resolution":{"observed_at":"2026-08-07T05:22:24.097958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.557200Z","title":"Diffusion maps","venue":null,"work_id":"81642674-3023-456c-8634-be9bb9252242","year":2006},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.181646Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:88a97da8443f763d2d9efeebce468b3fcd1efc86373b38ae16246b7e4c61a38e","observation_id":"c13f2ac5-941f-4bbc-ae58-d7ee4c981374","resolution":{"observed_at":"2026-08-07T05:22:28.561407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.542676Z","title":"Pink noise is all you need: Colored noise exploration in deep reinforcement learning","venue":null,"work_id":"c62939dc-c0e0-4331-bbaf-f7058cb91092","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.256430Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:25f3151172d4ea2217a36045172d2275a71bfc1a6c51d06718a0d64e6abe80a1","observation_id":"46b1f972-6798-496f-a2c9-70fe477b9e2a","resolution":{"observed_at":"2026-08-07T05:22:28.547034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:24.311145Z","title":"D4rl: Datasets for deep data-driven reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.311145Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:9c1e16bc0e477741e749c9e5a1b8dd140e22523f863e91f316e4f191e6b2ea34","observation_id":"e57d3fa9-29c9-4044-89e8-69d03c6d1aef","resolution":{"observed_at":"2026-08-07T05:22:24.311145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.517954Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":"5b0349fe-9f8b-4981-8036-365607b8daa3","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.363317Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:5b34a4e59512fc243dacf8f6b175eb62ecae0cb0b88bb6784c35dd49376815c2","observation_id":"7ae79ce4-115e-4677-9086-b1f6e9c8af6d","resolution":{"observed_at":"2026-08-07T05:22:28.522372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.503352Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"a43ed46c-b5f4-40f5-8891-17bbd6478998","year":2019},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.417323Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:291bdc0f8f06491810a8ec4d4b871d217c92c981fd9aa0220fd3b1dc030a9b11","observation_id":"423edc72-3bbc-4e63-a4cb-c285062e1a18","resolution":{"observed_at":"2026-08-07T05:22:28.507852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.488454Z","title":"Learning rankings via convex hull separation","venue":null,"work_id":"8dd444fb-2b9e-4ce6-a6e5-9de40134c175","year":2005},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.490677Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:4a3588ae68daf4196fee06fb9f03a98f4c80c6602353f50be24af4483cf3edac","observation_id":"01b87718-6770-47eb-be7a-7a426b0c7700","resolution":{"observed_at":"2026-08-07T05:22:28.493119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T05:22:24.560434Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.560434Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:094dee5e9061c69d58aacfda56ddd5e0ffae830ce30676d6969b2e2c426a2016","observation_id":"14dd046c-95d9-4c78-9362-9a3b7e400315","resolution":{"observed_at":"2026-08-07T05:22:24.560434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00321","last_updated":"2024-03-16T01:29:08Z","snapshot_observed_at":"2026-07-06T15:36:19.023553Z","submitted_at":"2023-06-01T03:36:06Z","title":"Improving Offline RL by Blending Heuristics","version":2},"cited_work":{"arxiv_id":"2306.00321","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00321","snapshot_observed_at":"2026-08-07T05:22:28.055756Z","title":"Improving Offline RL by Blending Heuristics","venue":"cs.LG","work_id":"ec77ff87-37c4-4c6c-9e70-1f1a3e5e65ff","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.609399Z"},"links":{"cited_paper":"/paper/2306.00321","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:03aa9d6950508c6075b91217d18224b5b30a7d3ba7a2d5f52e56d4254b67e62b","observation_id":"0762145d-4da6-4aea-8d80-90ebb6106a89","resolution":{"observed_at":"2026-08-07T05:22:28.060732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.473449Z","title":"Why so pessimistic? estimating uncertainties for offline rl through ensembles, and why their independence matters","venue":null,"work_id":"4b5e6cc1-641e-4d33-9857-8414e839f233","year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.668798Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:125f9938cad17a1ab5361a71961a50c6de344f8d3122dcb3c16883addb218b8a","observation_id":"5c018bd8-872b-4025-8e05-9254dd4f0ef2","resolution":{"observed_at":"2026-08-07T05:22:28.478149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:24.748337Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.748337Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:8eff622ce5bc629177ec81eabd97aa678b37d537dd93b840e5c6cc0d11bc2c7f","observation_id":"4e505ac3-d422-4752-b19e-2ae4a178802b","resolution":{"observed_at":"2026-08-07T05:22:24.748337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.447152Z","title":"Random projections for manifold learning","venue":null,"work_id":"0d4b37f4-76a1-4d34-b85e-0bd6f511581f","year":2007},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.810006Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:644875e511312757af0dbde2145abae03397b384868efeb4996ef75f28cfed70","observation_id":"087f99af-5649-49de-bd47-2c2e0f950ff8","resolution":{"observed_at":"2026-08-07T05:22:28.451972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.432100Z","title":"Beyond uniform sampling: Offline reinforcement learning with imbalanced datasets","venue":null,"work_id":"7002147b-2a3a-44b6-994c-1f772de1fb79","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.868522Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:d7ecb341f98030819b1cdcc03264308c40b62ee6e69626a2d1ff1c874b694a65","observation_id":"f174c80b-b129-4129-8507-7b5ac451a2dd","resolution":{"observed_at":"2026-08-07T05:22:28.436324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.417611Z","title":"Mild policy evaluation for offline actor--critic","venue":null,"work_id":"94dfa7f4-b849-460e-8f2e-368ac75163cb","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.941158Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:191ddb8202678d51f93cfcc0c8e199a94897c29c7772b1305054d165e1bb7f47","observation_id":"7483e25c-d457-4a7d-85ad-9f0c26e589c7","resolution":{"observed_at":"2026-08-07T05:22:28.421916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07572","last_updated":"2020-02-10T08:39:09Z","snapshot_observed_at":"2026-07-30T19:50:14.167277Z","submitted_at":"2018-06-20T06:35:46Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07572","snapshot_observed_at":"2026-08-07T05:22:25.087828Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.087828Z"},"links":{"cited_paper":"/paper/1806.07572","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:20ff568fdfd27527fb372f4447e166512229a75975cb7e9a1dbcbb1eb9f0b45a","observation_id":"bb277ef5-c440-4243-8801-ae2ca4e47a57","resolution":{"observed_at":"2026-08-07T05:22:25.087828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.403148Z","title":"A convex hull-based data selection method for data driven models","venue":null,"work_id":"475d3d72-212e-4814-b37f-d9421f3cb298","year":2016},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.188248Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:9d8debb68b1ddfb65861ed75b4637d6a8dd94d9cba6ff60197335a77e05d0653","observation_id":"0971bad8-7bec-440e-91f0-f6a9c4586f28","resolution":{"observed_at":"2026-08-07T05:22:28.407761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T05:22:25.300203Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.300203Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:5a8b599be3470a3ad058aa98f6b7b68b1ea880ad385f4d3a8ce6a7732cf515d1","observation_id":"b435e2c8-7c51-4615-a19b-45bfc93b67ce","resolution":{"observed_at":"2026-08-07T05:22:25.300203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.388227Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":"744591c3-ad3e-478f-9328-9603a3e34e35","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.361489Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:614beb54d600b77ac74015e94731313eca8c123635715764afcad151ba647c05","observation_id":"b4ac79f4-d8d5-4a13-8266-8afc8aabe59c","resolution":{"observed_at":"2026-08-07T05:22:28.392898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T05:22:25.460008Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.460008Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:8372743802c4e563926c8fde19f55a370a58b978fb6a385a6db762afc408a308","observation_id":"2796467c-3a3c-4708-a2c5-91d74746154e","resolution":{"observed_at":"2026-08-07T05:22:25.460008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.373570Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"3105225a-13ce-4581-a05a-25f0a0c53936","year":2019},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.549357Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:f8dfb9d3ca7bb3d72618c7bde03cddca440087393b853f9f1f38a5ed80500b19","observation_id":"950a4f7b-b3a5-4673-bf86-e4a380591bf4","resolution":{"observed_at":"2026-08-07T05:22:28.377984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:25.669895Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.669895Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:81f41fba551a8ecb5734fcd84ac404456a354251c84c594918270f45130663de","observation_id":"7acef59d-6aa9-4981-9cec-af33d8400982","resolution":{"observed_at":"2026-08-07T05:22:25.669895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18792","last_updated":"2024-05-29T06:17:33Z","snapshot_observed_at":"2026-07-06T18:21:48.356478Z","submitted_at":"2024-05-29T06:17:33Z","title":"Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies","version":1},"cited_work":{"arxiv_id":"2405.18792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18792","snapshot_observed_at":"2026-08-07T05:22:27.987495Z","title":"Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies","venue":"cs.LG","work_id":"80053d78-624a-4ed1-9b65-4f90e8414819","year":2024},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.764096Z"},"links":{"cited_paper":"/paper/2405.18792","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:3cb9167f14fb9582fcfde12e32fd346b8357c6f5e8eb4e19f780fd719f4a04d9","observation_id":"8b551c13-6061-4f88-90c0-b6a1620cb95d","resolution":{"observed_at":"2026-08-07T05:22:27.992371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11027","last_updated":"2023-02-08T09:12:47Z","snapshot_observed_at":"2026-07-06T13:12:39.361042Z","submitted_at":"2022-05-23T04:01:11Z","title":"When Data Geometry Meets Deep Function: Generalizing Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2205.11027","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.11027","snapshot_observed_at":"2026-08-07T05:22:27.965503Z","title":"When Data Geometry Meets Deep Function: Generalizing Offline Reinforcement Learning","venue":"cs.LG","work_id":"6a8eed76-15cf-4115-b03b-f47294ca37b6","year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.844016Z"},"links":{"cited_paper":"/paper/2205.11027","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:267f53ce0609aa1bf89903219bb0d9bbe58375374c16b4f59dd59d6b5eefe67b","observation_id":"7a30ff04-8ad2-4ad5-a2df-3330feda9fd5","resolution":{"observed_at":"2026-08-07T05:22:27.971229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.347674Z","title":"Mildly conservative q-learning for offline reinforcement learning","venue":null,"work_id":"d03d1800-6786-491b-b19b-e4952e319181","year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:25.916094Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:88670bd29f362ecfd816ed140c1818ed4e86e8981ee0a9c14616e4b74a8555b1","observation_id":"258495b4-b0ff-4cb4-99e9-f73d6b6800dc","resolution":{"observed_at":"2026-08-07T05:22:28.352784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03807","last_updated":"2024-02-21T05:24:37Z","snapshot_observed_at":"2026-08-04T04:38:39.414048Z","submitted_at":"2024-02-06T08:48:01Z","title":"SEABO: A Simple Search-Based Method for Offline Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03807","snapshot_observed_at":"2026-08-07T05:22:26.045813Z","title":"Seabo: A simple search-based method for offline imitation learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.045813Z"},"links":{"cited_paper":"/paper/2402.03807","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:ad7835391ac8a3dfcc3e9af635b770965e7cadeadf8e2eaab97481be3a31f11a","observation_id":"b067009a-5214-4801-85fc-419e7b097027","resolution":{"observed_at":"2026-08-07T05:22:26.045813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.332790Z","title":"On the role of general function approximation in offline reinforcement learning","venue":null,"work_id":"18019179-da49-4654-b4a8-fbee22192e19","year":2024},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.115252Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:090034520d670e7ba6d5b2dff87c46661e86acfcbaf975cfa8c3212404e14378","observation_id":"1196c970-65f4-4ac2-8829-4bdcd0bce33a","resolution":{"observed_at":"2026-08-07T05:22:28.337075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.318295Z","title":"Machine learning algorithm based on convex hull analysis","venue":null,"work_id":"93a98a34-c312-4a97-a5cd-be913b9f98de","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.203111Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:211cff6329d5b3aa3b8604c1d1c2a38e1d2041b0fa6fdbfd6da6f3ca39e0fc8e","observation_id":"3d6c7838-3c2c-4f35-874e-6992398433af","resolution":{"observed_at":"2026-08-07T05:22:28.322758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.00215","last_updated":"2017-06-13T15:54:51Z","snapshot_observed_at":"2026-08-01T16:32:31.584735Z","submitted_at":"2016-07-01T11:58:28Z","title":"Why is Posterior Sampling Better than Optimism for Reinforcement Learning?","version":3},"cited_work":{"arxiv_id":"1607.00215","doi":null,"metadata_source":"pith","pith_arxiv_id":"1607.00215","snapshot_observed_at":"2026-08-07T05:22:27.927982Z","title":"Why is Posterior Sampling Better than Optimism for Reinforcement Learning?","venue":"stat.ML","work_id":"68b5a2e7-bb24-47aa-b17b-e92d37a6f2d1","year":2016},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.273819Z"},"links":{"cited_paper":"/paper/1607.00215","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:627edd08fc2f68d94c97404a475c26f7f60850e6b3d5dc0b2451a1b118e73ffc","observation_id":"44f94f89-08f2-41ca-be92-788441ea4c08","resolution":{"observed_at":"2026-08-07T05:22:27.932706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T05:22:26.320316Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.320316Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:5155c20a20b30a261abb8edb2cda2398345ee72c78e66d82fda48d8f1d2730e4","observation_id":"e3c0c889-bdd8-436e-ba64-193c5f90571d","resolution":{"observed_at":"2026-08-07T05:22:26.320316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-07-06T06:01:51.192687Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-07T05:22:26.393335Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.393335Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:7aeb45524da811eb514be5ac7ba3a82f9a838c7e38af8667e2aa5610dd79af96","observation_id":"4fbc39b4-afb8-4167-9a6f-cd1fdce17504","resolution":{"observed_at":"2026-08-07T05:22:26.393335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.303813Z","title":"Policy regularization with dataset constraint for offline reinforcement learning","venue":null,"work_id":"499550f7-eaab-454d-89c9-ddb37c297225","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.477113Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:95281ccb2192ed5c9fbc25aeef59878e493930da6b52f0b7abd3b2b07dc84148","observation_id":"87e71b41-e966-446e-9f88-910d9bf76560","resolution":{"observed_at":"2026-08-07T05:22:28.308226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.289579Z","title":"Nonlinear dimensionality reduction by locally linear embedding","venue":null,"work_id":"f1de8f51-5a0c-42ab-af05-0af91b155843","year":2000},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.530029Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:8d8aaf21e2165185de5ddcc615be7cb0b6e15c23fa4ded0efb3e26ea29752346","observation_id":"1e868df6-a8bb-44bf-9b57-e2a19a62e438","resolution":{"observed_at":"2026-08-07T05:22:28.293800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.275440Z","title":"A dataset perspective on offline reinforcement learning","venue":null,"work_id":"bb13683d-b9c1-4dd6-b386-cd487b9a4785","year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.572723Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:b0735faa279519dfc98fea5e5dcb6e53cb18a355b95fd52553e6b07794b5ce80","observation_id":"e2562a35-92bd-4490-8447-166d9e165625","resolution":{"observed_at":"2026-08-07T05:22:28.279695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07747","last_updated":"2023-10-27T16:23:43Z","snapshot_observed_at":"2026-08-06T19:38:26.611740Z","submitted_at":"2023-10-11T17:20:32Z","title":"Accountability in Offline Reinforcement Learning: Explaining Decisions with a Corpus of Examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07747","snapshot_observed_at":"2026-08-07T05:22:26.632916Z","title":"Accountability in offline reinforcement learning: Explaining decisions with a corpus of examples, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.632916Z"},"links":{"cited_paper":"/paper/2310.07747","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:742253b3211204ad2ee46d1d73f4db175d672ad9e282442cbad3739a9487604c","observation_id":"5c6daea8-bc9b-4774-9770-09b969caaafe","resolution":{"observed_at":"2026-08-07T05:22:26.632916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:26.731486Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.731486Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:b9ff5bd0c391302535398f09cd581ce6c7feb88cdadd474cf9b7863ebe6b5e8a","observation_id":"be1e0c20-24d3-4c46-9125-6725309df06d","resolution":{"observed_at":"2026-08-07T05:22:26.731486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.248856Z","title":"A global geometric framework for nonlinear dimensionality reduction","venue":null,"work_id":"e06960c2-0ef6-412c-aa43-09e0d4194b17","year":2000},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.777449Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:30261bb3d1dfaf6b84e926d92245e0de8d705a15a995ee664b15469f91583355","observation_id":"bdf784a3-85fc-4a18-a1b8-10cce6db4427","resolution":{"observed_at":"2026-08-07T05:22:28.254341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:26.818469Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.818469Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:34d76b1c9a900816a9f343d6ec5c5c65c0ed3af88dd01a0245675d5533a29771","observation_id":"c3550023-30a5-4f75-860e-b65b43c43a7e","resolution":{"observed_at":"2026-08-07T05:22:26.818469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.233451Z","title":"Adaptive manifold learning","venue":null,"work_id":"8138a8e3-bc2a-42d8-b937-d84f8f2ae552","year":2004},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.909702Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:1898563fc95163c534445285c66b7abf7b59cd36d358c9b37bf1371b449933a3","observation_id":"97666142-1f76-4ba5-8747-d477965e14a5","resolution":{"observed_at":"2026-08-07T05:22:28.237822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.219092Z","title":"Improving generalization in reinforcement learning with mixture regularization","venue":null,"work_id":"aff7b514-e13b-4068-b36e-7659842aab8d","year":2020},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.975185Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:974faa36ab17430ac6afa0cd1df449703d6f76587998215c8894490d4f135e81","observation_id":"c32c712c-f7b1-4f43-826c-ec7805ae0790","resolution":{"observed_at":"2026-08-07T05:22:28.223654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.204607Z","title":"Exponentially weighted imitation learning for batched historical data","venue":null,"work_id":"a0463146-5a24-44f9-9c70-12c52fb6d222","year":2018},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:26.993358Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:1cad423bf6ae077fc249839b077ecb402df9b3afcaeece771ae711df5289ecc8","observation_id":"6b0d68aa-5d91-45a0-872b-69df93598980","resolution":{"observed_at":"2026-08-07T05:22:28.209242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T05:22:27.055708Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.055708Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:4edc2b2415acd3c3e6d7cf858c45e546bcee1b9998349e844e0644e97d80eac6","observation_id":"77c722db-48ec-49f6-b92f-dfe28046357c","resolution":{"observed_at":"2026-08-07T05:22:27.055708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.190123Z","title":"Zeta hull pursuits: Learning nonconvex data hulls","venue":null,"work_id":"c73d7a8f-1599-4e5b-bde0-c562cc3b64a5","year":2014},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.159787Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:6455508293effb381bbf3fd32ba0d84bdb95036b4d0daff8409748c6869c058c","observation_id":"fbb913a5-e59d-418c-a15d-31470aad2381","resolution":{"observed_at":"2026-08-07T05:22:28.194510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.175461Z","title":"Uncertainty svm active learning algorithm based on convex hull and sample distance","venue":null,"work_id":"020795fb-3191-47f1-8a07-09bd8fc54216","year":2021},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.217496Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:01d51a0027e98281c9e198fefe85fed4e308848845085bcfe255a0e7a4f728e3","observation_id":"45f17633-9104-4ffd-9565-f2fa0d64e7c0","resolution":{"observed_at":"2026-08-07T05:22:28.179977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15810","last_updated":"2023-03-28T08:30:01Z","snapshot_observed_at":"2026-08-07T20:04:10.608391Z","submitted_at":"2023-03-28T08:30:01Z","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15810","snapshot_observed_at":"2026-08-07T05:22:27.299725Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.299725Z"},"links":{"cited_paper":"/paper/2303.15810","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:0fb8ce99ad94c5173a29f53adac435410a66c86c40fe54936d4c294abdca9bb2","observation_id":"a73e2a5f-1b28-4238-8d50-5f4e3eb823c2","resolution":{"observed_at":"2026-08-07T05:22:27.299725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:27.402534Z","title":"Rorl: Robust offline reinforcement learning via conservative smoothing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.402534Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:1d88caf2d738c9a76640ea4598b5b0e2954de6c86a17785a42ed61e4d1b72360","observation_id":"29ef1edb-2f09-4290-8ace-a5f42f6e7ef8","resolution":{"observed_at":"2026-08-07T05:22:27.402534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12955","last_updated":"2024-03-09T17:46:44Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:54:39Z","title":"Towards Robust Offline Reinforcement Learning under Diverse Data Corruption","version":3},"cited_work":{"arxiv_id":"2310.12955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12955","snapshot_observed_at":"2026-08-07T05:22:27.692509Z","title":"Towards Robust Offline Reinforcement Learning under Diverse Data Corruption","venue":"cs.LG","work_id":"2f8a575f-a893-4163-887a-20f30d801211","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.451131Z"},"links":{"cited_paper":"/paper/2310.12955","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:15ec4174b52b19c573afbbeec35c558b4feaa12ce86cd1a44e091d7aee4682ca","observation_id":"a42cc906-eef6-49be-9a4f-edf5155a047b","resolution":{"observed_at":"2026-08-07T05:22:27.698977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:28.149999Z","title":"In-sample actor critic for offline reinforcement learning","venue":null,"work_id":"6a73fe35-0def-43f7-bcfd-9b76dd1cc576","year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.547421Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:747970d8177926f9fe260f18fe6cfea271a6972474148a1021c066ca850e5a43","observation_id":"a0d3b574-9bee-46ee-8dc8-2945e3a3ccb4","resolution":{"observed_at":"2026-08-07T05:22:28.154600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:27.644839Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.644839Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:d25484c4b5f73c54ce61e3ecd9112723614ba472348b1584a0a70cdb5d886741","observation_id":"2572a492-724e-4fa6-94af-d2a55b0b8b92","resolution":{"observed_at":"2026-08-07T05:22:27.644839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:27.649510Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.649510Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:eb336c7890613d76740b005f5bc55fd4f0487e5d1868091da6c6b692941245d7","observation_id":"772415cc-6c2a-46be-9dac-6ee889b10779","resolution":{"observed_at":"2026-08-07T05:22:27.649510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:27.653919Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:27.653919Z"},"links":{"citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:fb606967d7b4e8c503bd0ab29bbc7cd54388014dd9e216a8a108331496e7b47e","observation_id":"9b3481cc-3210-418a-a671-83b889d1099b","resolution":{"observed_at":"2026-08-07T05:22:27.653919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":5,"verified_fuzzy":28},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2506.08417."}