{"as_of":"2026-08-05T17:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40aea47f2462841ac26585529e0ab087dcbd2938c2aae3e4eb0547ef1ae98343","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T15:19:21.367628Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:30:59.112579Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:1ed8905413d263018b03e5f758e64d69e2615d18ace87097e8195bf2377998ad","observation_id":"f23487c3-36f7-43bf-8abd-e58104d9bd1f","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:bd48baf68b019502b22b6aecd6100ccebc30dadc3fc740cf7531cb900bb65fa5","observation_id":"0917520c-e628-477f-b86c-b7c6188dbb71","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-07-06T11:15:20.397336Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T15:11:11.056013Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2106.01345"},"observation_digest":"sha256:bb40ce3da5ad85acdff761632d53fca37e9fcf5434c515ff7670a0c0fe66ea0d","observation_id":"765bef19-fcc1-489c-acba-1172f6b4b3f3","resolution":{"observed_at":"2026-05-18T15:11:11.319161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T08:51:55.826747Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2108.03298"},"observation_digest":"sha256:e516c9e8582e3ed0996bc9c90d207ead053203ae90d31b598db7e9b8f63b6440","observation_id":"75f85732-0c04-47a5-b31f-69d2ca963c83","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T08:47:05.621624Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2110.06169"},"observation_digest":"sha256:e8adb36314d77c746cb8cd1defb3221b8af491afac8645eaea8f5718bc865621","observation_id":"f64fabc1-1a1d-408c-bda8-03bc7021c3f7","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T07:55:15.678348Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2208.06193"},"observation_digest":"sha256:53676bc1b1d986f8cf32640fa614dbbc36046b28339a316480d66cc453030530","observation_id":"b5d510ac-e9e6-4f65-9da6-a99fdb5cef21","resolution":{"observed_at":"2026-05-15T07:55:15.772701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-05-15T15:35:10.593969Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2211.15657"},"observation_digest":"sha256:9ca074fb3bd4087c52a236f56f736f9614ebb0386cbc862c0bdea44c902e5722","observation_id":"e2be11f9-e0d6-47a7-bd22-195289c344a3","resolution":{"observed_at":"2026-05-15T15:35:10.764277Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T13:48:36.369334Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2304.10573"},"observation_digest":"sha256:cb0f41a536201e36559bc5f24684ae42efd77ffa53dc82c9237edcd56402ca75","observation_id":"55ee2c2c-377b-40b0-b152-b073598958a3","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2502.16156","last_updated":"2025-02-22T09:17:02Z","snapshot_observed_at":"2026-07-06T20:40:57.414593Z","submitted_at":"2025-02-22T09:17:02Z","title":"A Review of Causal Decision Making","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T02:47:21.582667Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2502.16156"},"observation_digest":"sha256:169bd46e36fd3e3ee41902644bcb62a61ec07c06ea6935bcbc399f4c7970fc78","observation_id":"806917f9-2128-4109-904b-6806ed8b63a9","resolution":{"observed_at":"2026-05-23T02:47:26.303995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2504.11944","last_updated":"2026-05-13T09:05:56Z","snapshot_observed_at":"2026-07-06T21:10:18.015145Z","submitted_at":"2025-04-16T10:23:44Z","title":"VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T19:34:33.263674Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2504.11944"},"observation_digest":"sha256:e20961c2e38d382213bb7f2667d8ef2181b2179a44007b38b5caec12e8728be8","observation_id":"42d5572d-c0b5-4403-b4d6-6f933d934507","resolution":{"observed_at":"2026-05-22T19:35:03.974431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T10:30:59.112579Z","title":"Behavior regularized offline reinforcement learning,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2509.19305","last_updated":"2026-06-02T14:25:30Z","snapshot_observed_at":"2026-08-05T10:30:58.593853Z","submitted_at":"2025-09-04T08:50:31Z","title":"Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:30:59.112579Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2509.19305"},"observation_digest":"sha256:d55e46163ba3139d91f8bfd935752f1e432a39839fc01ebda26174f6c5d8068b","observation_id":"08129b76-4f33-4ed9-9afa-a22c420908cf","resolution":{"observed_at":"2026-08-05T10:30:59.112579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2510.01479","last_updated":"2026-05-17T15:36:55Z","snapshot_observed_at":"2026-07-06T22:31:24.978726Z","submitted_at":"2025-10-01T21:43:04Z","title":"Density-Ratio Weighted Behavioral Cloning: Learning Control Policies from Corrupted Datasets","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T20:52:08.062450Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2510.01479"},"observation_digest":"sha256:142cee33bde91ef8c1036408158bfc2cd5b6c1c210fc1cbf935cd1e7f3eef800","observation_id":"1efc85fd-624a-4372-92a4-6a50001a3ea7","resolution":{"observed_at":"2026-05-21T20:54:21.643027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-04T11:01:34.967200Z","title":"Behavior regularized offline reinforcement learning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:34.967200Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:5d4804d14447842afee8b26bf841c45b72261d9564cc0ffc2a7f050f95ede434","observation_id":"495b7b13-f15e-4645-9999-fe494460d8c4","resolution":{"observed_at":"2026-08-04T11:01:34.967200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-04T10:14:00.316126Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2510.11499","last_updated":"2026-05-28T16:00:13Z","snapshot_observed_at":"2026-08-05T05:04:04.042581Z","submitted_at":"2025-10-13T15:06:28Z","title":"Offline Reinforcement Learning with Generative Trajectory Policies","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T10:14:00.316126Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2510.11499"},"observation_digest":"sha256:5d0ebb694707aa1dbac36a58ba38bc948863a05bb1b8ffb7150db936cb87ae06","observation_id":"dbe55e0d-a0ad-4698-8b26-ff4c518e443e","resolution":{"observed_at":"2026-08-04T10:14:00.316126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-03T13:18:31.749822Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-03T13:18:24.988636Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.749822Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:7114b33eea76b14e7a826f4d35b3ea38db450b74b06ff6e577f1479f6a72d3a7","observation_id":"f66d2dca-4c80-467d-9ed9-11657ba88217","resolution":{"observed_at":"2026-08-03T13:18:31.749822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-03T00:05:19.900233Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.12107","last_updated":"2026-06-07T03:40:44Z","snapshot_observed_at":"2026-08-03T19:35:11.911054Z","submitted_at":"2026-02-12T15:59:42Z","title":"On the Complexity of Offline Reinforcement Learning with $Q^\\star$-Approximation and Partial Coverage","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T00:05:19.900233Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2602.12107"},"observation_digest":"sha256:3696272465ae341e2733810a439cd6b465e3599551e6b8f736a73456091ebd4c","observation_id":"933b222c-37b7-4b28-82b9-de8b415aa0f3","resolution":{"observed_at":"2026-08-03T00:05:19.900233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-02T20:01:01.373185Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.00374","last_updated":"2026-06-25T19:26:06Z","snapshot_observed_at":"2026-08-02T20:00:56.048666Z","submitted_at":"2026-02-27T23:24:02Z","title":"Conservative Equilibrium Discovery in Offline Game-Theoretic Multiagent Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T20:01:01.373185Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2603.00374"},"observation_digest":"sha256:ce7d9a90c67b38b73a9ef9582305191c58dc65ffaf124714bf41319489aeffba","observation_id":"824c354f-8c00-4d96-9370-37f55efa3522","resolution":{"observed_at":"2026-08-02T20:01:01.373185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2604.06497","last_updated":"2026-04-07T21:58:09Z","snapshot_observed_at":"2026-07-06T22:54:57.597183Z","submitted_at":"2026-04-07T21:58:09Z","title":"Hyperfastrl: Hypernetwork-based reinforcement learning for unified control of parametric chaotic PDEs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T18:09:00.155657Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2604.06497"},"observation_digest":"sha256:249085384936539c8cdcba40ca5a97e06d9e6cb1febe3be715ab6316abd94beb","observation_id":"84689829-318c-4648-9085-d67229a035e0","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2604.23360","last_updated":"2026-04-25T16:03:54Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T16:03:54Z","title":"Learning from Demonstration with Failure Awareness for Safe Robot Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T07:50:54.065679Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2604.23360"},"observation_digest":"sha256:55593a747255e0dc82ef68917e0276d4a17c3b3b1b33c1f11682c1e0868c7df8","observation_id":"148c999e-caa3-4570-8e21-210598083330","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.00264","last_updated":"2026-05-18T00:34:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T21:58:16Z","title":"Pessimism-Free Offline Learning in General-Sum Games via KL Regularization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T20:10:30.920114Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.00264"},"observation_digest":"sha256:9ecb3591ee8ceb417f3c7f58076a31a8dde38d94f515dbe1df77b55f6fd55ed4","observation_id":"a99306da-60fc-411c-afc1-e3b49488e233","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.00264","last_updated":"2026-05-18T00:34:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T21:58:16Z","title":"Pessimism-Free Offline Learning in General-Sum Games via KL Regularization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-20T23:34:21.091472Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.00264"},"observation_digest":"sha256:ac32938f45d00249a9e8106999eea7d1b6ed3d57d1154c9348b2358161a5fcaa","observation_id":"932a20a2-733b-4978-8583-627793babb59","resolution":{"observed_at":"2026-05-20T23:39:13.528272Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.00268","last_updated":"2026-05-18T00:32:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T22:04:34Z","title":"Fast Rates in $\\alpha$-Potential Games via Regularized Mirror Descent","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-09T19:27:15.002190Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.00268"},"observation_digest":"sha256:3c7710c64b16be29941885f82c535617da5a0d7e2ec271b8c1530800f2497b90","observation_id":"5616167d-c061-4e09-9067-bd1e7576691a","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.00268","last_updated":"2026-05-18T00:32:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T22:04:34Z","title":"Fast Rates in $\\alpha$-Potential Games via Regularized Mirror Descent","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-21T00:38:53.592229Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.00268"},"observation_digest":"sha256:39db4b456efe4fd0375c310a08f251f4ff47272a4840f4015ce892cf29e44a59","observation_id":"183ef916-8b87-4981-a677-326678c5b139","resolution":{"observed_at":"2026-05-21T00:39:18.022793Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:8e98ccb3e8b8d3f9a0e86416c7f0afbd5eeb91bc99ae20fa1adc1afa7acefcf8","observation_id":"2726a3a4-e724-4d5b-bfce-d5b7edadcba8","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:8aaaa4f00c75879775095e22cd7602ff8ffb11aac9024f31edaffb4e9bcc5568","observation_id":"8f3af840-3e14-47c8-becb-804337b8e558","resolution":{"observed_at":"2026-07-01T00:45:11.401553Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.01862","last_updated":"2026-05-08T03:23:44Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T13:11:28Z","title":"QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL","version":2},"reference_index":204,"source":"arxiv_source","source_observed_at":"2026-05-11T01:17:48.643521Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.01862"},"observation_digest":"sha256:ba7db1b5dc609b52f4b821b33587237b755b4b98869785658b626502d3106fec","observation_id":"2e5f7374-7691-4479-9c16-8ad386480d2e","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.01968","last_updated":"2026-05-03T16:53:29Z","snapshot_observed_at":"2026-08-05T17:06:11.864759Z","submitted_at":"2026-05-03T16:53:29Z","title":"AdamO: A Collapse-Suppressed Optimizer for Offline RL","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-10T14:48:05.166453Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.01968"},"observation_digest":"sha256:c039a3f2fe1198f507d1454590742653e233e8f9f4c6182c1530eb58e8a12272","observation_id":"ec13c5f2-ae10-4ada-a735-c9dfeb071674","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.02112","last_updated":"2026-05-04T00:22:21Z","snapshot_observed_at":"2026-08-02T05:50:52.770878Z","submitted_at":"2026-05-04T00:22:21Z","title":"An adaptive variance estimator for relative sparsity","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-08T19:35:46.097113Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.02112"},"observation_digest":"sha256:7458fbd3859bd94a3a59ed8a14d5f06e2cfc4e75b41e7c7d1b4687646e6b2ab4","observation_id":"e6345ba4-7702-4554-aedb-c55b7c1c4fc5","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.02141","last_updated":"2026-05-04T01:46:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T01:46:35Z","title":"On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T19:35:59.832868Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.02141"},"observation_digest":"sha256:db4d3ff345dd72ef99b10babcf03d28845a030becc71b92b8270cf4e1ca0391f","observation_id":"a630e76f-3544-4f10-a1ca-e95a4bf528b4","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.05573","last_updated":"2026-05-07T01:36:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T01:36:27Z","title":"AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-08T05:23:18.294600Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.05573"},"observation_digest":"sha256:043b74c7c55eb64cd576322d109d22bb10329eda08820620c28f0a64c0043ea4","observation_id":"a946cab4-1297-4ad0-9968-c016734422f5","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.07727","last_updated":"2026-05-08T13:34:27Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T13:34:27Z","title":"Drifting Field Policy: A One-Step Generative Policy via Wasserstein Gradient Flow","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T02:16:36.302353Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.07727"},"observation_digest":"sha256:9071e5567f518216e56ba5dd3adc76eaba6787b4190d0eaa959050b3db12208c","observation_id":"aefdd0e6-76fd-42db-80cb-e9c752e84518","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.08202","last_updated":"2026-05-06T01:21:53Z","snapshot_observed_at":"2026-07-06T23:20:28.875586Z","submitted_at":"2026-05-06T01:21:53Z","title":"Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T02:17:25.783688Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.08202"},"observation_digest":"sha256:893dda85b4c9b5e4dbb5eb54eae71c8b772ab796c9ad7a63d5ec0ad6edfa1645","observation_id":"ffa3e126-e098-40bb-a5eb-f6fe201c8057","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.08450","last_updated":"2026-05-08T20:16:52Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:16:52Z","title":"Zero-shot Imitation Learning by Latent Topology Mapping","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T02:31:58.729048Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.08450"},"observation_digest":"sha256:5a9bafd97849e061338dfa8d50b5f18b3a8e24d1b568606fbedf3cf13348687d","observation_id":"63c5fded-be7b-4745-a725-c084af64f9b4","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T02:32:16.746824Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:da7eb1bbaa91eb95e95723b68fe8b968572245da1d483ecc6222f67318305c1e","observation_id":"3f3608e2-762a-4c0e-a06e-b4cf29459cf3","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T08:53:29.468764Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:8a7be03e92dc103958bbaeb211c2ae4fe3ae5539bd88e6bd9a617b827be1fa21","observation_id":"4362b89d-50ce-4625-8303-fd111d078b05","resolution":{"observed_at":"2026-05-21T08:54:05.781779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.12236","last_updated":"2026-05-12T15:07:04Z","snapshot_observed_at":"2026-08-03T01:51:28.024049Z","submitted_at":"2026-05-12T15:07:04Z","title":"TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T04:22:07.953637Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.12236"},"observation_digest":"sha256:ba1d387d6f976c86a7803deb8351c21eee9181548470be6e993269a63bc466cb","observation_id":"6116149f-7a80-43da-b934-5cfb98534174","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.12416","last_updated":"2026-05-12T17:12:29Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:12:29Z","title":"Aligning Flow Map Policies with Optimal Q-Guidance","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:04:22.603786Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.12416"},"observation_digest":"sha256:0609c046fa8a1c0f688b67564090b3f044d5dc0878e304d9dc517269150d8a68","observation_id":"6ec9c9ed-582a-4a7a-bb3b-a8a250fdf450","resolution":{"observed_at":"2026-05-13T15:19:21.456208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.13054","last_updated":"2026-05-13T06:23:51Z","snapshot_observed_at":"2026-07-06T23:24:42.799888Z","submitted_at":"2026-05-13T06:23:51Z","title":"Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T20:12:19.948073Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.13054"},"observation_digest":"sha256:2b3da947bf5d804adc535b69d026f946afd44be815275ad312a6d99cc1751a45","observation_id":"62492d95-73c1-4e21-92a5-883943d68e7e","resolution":{"observed_at":"2026-05-14T20:12:54.825226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.13435","last_updated":"2026-06-22T11:20:01Z","snapshot_observed_at":"2026-08-02T21:35:58.384587Z","submitted_at":"2026-05-13T12:31:02Z","title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:26:19.032362Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.13435"},"observation_digest":"sha256:4c2501add8222f7f756a69c1c2915316a72beae46cfd5454b416b6ecd3974d06","observation_id":"1d66c375-73cc-41e0-b836-f74a2e288b18","resolution":{"observed_at":"2026-05-14T19:27:51.709195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.13435","last_updated":"2026-06-22T11:20:01Z","snapshot_observed_at":"2026-08-02T21:35:58.384587Z","submitted_at":"2026-05-13T12:31:02Z","title":"Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T21:35:14.348849Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.13435"},"observation_digest":"sha256:af174d2016f7f05bcf4b2abe3d5777cbd4355415dd23954070bd7a4abddc4c56","observation_id":"eae99009-4523-4a96-931f-5d300b910bfa","resolution":{"observed_at":"2026-07-01T14:25:46.658353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:356ab12f4852ba0006ac337776787bec77a524d29eee45d5e5167af42daf3d9e","observation_id":"cc5e60bd-d702-417e-9a3b-29ca20e024c1","resolution":{"observed_at":"2026-07-01T14:25:45.864510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:1b6a54ef02179af7156f08638506be32506d74eeef2de0fbd654402f7d916ee8","observation_id":"54e9aa71-e3de-4721-a59d-dbf5d64f707f","resolution":{"observed_at":"2026-05-20T13:13:18.046411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.26552","last_updated":"2026-05-27T07:59:16Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T05:02:49Z","title":"Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-06-29T19:17:17.682142Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.26552"},"observation_digest":"sha256:911e02434d1f17ed27d1f22056777881a60df43197c9263a3a9a7063a0da0267","observation_id":"1d18ef97-ed01-4e62-b765-7cec0f68eb86","resolution":{"observed_at":"2026-06-29T19:23:54.043323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.27877","last_updated":"2026-05-27T02:53:41Z","snapshot_observed_at":"2026-07-06T23:37:31.844094Z","submitted_at":"2026-05-27T02:53:41Z","title":"SPAR: Support-Preserving Action Rectification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T14:34:39.094753Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.27877"},"observation_digest":"sha256:8b82c7fd6f3406ab3777b50b71440af8f4e31c122286ba7921354e80a1f02481","observation_id":"674744f1-5159-4346-9947-96a6756aff4e","resolution":{"observed_at":"2026-06-29T14:43:30.999577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2605.29033","last_updated":"2026-05-27T19:33:51Z","snapshot_observed_at":"2026-08-04T02:29:21.899997Z","submitted_at":"2026-05-27T19:33:51Z","title":"Moment Matching Q-Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T13:59:15.129557Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2605.29033"},"observation_digest":"sha256:fb47c08ef26f7551a93776c994a2ddd00d069bd4926bd446a1764e795bf0df62","observation_id":"647f13be-8ac4-4238-b722-e56c9f627a42","resolution":{"observed_at":"2026-06-29T14:03:29.519731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.04161","last_updated":"2026-06-02T19:24:09Z","snapshot_observed_at":"2026-07-06T23:44:19.059079Z","submitted_at":"2026-06-02T19:24:09Z","title":"When Offline Selectors Cannot Beat the Best Single Model: A Diagnostic Study on edX Dropout Prediction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T11:09:49.799311Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.04161"},"observation_digest":"sha256:2970bc1b7c45d67a82675648e1a0fde1f6531119214ab4f1a9403325acbcf401","observation_id":"617cd559-579a-47b8-b821-8d623146afb3","resolution":{"observed_at":"2026-07-02T02:16:26.269126Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.07592","last_updated":"2026-05-28T17:05:05Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-28T17:05:05Z","title":"UNIQ: Conformal Calibration for Adaptive Conservatism in Offline Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T08:39:34.884726Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.07592"},"observation_digest":"sha256:ba34fb0cbbdf6ed3a83e778e6bf88c1bb3ff03d52d771b061d4b266dec884913","observation_id":"3aab3e34-b56d-488c-bbc7-57e65a2b34ca","resolution":{"observed_at":"2026-06-29T08:43:15.138490Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.09115","last_updated":"2026-06-08T07:11:03Z","snapshot_observed_at":"2026-08-04T22:59:05.251199Z","submitted_at":"2026-06-08T07:11:03Z","title":"Counterfactual Transport Flows for Offline Conservative Trajectory Refinement","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T17:33:35.857240Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.09115"},"observation_digest":"sha256:49d7801f00d6f09b717c196f99e6c408cf642541c83d0a8d2298dfbba2442051","observation_id":"d359f891-5a75-4e24-ae5a-4f8771172a50","resolution":{"observed_at":"2026-07-02T23:57:28.579196Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.10613","last_updated":"2026-06-09T09:12:12Z","snapshot_observed_at":"2026-08-04T14:36:44.997787Z","submitted_at":"2026-06-09T09:12:12Z","title":"Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T13:57:31.180928Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.10613"},"observation_digest":"sha256:1f6950172b642d3d8247ae4994c2f7f8fa36770640933cd5bfaec98101973bad","observation_id":"d8a92057-29fe-4451-b238-7579148f1aea","resolution":{"observed_at":"2026-07-03T04:27:36.361729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:714d1d546f458ead4b5b2f52d03b63d9b2b9d42f4f84b1a87b4ae7e16f78a37b","observation_id":"40d2b0d4-c6ac-4afa-9ba9-0956e525f26b","resolution":{"observed_at":"2026-07-03T04:17:36.918438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.17551","last_updated":"2026-06-16T05:56:10Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:56:10Z","title":"Reversal Q-Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T02:30:24.951689Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.17551"},"observation_digest":"sha256:5465bfd30e668867ec5cf4ea0f8127c2ff172eb7343e50360588075fe73c28bf","observation_id":"550ffca1-95b7-4952-98c5-05a4076069f0","resolution":{"observed_at":"2026-07-03T18:38:49.878345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.23978","last_updated":"2026-06-22T22:10:06Z","snapshot_observed_at":"2026-08-03T15:42:57.505668Z","submitted_at":"2026-06-22T22:10:06Z","title":"Offline Reinforcement Learning for Warehouse SLAM Throughput Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:47.196692Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.23978"},"observation_digest":"sha256:ea4b8b5273b726b7e005b21f8a7538887ddb5a5057804c613f5764bf22601e88","observation_id":"8064d5cf-36a9-49c7-a1b7-1f92296fc2e0","resolution":{"observed_at":"2026-07-04T10:39:45.271472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.25527","last_updated":"2026-06-24T08:05:28Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T08:05:28Z","title":"Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:07.735336Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.25527"},"observation_digest":"sha256:803c05f6b5f3b6602b2ad8a7111d93f1800ff75fa550f646920a43ba49ea564c","observation_id":"b904ea4d-485d-4915-9f8b-e12248217d44","resolution":{"observed_at":"2026-07-04T19:30:07.892023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.27475","last_updated":"2026-06-25T18:52:27Z","snapshot_observed_at":"2026-08-02T12:36:42.748876Z","submitted_at":"2026-06-25T18:52:27Z","title":"Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T01:57:04.293058Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.27475"},"observation_digest":"sha256:df64455c256ad7ae4c3936b2663093675d9da024cbda03548dc89789b4b6728a","observation_id":"d4efaf69-9cd8-47f3-8099-325661fe148c","resolution":{"observed_at":"2026-07-01T18:25:58.759576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1911.11361","doi":"10.1609/aaai.v40i31.39885","metadata_source":"pith","pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior Regularized Offline Reinforcement Learning","venue":"cs.LG","work_id":"95ad303d-9555-46ad-9a95-3bbea22ed9fb","year":2019},"citing_paper":{"arxiv_id":"2606.31025","last_updated":"2026-06-30T01:46:48Z","snapshot_observed_at":"2026-07-29T14:35:40.044269Z","submitted_at":"2026-06-30T01:46:48Z","title":"Offline Reinforcement Learning for Fluid Controls: Data-based Multi-observational Policy Extraction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-01T06:25:00.318818Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2606.31025"},"observation_digest":"sha256:ac2f2fdc6f75322f6b83259b5728a798afcc8682885f5f9973c0bc2d7f8a0742","observation_id":"333e00da-25ef-47d5-b638-b8b2166a6438","resolution":{"observed_at":"2026-07-01T09:35:40.856236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-07-16T23:18:20.490462Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:583984ed633a4f7bcd37acad5113df5d6d33b07de9f75e4d69da6b4538b6cb72","observation_id":"405a6e6e-a03f-4800-8f5c-ed1fd658b44e","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-01T17:45:16.846768Z","title":"arXiv preprint arXiv:1911.11361 , year=","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:16.846768Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:6ea174aa99b771d36e47d61a9406789859fd236509e6cd08facaf93114d606b6","observation_id":"d71456da-f613-4873-8330-e33d06acd1ce","resolution":{"observed_at":"2026-08-01T17:45:16.846768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-01T13:15:14.620583Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.19199","last_updated":"2026-07-21T15:34:06Z","snapshot_observed_at":"2026-08-01T13:15:09.438065Z","submitted_at":"2026-07-21T15:34:06Z","title":"Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T13:15:14.620583Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2607.19199"},"observation_digest":"sha256:f5572d524d3d1e111e49ed821471358c42777e32c7a4c0cc2c8628d7dcd59c49","observation_id":"f7116211-d4db-4c72-baab-b38f3a602b08","resolution":{"observed_at":"2026-08-01T13:15:14.620583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-04T01:16:04.732902Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-05T17:20:31.954984Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.732902Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:913474424699873fe051b4f229fd5214f2f4c471522f451029a175dca08a5b6d","observation_id":"32df2db8-2384-4a95-ad7f-c374e6cba6e4","resolution":{"observed_at":"2026-08-04T01:16:04.732902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1911.11361/citation-record","integrity":"/paper/1911.11361/integrity","json":"/paper/1911.11361/citation-record.json","paper":"/paper/1911.11361"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-07-06T06:45:27.162265Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":"1806.06920","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-06-30T23:45:08.145951Z","title":"Maximum a Posteriori Policy Optimisation","venue":"cs.LG","work_id":"cb0e49f6-4417-4c5e-b4a8-567d7e9e76a7","year":2018},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:f2a8d88c76876ea71c27df7bf27163b083bff948098b05cf56593fde4c50b48e","observation_id":"06ae7e58-308f-472a-8d03-edbfd6b3e6ae","resolution":{"observed_at":"2026-05-13T15:19:21.384956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04543","last_updated":"2020-06-22T04:32:50Z","snapshot_observed_at":"2026-07-06T08:06:44.034117Z","submitted_at":"2019-07-10T07:23:27Z","title":"An Optimistic Perspective on Offline Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"1907.04543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.04543","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Striving for simplicity in off-policy deep reinforcement learning","venue":null,"work_id":"588a4dc4-2821-4960-ab47-4a85390287c3","year":1907},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1907.04543","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:ed5981da44baa79e42991e829983504173d85d67541602920f14ce749e8cb98a","observation_id":"b92ebeef-a629-4390-b315-c341af45c056","resolution":{"observed_at":"2026-05-13T15:19:21.390202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Residual algorithms: Reinforcement learning with function approximation","venue":null,"work_id":"e0b56351-3991-4969-8875-4a569f692ccb","year":1995},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:29d057b1bf66e96425997af81c1c6fda274ee3862c87d63c179383caa237d484","observation_id":"252d7f97-2309-4331-9cf7-f6e58e14ef8d","resolution":{"observed_at":"2026-05-13T15:19:21.445329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":"1606.01540","doi":"10.1109/jssc.2019","metadata_source":"pith","pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenAI Gym","venue":"cs.LG","work_id":"6af98f3f-f074-41ae-a689-7dd7b4b8efde","year":2016},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:32c971d43eb933969a4dc206d9643d37a96a48eb30ef2e72c5473064adc1dd52","observation_id":"3407c222-eb82-4d02-ae71-0fd10e08a173","resolution":{"observed_at":"2026-05-13T15:19:21.414803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.10250","last_updated":"2019-02-26T22:17:47Z","snapshot_observed_at":"2026-08-03T19:35:11.882400Z","submitted_at":"2019-02-26T22:17:47Z","title":"Diagnosing Bottlenecks in Deep Q-learning Algorithms","version":1},"cited_work":{"arxiv_id":"1902.10250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.10250","snapshot_observed_at":"2026-07-04T23:25:51.131241Z","title":"Diagnosing bottlenecks in deep q-learning algorithms","venue":null,"work_id":"ae65aa93-1aa9-4a49-83a1-3d808bc9a349","year":1902},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1902.10250","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:ab0b115aad914202388bb8d9af522934531893e915d16bd3bbb0d9539ae04f4b","observation_id":"c1acbe81-2593-43f4-9dc4-2db4eea566ba","resolution":{"observed_at":"2026-07-04T23:25:51.131241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:73226576d9d0cc7a9b2ef94d07f1fc857b0626e67059ce7af42333b3aa391b86","observation_id":"b6b042a1-08d5-4666-8bde-5a1126682347","resolution":{"observed_at":"2026-05-13T15:19:21.423129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f2845122-503e-4e6c-8b58-1f606d7b8fc4","year":1999},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:2b5db975c7bf9576d791b40331be25947c4ba816182bc6e6332fe0eec69812a8","observation_id":"45e0609b-6d5d-45c7-ad4e-df10c522ee28","resolution":{"observed_at":"2026-05-13T15:19:21.455180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":"1801.01290","doi":"10.48550/arxiv.1801.01290","metadata_source":"pith","pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":"cs.LG","work_id":"6674e5db-4e1c-49c0-b598-c108a0ecadb6","year":2018},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:90c90fe7aa7d1e4ffcb9e502f4c78943804000c2b2641da5b51d4d7da16418c1","observation_id":"83f3ecad-3210-405a-9a0b-51dca9688678","resolution":{"observed_at":"2026-05-13T15:19:21.427156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01624","last_updated":"2019-11-23T01:19:09Z","snapshot_observed_at":"2026-08-05T13:54:00.072551Z","submitted_at":"2019-06-04T17:57:06Z","title":"Off-Policy Evaluation via Off-Policy Classification","version":3},"cited_work":{"arxiv_id":"1906.01624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.01624","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oﬀ-policy evaluation via oﬀ-policy classiﬁcation.arXiv preprint arXiv:1906.01624","venue":null,"work_id":"1e8fc2f8-966d-436e-9641-e4f2eee970ea","year":1906},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1906.01624","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:864c2b7227b7bccb01ab41bde4ef43d56795a04f082ce037eec79c86ddc7ce11","observation_id":"35458c85-07ee-40b9-a1ce-6a8346badca0","resolution":{"observed_at":"2026-05-13T15:19:21.431260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":"1907.00456","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-07-03T01:37:30.382383Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","venue":"cs.LG","work_id":"42fcaa3e-0409-481b-9dd5-9a2c3be8a383","year":2019},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:562fe9b94aa4147532777c83877966fa997af38f22c082c7b8a801800c41f9fe","observation_id":"c3c973c9-edca-4681-8eec-d787f2c36444","resolution":{"observed_at":"2026-05-13T15:19:21.435201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00949","last_updated":"2019-11-25T18:52:33Z","snapshot_observed_at":"2026-07-06T07:57:34.683633Z","submitted_at":"2019-06-03T17:59:10Z","title":"Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction","version":2},"cited_work":{"arxiv_id":"1906.00949","doi":"10.48550/arxiv.1906.00949","metadata_source":"arxiv_reference","pith_arxiv_id":"1906.00949","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kumar, J","venue":"arXiv (Cornell University)","work_id":"5245a2f6-b3e1-4edb-8d34-fb132fc9ccdc","year":2019},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1906.00949","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:9824442f34d95229e01190e738b9a1c7f481591d02abe254559c5e8a78f7e85b","observation_id":"3e80bcb5-9896-41f8-b0e7-abe10bae736d","resolution":{"observed_at":"2026-05-13T15:19:21.438740Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06924","last_updated":"2019-06-07T17:45:54Z","snapshot_observed_at":"2026-07-06T06:15:06.347683Z","submitted_at":"2017-12-19T13:43:41Z","title":"Safe Policy Improvement with Baseline Bootstrapping","version":5},"cited_work":{"arxiv_id":"1712.06924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1712.06924","snapshot_observed_at":"2026-07-04T23:41:48.517026Z","title":"Safe policy improvement with baseline bootstrapping","venue":null,"work_id":"b0320f95-0471-42d7-a8e0-2a949f977a99","year":null},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1712.06924","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:2e4f8a49efaadcec2b6d740ddd7d844ca5c9baa1ed1afbd99f7911fdc59bff21","observation_id":"9690e71a-dc55-4ea6-b2d9-353c1ada4f71","resolution":{"observed_at":"2026-07-04T23:41:48.517026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:5890613b43de18f863a9c4001ebcadb6895422b48823207b8c3b08a775f2af33","observation_id":"d7cdf11a-cf36-4e90-ae59-688703bd6cf0","resolution":{"observed_at":"2026-05-13T15:19:21.394456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:65ad38aeb4dc70eb50673884e7943550544fb1ccab47efe67ea4d8ae86354ad4","observation_id":"2e0a7bfb-6e1d-49b1-8409-69b6be9f60f8","resolution":{"observed_at":"2026-05-13T15:19:21.398489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"4c306c81-ce48-4820-aa5e-70094c01db7f","year":1928},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:bfe9fc377cd5535ac3d8f0d7fbf707eb7fc72df11dd8e02258431dd004e5ba1b","observation_id":"d7727fdf-2026-46b1-9439-40732d01decc","resolution":{"observed_at":"2026-05-13T15:19:21.450328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01891","last_updated":"2018-02-22T21:28:57Z","snapshot_observed_at":"2026-07-06T05:50:03.544515Z","submitted_at":"2017-07-06T17:50:19Z","title":"Trust-PCL: An Off-Policy Trust Region Method for Continuous Control","version":3},"cited_work":{"arxiv_id":"1707.01891","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1707.01891","snapshot_observed_at":"2026-07-04T22:34:15.110658Z","title":"Trust-pcl: An oﬀ-policy trust region method for continuous control.arXiv preprint arXiv:1707.01891","venue":null,"work_id":"5cb596c4-ef5a-4966-a45b-586f7412ad6d","year":2017},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1707.01891","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:11eafdecd103bc8535b59055d4a60022dad208ff5923f23576ae080a2d9f4515","observation_id":"9ee4315b-5939-41f4-a9b2-aabf0ac682a0","resolution":{"observed_at":"2026-07-04T22:34:15.110658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04733","last_updated":"2019-11-04T22:01:49Z","snapshot_observed_at":"2026-08-01T17:57:36.250332Z","submitted_at":"2019-06-10T19:33:00Z","title":"DualDICE: Behavior-Agnostic Estimation of Discounted Stationary Distribution Corrections","version":2},"cited_work":{"arxiv_id":"1906.04733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.04733","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dualdice: Behavior-agnostic estimation of discounted stationary distribution corrections.arXiv preprint arXiv:1906.04733","venue":null,"work_id":"cebdc0e7-9dbf-42fc-8117-d60cd3d0065f","year":1906},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1906.04733","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:7b1fb4445aaf07db5631d0b2e40d6eefd7658f262d75269c920bcee4c966a76b","observation_id":"4ba809e1-f758-431f-ab64-282d13f4702a","resolution":{"observed_at":"2026-05-13T15:19:21.407189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":"1812.02648","doi":"10.48550/arxiv.1812.02648","metadata_source":"pith","pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning and the Deadly Triad","venue":"cs.AI","work_id":"de214ead-4cb0-4abd-be3d-ae3389f55e9b","year":2018},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:b191936c76d03864cab7f77512eb00f0ee83ccd68da66ea5be69927ab2f57ea7","observation_id":"30fef271-52dd-4251-ad54-d8d0b55315bc","resolution":{"observed_at":"2026-05-13T15:19:21.411238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Each dataset contains 1 million transitions","venue":null,"work_id":"41396c3a-9e35-45cb-b5e9-4dfd80e74ee1","year":2019},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:e99c48a0345d31fe56ff8e86c597340c3a564e0a2de178b689498ffd36a823c8","observation_id":"585f8302-f87b-4414-a5bc-955498b65522","resolution":{"observed_at":"2026-05-13T15:19:21.448121Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient penalty (one sided version of the penalty in Gulrajani et al","venue":null,"work_id":"69dd82c4-43c6-4b4d-abf9-b46209d13cf2","year":2017},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:9fe71050fcffc78db55a8d03b0359acaa284e7219325fdf086cffb675a27f23e","observation_id":"ce37897d-5852-42be-9718-c7aeae0ccc61","resolution":{"observed_at":"2026-05-13T15:19:21.452481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":14,"verified_fuzzy":3},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 59 inbound Pith citation observations for arXiv:1911.11361."}