{"as_of":"2026-08-14T17:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1d713e6ce8c4bdcc0646268a592055f0f2dc62eae3931adaa6e8c1aeac431cb","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:47:41.308466Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.09722/citation-record","integrity":"/paper/2411.09722/integrity","json":"/paper/2411.09722/citation-record.json","paper":"/paper/2411.09722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.959624Z","title":"Swazinna, S","venue":null,"work_id":"aa27a0c6-6879-4528-ad0a-fbbd4560228e","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.133523Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:79206a868912cf90fb6c77e2a6561c8c9f6f3e5ac731860c2366258de69d84ae","observation_id":"baea27a8-b8a8-4b29-a92b-0d9ed4d63090","resolution":{"observed_at":"2026-08-12T20:47:41.962900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.950003Z","title":null,"venue":null,"work_id":"1809a2ac-87b3-4c04-891a-4b72ff9996e0","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.138522Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:63dd91ee0012d9d92d5f8da42b9dc0e4f59078061ed9a6fb334e402d8376a00c","observation_id":"c0b5c7d2-f0bb-4677-8a32-6d99c98dd0a8","resolution":{"observed_at":"2026-08-12T20:47:41.953391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.939753Z","title":null,"venue":null,"work_id":"a389f3ea-45c8-4b0a-ae0a-1399592a947d","year":2017},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.142320Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:2d6f9c0be382504d458bdb1be3ad05757d7df0a6782dc1ba32103f75e05b4629","observation_id":"38a072be-3f9d-4f8c-b0f0-14065cc9b6d7","resolution":{"observed_at":"2026-08-12T20:47:41.943477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03647","last_updated":"2020-06-23T16:54:09Z","snapshot_observed_at":"2026-08-07T05:24:51.039556Z","submitted_at":"2020-06-05T19:33:19Z","title":"Deployment-Efficient Reinforcement Learning via Model-Based Offline Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03647","snapshot_observed_at":"2026-08-12T20:47:41.146371Z","title":"Matsushima, H","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.146371Z"},"links":{"cited_paper":"/paper/2006.03647","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:cc3d272ff567193f0c4c3bc914c588e57ef88b4dabb790510dbf8a695ba5b147","observation_id":"2c2c3844-7be9-45cc-b185-156081afaa58","resolution":{"observed_at":"2026-08-12T20:47:41.146371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05726","last_updated":"2023-10-17T16:25:25Z","snapshot_observed_at":"2026-08-13T11:20:31.669383Z","submitted_at":"2023-06-09T07:46:24Z","title":"Iteratively Refined Behavior Regularization for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2306.05726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.05726","snapshot_observed_at":"2026-08-12T20:47:41.610040Z","title":"Iteratively Refined Behavior Regularization for Offline Reinforcement Learning","venue":"cs.LG","work_id":"8048295b-7f68-4c14-a0a4-bb66b569ce22","year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.150335Z"},"links":{"cited_paper":"/paper/2306.05726","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:eade72fe23bc7e255810d48aa42326c9f422ff8084bee2749cdfc207f54d1371","observation_id":"f4dcf8f0-80de-487b-92f0-17e0e961f924","resolution":{"observed_at":"2026-08-12T20:47:41.614831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.930140Z","title":"Zhang, L","venue":null,"work_id":"ca464694-a320-45d0-96e9-b617184b731d","year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.154072Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:bb3274d7cb36ff866c1062b8a46d8a4628dce6ad4fb00d6eee37b4bb001bbd7d","observation_id":"55695fe5-8b1b-4a25-b3d0-7feede4eeede","resolution":{"observed_at":"2026-08-12T20:47:41.933634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.920316Z","title":"Ernst, M","venue":null,"work_id":"af91311d-af8f-4977-8a8b-652d150d3f0f","year":2005},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.157701Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:84e7223b007a0d9bbd85abaafa29b97995ef8e2147e3d51094e071c5c2846d07","observation_id":"88ed4f6e-9224-4677-adea-e8c74999192a","resolution":{"observed_at":"2026-08-12T20:47:41.923767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.909696Z","title":"Riedmiller","venue":null,"work_id":"9da4f4b2-26f9-4937-a88d-d165cd3b2035","year":2005},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.160746Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:8213a2b864dca403d5f3059491e9bd8128714ee1c053a61dff76f86a3326c884","observation_id":"68c30bc7-28cd-44fa-b7ff-bbc6d7211145","resolution":{"observed_at":"2026-08-12T20:47:41.913203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.899426Z","title":"Riedmiller, T","venue":null,"work_id":"b93963f4-627a-4ce9-97e2-280be81882a0","year":2009},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.164027Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:d73f1eead03437eb5fe75b5d0666ad6ff813e9e10af54cb618340f691be9141e","observation_id":"d42e0400-740e-4db2-b6bd-78b866b1a99a","resolution":{"observed_at":"2026-08-12T20:47:41.903072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.889640Z","title":"Lange, T","venue":null,"work_id":"70f95735-e04b-4af2-8eac-a2d937044426","year":2012},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.167320Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:5aa6c3e3619c52d069d2ec2144fe8c05755a1d74f0b85a6dba5c90f167d0b7ac","observation_id":"ebb67969-2615-4c9d-9222-1b6d86edbf8b","resolution":{"observed_at":"2026-08-12T20:47:41.893147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.879420Z","title":null,"venue":null,"work_id":"46998eb9-66aa-47c2-9c14-340f3fa946ca","year":2016},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.170526Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:c437e6b6ef00d21269c3bd9294a93eb8dc81d45fa78a886b5ad41a683a18ad9f","observation_id":"e1c42eff-c223-4ec1-a0f2-a158b5f0e0b3","resolution":{"observed_at":"2026-08-12T20:47:41.883029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.868831Z","title":"Depeweg, J","venue":null,"work_id":"89a1bd84-baee-4fb7-8942-0f4a19027170","year":2017},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.173724Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:181dcf0b2955e7b1d87666fce417b891679eaadadb79477bc08b22507c359140","observation_id":"19d16d6d-bcae-4f81-b986-7ca422082b74","resolution":{"observed_at":"2026-08-12T20:47:41.872665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.858103Z","title":null,"venue":null,"work_id":"12b7fa04-0d6e-4e16-9cae-ad77c55acb00","year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.176985Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:8756843badab580d1afd39611731c218f864225861d99b71093d78c90f9e1f22","observation_id":"f159b5a8-a407-464a-bbe5-2aa31e6b6c08","resolution":{"observed_at":"2026-08-12T20:47:41.861819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.847875Z","title":"Depeweg, J.-M","venue":null,"work_id":"efc2fbfa-4c6b-4384-98fd-48d2bb87867b","year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.180214Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:83d283e8aa55a46829aa499ce087b5898066e99381b3cfe3bcc5fc0cb41ae87a","observation_id":"9a7c2ee1-7283-4da4-87a1-57d60ab473c9","resolution":{"observed_at":"2026-08-12T20:47:41.851540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.837752Z","title":"Silver, G","venue":null,"work_id":"c81d3f4c-d958-48e5-af47-33918ca8eb61","year":2014},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.183234Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:6bd196148b6b9676865e1fdd76c64b7fd02fc5f86a5e099bf85dcc62616cd542","observation_id":"ac807bce-3985-4452-8c62-ab56b54f2464","resolution":{"observed_at":"2026-08-12T20:47:41.841236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T20:47:41.186542Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.186542Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:de29dedade8127cc4f0c5715d325cb2a11856801dfb7bd0dcc4f6debd1bce012","observation_id":"df67475a-3344-44f8-bb1d-40db5796320c","resolution":{"observed_at":"2026-08-12T20:47:41.186542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-12T20:47:41.189937Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.189937Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:37171f260bf91cb68497ea96a29826cd7ac2c2d5fb4f2210cc0f35be5f053f16","observation_id":"5e24cdee-19a5-4c68-a66a-bd9fb7088066","resolution":{"observed_at":"2026-08-12T20:47:41.189937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.827191Z","title":"Fujimoto, D","venue":null,"work_id":"c32551f7-6016-4285-a78d-2964745a9d41","year":2019},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.193715Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:24e68bbeea404578f122192a451c2127ff0ed75f51831ba7dd48c04820fa602d","observation_id":"98e7c06a-8ff2-4ccf-9992-e794d5e71ce5","resolution":{"observed_at":"2026-08-12T20:47:41.830814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.816837Z","title":"Kumar, J","venue":null,"work_id":"a2f0e487-7be2-4619-9b51-cccd1c400c7e","year":2019},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.197040Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:e972245d1f7ec001d240e1491f6d24d3ec910b11ea1850f6757c044db0f412ef","observation_id":"fa126106-783f-4b04-8ee2-8e275d229e31","resolution":{"observed_at":"2026-08-12T20:47:41.820463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-12T20:47:41.200672Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.200672Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:c3c86aab19e220d3cca7f8f0e37214073d65a8e1314a179ab19513349fedd8e3","observation_id":"364732df-c85a-4534-ac11-1b0ccae7f325","resolution":{"observed_at":"2026-08-12T20:47:41.200672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-12T20:47:41.204241Z","title":"Kumar, A","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.204241Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:709b40e6d54ece9244d8e4fd8b975670fc83a6592d84ff4d49e1a7b8934f7b2d","observation_id":"039eed4f-f7a5-4231-9493-cdfcac462ff4","resolution":{"observed_at":"2026-08-12T20:47:41.204241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.207800Z","title":"Fujimoto and S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.207800Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:dc62c5457688ae045553ca9de33df3df6fbcf99ecc78c1d5009358a5b1e67c6e","observation_id":"0d2d64fa-fb64-4cd5-ba0d-8c216076e20b","resolution":{"observed_at":"2026-08-12T20:47:41.207800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-12T20:47:41.211016Z","title":"Kostrikov, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.211016Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:acabe0aaa8edf70b7f8d7445a7ad6a1fecdf24217b8cf5f58c9104dfa96276a6","observation_id":"042baa0b-1afe-4387-9824-21d356c7369a","resolution":{"observed_at":"2026-08-12T20:47:41.211016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08396","last_updated":"2020-06-17T10:12:44Z","snapshot_observed_at":"2026-08-11T03:30:21.229658Z","submitted_at":"2020-02-19T19:21:08Z","title":"Keep Doing What Worked: Behavioral Modelling Priors for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08396","snapshot_observed_at":"2026-08-12T20:47:41.214592Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.214592Z"},"links":{"cited_paper":"/paper/2002.08396","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:acc7144cc2c8f32195da4834d55aeea005ae1ec3a7f4d905a4a4059fb436d38b","observation_id":"5771f901-66f9-4bac-864d-adc6b2ddc2ad","resolution":{"observed_at":"2026-08-12T20:47:41.214592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.218162Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.218162Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:5ec3c98a5b2c71d2e174288d961a5152148bc7b877d2b70650f88a79b4fb17b8","observation_id":"f6a2221a-b96b-4b53-9505-2baa3e205f28","resolution":{"observed_at":"2026-08-12T20:47:41.218162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.794734Z","title":"Yin and Y .-X","venue":null,"work_id":"2063dc6f-ad9e-4aff-a90d-f1b7d67ab566","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.221550Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:4cfade70b753258ab4348baa9bde5a4f46280e299f308805c0c94bc3b7acd081","observation_id":"4a8331ce-b95e-4dd6-a96a-fa4c1c42d2a6","resolution":{"observed_at":"2026-08-12T20:47:41.798082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.785246Z","title":"Deisenroth and C","venue":null,"work_id":"764b0198-7afa-4da6-81cd-babfbf30daa6","year":2011},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.224944Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:c218567253badcc0fb08c2b5ba87bfdb42a780b80bd9e67d6ce2cf357f3ac301","observation_id":"bfadec26-7551-47a4-b56d-9cee690cb75e","resolution":{"observed_at":"2026-08-12T20:47:41.788739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.775064Z","title":"Nagabandi, G","venue":null,"work_id":"301f6528-1c7b-41b0-853f-cbafa2504a54","year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.228412Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:a25d85eb6000f144bf69097e7a6502dd8f2e6d1f46a6dd175d9af50a3c5e7e20","observation_id":"ca2c9651-c485-4bb7-b59d-ed1bbf24406e","resolution":{"observed_at":"2026-08-12T20:47:41.778647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.764177Z","title":null,"venue":null,"work_id":"4e6f4e73-9d98-470f-938e-9c25eabf7360","year":2020},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.231693Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:2d9fd2d399881a138a60006121aabedc73d9bfc0221a6988908437feda8f0617","observation_id":"24ea62be-82cc-460a-98fc-b8bc5685ccb1","resolution":{"observed_at":"2026-08-12T20:47:41.767780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05951","last_updated":"2021-03-02T04:35:04Z","snapshot_observed_at":"2026-08-13T22:44:31.375832Z","submitted_at":"2020-05-12T17:52:43Z","title":"MOReL : Model-Based Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05951","snapshot_observed_at":"2026-08-12T20:47:41.235096Z","title":"Kidambi, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.235096Z"},"links":{"cited_paper":"/paper/2005.05951","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:fc1bcd18cd4df05ca14d8059977ab1eec8c33c661d45a363b8adb1d44bd8f717","observation_id":"1ec8c519-2b1b-4a92-89dd-9ece8c9411a9","resolution":{"observed_at":"2026-08-12T20:47:41.235096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15669","last_updated":"2023-05-25T02:40:32Z","snapshot_observed_at":"2026-08-13T11:33:55.184747Z","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15669","snapshot_observed_at":"2026-08-12T20:47:41.238691Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.238691Z"},"links":{"cited_paper":"/paper/2305.15669","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:dc66cbfa0167e43607e01bd27bbd880962d34085696eefa6368465a4eff422ff","observation_id":"61afbba5-b495-49d4-ab58-6a28a0c5b91c","resolution":{"observed_at":"2026-08-12T20:47:41.238691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.753876Z","title":null,"venue":null,"work_id":"1f458d47-f0d5-4404-be1e-a89b9e63e81e","year":2022},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.242496Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:0445ce07152612c7b77de30189afbdf266ebc4cbabf019bb8d89fc5ca59c850f","observation_id":"b7c4a1c7-8a86-4c82-8f5c-e94faa267464","resolution":{"observed_at":"2026-08-12T20:47:41.757313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-12T20:47:41.245856Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.245856Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:7719cd8d7a17f2ff9a02781af215eb98a0e1b991ee2e74cb28ebd00212ac0d08","observation_id":"3ef4b400-00fb-4583-ba7b-7558d63419c0","resolution":{"observed_at":"2026-08-12T20:47:41.245856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.743816Z","title":null,"venue":null,"work_id":"12997fbe-5719-4230-b670-ded28e21e730","year":2022},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.249654Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:ffa16bc0ed1b050a11cd75f23e7d25e9fc22aa537b2ff73235ae76690ebe8b91","observation_id":"607d61f2-ee67-43c5-aa03-574e60dfe407","resolution":{"observed_at":"2026-08-12T20:47:41.747290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.733291Z","title":null,"venue":null,"work_id":"3c5d7a43-3ab5-40e9-846f-05786da4cdb2","year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.253191Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:60c47b892b85e762639f726b01737e6956ff07a651bec68b52f2f966c20d7dd6","observation_id":"17c4a470-7c82-4479-884e-366bd2d933d2","resolution":{"observed_at":"2026-08-12T20:47:41.737246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.722517Z","title":"Schmidhuber","venue":null,"work_id":"64c6bd1a-d38a-42ba-a879-6d7acc517f64","year":1991},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.256829Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:9ff40e6c4ccb0eec6d5894a038ca1187a437261006eb323375096c35fdff3b2f","observation_id":"429f1084-f6d0-4519-abd0-6d9203216441","resolution":{"observed_at":"2026-08-12T20:47:41.726194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.260418Z","title":"Pathak, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.260418Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:9dcb645cab88bef3f22c0bd531cfc44d4c4b7767b27f9f141fed50907d0b8550","observation_id":"1f5571e3-f1a5-4290-abeb-fbca27311ff6","resolution":{"observed_at":"2026-08-12T20:47:41.260418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06070","last_updated":"2018-10-09T23:19:52Z","snapshot_observed_at":"2026-08-12T20:12:44.567915Z","submitted_at":"2018-02-16T18:57:57Z","title":"Diversity is All You Need: Learning Skills without a Reward Function","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06070","snapshot_observed_at":"2026-08-12T20:47:41.263831Z","title":"Eysenbach, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.263831Z"},"links":{"cited_paper":"/paper/1802.06070","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:5ae71785b82457f928a6055cf3d59dcf5170bfa0431247408e803a42ce765e80","observation_id":"ad307b53-ffff-48a2-8182-c1c2c22d6a4d","resolution":{"observed_at":"2026-08-12T20:47:41.263831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-12T20:47:41.270823Z","title":"Yarats, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.270823Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:9b385e8839c23973d994e34e8c5b9eab5f356c539af67b21e6deca8fcc250e07","observation_id":"d1a872b2-57c7-42f5-acb2-4a179194ab68","resolution":{"observed_at":"2026-08-12T20:47:41.270823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11861","last_updated":"2022-02-19T01:12:25Z","snapshot_observed_at":"2026-08-13T16:52:00.608923Z","submitted_at":"2022-01-27T23:59:56Z","title":"The Challenges of Exploration for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11861","snapshot_observed_at":"2026-08-12T20:47:41.274317Z","title":"Lambert, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.274317Z"},"links":{"cited_paper":"/paper/2201.11861","citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:7de6f3fc5e7dc935de81db4b50c7f7970e578d4f304d8867b17931029c3f1116","observation_id":"eb952f6b-4f00-45dd-85b8-f8fecc5cd21a","resolution":{"observed_at":"2026-08-12T20:47:41.274317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.705888Z","title":"Hong, T.-Y","venue":null,"work_id":"b84985cb-6709-4af3-9c38-9a209c4ce460","year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.277661Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:c31554957f0c16701bf14ddc9a2afb1b43b7fb9a8207a813f0cef7453d9ada64","observation_id":"3e257135-f4fd-4299-85df-0b174d38135d","resolution":{"observed_at":"2026-08-12T20:47:41.709563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.695764Z","title":"Parker-Holder, A","venue":null,"work_id":"3d612a50-c7be-4f4f-83a4-6cd4357a210f","year":2020},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.281308Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:f0dfd73109c77dbf435642cf335589cddafd4e7d2fa26b76ba0acc56ec2a1c08","observation_id":"996d6b90-2aa1-494a-bba9-af38ebd027cd","resolution":{"observed_at":"2026-08-12T20:47:41.699525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.685751Z","title":"Kumar, A","venue":null,"work_id":"a2e8d884-be99-43d2-abcf-a8e8bc59a2a9","year":2020},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.284743Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:4723bb5605d2b8a52be84616f16124938ac5e635196d0bbad51678b071cfa621","observation_id":"c6ed421f-d888-4541-a690-cd02157dab5a","resolution":{"observed_at":"2026-08-12T20:47:41.689161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.675473Z","title":"Swazinna, S","venue":null,"work_id":"e406ba89-957d-46e7-a4a5-a372fddbf1ee","year":2023},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.287861Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:c0b7b516c39375fe01b99b1e06d2a04781e556cab1d9a545221365de4dbbd183","observation_id":"3aa3e3c5-fd6d-4501-ada2-2695ee97c41d","resolution":{"observed_at":"2026-08-12T20:47:41.678975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.665450Z","title":"Brandfonbrener, W","venue":null,"work_id":"af65dc7f-389e-4d2b-b750-a8b0adca796e","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.291369Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:d8802a0023d466e9ad2d718a76e0b6a4e293aa6b4b703a771cc47f6b30bdc3a6","observation_id":"df50044b-3177-4034-8ed4-9913996b9000","resolution":{"observed_at":"2026-08-12T20:47:41.668919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1971.43083","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.477116Z","title":null,"venue":null,"work_id":"a92932b5-d07b-4c3d-b703-fcfd7c2990c5","year":1971},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.294798Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:4071ad57939a2c116d09d8045434b556ec1daabdd03c84a2945c2c002e7c4060","observation_id":"27bf7d8d-8dfa-419c-aa5a-bf48bc422376","resolution":{"observed_at":"2026-08-12T20:47:41.483929Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.298099Z","title":"Bottou, F","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.298099Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:42fc729bc122853fbef79ba0b70000b15247fe194b5e5e2f4b3ee90033a0b4a3","observation_id":"9a460be0-c110-4cb4-88e8-79c250c16adc","resolution":{"observed_at":"2026-08-12T20:47:41.298099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.648926Z","title":"Mangalam, H","venue":null,"work_id":"ab9dbcb4-1ada-4fe1-9927-89a3fecce501","year":2020},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.301303Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:e9cc0651c128ac0911364e94749515add1a4f16e5ed9ca88f899faad62958c3d","observation_id":"9f9efc1d-5f92-49d8-b88d-b272e3fc6313","resolution":{"observed_at":"2026-08-12T20:47:41.652288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.304665Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.304665Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:9d7095cba82a73d9b79a9eb2d6dc8225938eb9eec07a8728966f3c28c56ecbff","observation_id":"d07ac0d6-aba3-4fc5-a912-3b887fd19766","resolution":{"observed_at":"2026-08-12T20:47:41.304665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:47:41.631765Z","title":null,"venue":null,"work_id":"69a51669-0743-4356-a084-99ed62b32326","year":2021},"citing_paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T20:47:41.308466Z"},"links":{"citing_paper":"/paper/2411.09722"},"observation_digest":"sha256:6c6874fa303f42fed8cb31bdfdbf2dc0546cdee9696cd1e864af9db7c5034e40","observation_id":"0c68d80d-ed0a-4f0a-aa97-a6ec2709cb0f","resolution":{"observed_at":"2026-08-12T20:47:41.636060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.09722","last_updated":"2024-11-14T11:10:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T00:17:20.813952Z","submitted_at":"2024-11-14T11:10:36Z","title":"Iterative Batch Reinforcement Learning via Safe Diversified Model-based Policy Search"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2411.09722."}