{"as_of":"2026-08-16T18:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe07476981f7764adf140f114a02acfb4e99125675743fca630e79d37594efad","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:17:37.396552Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.06012/citation-record","integrity":"/paper/1908.06012/integrity","json":"/paper/1908.06012/citation-record.json","paper":"/paper/1908.06012"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.885438Z","title":"P., Bertsekas, D","venue":null,"work_id":"d2b78aca-1d07-4e58-a259-475897cf3ddd","year":2005},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.231442Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:967e990a9cca46851d687d20541370e9f61e27ed1e8c753555ac4fc898246468","observation_id":"776294e9-624a-46b1-b34f-dec4ae894125","resolution":{"observed_at":"2026-08-14T13:17:37.889625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.874938Z","title":"Openai gym, 2016","venue":null,"work_id":"08ced6f4-d793-40e1-afcb-affaf174fb47","year":2016},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.235927Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:a09fb565d67e4cda5e9e1074e01f5e904403e31dd3d820f281bf17b82ca73130","observation_id":"fabf6bcb-aa9a-48b9-bbd0-ee0dd77e7150","resolution":{"observed_at":"2026-08-14T13:17:37.878927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.863652Z","title":"Sample-efﬁcient reinforcement learning with stochastic ensemble value expansion","venue":null,"work_id":"9e898018-5fc2-4f2a-a3e2-3f0a2f906a60","year":2018},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.239520Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:01fdf8e03f52204249c042c13add3576d2cb9d63b5c5a6879f31d7ca85dc432f","observation_id":"79be8fd6-875e-4cf9-8702-40e5ff0e7197","resolution":{"observed_at":"2026-08-14T13:17:37.867393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.852755Z","title":null,"venue":null,"work_id":"07960610-8c0f-446b-b84a-f08d6075eef0","year":2003},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.243699Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:4d203709374900303dc36cbd336e3536b13baad1aff5ee0285565d37d8b7dd7b","observation_id":"663cb465-4bec-4723-a978-1b559c5243f4","resolution":{"observed_at":"2026-08-14T13:17:37.856698Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.843043Z","title":"Path integral guided policy search","venue":null,"work_id":"05fea0eb-b22a-4acf-92c1-76a5805fe59d","year":2017},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.248363Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:dbadfc846ca9a3dd962c79e42cda5bfcd6fd60ff035b9650217fc60ae1af2c82","observation_id":"253a75bb-e7f7-4f74-a597-59d921778c19","resolution":{"observed_at":"2026-08-14T13:17:37.846467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.832567Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":"8828a6d0-cc3c-4fd1-96ec-3889210d1659","year":2018},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.252379Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:b957575fbad8c66056682e4a98c0373513218ca65020b677c2c866f3301f9365","observation_id":"db5b2ffc-cfc0-4def-854a-540962279506","resolution":{"observed_at":"2026-08-14T13:17:37.836699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.05214","last_updated":"2018-09-14T01:15:28Z","snapshot_observed_at":"2026-08-14T18:28:34.848368Z","submitted_at":"2018-09-14T01:15:28Z","title":"Model-Based Reinforcement Learning via Meta-Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.05214","snapshot_observed_at":"2026-08-14T13:17:37.256111Z","title":"Model-based reinforcement learning via meta-policy optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.256111Z"},"links":{"cited_paper":"/paper/1809.05214","citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:814ba6f102fd6f016b712667bb6183067956a0fdd93dfbb16946209f4622cba0","observation_id":"baaf0c54-ea46-4b32-8d0b-f287051b7d20","resolution":{"observed_at":"2026-08-14T13:17:37.256111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.822767Z","title":"and Rasmussen, C","venue":null,"work_id":"38727563-cd43-496b-8e9f-b78c1f745630","year":2011},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.259734Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:c906994e38999a6ed8931083863340d4e94ccea4df5ab94637f5e5874749cfea","observation_id":"419700fa-9bdc-4041-8247-5369737e0ac6","resolution":{"observed_at":"2026-08-14T13:17:37.826065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.813094Z","title":"S., Landau, S., Leese, M., and Stahl, D","venue":null,"work_id":"220327bc-3ae0-4809-bac0-ebf23c893b48","year":2011},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.264166Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:5ea027a9b5371a3d7436bc5c803a52d02ef752c37074069b5d5a0b240b16906b","observation_id":"56bfb4ff-688c-4536-908c-472cd95ce25e","resolution":{"observed_at":"2026-08-14T13:17:37.816275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00101","last_updated":"2018-02-28T21:43:37Z","snapshot_observed_at":"2026-08-16T03:18:43.932234Z","submitted_at":"2018-02-28T21:43:37Z","title":"Model-Based Value Estimation for Efficient Model-Free Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00101","snapshot_observed_at":"2026-08-14T13:17:37.267563Z","title":"I., Gonzalez, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.267563Z"},"links":{"cited_paper":"/paper/1803.00101","citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:6d086eaf5d1d647840d5f0040e9843408608e1d145e9ce375043c50a01005363","observation_id":"f18e2050-0ec2-43d4-b79d-1a4833bbc2ea","resolution":{"observed_at":"2026-08-14T13:17:37.267563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.803480Z","title":"E., Prett, D","venue":null,"work_id":"d59f6a01-f41d-42bc-afa3-792fdfdf41e0","year":1989},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.271862Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:646ca5c8b7f9078612551378ddcd0a342869717ca82c19b0414ee5ec37f2594e","observation_id":"17609a03-51e6-4ea6-ac2e-5624f0034d74","resolution":{"observed_at":"2026-08-14T13:17:37.807117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.792079Z","title":"Continuous deep q-learning with model-based acceleration","venue":null,"work_id":"789f6c91-a562-4357-bae5-579f7766ebc4","year":2016},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.275335Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:2f5db15cbd512ac059025ef6b033ac951045eb766cfa60f17edeed1ee320c321","observation_id":"8b727540-6c4d-4ceb-947c-3d31e4fce761","resolution":{"observed_at":"2026-08-14T13:17:37.796375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.781898Z","title":"and Boedecker, J","venue":null,"work_id":"9f247b15-4c7f-475b-b6d5-80bbb278e9be","year":2017},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.279350Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:507ca16bf6995473d0e7c8baebd515357b238684db1dcb70d5c120aa86314326","observation_id":"0d1db2bb-987b-4666-b769-6a848141db83","resolution":{"observed_at":"2026-08-14T13:17:37.785524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.771599Z","title":"and Deisenroth, M","venue":null,"work_id":"379ec034-607d-4d9c-a9ac-254f97b128f8","year":2018},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.282549Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:7dc0c95629fc7cb2a3c63d9d2a2603908fbc80de75355b0ca944ede18e8ca81e","observation_id":"62f1c7ac-bbd8-4ffc-9363-3849a644eb33","resolution":{"observed_at":"2026-08-14T13:17:37.775589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.761125Z","title":null,"venue":null,"work_id":"6ae7ce36-4413-4d8c-bd48-a753cc1f3254","year":2015},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.286557Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:08df4feec3e01df69cdc33993e0d0aac41cd0f5038c6033e3fb52d315fa4b13a","observation_id":"5358cb5e-add2-4517-92d0-88e34577ed48","resolution":{"observed_at":"2026-08-14T13:17:37.765337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.751217Z","title":"Model-ensemble trust-region policy optimization","venue":null,"work_id":"b07295a4-7669-4866-a7ab-094c1b92ff74","year":2018},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.289984Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:211594adc787bdd9b12cce12e838784531a1e3d4066f804987fc0940d13a2c14","observation_id":"5616f29b-bf39-4dec-a9f4-6b963d9b0ceb","resolution":{"observed_at":"2026-08-14T13:17:37.755074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.741443Z","title":"and Abbeel, P","venue":null,"work_id":"07210855-b1a1-435f-a4cd-54c21be86583","year":2014},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.294269Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:bdecc66df5c208a55f2138159936e9dfc4f846a5de9e0343fe2c3df434fdbf61","observation_id":"a455a082-acb5-44ae-9899-2397c76d6ff5","resolution":{"observed_at":"2026-08-14T13:17:37.744962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.731461Z","title":"and Koltun, V","venue":null,"work_id":"09634543-cbe1-46b3-842a-77f56b5b31c5","year":2013},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.298373Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:fa49b008bcf3d55ea3f6ba7a9853f95ed3cb4c637897676a743c1c74f9f58938","observation_id":"8b8bcc0f-1d01-4f8b-b510-07c1bf1bd264","resolution":{"observed_at":"2026-08-14T13:17:37.734923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.721981Z","title":"P., Hunt, J","venue":null,"work_id":"70c00562-779b-4d60-ae1b-bda6129305e4","year":2016},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.301710Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:19040a671e9ba63e007db9fe39bcc7492da2e237ea6dbf3295422d56cf0107e0","observation_id":"75a62b1e-2405-4a33-b68e-ee12129cb0ee","resolution":{"observed_at":"2026-08-14T13:17:37.725309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.712093Z","title":"Plan online, learn ofﬂine: Efﬁcient learning and exploration via model-based control","venue":null,"work_id":"df0cb095-2eed-4a89-99af-31698f23f08c","year":2019},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.305679Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:ce7a74a954d36b8d195962d9b1ee178ae135d27cf50c874fe5c578c1e9c65cf0","observation_id":"fbae266b-1913-4a45-9076-ca6ab5126c0d","resolution":{"observed_at":"2026-08-14T13:17:37.715706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.702246Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"0e133ede-ba0d-464a-ad11-122b422fb2f8","year":2015},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.309048Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:719c5230c1321bc639fdcf7422bbe6f1bfc5566fad91c1844af2d6a3073874bf","observation_id":"73cf11d9-66b6-44a8-9c0c-bdf1439f05cd","resolution":{"observed_at":"2026-08-14T13:17:37.705794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.692352Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"5177a1f6-1053-49ca-91df-e63da864400e","year":1928},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.312694Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:91d66c9ac96301d822bb6ed813cd11267f8f51554053a178340ea3bd35c6562a","observation_id":"a1865dd4-34dd-4762-b6dd-ee2de984ae6d","resolution":{"observed_at":"2026-08-14T13:17:37.695918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.680881Z","title":"S., and Levine, S","venue":null,"work_id":"45d1c374-5771-4712-ac74-995bacacf1f2","year":2018},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.316047Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:e8d51d3189cfca801e17302a73374a2587bad1d5b0a9bdc23147880cac575f87","observation_id":"c68fccc3-3412-44ce-b418-421eb2ef496f","resolution":{"observed_at":"2026-08-14T13:17:37.684445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.669869Z","title":"Value prediction network","venue":null,"work_id":"1be4f25a-211e-4491-a19f-94c569fbf70c","year":2017},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.320395Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:be3d2b15861fd829401fbf6ac8677129cc828745f3c44a1298715c53a4c6d984","observation_id":"d4d28720-0592-4490-a536-5e382e40fa1d","resolution":{"observed_at":"2026-08-14T13:17:37.674084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.658933Z","title":"Temporal difference models: Model-free deep RL for model-based control","venue":null,"work_id":"6fd7c82f-7bbe-4b19-b9e1-b62f86bb6374","year":2018},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.324112Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:ebe31f604dadf6272ff998ebc9cc431d7c3684c70a8fba7af9b302cab37d3807","observation_id":"ac5f6293-98cb-4644-be0e-142b86ac56b5","resolution":{"observed_at":"2026-08-14T13:17:37.662538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.647656Z","title":"Imagination-augmented agents for deep reinforcement learning","venue":null,"work_id":"f2ddce20-28d6-49e9-883c-0a115fba6c33","year":2017},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.327996Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:3d67a1cf7aec84928649f375d8b218e2c10fe53476a7469d6f6c760bae4a8739","observation_id":"f1718961-02c7-49f5-8569-33c92c5bf7aa","resolution":{"observed_at":"2026-08-14T13:17:37.651777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.637927Z","title":null,"venue":null,"work_id":"c7b6799f-2ddc-4d88-8ad4-6abfb2b9cba5","year":2005},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.332256Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:bbda9056fedd1394bb7d3f7eff131de0c0ddc911d2cc40056bcef5fb19c85a08","observation_id":"39317062-92d7-4dfb-94ff-e2981f9a1b85","resolution":{"observed_at":"2026-08-14T13:17:37.641438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.628231Z","title":"The cross-entropy method for combinatorial and continuous optimization","venue":null,"work_id":"9ff76286-90ce-4ab4-87e4-6ad71b684a8e","year":1999},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.336076Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:2aeee5d0eb2b383d8caa49a2994bbf559290a2c5a5a2331d09a40cf5c6ef4412","observation_id":"a9447858-dad8-455c-840a-2e3088c36866","resolution":{"observed_at":"2026-08-14T13:17:37.631844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.617402Z","title":"Trust region policy optimization","venue":null,"work_id":"3a09eaeb-8ede-4670-af95-393fd1a8ce4e","year":2015},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.339587Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:e2deee62ffec09fa08fec4e8af3d04a4726352bc62001e1cdbc9e11c4269d8a1","observation_id":"206744e1-bfc8-4557-a0f1-b9801517f350","resolution":{"observed_at":"2026-08-14T13:17:37.621638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.606333Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":"e0b2dc37-7d38-429b-b196-383392a91dfd","year":2016},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.342974Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:eff82618c8ad29e2b1a4abd72ee8c74bbf55e9806b5e9242af4b3e0c5e55869c","observation_id":"bb6bb807-7553-4ba6-968b-46024598ae29","resolution":{"observed_at":"2026-08-14T13:17:37.610305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-14T13:17:37.346297Z","title":"Proximal policy optimiza- tion algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.346297Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:eece0410085b4b12066a4b6a8018c8b59ab9dde65269fbc47b62fe3fdc8684ae","observation_id":"5b4a165f-b097-4e28-a023-39fa80f1ef2a","resolution":{"observed_at":"2026-08-14T13:17:37.346297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.596333Z","title":"S., and Müller, M","venue":null,"work_id":"996d7cba-790b-47d1-a7e3-9e1775124753","year":2008},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.350120Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:1acb2d32e5c21dcdd9659a3f798312f4d1b3a5e1ab286ed87ab7d444c07702c1","observation_id":"1daab8d8-610c-45b8-87a9-8c9881af384a","resolution":{"observed_at":"2026-08-14T13:17:37.599830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.586270Z","title":"J., Guez, A., Sifre, L., Van Den Driessche, G., Schrittwieser, J., Antonoglou, I., Panneershelvam, V ., Lanctot, M., et al","venue":null,"work_id":"ae9e1e48-ad5a-40bf-8bd3-bfcc06eb1d4f","year":2016},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.353658Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:69c8310b9efb7194098bc9afe33f43f40fb0de2f5b7a06f9034a937623ce6fa8","observation_id":"04afc63b-720a-4d19-be61-ed2d927076be","resolution":{"observed_at":"2026-08-14T13:17:37.590146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.577263Z","title":null,"venue":null,"work_id":"831f2935-7239-414a-a9a2-aa52f6c57682","year":1990},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.357524Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:ffac438c2c9351bd9237b88a00a816b1f17d67ba1f88c9168ce568b0add6136a","observation_id":"e847c61d-8b81-484e-982a-f3fda0f64d4d","resolution":{"observed_at":"2026-08-14T13:17:37.580310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.567004Z","title":null,"venue":null,"work_id":"d7b0b858-d613-4cd6-81c5-d0ca7dc2f645","year":1998},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.361972Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:b74ed5b8a0c13c55328c60f82adb672bccffffd479b735527d818ad1650a0a33","observation_id":"38e879ad-ee36-4b66-8541-fa97091598cc","resolution":{"observed_at":"2026-08-14T13:17:37.570878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.556954Z","title":"S., McAllester, D","venue":null,"work_id":"27c802a7-fa0a-4ef8-81bb-86126a138660","year":2000},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.365475Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:346d634a00e9de05f225fdcacd7b11c913ffdc2993a53c1717fecffd35ad68ef","observation_id":"8ce5b5d7-cbcd-4d57-92c7-81690b31f1fa","resolution":{"observed_at":"2026-08-14T13:17:37.560709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.546611Z","title":"S., Szepesvári, C., Geramifard, A., and Bowling, M","venue":null,"work_id":"fa84eaf5-f115-4679-997f-c542e96a637e","year":2008},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.368753Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:096a6b2757f73a7abd762d4a8017df7e16ee2c24bbcf582129fa1fd3d09d52a0","observation_id":"d841f841-efcc-425f-a60a-f814578cc467","resolution":{"observed_at":"2026-08-14T13:17:37.550369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.535574Z","title":"Value iteration networks","venue":null,"work_id":"7173aed6-c83c-4243-8e70-d176f6018f48","year":2016},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.372152Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:5add67f5395d10324175cd00e59a778bcba718a3dd904dc325a9c318e38c2ec3","observation_id":"48f487be-f315-421f-89be-0fea53bf9a3f","resolution":{"observed_at":"2026-08-14T13:17:37.539359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.523615Z","title":"Synthesis and stabilization of complex behaviors through online trajectory optimization","venue":null,"work_id":"faeb4dee-72a1-41e1-840e-d4a4a4b72dd3","year":2012},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.376395Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:92e48318a7da329948b8e7480e518caf8542a77a3150e86f6f2cef08d2cb137e","observation_id":"af888445-fc10-4297-ba8d-c89d6c3db530","resolution":{"observed_at":"2026-08-14T13:17:37.527957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.511382Z","title":"Control-limited differential dynamic programming","venue":null,"work_id":"30fe5516-865d-46b5-a9b7-32d7c99e1c45","year":2014},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.379869Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:68466b756d2fa9de7c65b5a6140073c41efbc6f74f1195adcc1edb3a3ec87b3e","observation_id":"de43765c-0643-4f15-9614-49ef7830ea3d","resolution":{"observed_at":"2026-08-14T13:17:37.515660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.499382Z","title":"and Li, W","venue":null,"work_id":"f2bac67f-b7e5-4574-b2bb-930eff857140","year":2005},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.383098Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:80f266044a9d079b3084d127d612265827a0a6d1cd9834ab8769374ddb20e272","observation_id":"3eadc33b-c3f6-455d-9ec8-dd2eba3fa775","resolution":{"observed_at":"2026-08-14T13:17:37.502924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.488201Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"89d53411-e730-402a-8936-0edbe9580b6a","year":2012},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.386536Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:8417207e3d24584a10572ff200cd68188ef30aa366348b582ded469a6339fa91","observation_id":"53a07cd6-27fe-4312-952c-055db9881305","resolution":{"observed_at":"2026-08-14T13:17:37.492279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.475382Z","title":"M., Boots, B., and Theodorou, E","venue":null,"work_id":"a3e56cb3-e2d8-4318-bbed-7d64821e2898","year":2017},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.389840Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:34a6ee32ae7a2c0b0781e22853f2ea9e4e31e8374922bd4fccbbf0ebc251cd40","observation_id":"353316e4-5ba0-4ae4-9ea6-1e772cb52d01","resolution":{"observed_at":"2026-08-14T13:17:37.480079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.464678Z","title":null,"venue":null,"work_id":"83ec9289-3291-4e06-86d1-e904ac7b9860","year":1992},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.393125Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:fa9830e9783bb45081eb5550aff547682d390bc0d90413144ed29b02986dd418","observation_id":"5759920e-d39d-4673-8b30-067003c84a6f","resolution":{"observed_at":"2026-08-14T13:17:37.468351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:17:37.451861Z","title":"Learning deep control policies for autonomous aerial vehicles with mpc-guided policy search","venue":null,"work_id":"a71d7f79-2d1f-47e4-8b71-6d2f8079aa32","year":2016},"citing_paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T13:17:37.396552Z"},"links":{"citing_paper":"/paper/1908.06012"},"observation_digest":"sha256:ed98097220d046083e0dc965199763a4da518a8e9be862716f295f801f603be2","observation_id":"c0b22320-15d7-462f-8600-aa8f9b155c09","resolution":{"observed_at":"2026-08-14T13:17:37.457788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.06012","last_updated":"2019-08-15T04:10:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T09:03:25.335800Z","submitted_at":"2019-08-15T04:10:13Z","title":"Model-based Lookahead Reinforcement Learning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:1908.06012."}