{"as_of":"2026-08-07T15:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88958d6a93530c30bbf1d7e3f2d5ac5848e1aa6d90db883ab4d3fae477d41848","coverage":[{"denominator":197,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:28:55.851695Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:14:58.076642Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:17:30.887576Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"cited_work":{"arxiv_id":"2507.13491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13491","snapshot_observed_at":"2026-07-03T01:17:30.887576Z","title":"arXiv preprint arXiv:2507.13491 (2025)","venue":null,"work_id":"7aea9ea1-e839-4945-b0ac-444e6e66eced","year":2025},"citing_paper":{"arxiv_id":"2606.10167","last_updated":"2026-07-31T12:05:24Z","snapshot_observed_at":"2026-08-05T23:10:46.115458Z","submitted_at":"2026-06-08T20:53:11Z","title":"FlexPath: Adapting Learned Connectivity Guidance to Path Preferences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T16:41:29.124842Z"},"links":{"cited_paper":"/paper/2507.13491","citing_paper":"/paper/2606.10167"},"observation_digest":"sha256:545679c299c8843d1bde28ffaf9162f60609a257a914a12bac65d688664d3312","observation_id":"b10582df-bbf4-4826-8a45-9d474592ab6d","resolution":{"observed_at":"2026-07-03T01:17:30.888870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13491","snapshot_observed_at":"2026-08-03T02:14:58.076642Z","title":"arXiv preprint arXiv:2507.13491 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10167","last_updated":"2026-07-31T12:05:24Z","snapshot_observed_at":"2026-08-05T23:10:46.115458Z","submitted_at":"2026-06-08T20:53:11Z","title":"FlexPath: Adapting Learned Connectivity Guidance to Path Preferences","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T02:14:58.076642Z"},"links":{"cited_paper":"/paper/2507.13491","citing_paper":"/paper/2606.10167"},"observation_digest":"sha256:15d9c4d77b390490f61c6a47ab00de4420efa07326ee6d7c2363e7e56aae001b","observation_id":"58d072fe-1c40-4f82-8c23-b2706d46233e","resolution":{"observed_at":"2026-08-03T02:14:58.076642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13491/citation-record","integrity":"/paper/2507.13491/integrity","json":"/paper/2507.13491/citation-record.json","paper":"/paper/2507.13491"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.313392Z","title":"Preference-Based Policy Learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.313392Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:1ddf5487ac003838933f74570c088c6d3ddfdcefd7a8b7d1091a1dbe1d45db2b","observation_id":"e7c15d3a-7095-4920-9d5d-3d6c1593fed2","resolution":{"observed_at":"2026-08-06T16:28:44.313392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.348210Z","title":"Ames, Samuel Coogan, Magnus Egerstedt, Gennaro Notomista, Koushil Sreenath, and Paulo Tabuada","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.348210Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:71c228ae16a69550fe5e0679096f2cff43c3346e252a0ab3517e6c682b640ca8","observation_id":"736f3e60-5c53-4c76-959e-8599b463cd58","resolution":{"observed_at":"2026-08-06T16:28:44.348210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T16:28:44.452672Z","title":"Concrete problems in AI safety, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.452672Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:62404ba2d5b54217d023bfd1135e5c396009dd4db7c8058b89215c2351204ff8","observation_id":"f9df93c7-572c-43c2-a873-0318a593964b","resolution":{"observed_at":"2026-08-06T16:28:44.452672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.519797Z","title":"Zico Kolter","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.519797Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:49217fe4a519019359f05688987c13f06e3744f8d33f087f0b7e5ce58ad2272c","observation_id":"efb99a98-d436-42d6-9235-86b8f095e65f","resolution":{"observed_at":"2026-08-06T16:28:44.519797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.620576Z","title":"A Painless Deterministic Policy Gradient Method for Learning-based MPC","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.620576Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:9f70b456545145c1cf1a11cd753962e922a0d98a3688c84663de8a06b4a16f3e","observation_id":"279dd837-77d0-419d-9e8a-9a0a0b40d59f","resolution":{"observed_at":"2026-08-06T16:28:44.620576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.695472Z","title":"Andrychowicz et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.695472Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5ffc7c7af9257f6272a99e538091e443a2d49c91bd1af811c71a39a83b695c7d","observation_id":"74523618-bc9c-4258-8f83-4476fcbdb7fc","resolution":{"observed_at":"2026-08-06T16:28:44.695472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.789971Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.789971Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:1c7756161e662199b9cdf42c1e7e0b7be22153ae13aeabf4995ff239ffde5359","observation_id":"7df2d093-7db2-4c00-aef9-79947ba475b5","resolution":{"observed_at":"2026-08-06T16:28:44.789971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.844883Z","title":"MPC-based reinforcement learning for economic problems with application to battery storage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.844883Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:c6817ca26796276764baef4d42f6900db3fc57e0bb79352800eb8ea8c389f2fd","observation_id":"c6c96e72-488e-406e-b02b-cbd403035d0b","resolution":{"observed_at":"2026-08-06T16:28:44.844883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T16:28:44.984676Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.984676Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d5dbd7eec2f04b3b9100597826d1a03da44339bf98c0b75c391ff952efde9d7f","observation_id":"0639dd66-ad08-4362-9d8e-7181577964a9","resolution":{"observed_at":"2026-08-06T16:28:44.984676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13289","last_updated":"2025-03-17T15:38:41Z","snapshot_observed_at":"2026-07-06T20:54:00.272496Z","submitted_at":"2025-03-17T15:38:41Z","title":"Local-Global Learning of Interpretable Control Policies: The Interface between MPC and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.13289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13289","snapshot_observed_at":"2026-08-06T16:29:09.371651Z","title":"Local-Global Learning of Interpretable Control Policies: The Interface between MPC and Reinforcement Learning","venue":"eess.SY","work_id":"8e28f4aa-bd54-4e79-babb-4716775f6293","year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.059769Z"},"links":{"cited_paper":"/paper/2503.13289","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:8a77714b5584c7583bfe12b3d2b9d7a67701219314cfb6a75400e056569c84c9","observation_id":"ee64041e-14be-4679-915b-e94e3e37f4e0","resolution":{"observed_at":"2026-08-06T16:29:09.504750Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.136798Z","title":"Gradient-Based Framework for Bilevel Optimization of Black-Box Functions: Synergizing Model-Free Reinforcement Learning and Implicit Function Differentiation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.136798Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:9a7bbf0697cbdbce70edb1a05bdf3a618127d72deb8f8989f75b0e1c37d96861","observation_id":"e10bdf5b-55f9-4429-8028-5a0167c0c045","resolution":{"observed_at":"2026-08-06T16:28:45.136798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.265231Z","title":"Bellemare, Will Dabney, and R´ emi Munos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.265231Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:52f062e1de10fb5f6f5aed03ba5f3a35a83e0dd48ec1686899d8c91296d643c6","observation_id":"7e45a85b-b174-41cd-b8ba-18859ed100df","resolution":{"observed_at":"2026-08-06T16:28:45.265231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.332034Z","title":"Bellman and R","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.332034Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2b7c82b80c1284a5076d9a3d58e60107d041268d524b6e772a1c190236d3b6e8","observation_id":"d3a9b809-f4c7-4026-8e52-51fe473b0f40","resolution":{"observed_at":"2026-08-06T16:28:45.332034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.439282Z","title":null,"venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.439282Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d27fb1412e1dcf30314f7ebf62c5a8101cbf0b07444de8cd80fccc749bb60793","observation_id":"d64caec5-61eb-42b2-a2ca-86a1f1031cb1","resolution":{"observed_at":"2026-08-06T16:28:45.439282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.540272Z","title":"Bellman and Stuart E","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.540272Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:18a66fe9f7f20a5b2b533b3f88bcec34762d777f0876ee41689e97e29ab0ad44","observation_id":"7eec9bcf-9dad-4f14-be9f-c1a51c041c06","resolution":{"observed_at":"2026-08-06T16:28:45.540272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.695771Z","title":"Schoellig","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.695771Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4d478822f8bede237b96cabdc1ab4819a924cb9d9a628f9be7039249916d28ae","observation_id":"a94bedd2-011e-4ad1-a77d-0967f5ae8ea3","resolution":{"observed_at":"2026-08-06T16:28:45.695771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.768307Z","title":"Bertsekas and J.N","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.768307Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:c6fca212d8aa2c41f2ebed99e44e981ea2f8670d84953114e90e3caa93e7656a","observation_id":"70d7ae2f-36db-4924-acdd-859280358ef8","resolution":{"observed_at":"2026-08-06T16:28:45.768307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01786","last_updated":"2022-06-20T01:01:28Z","snapshot_observed_at":"2026-08-03T04:00:13.171730Z","submitted_at":"2019-06-05T02:12:22Z","title":"Global Optimality Guarantees For Policy Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01786","snapshot_observed_at":"2026-08-06T16:28:45.850097Z","title":"Global optimality guarantees for policy gradient methods, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.850097Z"},"links":{"cited_paper":"/paper/1906.01786","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:b7a2095811600789afd4eebdf55ce4463be4fa099dbdce6a205f1e80de18a57b","observation_id":"e89928d0-be98-41fd-bd19-ef0392e64aaa","resolution":{"observed_at":"2026-08-06T16:28:45.850097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.07484","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:29:09.065491Z","title":"Differentiable optimization-based control policy with convergence analysis, 2025","venue":null,"work_id":"8671820e-8e1c-4393-91bf-9867d1cd5b72","year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.951592Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:b37898c54701790a03f0004245d8769a4d7c31b3e0bbe3247dfdf93c7098ca1a","observation_id":"edd22dfd-71d3-4edb-b8c1-83b28c67ec73","resolution":{"observed_at":"2026-08-06T16:29:09.213959Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.050703Z","title":"A survey on high- dimensional gaussian process modeling with application to Bayesian optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.050703Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:82b460f347e18f9a996d1e236d0cc56ae65d5d818712c7d09fcbcce4ba1b1f4f","observation_id":"44f8d265-bd48-4174-907b-d3713d88d0c8","resolution":{"observed_at":"2026-08-06T16:28:46.050703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.156986Z","title":"Blondel and John N","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.156986Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2eea32267735d84d5508877c05eaa628e25225ee9dd6a73091984812dc733539","observation_id":"102b9f4c-3129-4893-97b9-b00f3e38031e","resolution":{"observed_at":"2026-08-06T16:28:46.156986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.328192Z","title":"Time-varying gaussian process bandit optimization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.328192Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f5c3637ad73b1b2603710c94f8c804c7ffb142de9bff456084746a4ddbf87433","observation_id":"c330312f-fc5c-4212-8054-8f184cb8be85","resolution":{"observed_at":"2026-08-06T16:28:46.328192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.479989Z","title":"Optimization of the model predictive control meta-parameters through reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.479989Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5c001e126748aee79762e9109694922ce566394e59378b9dc81e74798f8f5dd0","observation_id":"7916b5ca-9698-422b-881a-7bb00e47feb2","resolution":{"observed_at":"2026-08-06T16:28:46.479989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.686707Z","title":"Safe Learning in Robotics: From Learning-Based Control to Safe Reinforcement Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.686707Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:ad16ff9c1707bdb33118a0290c28355925266c38a7948a1b365a7c0b5ffa4507","observation_id":"ec0938e2-b854-4aef-bd12-b00dc26d9cd8","resolution":{"observed_at":"2026-08-06T16:28:46.686707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.823255Z","title":"On controller tuning with time-varying bayesian optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.823255Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:651937b703a3b9520b03e600548f516ea4ad3416b888acd3fd1c210f19404b3e","observation_id":"699c5d58-a22e-4094-9152-2cf237b4d36c","resolution":{"observed_at":"2026-08-06T16:28:46.823255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.982388Z","title":"Reinforcement Learning of the Prediction Horizon in Model Predictive Control","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.982388Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:a0576bb56c784fc5d4a518dce4eaefbf35184aa35d6be7be44e688e800eb8442","observation_id":"5fac73f7-f300-4eb5-9c54-2955187f2821","resolution":{"observed_at":"2026-08-06T16:28:46.982388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08634","last_updated":"2021-08-05T09:07:47Z","snapshot_observed_at":"2026-07-06T11:19:49.354722Z","submitted_at":"2021-06-16T08:39:51Z","title":"MPC-based Reinforcement Learning for a Simplified Freight Mission of Autonomous Surface Vehicles","version":2},"cited_work":{"arxiv_id":"2106.08634","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.08634","snapshot_observed_at":"2026-08-06T16:29:08.648235Z","title":"MPC-based Reinforcement Learning for a Simplified Freight Mission of Autonomous Surface Vehicles","venue":"eess.SY","work_id":"4b275c76-f973-437d-bce0-4454db11cba7","year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.092643Z"},"links":{"cited_paper":"/paper/2106.08634","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:3dfca0097ce480a70f7bd09ab2e1ab9e30091922724dc952f7f25a086ca36930","observation_id":"887bc6a0-2a96-40e9-96a6-4d7120bcee16","resolution":{"observed_at":"2026-08-06T16:29:08.828872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.285611Z","title":"Chan, Georgios Makrygiorgos, and Ali Mesbah","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.285611Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:ae13a981722b9a75ca7225c1316ac8ec2a1e0ff11b1bc9b9a0864c18549aea69","observation_id":"a305b5f0-1d9e-4f0c-b911-0ed010ca3d25","resolution":{"observed_at":"2026-08-06T16:28:47.285611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.464764Z","title":"Chan, Joel A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.464764Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:74e7df3df39d1b2e008193a933d2d32ac87a15ab018af2a905578fb91d7021ca","observation_id":"9d9d0d33-fdc7-4195-9439-1c98130e8f3b","resolution":{"observed_at":"2026-08-06T16:28:47.464764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.634740Z","title":"Chan, Joel A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.634740Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f2c7e3baf1ac8895700e19d90fc7eab78cfac030da9f6d5e3e855a5f34e54caa","observation_id":"d1d7ee7f-01f0-4376-89fc-33052a11e5c3","resolution":{"observed_at":"2026-08-06T16:28:47.634740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.786612Z","title":"Goal- conditioned reinforcement learning with imagined subgoals","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.786612Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4088f7f24644b6f14c99ec9ebb4c37b1337b40ff7c3059d8808630b5e3349e82","observation_id":"d457332e-e506-43d3-acf3-fa455d5f8e69","resolution":{"observed_at":"2026-08-06T16:28:47.786612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.902314Z","title":"Gnu-RL: A precocial reinforcement learning solution for building hvac control using a differentiable MPC policy","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.902314Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:1b87ca5ac4fa93021cb631c385edecfb2ec3a410bea868f9a8c6682c6f0ac9a3","observation_id":"341b75b4-268e-4423-ad7b-b587ad2b3266","resolution":{"observed_at":"2026-08-06T16:28:47.902314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.026251Z","title":"Intrinsically motivated reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.026251Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:be2b8af9a2d6d7e974247020c826c240740fddd2e4f34f73d10042b86af83079","observation_id":"15a8427b-cd1e-4084-a8ce-f952fa813103","resolution":{"observed_at":"2026-08-06T16:28:48.026251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.183329Z","title":"Run- indexed time-varying Bayesian optimization with positional encoding for auto-tuning of controllers: Application to a plasma-assisted deposition process with run-to-run drifts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.183329Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:377428bb735c91a484d0d1e122f754818a044f5ceda868d6f444143973b5b5d3","observation_id":"bd2f87d3-5984-4d34-8c62-8fc395dabd9a","resolution":{"observed_at":"2026-08-06T16:28:48.183329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.303134Z","title":"Choksi and Joel A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.303134Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:33af19b578b271ac11fe7d173d0cce0fd5277a605ee3f7eaf2523297ddf373b2","observation_id":"0abc7c5a-9e60-4a74-9f52-ac1856ce4cc3","resolution":{"observed_at":"2026-08-06T16:28:48.303134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.442695Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.442695Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4adc31bd35ea1689c2bc79e3183d8562c2ac3ef5f75ac20fd7554da0a911ef6f","observation_id":"0cf21be5-ca6d-415f-a1fa-7091b8de664e","resolution":{"observed_at":"2026-08-06T16:28:48.442695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.547102Z","title":"Model-Based Reinforcement Learning via Meta-Policy Optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.547102Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:b5db34ff3094c9807087af0a06d986badb4528b88ae1f3dba6d89c933af4cf54","observation_id":"a60f030e-1dfb-4b31-9acd-9b4ec375c21c","resolution":{"observed_at":"2026-08-06T16:28:48.547102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.650902Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.650902Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:fdf3067e7bc1556b8a0526f660fc34ca11c4ed9a10ab2c516d33e51226cee2ea","observation_id":"f9a3e710-ab57-484d-820e-0e6b676855d4","resolution":{"observed_at":"2026-08-06T16:28:48.650902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.783973Z","title":"Bayesian reinforcement learning in continuous POMDPs with gaussian processes","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.783973Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:bb5e60423190ee0b26abd0580b76173bcef31ef11ef8ccdadb6f818bb3817bc8","observation_id":"7a8d9023-da0c-450b-851c-1a65e2b602fa","resolution":{"observed_at":"2026-08-06T16:28:48.783973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.920530Z","title":"Unexpected improvements to expected improvement for Bayesian optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.920530Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:304145911035e687c4952f5b0da2f018853b72052ea3e43466b0b85f2dbbd1ac","observation_id":"2abae544-0be7-4f26-bd71-66a3cc4029ba","resolution":{"observed_at":"2026-08-06T16:28:48.920530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.997747Z","title":"Differentiable Expected Hypervolume Improvement for Parallel Multi-Objective Bayesian Optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.997747Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:6383035d8d6293ad891fab09afc1704d767c45397093d1f49d01bc47dcb44d0c","observation_id":"c29a358d-7667-4e93-ad4c-d012972837d5","resolution":{"observed_at":"2026-08-06T16:28:48.997747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.142742Z","title":"Multi-objective Bayesian optimization over high-dimensional search spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.142742Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f24425b01fcf04b489331de161acbdbead3853c9fd4de57fc67c983dc897f783","observation_id":"2c7f02ae-cf66-49e7-80de-7ad56ca92293","resolution":{"observed_at":"2026-08-06T16:28:49.142742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.230348Z","title":"Osborne, and Eytan Bakshy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.230348Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:915da089c5976f81ea2330b180d248ef0def985d5f2f0f880c3b90b6c124a060","observation_id":"e9fc999d-c90b-4519-9d40-38384e5579b4","resolution":{"observed_at":"2026-08-06T16:28:49.230348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.336397Z","title":"Mixed-Variable Bayesian Optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.336397Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:208b137f8570aea1103af52d53775e6d8ec838efbca00fd0399f2af63f606bac","observation_id":"0210de10-1e39-41e0-9adb-1464d20d7cd5","resolution":{"observed_at":"2026-08-06T16:28:49.336397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.483170Z","title":"Gymnasium robotics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.483170Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d8e5240fe298dc47cc92eed3fa06ded1e1843b9c277c02f39a547c956de22720","observation_id":"c4d791cb-6b20-44d3-85bf-1894a20a4ff3","resolution":{"observed_at":"2026-08-06T16:28:49.483170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.608731Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.608731Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:835d4b44853de1e77ad68cf91a788057865a728ea35dd50c28c917f455480c0e","observation_id":"aaa953c0-6213-4f62-bc61-5b55584bdb5f","resolution":{"observed_at":"2026-08-06T16:28:49.608731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:28:49.753278Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.753278Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4ff9b2e277cfa60445ff0cdcd11694b96e0612700abbda9d31db3875532c65c5","observation_id":"5cacf78e-d92e-4915-90aa-72c9e3ddf18c","resolution":{"observed_at":"2026-08-06T16:28:49.753278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.848569Z","title":"Dontchev and R","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.848569Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:78592ad3bd10261fdf08b82b83d14d6d5a212b2d4c24981f1e17856bd85d431e","observation_id":"e693109d-d6be-4568-a411-8a93d5e9af38","resolution":{"observed_at":"2026-08-06T16:28:49.848569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.980220Z","title":"Additive Gaussian Processes","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.980220Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5fd1ffea776770039abda10b10ed4293768806258cb887895de56e8f1187318c","observation_id":"db3c00b8-6091-4279-a1ed-e52b829f7813","resolution":{"observed_at":"2026-08-06T16:28:49.980220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.02244","last_updated":"2020-01-07T19:00:39Z","snapshot_observed_at":"2026-08-05T12:13:09.530705Z","submitted_at":"2020-01-07T19:00:39Z","title":"Infinite-Horizon Differentiable Model Predictive Control","version":1},"cited_work":{"arxiv_id":"2001.02244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.02244","snapshot_observed_at":"2026-08-06T16:29:08.440053Z","title":"Infinite-Horizon Differentiable Model Predictive Control","venue":"math.OC","work_id":"95d63493-9bfd-4767-bec1-0cddab48d096","year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.126635Z"},"links":{"cited_paper":"/paper/2001.02244","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:56ab3d4e197900c4b5f765026b44d276883d6f159b92cfa899b77c40af7a784a","observation_id":"d6aaf8e2-8427-4164-8dc6-f5e214697488","resolution":{"observed_at":"2026-08-06T16:29:08.505055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.200406Z","title":"High-dimensional Bayesian optimization with sparse axis-aligned subspaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.200406Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f93c89e6f17ea8fe10bb41f751973e6b06a849c4d340206567a0119b39f1f96c","observation_id":"06272063-febb-48c6-81fb-68f7c30fa691","resolution":{"observed_at":"2026-08-06T16:28:50.200406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.286025Z","title":"Scalable global optimization via local Bayesian optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.286025Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:a83de9089b51b6327ae31f8f2a4a3f69198ebf54291327aabdef8bbdc6eb21a9","observation_id":"b2a58269-5ccb-48f9-a0c1-d8760b45e2b1","resolution":{"observed_at":"2026-08-06T16:28:50.286025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.355960Z","title":"Policy Gradient Reinforcement Learning for Uncertain Polytopic LPV Systems based on MHE-MPC","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.355960Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:556ab0315b686a4a5cf244f04f112145202f06d326c928d0a256918baac88857","observation_id":"9a96bcb0-c537-4c9e-8eb3-bf71e8c28156","resolution":{"observed_at":"2026-08-06T16:28:50.355960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.509504Z","title":"Global convergence of policy gradient methods for the linear quadratic regulator","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.509504Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:338abdb7ff4099be7bd3d786f308afea5b93e09eb56c6aca1775a44d0f7877da","observation_id":"7f93373b-1917-41bc-9c87-31d31c96d911","resolution":{"observed_at":"2026-08-06T16:28:50.509504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.622366Z","title":"Dynamic Regret of Policy Optimization in Non- Stationary Environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.622366Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:3a6ed47dc3e13e131a1a56dfdbf02dc56ae017c8a3e6608e28142cce5a22f149","observation_id":"77ebcedc-5837-4f2d-8170-dc463a0941f3","resolution":{"observed_at":"2026-08-06T16:28:50.622366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.780885Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.780885Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:683ad5a66f762f1bb25defa46f77dd0af34cc455376fce4899a7844cf1f44acd","observation_id":"8b0f7a8c-ec51-4041-8806-b5bb94663ed9","resolution":{"observed_at":"2026-08-06T16:28:50.780885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.02811","last_updated":"2018-07-08T13:06:26Z","snapshot_observed_at":"2026-08-07T12:49:05.688504Z","submitted_at":"2018-07-08T13:06:26Z","title":"A Tutorial on Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.02811","snapshot_observed_at":"2026-08-06T16:28:50.893776Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.893776Z"},"links":{"cited_paper":"/paper/1807.02811","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:9dc861bce9b816f074ca70f55084b38819f1fbb49bcfa33d0c235e1d70b146a4","observation_id":"fd8b8bc1-56b0-40bb-8b46-8c1b77b3b521","resolution":{"observed_at":"2026-08-06T16:28:50.893776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.034133Z","title":"Fr¨ ohlich, Melanie N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.034133Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:381b09e479bb7524379a67aeb53f4a839069d33b2b78f05609e37758af674f15","observation_id":"773f0b59-9a33-492f-87e0-917ef673b319","resolution":{"observed_at":"2026-08-06T16:28:51.034133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.160277Z","title":"Fr¨ ohlich, Edgar D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.160277Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:c3427b2d97afdc3789b234c521a2efeca439e6bce63630fd5e0ea51810d4a101","observation_id":"00e4ea5d-0466-47aa-84ee-a3aa545643c7","resolution":{"observed_at":"2026-08-06T16:28:51.160277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.312165Z","title":"Learning robust rewards with adversarial inverse reinforcement learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.312165Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d5876333b4ba8a8e9e8cd0963254656c0b7b0114b235a7f34cfe260b041cded3","observation_id":"ff23afdf-4102-4867-b726-540d9165c9c6","resolution":{"observed_at":"2026-08-06T16:28:51.312165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.482326Z","title":"Bayesian Optimization with Inequality Constraints","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.482326Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:cc0b06a98f574862572064005b1d25cceb23451d1e325626431721894a194f9f","observation_id":"b831fc45-6678-42d8-8e94-55b9ac6dffd5","resolution":{"observed_at":"2026-08-06T16:28:51.482326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.668203Z","title":"Osborne, and Philipp Hennig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.668203Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:60ad8c1175c984d6b333419fa269bf641f6749262c2b8e4451862c941ab505f0","observation_id":"c193070c-d987-433f-aa08-cbd41e63d02f","resolution":{"observed_at":"2026-08-06T16:28:51.668203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.761659Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.761659Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:30e893d8b6178d7aa864ba5d588efb08de157136e39a83814bf6908aab81a2ac","observation_id":"6f48b991-45db-4c75-862f-f415a93ca696","resolution":{"observed_at":"2026-08-06T16:28:51.761659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.901991Z","title":"Identification for control: From the early achievements to the revival of experiment design","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.901991Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:20dadc90e22ad230a01da7d0f38054a1357741de0e24ca666599d0f05f408d3f","observation_id":"c0a25d99-8986-4e75-bd2a-84f1d70266b4","resolution":{"observed_at":"2026-08-06T16:28:51.901991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.092088Z","title":"Multi-objective optimization of a path-following MPC for vehicle guidance: A Bayesian optimization approach","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.092088Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4b6a953b08485f28ce6f35be5a14766e00e5b4370690346f0da1008255a77e17","observation_id":"378c0845-6a81-4a2d-b0be-d0c77d64fd7a","resolution":{"observed_at":"2026-08-06T16:28:52.092088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.188337Z","title":"Lawrence","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.188337Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:381987fec685ba8748241aeb949f79c4222b0669e9f89f2311a3df296c5337a7","observation_id":"a3714ab1-e776-4a58-9962-2c181298f6d7","resolution":{"observed_at":"2026-08-06T16:28:52.188337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.287056Z","title":"Variance Reduction Techniques for Gradient Estimates in Reinforcement Learning","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.287056Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d3b01e299025c7085cf20dc01bb8d06c96ed179169ab1245382d563e2ff7e332","observation_id":"a2018f0b-1014-4e8e-8fb3-56adb8955b9c","resolution":{"observed_at":"2026-08-06T16:28:52.287056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.429909Z","title":"A survey of actor-critic reinforcement learning: Standard and natural policy gradients","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.429909Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:a35939135630a4533ac2a29f4a8373350de967f0b8624c7eb54e3067ec42695a","observation_id":"18675a04-9d78-45a4-867d-9e776506cec3","resolution":{"observed_at":"2026-08-06T16:28:52.429909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.587647Z","title":"Learning for MPC with stability & safety guarantees.Automatica, 146:110598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.587647Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:60c932bc2e91bdae37a50e680e4a9a7c6b72cbe936a8226224339c17343e4f4e","observation_id":"a4aa8710-db08-4f3f-b9b7-30e220691a21","resolution":{"observed_at":"2026-08-06T16:28:52.587647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.681105Z","title":"Safe Reinforcement Learning via Projection on a Safe Set: How to Achieve Optimality? IF AC-PapersOnLine, 53(2):8076– 8081, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.681105Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f51ede2c6152b35c10a5d24502eeff36d9cc69087a12a6b6158e2d98448162b9","observation_id":"cfa3db73-79b8-4c35-9657-0102213c6f3f","resolution":{"observed_at":"2026-08-06T16:28:52.681105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.801739Z","title":"Data-Driven Economic NMPC Using Reinforcement Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.801739Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:de4c0e8c421a11e49e3597a85f5d178f11baed9caeec480f6fedc327be281024","observation_id":"59cf1326-66f8-46b6-a59b-94dda879d8e5","resolution":{"observed_at":"2026-08-06T16:28:52.801739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.917251Z","title":"Reinforcement learning for mixed-integer problems based on MPC","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.917251Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:082230ff2b10a9962a51d4c56a64840ed3a98391c4c0fdea760f0da532664c1a","observation_id":"42ec66f3-8de9-44d8-9d9f-8b8044d6e82d","resolution":{"observed_at":"2026-08-06T16:28:52.917251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.032903Z","title":"Reinforcement learning based on MPC and the stochastic policy gradient method","venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.032903Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:ab24d249e063a49baca0fd35d3b5b23328181450b0e86363e909eaedb20cbd81","observation_id":"4272abc0-ebae-4cb2-b051-432f2bef1fff","resolution":{"observed_at":"2026-08-06T16:28:53.032903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.215348Z","title":"Guerreiro, Carlos M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.215348Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:a83a9aa948b17f82ae23b706499ffe73b6f3b5075b3a8e1f6b478c83a0bf8762","observation_id":"1d02cf75-c4a2-4bbf-b276-f7fccaa57a8d","resolution":{"observed_at":"2026-08-06T16:28:53.215348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.364738Z","title":"Evolutionary optimization of high- dimensional multiobjective and many-objective expensive problems assisted by a dropout neural network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.364738Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:3f0ab91c0c7c544fbe9e3719a4867f60315ec5b7a2d66d58370437803570de9b","observation_id":"bf4d0789-a6ac-4db9-9087-4b7688807207","resolution":{"observed_at":"2026-08-06T16:28:53.364738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.451248Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.451248Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2a7810eb72a9bee9ae06d5b23ac36314fae72e5f5a8642040b698705fa023503","observation_id":"5d57e077-d5c2-48f0-b871-9801f5aabbec","resolution":{"observed_at":"2026-08-06T16:28:53.451248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.616540Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.616540Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:57517ab34f9dd625d35f4293ab08ff6a0b9b6874ec772eab8a7ae508ad7208ab","observation_id":"8f6b6404-08fd-4314-ac2b-a056f07a74a9","resolution":{"observed_at":"2026-08-06T16:28:53.616540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.746417Z","title":"M¨ uller, and Petros Koumoutsakos","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.746417Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:888f9c0a3bf6046c76c58be41aed32dac64e8d3560ba684994b3aa2ed0e76e50","observation_id":"985e64d1-e6f0-46ea-96ad-c72658422f6a","resolution":{"observed_at":"2026-08-06T16:28:53.746417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.896075Z","title":"Hayes et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.896075Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:ea6292ab2bed825f080c1ecb923edaec6a030e9426c861c24986bf20eef73c56","observation_id":"6a93eed2-b3e2-4e98-88fa-2808674b1348","resolution":{"observed_at":"2026-08-06T16:28:53.896075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.067409Z","title":"Deep Gaussian process for multi-objective Bayesian optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.067409Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5bb4cde342749b7b102e819384a5502d82da61b4348b0c1a30797ebc84648a9d","observation_id":"424688ee-7bfe-4e01-87fd-262b4592691f","resolution":{"observed_at":"2026-08-06T16:28:54.067409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.160670Z","title":"Wabersich, Marcel Menner, and Melanie N","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.160670Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:42bd91886f27e2c89d9edd0678fb043b012bddde19ea38b879348076226dcf6b","observation_id":"13cb9411-1ac4-41b8-b7b5-1e2b911a13c2","resolution":{"observed_at":"2026-08-06T16:28:54.160670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.218919Z","title":"Stability-informed Bayesian Optimization for MPC Cost Function Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.218919Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:8bba344df701347480917f8c9a69177d3b782a257714513e6106f4cddeaabba8","observation_id":"a4e564d1-66e1-4475-89a6-404301392b3b","resolution":{"observed_at":"2026-08-06T16:28:54.218919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.267010Z","title":"Multi-objective Bayesian optimisation over sparse subspaces for model predictive control of wind farms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.267010Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:0cca8b534e671841a8be5de56a6f8aa96b7d3d0f41519f736030f6ab070b6365","observation_id":"5c7c6898-a4e8-4634-ad24-e03b9aee322f","resolution":{"observed_at":"2026-08-06T16:28:54.267010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.323315Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.323315Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:163f20aecc873d451a35bbb47cad753bf1f9100de9cf763999a492ed169d14e8","observation_id":"02b17292-dd46-4f76-9494-e62e8d7762b2","resolution":{"observed_at":"2026-08-06T16:28:54.323315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.417150Z","title":"Reinforced Few-Shot Acquisition Function Learning for Bayesian Optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.417150Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:073fab40b02fd3cec6768280e5ce5517fc6f41a98762a7b6261a03bc26d4de09","observation_id":"8b35d3e4-8d5b-418d-9257-caf1f423dee2","resolution":{"observed_at":"2026-08-06T16:28:54.417150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.521695Z","title":"Toward a theoretical foundation of policy optimization for learning control policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.521695Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:1f0d48dcadcbbc6e29544f0253f4aaf6aa932bd15013bc9933378745d778f5c8","observation_id":"e5df7bd6-1aa3-4c4c-9b3f-a38304e3b418","resolution":{"observed_at":"2026-08-06T16:28:54.521695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21974","last_updated":"2025-05-29T09:07:59Z","snapshot_observed_at":"2026-08-07T13:45:15.899835Z","submitted_at":"2025-05-28T05:00:50Z","title":"BOFormer: Learning to Solve Multi-Objective Bayesian Optimization via Non-Markovian RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21974","snapshot_observed_at":"2026-08-06T16:28:54.642701Z","title":"BOFormer: Learning to solve multi-objective Bayesian optimization via non- markovian rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.642701Z"},"links":{"cited_paper":"/paper/2505.21974","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4ea8e129d7ef7798147033b76ea2d7d716c7f3e60c461b2b1f0a505ac33dd2cb","observation_id":"e69dc31d-ede3-4223-93e5-78dfad687a2a","resolution":{"observed_at":"2026-08-06T16:28:54.642701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.744749Z","title":"Hoos, and Kevin Leyton- Brown","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.744749Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7ca0d7642b6e764a4f8d722fb5a5b79576f66eda1d1d6af4122b3ee486d2bf56","observation_id":"c607f2fd-834d-4132-b10b-08553b2fbb0c","resolution":{"observed_at":"2026-08-06T16:28:54.744749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.823943Z","title":"J., Santosh Penubothula, Chandramouli Kamanchi, and Shalabh Bhatnagar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.823943Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5c427215f3d5b60ab548f44043148a429352f277c361d2c1d5a2f5e4a85ba9b9","observation_id":"8409ded2-003a-4d9e-8ef3-5ff90c1ca3a3","resolution":{"observed_at":"2026-08-06T16:28:54.823943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08253","last_updated":"2021-11-29T00:49:49Z","snapshot_observed_at":"2026-08-05T14:59:13.622635Z","submitted_at":"2019-06-19T17:54:53Z","title":"When to Trust Your Model: Model-Based Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08253","snapshot_observed_at":"2026-08-06T16:28:54.925681Z","title":"When to trust your model: Model-based policy optimization, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.925681Z"},"links":{"cited_paper":"/paper/1906.08253","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:0779d117296d2c8d9c9916e5ab6646e70427f9f7116a871a83640cae05bd071e","observation_id":"52639965-2c9f-4507-b5a9-096583ae1d7b","resolution":{"observed_at":"2026-08-06T16:28:54.925681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.013776Z","title":"Bilevel optimization: Convergence analysis and enhanced design","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.013776Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:731ac3688aec80e0688c96d364551feba403d2cf570917a3d023281c5dde3f53","observation_id":"ad30fe06-42b9-4105-89e7-eb02943d00dd","resolution":{"observed_at":"2026-08-06T16:28:55.013776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.092899Z","title":"BINOCULARS for efficient, nonmyopic sequential experimental design","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.092899Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:569600d88716e78262fee4c4422d94e3031289dc6ab2ac6400d588049c9376f1","observation_id":"65c7e323-be5f-46ed-9849-e3a31a173c21","resolution":{"observed_at":"2026-08-06T16:28:55.092899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.203017Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.203017Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f47e4cb7011a21707dc41343c5e57b9453872919c9575adb240412ab5c447eb1","observation_id":"a8346639-dbf4-4af7-bd39-1ca183a70804","resolution":{"observed_at":"2026-08-06T16:28:55.203017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.303038Z","title":"Pontryagin Differentiable Programming: An End- to-End Learning and Control Framework","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.303038Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:9693c616adf0dcaf2cf46c42f9b0ab427355635269e7211d6b632ef7a0f34689","observation_id":"d787f3ea-9142-48ca-a59d-9e089b7a6597","resolution":{"observed_at":"2026-08-06T16:28:55.303038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.374609Z","title":"Data-efficient reinforcement learning with probabilistic model predictive control","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.374609Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:1df6b3e70c8075ad36da6f842918333665ab3a9b50a4b0cf3d7e86397318124d","observation_id":"56f647ea-4e48-4fdd-b1df-7239a29065bf","resolution":{"observed_at":"2026-08-06T16:28:55.374609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.476462Z","title":"A review on genetic algorithm: past, present, and future","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.476462Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:0ae93a52b219bcf7e3e9651389703ce52d145c4fd40b476434e2ac7d1c2dd020","observation_id":"00b79c4c-7343-41b9-94ce-66e91a59bdc3","resolution":{"observed_at":"2026-08-06T16:28:55.476462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.557377Z","title":"Lekkas, and S´ ebastien Gros","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.557377Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5fa72981bc450c66c1800b98178524091425dc239bc2e57b5fc1e42df6581396","observation_id":"2c16d47a-591c-4a9f-ae6c-590fd5187d12","resolution":{"observed_at":"2026-08-06T16:28:55.557377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.649869Z","title":"Doyle III","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.649869Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:670999832ec7a015097a2b4f09eb37aca2e8243ce892a09c7d14ffedea4124f8","observation_id":"1c661c43-f00b-45f3-a849-90fe67464ae9","resolution":{"observed_at":"2026-08-06T16:28:55.649869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.743538Z","title":"Huynh, Ali Mesbah, and Joel A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.743538Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:6ff4283c60f5074e18a1e10812ff73f838e89aa0b7c44dec23d23396a36eacd1","observation_id":"44ec2c76-757e-4fa2-9cd5-f570cd561f56","resolution":{"observed_at":"2026-08-06T16:28:55.743538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.851695Z","title":"Lagoudakis and Ronald Parr","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.851695Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:86bb0ca7da4a1ef461facd131375367c4d46d3da0f084214b5b886a97c7f18c2","observation_id":"109af6cc-e0b4-4957-8b30-076b5ab235a9","resolution":{"observed_at":"2026-08-06T16:28:55.851695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T08:00:05.669126Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":96,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":197},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 197 outbound references and 2 inbound Pith citation observations for arXiv:2507.13491."}