{"as_of":"2026-08-16T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e32801171993d1f00bcad974c64c16be48bed7d97a7162a8f9e367ec85b756e","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:02:45.818390Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:53:48.187942Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T07:56:00.523665Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":"2412.06139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06139","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bounded exploration with world model uncertainty in soft actor-critic reinforcement learning algorithm","venue":null,"work_id":"ec66d7bf-f337-45b8-85f9-b8565eae7a27","year":2024},"citing_paper":{"arxiv_id":"2604.08780","last_updated":"2026-04-09T21:31:24Z","snapshot_observed_at":"2026-08-12T12:31:23.162782Z","submitted_at":"2026-04-09T21:31:24Z","title":"Toward Hardware-Agnostic Quadrupedal World Models via Morphology Conditioning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T16:53:48.187942Z"},"links":{"cited_paper":"/paper/2412.06139","citing_paper":"/paper/2604.08780"},"observation_digest":"sha256:160dddd95fadb5a010a6ce8542412606eb24c15490693a125b9d2f1634664592","observation_id":"9670e234-2ab1-43de-8c13-e37aceaa7a1a","resolution":{"observed_at":"2026-05-11T07:56:00.529175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06139/citation-record","integrity":"/paper/2412.06139/integrity","json":"/paper/2412.06139/citation-record.json","paper":"/paper/2412.06139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.06976","last_updated":"2019-11-19T14:40:14Z","snapshot_observed_at":"2026-08-14T12:28:56.518217Z","submitted_at":"2019-08-19T16:22:20Z","title":"A survey on intrinsic motivation in reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06976","snapshot_observed_at":"2026-08-11T20:02:45.685985Z","title":", 2019] Arthur Aubret, Laetitia Matignon, and Salima Hassas","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.685985Z"},"links":{"cited_paper":"/paper/1908.06976","citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:8f3d36a936e9f0aeb95a619959d6e7aaba97bb60b5e7439953d00b464c0e06c8","observation_id":"1dd89f82-0b1b-4c64-80bd-bc3fb0dd824a","resolution":{"observed_at":"2026-08-11T20:02:45.685985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07127","last_updated":"2017-03-08T01:07:15Z","snapshot_observed_at":"2026-08-15T18:28:49.065735Z","submitted_at":"2016-05-23T18:28:15Z","title":"Learning and Policy Search in Stochastic Dynamical Systems with Bayesian Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07127","snapshot_observed_at":"2026-08-11T20:02:45.715371Z","title":", 2016] Stefan Depeweg, Jos´ e Miguel Hern´ andez-Lobato, Finale Doshi-Velez, and Steffen Udluft","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.715371Z"},"links":{"cited_paper":"/paper/1605.07127","citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:3b635b780dd96269d0b5c0cfd381c5896bbcc37a5a061c678a7ca42b75915453","observation_id":"3613d47c-4572-450f-86a8-306a8719793e","resolution":{"observed_at":"2026-08-11T20:02:45.715371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.229030Z","title":", 2017] Prafulla Dhariwal, Christopher Hesse, Oleg Klimov, Alex Nichol, Matthias Plappert, Alec Radford, John Schulman, Szymon Sidor, Yuhuai Wu, and Peter Zhokhov","venue":null,"work_id":"69b88f27-72cc-4da3-9113-9a2c8f6751af","year":2017},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.726904Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:5d402ee507243757e33f23cb723abbc6c84f42f5eb34b79707259c01c677b45b","observation_id":"7db7953c-11f5-493b-948d-6c466888f356","resolution":{"observed_at":"2026-08-11T20:02:46.245200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.206643Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":"66343d67-6c09-4f20-b012-c2bdcc3063f0","year":2015},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.736303Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:cae22b23295853cc357891d52f583265388f2ee59f204dce97e6bbd03671de40","observation_id":"f257143d-5db1-4930-84e8-20560d8a57b7","resolution":{"observed_at":"2026-08-11T20:02:46.215485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.188074Z","title":null,"venue":null,"work_id":"3dfe4412-dd63-4ef5-a026-68ee9a5988d2","year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.745359Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:fe54c207d936d21e743fd725e5a04f6b8fe2f31a6e48113e5919636ff93f9729","observation_id":"ecb6fd95-aeb9-46fd-b05d-dd83104fcdd4","resolution":{"observed_at":"2026-08-11T20:02:46.194137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.165516Z","title":", 2016] Rein Houthooft, Xi Chen, Yan Duan, John Schulman, Filip De Turck, and Pieter Abbeel","venue":null,"work_id":"91e3784e-3a32-4cc8-940e-017e92413505","year":2016},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.750534Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:b8af2c89f02545d7621f5ebe30abfaeb893157ffffe42fcf9ae08cdb21c10bf2","observation_id":"832226f7-308c-429b-bf3e-2faeed70392c","resolution":{"observed_at":"2026-08-11T20:02:46.171607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.149490Z","title":", 2019] Michael Janner, Justin Fu, Marvin Zhang, and Sergey Levine","venue":null,"work_id":"f8017b7a-9b5c-4c6e-a1a9-a6e3352df717","year":2019},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.754158Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:2fc8b8608b8279b4d321e87ee022ebe683e31d917ab593b65a2eaca56874204e","observation_id":"104d555d-73c1-4c02-bd3f-a654af097d37","resolution":{"observed_at":"2026-08-11T20:02:46.154522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.136037Z","title":"What uncertainties do we need in bayesian deep learn- ing for computer vision? Advances in neural informa- tion processing systems, 30,","venue":null,"work_id":"4f88cab4-f82c-43d6-ae5d-8dd03b010864","year":2017},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.757808Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:4985f0cce9e63e054b1877ea9b5e6060982ec01be77472f784ca89e6ac18c1a9","observation_id":"b8658f0c-fd8e-45d1-aeb6-80ff90e71e7f","resolution":{"observed_at":"2026-08-11T20:02:46.140403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.121064Z","title":", 2013] Jens Kober, J Andrew Bagnell, and Jan Peters","venue":null,"work_id":"1c8a849d-ffae-431b-a784-1e22f7d742f5","year":2013},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.762835Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:94e83b5c88b7dffc0a284f60639942eabab1c95e3f996d33abbbf08e7125c50a","observation_id":"3dbbfe57-0df0-4f43-8f69-0378f032b92b","resolution":{"observed_at":"2026-08-11T20:02:46.126290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10592","last_updated":"2018-10-05T05:08:37Z","snapshot_observed_at":"2026-08-14T19:41:03.980803Z","submitted_at":"2018-02-28T18:58:22Z","title":"Model-Ensemble Trust-Region Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.10592","snapshot_observed_at":"2026-08-11T20:02:45.769270Z","title":", 2018] Thanard Kurutach, Ignasi Clav- era, Yan Duan, Aviv Tamar, and Pieter Abbeel","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.769270Z"},"links":{"cited_paper":"/paper/1802.10592","citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:5bc65ed33f3b563b3be861c16cf68fd71efcf9fe6ddbcbbdfce474c9464a0774","observation_id":"f235896b-46c1-4921-9634-e50998ba371d","resolution":{"observed_at":"2026-08-11T20:02:45.769270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.102958Z","title":", 2022] Pawel Ladosz, Lilian Weng, Min- woo Kim, and Hyondong Oh","venue":null,"work_id":"86fc1285-cfa9-4e7f-a6d4-e105ff1e5a0a","year":2022},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.774118Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:63ac1fcccc0539501e092ed4c634ffcdfe43a461be3d4a1c6d43086456c06f77","observation_id":"9a5326c9-2446-448c-92d4-6cf109c931b7","resolution":{"observed_at":"2026-08-11T20:02:46.107074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10067","last_updated":"2023-01-24T15:13:02Z","snapshot_observed_at":"2026-08-15T07:00:34.844231Z","submitted_at":"2023-01-24T15:13:02Z","title":"Intrinsic Motivation in Model-based Reinforcement Learning: A Brief Review","version":1},"cited_work":{"arxiv_id":"2301.10067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10067","snapshot_observed_at":"2026-08-11T20:02:45.907066Z","title":"Intrinsic Motivation in Model-based Reinforcement Learning: A Brief Review","venue":"cs.LG","work_id":"7c7dc0d4-dd3d-446a-9cfa-295ca89a3262","year":2023},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.779781Z"},"links":{"cited_paper":"/paper/2301.10067","citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:122afca8d604545dde8d9c3a800eb26b94f77c5c52cfdac46a6acb85a200d8d7","observation_id":"6a5e884e-7a78-4c31-a9f2-906831e5b99a","resolution":{"observed_at":"2026-08-11T20:02:45.915394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03858","last_updated":"2021-02-15T17:29:47Z","snapshot_observed_at":"2026-08-14T18:53:32.384767Z","submitted_at":"2018-07-10T20:53:04Z","title":"Algorithmic Framework for Model-based Deep Reinforcement Learning with Theoretical Guarantees","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03858","snapshot_observed_at":"2026-08-11T20:02:45.797201Z","title":", 2018] Yuping Luo, Huazhe Xu, Yuanzhi Li, Yuandong Tian, Trevor Darrell, and Tengyu Ma","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.797201Z"},"links":{"cited_paper":"/paper/1807.03858","citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:440504306c4e942a42dc49addb112cc36a750b7133aea58648c9582007413ef7","observation_id":"278ad961-a352-4150-91e5-0bf82c1a9bd6","resolution":{"observed_at":"2026-08-11T20:02:45.797201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.074474Z","title":", 2018] Anusha Nagabandi, Gregory Kahn, Ronald S Fearing, and Sergey Levine","venue":null,"work_id":"7e6df442-d1db-4a75-8f9b-c83ca7601ec0","year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.802267Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:300c735cda20db9ad52dcd1f904f1feb958677eca6478a3b3d18094b90b93a62","observation_id":"f7460c7f-3bf6-4d93-b407-66eb401f6c1f","resolution":{"observed_at":"2026-08-11T20:02:46.078816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.057860Z","title":", 2017] Deepak Pathak, Pulkit Agrawal, Alexei A Efros, and Trevor Darrell","venue":null,"work_id":"9387c371-dae7-4d05-8e0c-148bd8ecf97f","year":2017},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.805967Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:96d43dbfeb782e907fa890477705231d3d11e51fa3008224cf93a1efab02a6be","observation_id":"643c7846-1ead-41ce-b151-86c8fc08c113","resolution":{"observed_at":"2026-08-11T20:02:46.064087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.043608Z","title":", 2019] Deepak Pathak, Dhiraj Gandhi, and Abhinav Gupta","venue":null,"work_id":"b72fb258-4f70-4a7e-99e8-8806a59e24d5","year":2019},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.810125Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:9aa5cbc8bd4a705043e0fe1c7216bee2a2e94fa23cf55485db681b8c98f74f1f","observation_id":"59f8fb34-c43f-4f75-a965-1be45d33603a","resolution":{"observed_at":"2026-08-11T20:02:46.048218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.026792Z","title":", 2021] Yao Yao, Li Xiao, Zhicheng An, Wan- peng Zhang, and Dijun Luo","venue":null,"work_id":"ee5b0642-c043-44e2-aad7-e682a7d1bfd2","year":2021},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.813951Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:d10d1cff6ba7e45474d9f7771f9d27e8ba1b4350db6a13c9954f2e4b3336e213","observation_id":"6e5d27a0-6282-4b9b-9e67-38bcefd2b87f","resolution":{"observed_at":"2026-08-11T20:02:46.030996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.010165Z","title":"Modeling purpose- ful adaptive behavior with the principle of maximum causal entropy","venue":null,"work_id":"cc1bb8c5-7c5f-415c-bed7-06c94966b03d","year":2010},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.818390Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:07f392c73adaecc3f2b43881fa68a659150daf715c5b7d22f3ed70147af490fe","observation_id":"4848ba8b-df00-4f91-bb80-6185fc03adc9","resolution":{"observed_at":"2026-08-11T20:02:46.015578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.327404Z","title":"Intrinsic motivation and reinforcement learning","venue":null,"work_id":"cc2d6cce-b5ab-4086-9025-256e56e52fdf","year":2013},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.698457Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:1f09593511b15bbc89308ad404eb615f5f6255ac24af6da4bc6ac5b7e7e4c284","observation_id":"cd187864-74e3-43e8-ad71-1c1de22d8fc9","resolution":{"observed_at":"2026-08-11T20:02:46.331163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.314053Z","title":", 2022] Lukas Brunke, Melissa Greeff, Adam W Hall, Zhaocong Yuan, Siqi Zhou, Jacopo Panerati, and Angela P Schoellig","venue":null,"work_id":"3f779d30-7d5b-42cd-b0e2-cf3b3881ad9c","year":2022},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.702272Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:82eeb21438735a16e9ddc874b8ed7f89189a79860711d8cdf1bc395dd53dc971","observation_id":"41eb5a9b-bd06-49a4-9278-e764dc3e9c37","resolution":{"observed_at":"2026-08-11T20:02:46.319245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-11T20:02:45.741095Z","title":", 2018] Tuomas Haarnoja, Aurick Zhou, Kristian Hartikainen, George Tucker, Sehoon Ha, Jie Tan, Vikash Kumar, Henry Zhu, Abhishek Gupta, Pieter Abbeel, et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.741095Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:6935d26a9cafb86b94828f4e1d93e87360e9d00fb6b6c97465800c2a046a548a","observation_id":"f2e463cb-5094-4f04-aaaa-d901881a2eac","resolution":{"observed_at":"2026-08-11T20:02:45.741095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.261176Z","title":", 2018] Stefan Depeweg, Jose-Miguel Hernandez-Lobato, Finale Doshi-Velez, and Steffen Udluft","venue":null,"work_id":"91e68510-e8a8-437a-ac4d-5729e3240585","year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.719312Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:f9d64c02665475ec230779acc92d715070e6f5af1e48c989bc84605f75466c62","observation_id":"45588b8e-38e7-4d7d-961a-8768d590bcda","resolution":{"observed_at":"2026-08-11T20:02:46.268857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00101","last_updated":"2018-02-28T21:43:37Z","snapshot_observed_at":"2026-08-16T03:18:43.932234Z","submitted_at":"2018-02-28T21:43:37Z","title":"Model-Based Value Estimation for Efficient Model-Free Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00101","snapshot_observed_at":"2026-08-11T20:02:45.731545Z","title":", 2018] Vladimir Feinberg, Alvin Wan, Ion Stoica, Michael I Jordan, Joseph E Gonzalez, and Sergey Levine","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.731545Z"},"links":{"cited_paper":"/paper/1803.00101","citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:ac5849dc9801b8806374668c9d813d92d2824a5d875e25bbe5c8816652bdd527","observation_id":"7c93570e-eced-4f8f-9682-b9aa755a03c3","resolution":{"observed_at":"2026-08-11T20:02:45.731545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.279657Z","title":", 2018] Kurtland Chua, Roberto Calandra, Rowan McAllister, and Sergey Levine","venue":null,"work_id":"b8395319-cb14-45ca-8f2a-0d8973fee1dc","year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.710787Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:3544d0448fe94a058b5ab8aa6193567fb4a942a17986e046e07baea11c80da96","observation_id":"f06e91d1-0c3a-4c00-873e-36c1f4902579","resolution":{"observed_at":"2026-08-11T20:02:46.284785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.339854Z","title":", 2002] Peter Auer, Nicolo Cesa-Bianchi, and Paul Fischer","venue":null,"work_id":"0f1ce276-960f-499e-8351-3256bb2e6639","year":2002},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.693655Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:f0b0dd0ea1087d563724a95745e853e4b52fceb3b88d796b44c12a84210b6d5a","observation_id":"e0a1cbfa-b120-4af9-b12f-4dedd864262a","resolution":{"observed_at":"2026-08-11T20:02:46.344031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-11T20:02:45.792466Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.792466Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:291304b49ce0adbe6139e7b6de55202e906c4397a966da7fba9055b92bbbdb4d","observation_id":"8d802246-0a33-4b64-8b21-221c48c55629","resolution":{"observed_at":"2026-08-11T20:02:45.792466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.299134Z","title":", 2018] Jacob Buckman, Danijar Hafner, George Tucker, Eugene Brevdo, and Honglak Lee","venue":null,"work_id":"6651ea8b-246a-47c8-b223-1b06132ddb42","year":2018},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.706238Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:b15cfe805374f76cceb7c330049baa108dc9e770a1e4813f124366b412d17de6","observation_id":"a28fbaf3-e78c-4031-abd6-d277e5351ab9","resolution":{"observed_at":"2026-08-11T20:02:46.305592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:02:46.087977Z","title":", 2021] Kimin Lee, Michael Laskin, Aravind Srinivas, and Pieter Abbeel","venue":null,"work_id":"52da7dba-7cb1-4110-92d4-f30c571dc15b","year":2021},"citing_paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T20:02:45.786109Z"},"links":{"citing_paper":"/paper/2412.06139"},"observation_digest":"sha256:baecc3f44890a68e89508fc6ee2d4fb32095467e925cd4712a4118a7af69ba5a","observation_id":"3a72e50a-8791-4ccc-bc4b-fc8bed14c54e","resolution":{"observed_at":"2026-08-11T20:02:46.092859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.06139","last_updated":"2024-12-09T01:45:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T10:07:08.754642Z","submitted_at":"2024-12-09T01:45:08Z","title":"Bounded Exploration with World Model Uncertainty in Soft Actor-Critic Reinforcement Learning Algorithm"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2412.06139."}