{"as_of":"2026-08-19T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aca9ac0194dc6d59b6ebfe7d82343ff21b37e6cbd0ae354da56cc82a2ca8129a","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:24:23.487246Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.14312/citation-record","integrity":"/paper/2412.14312/integrity","json":"/paper/2412.14312/citation-record.json","paper":"/paper/2412.14312"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.250361Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.250361Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:108e1d9527169c65ccda72d5071e6074e35d8f173151f4324ea25daf0f6b6f4d","observation_id":"31202fdf-95ac-4a0c-b951-4be5873e32a9","resolution":{"observed_at":"2026-08-11T12:24:23.250361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.614809Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":"5d2be26f-1603-4e08-a84f-973b273ae35f","year":2021},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.256377Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:b35abbaa641bda3cf8cfef4e3f1897fb327796e49faadd0857f7a3c4c398f530","observation_id":"c049cbc4-fc97-48da-ab2b-68620653c8dc","resolution":{"observed_at":"2026-08-11T12:24:24.619058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.260388Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.260388Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:0f7f1f9ba95956043d569af0116dc8b800ba95b7736db23bb5939c70d9512089","observation_id":"25a816c6-d86a-413d-bd71-f995b566de4b","resolution":{"observed_at":"2026-08-11T12:24:23.260388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.603252Z","title":null,"venue":null,"work_id":"bf1dddf8-0f5a-4096-8859-c254ee05b233","year":2021},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.264359Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:bd1ab908ffe0b34a9cb27b6b4885a6d703a7a14d33284e3c4291631dc8584718","observation_id":"055b6c35-a945-4e4d-9708-176af80a38ac","resolution":{"observed_at":"2026-08-11T12:24:24.607353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1997.61438","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.166513Z","title":"and Schaal, S","venue":null,"work_id":"1423e528-26c3-4381-8914-b4cf18640139","year":1997},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.267954Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:8f69553f2a3e7fa998602ff03fe7e4eb9e382cdeaec32197177993053f4a1809","observation_id":"9349635a-e5ad-4c5a-9bf3-dd863c8a9f19","resolution":{"observed_at":"2026-08-11T12:24:24.172511Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-11T12:24:23.272015Z","title":"L., Kiros, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.272015Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:af092756892b42635a4b6a8f2d87813d8a5feac445494ff5280dfe152a095645","observation_id":"e66e9819-d457-4d60-9163-c67407f2a904","resolution":{"observed_at":"2026-08-11T12:24:23.272015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.591057Z","title":"J., Smith, L., Kostrikov, I., and Levine, S","venue":null,"work_id":"5bf6383b-bd92-4a45-8a52-39b1839c870a","year":2023},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.277055Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:725b30c5620200d7471308c7a206333b619fe437d3b930649442021079890bc7","observation_id":"51c7b76e-ca68-490e-b910-5003ed4348b9","resolution":{"observed_at":"2026-08-11T12:24:24.595513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.281329Z","title":"M., Gebru, T., McMillan-Major, A., and Shmitchell, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.281329Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:6dd0b84d7951e5f83eba352b4c0f3a2c12d73e0d3182484a72530b275194ab1f","observation_id":"8e6b2bd3-6170-401e-9d1d-84e0dd096dd2","resolution":{"observed_at":"2026-08-11T12:24:23.281329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.285322Z","title":"J., Leary, C., Maclaurin, D., Necula, G., Paszke, A., Vander P las, J., Wanderman- M ilne, S., and Zhang, Q","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.285322Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:8652b78ef858ededcb18853f39f7f7a4eba65a5cbb1ca5282566d7d1df8f4fe4","observation_id":"d4c6f1ec-2034-42cf-94b6-8f7a803c6a4d","resolution":{"observed_at":"2026-08-11T12:24:23.285322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-11T12:24:23.289322Z","title":"Openai gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.289322Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:fd53579599adb842783ffe0862916fbfcd8ac05ea8a196083b0015ff6bf068ae","observation_id":"16858469-0400-4ebf-8be7-8afb840ce37e","resolution":{"observed_at":"2026-08-11T12:24:23.289322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.573545Z","title":"Sample-efficient reinforcement learning with stochastic ensemble value expansion","venue":null,"work_id":"f7a16516-e0ae-4431-be33-2c5800022563","year":2018},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.293432Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:dda109ca605912b2a929e45720e6c41b752a126ccff13ff473d172efb6b21ce6","observation_id":"08c422c3-3c26-4ac7-b35c-adc7a8159ae9","resolution":{"observed_at":"2026-08-11T12:24:24.577716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.562018Z","title":"G., and Silver, D","venue":null,"work_id":"50542a44-87d4-4da2-95e6-1e209140e077","year":2021},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.297288Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:865807a14b7056f4df011de74f79da8fcc0f709c2173654f0dd75c1818d3bace","observation_id":"bad5d73f-ab3c-4f1b-afa3-1a048313de29","resolution":{"observed_at":"2026-08-11T12:24:24.565813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.551094Z","title":null,"venue":null,"work_id":"7e1a9c9f-1f7f-4c91-8b56-13601b516cc0","year":2011},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.301171Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:20ef2731f290af287b7a2db104f87ab61586b006ecf453a3c37c385afb2b8b03","observation_id":"8e21eb4d-2ddf-4f97-824c-4df356c8e3db","resolution":{"observed_at":"2026-08-11T12:24:24.555082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.11142","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.960178Z","title":"Dyna-style model-based reinforcement learning with model-free policy optimization","venue":null,"work_id":"643a73ca-714c-467f-af5c-2a5dd8db6cc6","year":2024},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.305689Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:86ca2d45947d1642aeb2633b7c8ce3aa5c7732f0f854760312996d7c6f3335d8","observation_id":"61d81e54-88b5-4d08-97bf-9c7c951a6fb0","resolution":{"observed_at":"2026-08-11T12:24:23.966181Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.540934Z","title":"G., and Courville, A","venue":null,"work_id":"3aea532d-29a5-4071-8141-d28a397c4ac0","year":2023},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.309610Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:1f2bef71d76cc883d6685d3f520d2d3ca23463eb6949b4bfaeabc54a2628b401","observation_id":"da59c95c-2f3c-4fd8-a635-6538bbacadd6","resolution":{"observed_at":"2026-08-11T12:24:24.544249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.529875Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"7c38f8b2-b5b4-4639-9b48-c0180a581166","year":2018},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.313519Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:3cf14448fbcde24713563411f9c34e7f8062ab6b9720b3cfa61d1a2d268b701c","observation_id":"7da63c09-e45b-4e8c-8a6a-eb698e74db61","resolution":{"observed_at":"2026-08-11T12:24:24.533847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.518521Z","title":"Simplifying model-based rl: learning representations, latent-space models, and policies with one objective","venue":null,"work_id":"c1d3cf42-ddcc-40a5-b12f-fe9474bf8e1b","year":2022},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.318786Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:1aeec4a183a636b5936148d143bdb01e569f032b2d5af57daf04603b4c60f95b","observation_id":"336df748-4204-4ae1-bc18-c3ac8aef2926","resolution":{"observed_at":"2026-08-11T12:24:24.522697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.506385Z","title":"Continuous deep q-learning with model-based acceleration","venue":null,"work_id":"f9e69a3e-08ae-4b3f-bc80-3c55217114be","year":2016},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.322562Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:7f8ae7e9f852f7b678a7c16f22726d76813c70529cd3ff360c5ea15e54f22f6a","observation_id":"fd95f24f-db71-43bd-9b9d-9432b389fd2e","resolution":{"observed_at":"2026-08-11T12:24:24.511123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-11T12:24:23.326340Z","title":"Soft actor-critic algorithms and applications, 2019 a","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.326340Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:e0ef21a6729e9acb2355cad3875a5b866aa0ccb556fb2a9ab6a6b293e57e3862","observation_id":"4bac0b49-657c-4837-b044-de808bd7dbe0","resolution":{"observed_at":"2026-08-11T12:24:23.326340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.494440Z","title":"Dream to control: learning behaviors by latent imagination","venue":null,"work_id":"c6763687-f739-4a5f-b90c-82ea6a82abf9","year":2020},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.330692Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:cada05f64074a68123ee5733fe65a4514f7959101126b85bb114d6b0447077bb","observation_id":"e37e8501-1df5-4d9a-a3a4-c7fc6834b4e4","resolution":{"observed_at":"2026-08-11T12:24:24.499061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.334574Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.334574Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:bff19b61a38034f7638c48d9dd9205a5dd3c6f02ed8f75ef89d3e9baa4c9cfae","observation_id":"512fc7d4-90e2-401b-aebb-c20323a4d466","resolution":{"observed_at":"2026-08-11T12:24:23.334574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.338375Z","title":"A., Hosny, A., Khodakarami, F., Waldron, L., Wang, B., McIntosh, C., Goldenberg, A., Kundaje, A., Greene, C","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.338375Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:5a74c414899dabe6c5cae2b3af2c05493fbf656ae145aa5fc8abe6beac412a8a","observation_id":"c12c7111-984c-4c29-af52-84db5adc6da5","resolution":{"observed_at":"2026-08-11T12:24:23.338375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.483540Z","title":"A., Su, H., and Wang, X","venue":null,"work_id":"e6b55f37-47ca-4949-bd8a-2257e2bf208e","year":2022},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.342417Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:8ec3e8d27138781a872e9a3a0eaa63faec946dfab8e7521b6522fcedb038faca","observation_id":"321aa030-88b4-46d9-bdca-040ebfc6199c","resolution":{"observed_at":"2026-08-11T12:24:24.487487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01825","last_updated":"2019-03-29T03:00:57Z","snapshot_observed_at":"2026-08-18T22:21:06.676190Z","submitted_at":"2018-06-05T17:31:02Z","title":"The Effect of Planning Shape on Dyna-style Planning in High-dimensional State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01825","snapshot_observed_at":"2026-08-11T12:24:23.346757Z","title":"Z., Talvitie, E","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.346757Z"},"links":{"cited_paper":"/paper/1806.01825","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:9e156cbc57af3d9dafeb3308f0f4d3f75b2092a0615dab3e2771f5f5ca48d7ea","observation_id":"2dd2e89b-2a79-47a7-b756-7dc1bdb7a3d2","resolution":{"observed_at":"2026-08-11T12:24:23.346757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.471469Z","title":"A., Gilitschenski, I., Farahmand, A.-m., and Eaton, E","venue":null,"work_id":"a7d66ca0-1e6b-4f6e-80c1-7bb53d468e48","year":2024},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.351317Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:54017854f0e3e523481dc3e5adb16b09a89f6be81a1235c0b9eabbe2e3830865","observation_id":"605a0198-5307-4163-a747-bed6628e1f3a","resolution":{"observed_at":"2026-08-11T12:24:24.476030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.460770Z","title":"Mbpo: Model-based policy optimization, 2019","venue":null,"work_id":"63b83bee-43be-4f07-833f-bc666e34f079","year":2019},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.355133Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:f4acbb7376babbba37f819eda9e9d0a1026c848d1a30cf15c76138b9bf9062f1","observation_id":"ccc7b9e6-e63e-4bfc-adfc-89856c4b815c","resolution":{"observed_at":"2026-08-11T12:24:24.464607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.449659Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"2b2417bb-eb43-40c4-89ea-23bd63568b49","year":2019},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.359923Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:0fecdbdfd174901df51b3809ec4e20cdb0e7e8c9e14dbda92becb95e0beaf2cc","observation_id":"63f6b51a-bba8-4421-b1fd-42e6614f862b","resolution":{"observed_at":"2026-08-11T12:24:24.453713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16241","last_updated":"2024-06-23T23:36:26Z","snapshot_observed_at":"2026-08-16T13:40:19.844492Z","submitted_at":"2024-06-23T23:36:26Z","title":"Position: Benchmarking is Limited in Reinforcement Learning Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16241","snapshot_observed_at":"2026-08-11T12:24:23.363794Z","title":"M., White, A., da Silva, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.363794Z"},"links":{"cited_paper":"/paper/2406.16241","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:59959483ab62e860b4b21a5b5170e6b2f5d23b87579a2ae773ba628320c895ce","observation_id":"ac8118e3-0368-4a1b-809d-78fa799e1ecb","resolution":{"observed_at":"2026-08-11T12:24:23.363794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.438216Z","title":"and Boedecker, J","venue":null,"work_id":"bbc3e9e3-531c-45d3-9c6c-78a680a1afe0","year":2017},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.367848Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:c13c8dfa34c483894d042ee3d719839c3fe3e451e637628fc6aa9c8b301fce4a","observation_id":"9d7a26f6-2b14-483c-9b88-671519d2ac0c","resolution":{"observed_at":"2026-08-11T12:24:24.442103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.426515Z","title":"Bidirectional model-based policy optimization","venue":null,"work_id":"04cc2b81-387e-47f3-93be-c6ebc53b95cf","year":2020},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.371890Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:68ec7ac0459af84563e456114219a54f3c4ef08627ad3db269eb9eaa51474b1a","observation_id":"bdd8d717-bdc0-4711-b137-8a2d50dc0b28","resolution":{"observed_at":"2026-08-11T12:24:24.430788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.414825Z","title":"On effective scheduling ofmModel-based reinforcement Learning","venue":null,"work_id":"d2bb2ddb-2eae-4a3d-9e67-392e187618f4","year":2021},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.375682Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:764d340cdefa21991613dfd3dd8c2e0529bc96fc68c444ba7123854a79c9e809","observation_id":"2660e7cc-109b-449e-b5c2-593a61c5f2e3","resolution":{"observed_at":"2026-08-11T12:24:24.419372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.402842Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":"ded795b6-d2ff-4cce-8e70-f6b9762820f0","year":2020},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.379359Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:047910cb643583d14e6c3a7e69ec18b844f74d635bca485afac224d10b717913","observation_id":"e3f6eed4-39d0-47c4-90ee-3da3668beaec","resolution":{"observed_at":"2026-08-11T12:24:24.407272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12160","last_updated":"2024-10-16T01:49:03Z","snapshot_observed_at":"2026-08-16T23:48:00.735320Z","submitted_at":"2024-10-16T01:49:03Z","title":"When to Trust Your Data: Enhancing Dyna-Style Model-Based Reinforcement Learning With Data Filter","version":1},"cited_work":{"arxiv_id":"2410.12160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12160","snapshot_observed_at":"2026-08-11T12:24:23.855969Z","title":"When to Trust Your Data: Enhancing Dyna-Style Model-Based Reinforcement Learning With Data Filter","venue":"cs.LG","work_id":"1462f866-da1e-40e7-9c36-ddc6ce5ffb67","year":2024},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.383233Z"},"links":{"cited_paper":"/paper/2410.12160","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:f2e9aec8e12aa1e5862307a07880dc3e62e56411a02d2cf006d43ac7ec9f8a3f","observation_id":"a6f8c3df-dd88-4e57-90b5-bb1a4c2414e4","resolution":{"observed_at":"2026-08-11T12:24:23.863440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-11T12:24:23.387283Z","title":"P., Hunt, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.387283Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:c9ea353763635998f7acc01052cd101c7040782759ab945fe0bdfdf467b73864","observation_id":"85de09b5-5783-474f-bc32-e06e10de20cb","resolution":{"observed_at":"2026-08-11T12:24:23.387283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.391452Z","title":"[Re] When to trust your model: model-based policy optimization","venue":null,"work_id":"fcc90e81-55bf-4205-b604-f69cfd83594e","year":2020},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.391118Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:e1676527376068d24efb170faea010c03d2084f48e8cf43677bb6dcf39aad2af","observation_id":"0a038221-1b2c-49f6-9cb4-8b1479d39ce5","resolution":{"observed_at":"2026-08-11T12:24:24.395511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.379899Z","title":"A survey on model-based reinforcement learning","venue":null,"work_id":"fbf8fdb4-26df-4995-85ef-5a26b0ad54a8","year":2024},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.394649Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:ec8daf2f8a536dfa28ef8e278bffb88ecf0a3da8151d7bc38f2d6d0a8c4baf70","observation_id":"d1a74e53-dcdb-4138-8021-f8c90d856980","resolution":{"observed_at":"2026-08-11T12:24:24.383969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.368424Z","title":"Understanding and preventing capacity loss in reinforcement learning","venue":null,"work_id":"318fc7dd-6f69-4170-944e-038cc81fa168","year":2022},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.398437Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:01ed8f97bfdc0d42cc256e5ffa1c7629ca2551aca5add2a46d533a47e8ff4233","observation_id":"6fc80cd3-2bb6-4c6f-880e-06e5dfe909ed","resolution":{"observed_at":"2026-08-11T12:24:24.372657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.356790Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the Bitter lesson of Reinforcement learning","venue":null,"work_id":"0180ad3e-5511-4c07-a54d-52124c6581f0","year":2024},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.402220Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:8019c31ccba0dc6f9afec0574d5bfd9872cf07d44d7728a664d4b8e2c225070b","observation_id":"eaee252a-918c-4170-825c-80f2810cc0cd","resolution":{"observed_at":"2026-08-11T12:24:24.360750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.345503Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":"6845347f-36e7-4c67-9148-9cff0ea2accd","year":2022},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.406259Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:64a08e66bb8cdcbeb702d6cc459d49c5c8d8f45b19f5f7c1f4230cc5f623f46c","observation_id":"f545d2d9-bcec-49dd-88b1-fa07be1ba06d","resolution":{"observed_at":"2026-08-11T12:24:24.349395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-11T12:24:23.409998Z","title":"Pytorch: An imperative style, high-performance deep learning library, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.409998Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:a4d7120b1c53566035ae7117f7957c279fde64b50760cd52e282b9ed3d3792ab","observation_id":"0023f1d2-c5bb-49b3-ab31-091baf614736","resolution":{"observed_at":"2026-08-11T12:24:23.409998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.334195Z","title":"Mind the model, not the agent: the primacy bias in model-based RL","venue":null,"work_id":"1482f4a0-4a07-4499-a39d-a449dbf60885","year":2023},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.417742Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:1b6131ffb8e5e799d90872c07d50f19e6e6a1864e4323504bd9a80f5f47691d5","observation_id":"99d35366-c4ad-4da8-b331-b1f76aa7d831","resolution":{"observed_at":"2026-08-11T12:24:24.338389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.321956Z","title":"EPOpt : learning robust neural network policies using model ensembles","venue":null,"work_id":"dfd98baa-64ce-4bf1-958a-2115e4d985b8","year":2017},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.421858Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:18f96e62fe4badf1bebda3549a94b08cb874a9142c3370461f49d80c488d77b1","observation_id":"fa064f53-cf58-4fff-bc70-c5500eb04cbf","resolution":{"observed_at":"2026-08-11T12:24:24.326369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-11T12:24:23.425323Z","title":"High-dimensional continuous control using generalized advantage estimation, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.425323Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:a99fc889ff4b3b9053af3445fb710e574065bc8e7cab6e013e38fb61dea6a340","observation_id":"adb063b5-5af3-4573-9ec2-4a7938a5d6ca","resolution":{"observed_at":"2026-08-11T12:24:23.425323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.310048Z","title":"Learning off-policy with online planning","venue":null,"work_id":"a7fbf0c0-4322-4432-8651-ab596e0d15c4","year":2022},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.429324Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:6f68423dc7486395ee648b750a346f5157dea89d230c93c371f210d9386c6d37","observation_id":"fe9bb814-f39b-4457-865b-6a4c15d7f29d","resolution":{"observed_at":"2026-08-11T12:24:24.314096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.297810Z","title":"CURL : contrastive unsupervised representations for reinforcement learning","venue":null,"work_id":"032dc681-6dc5-440b-b112-af4b856ce7cc","year":2020},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.433345Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:b31cd5db0afed6227f931040c8a1c709cb27fd6ec6b2a9d083d7ff9865b07533","observation_id":"8f83b69a-7944-4425-b67d-49585f03fe94","resolution":{"observed_at":"2026-08-11T12:24:24.302236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.436853Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.436853Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:8c0beb0c070d2fe28f3ac1f629af4bc4595f2727625268d3699e7d2792c66374","observation_id":"f60c9680-34a0-490c-ade9-38be67f12759","resolution":{"observed_at":"2026-08-11T12:24:23.436853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.284978Z","title":"Model regularization for stable sample rollouts","venue":null,"work_id":"c758a928-0786-4880-97ae-321a25d73413","year":2014},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.440340Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:4ae452ee1d54310453b7ee38d72c7db59f4a52fa65aca21dec7009a9557032f1","observation_id":"2e9fbeeb-a76a-4e36-8b9f-337035181481","resolution":{"observed_at":"2026-08-11T12:24:24.289386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:23.443886Z","title":"dm\\_control: Software and Tasks for Continuous Control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.443886Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:5024d353139236bb12e31d0d81a5b9696078af028168427cb7ddbb659fd32cd5","observation_id":"99c30342-9c85-4a5a-99d2-522a309a5e44","resolution":{"observed_at":"2026-08-11T12:24:23.443886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.273252Z","title":"and Schwartz, A","venue":null,"work_id":"1da6d5f1-5bc2-4013-afca-b269c3d1ddf2","year":1993},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.448321Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:0cfcbffe33698738e8aa74bcece8eca68ec744fff0a30f4355fc820ebfb7343f","observation_id":"c0572604-5990-4223-94c0-095580640edf","resolution":{"observed_at":"2026-08-11T12:24:24.277247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.261594Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"0d781419-76d5-442b-9f9c-6b2783e4ab9b","year":2012},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.452784Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:90385d10ccbbc819af45adde1c587a86b0b6e0ba3c9ec7dbc49dc5ac0e689c9c","observation_id":"769a9005-b6cf-4e3e-a9ba-d59524ddbce9","resolution":{"observed_at":"2026-08-11T12:24:24.265820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.249421Z","title":"A., Hussing, M., and Eaton, E","venue":null,"work_id":"c0bf49fe-ca76-4a78-bb16-23801f112af1","year":2024},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.456565Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:1963f980d3c379d98afbcbeb0cde6b84e6d8fbf607cb66f0690a506a5f86e0f6","observation_id":"7b65fa95-5ba6-47ac-a51c-0a46879514b0","resolution":{"observed_at":"2026-08-11T12:24:24.253446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.236793Z","title":"Model-based policy optimization under approximate Bayesian inference","venue":null,"work_id":"8375b8ab-c832-4ac2-8e1f-42ef8201d49d","year":2024},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.460825Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:a78ccaace0efbd9b296b17e9d657aae2a6a756b08d51cb05b69af2b84f7b6210","observation_id":"499c58fd-5976-4aa2-988e-f06982d918c4","resolution":{"observed_at":"2026-08-11T12:24:24.241358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02057","last_updated":"2019-07-03T17:53:02Z","snapshot_observed_at":"2026-08-12T19:51:32.307910Z","submitted_at":"2019-07-03T17:53:02Z","title":"Benchmarking Model-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.02057","snapshot_observed_at":"2026-08-11T12:24:23.465176Z","title":"Benchmarking model-based reinforcement learning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.465176Z"},"links":{"cited_paper":"/paper/1907.02057","citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:814688e8851f96f13b41b70b16e125dd3f9081420395dfc991089f98959fa97a","observation_id":"95a2e144-6071-440b-8710-2cce7bea435b","resolution":{"observed_at":"2026-08-11T12:24:23.465176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.223156Z","title":"Live in the moment: learning dynamics model adapted to evolving policy","venue":null,"work_id":"a5fdf2dc-b180-4528-8d4a-9aa9046a8390","year":2023},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.469704Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:b9b9c151177c80bf92bb1d68594fb2924c975ca078f045043971ee1233d7b164","observation_id":"d4175e3b-3d47-45d3-ba63-93dfa091b947","resolution":{"observed_at":"2026-08-11T12:24:24.227657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.209971Z","title":"Accelerated policy learning with parallel differentiable simulation","venue":null,"work_id":"a1f2fa87-db01-4a34-ac03-12b6cca0939f","year":2022},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.473557Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:42894ea3fb92001bd73fd35265e436751039551e1f5614b1b222b768628ebbf8","observation_id":"5156ca77-6341-43a8-a8cf-659949f2563d","resolution":{"observed_at":"2026-08-11T12:24:24.214542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.196730Z","title":"Mastering visual continuous control: improved data-augmented reinforcement learning","venue":null,"work_id":"031a861e-8cf6-4bfa-9947-07bc7acce645","year":2022},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.477697Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:12a6986d0cb0b2324ad322e12fda8e2bbd80ecbcc3f5215eafd30bfcf224ffa6","observation_id":"a9466429-95f2-4e9c-a0c2-86a3eab5737e","resolution":{"observed_at":"2026-08-11T12:24:24.201085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:24:24.180965Z","title":"Is model ensemble necessary? Model-based RL via a single model with Lipschitz regularized value function","venue":null,"work_id":"b27000fe-f497-4b66-a3e3-99d8547e5d50","year":2023},"citing_paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T12:24:23.487246Z"},"links":{"citing_paper":"/paper/2412.14312"},"observation_digest":"sha256:a196f42314918b7c6e727c18967dede369b383ee8804a1cbf38843fd41c740a5","observation_id":"d2fa609a-25a9-4c43-bc43-a34530cc16f4","resolution":{"observed_at":"2026-08-11T12:24:24.185347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14312","last_updated":"2025-06-20T18:24:06Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T10:55:58.117546Z","submitted_at":"2024-12-18T20:25:04Z","title":"Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2412.14312."}