{"as_of":"2026-08-12T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdd1a09d58a58a94f38667c4fb808dc0fc81673269b945b199a644f88a5026e2","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:28:45.048339Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05766/citation-record","integrity":"/paper/2412.05766/integrity","json":"/paper/2412.05766/citation-record.json","paper":"/paper/2412.05766"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-11T20:28:44.751929Z","title":"Hafner, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.751929Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:35a63df5b065cac869ed45d6e0e17d56d28c16b04658f21eb5ecab4858bab925","observation_id":"ab188922-f77c-4f5a-8f2f-f8dc800750f9","resolution":{"observed_at":"2026-08-11T20:28:44.751929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T20:28:44.966115Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.966115Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:d47e1c6284c4eb9f87b28d3cda0e4b7386bd63e6d41c1bd3fab278b10cec5148","observation_id":"d5bb4fef-e4fd-4adb-9c5a-d3ea6286e56a","resolution":{"observed_at":"2026-08-11T20:28:44.966115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6034","last_updated":"2014-04-19T11:54:52Z","snapshot_observed_at":"2026-07-06T03:31:30.452356Z","submitted_at":"2013-12-20T16:45:54Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6034","snapshot_observed_at":"2026-08-11T20:28:45.002755Z","title":"Simonyan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.002755Z"},"links":{"cited_paper":"/paper/1312.6034","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:7cb53b39a32ae09a038b13b514b61f070cb5e8d0e7fdf79dde8e88e428c16d98","observation_id":"45205631-176d-4256-855a-1bd18381dd90","resolution":{"observed_at":"2026-08-11T20:28:45.002755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03825","last_updated":"2017-06-12T19:53:30Z","snapshot_observed_at":"2026-07-06T05:46:32.599765Z","submitted_at":"2017-06-12T19:53:30Z","title":"SmoothGrad: removing noise by adding noise","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03825","snapshot_observed_at":"2026-08-11T20:28:45.014569Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.014569Z"},"links":{"cited_paper":"/paper/1706.03825","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:e72b0f9a743d3ee5192bb56cd264e7f0ac28bfa3e6d40febe7d5eda9368c71b4","observation_id":"56254eb0-3883-49a8-b4d8-1c3d967b23c7","resolution":{"observed_at":"2026-08-11T20:28:45.014569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-11T20:28:45.020457Z","title":"Tassa, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.020457Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:ede62127010d89c62a38a4ca142bf6caf5cff033e905560bc45e4afa982d8114","observation_id":"498ee4d0-47ef-408b-9e8d-d0e330dd76de","resolution":{"observed_at":"2026-08-11T20:28:45.020457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15477","last_updated":"2023-04-06T23:56:38Z","snapshot_observed_at":"2026-08-12T04:21:29.004755Z","submitted_at":"2022-06-30T17:59:49Z","title":"Denoised MDPs: Learning World Models Better Than the World Itself","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15477","snapshot_observed_at":"2026-08-11T20:28:45.031618Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.031618Z"},"links":{"cited_paper":"/paper/2206.15477","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:280f92ae3c100385eb6b47635df16a4a1a37f26b9b0ecda654325767cdd46f6e","observation_id":"5ff31b1c-18ba-41e2-b8ec-0e65e87809cb","resolution":{"observed_at":"2026-08-11T20:28:45.031618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17116","last_updated":"2023-12-28T16:53:23Z","snapshot_observed_at":"2026-07-06T17:09:19.909685Z","submitted_at":"2023-12-28T16:53:23Z","title":"Generalizable Visual Reinforcement Learning with Segment Anything Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17116","snapshot_observed_at":"2026-08-11T20:28:45.037385Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.037385Z"},"links":{"cited_paper":"/paper/2312.17116","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:56330c5022255ee1169a7aecae191250e3a53a60f39d73def482513cba379e12","observation_id":"bc6f1f18-a822-4c37-9fb2-dfb8ef8a9fe7","resolution":{"observed_at":"2026-08-11T20:28:45.037385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09645","last_updated":"2021-07-20T17:29:13Z","snapshot_observed_at":"2026-07-06T11:30:56.150751Z","submitted_at":"2021-07-20T17:29:13Z","title":"Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09645","snapshot_observed_at":"2026-08-11T20:28:45.043226Z","title":"Yarats, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.043226Z"},"links":{"cited_paper":"/paper/2107.09645","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:4677c01dce7f99f365d37d48f7ee4a2a2ffdeda4f547cefc869015c8b0bc8cdd","observation_id":"854ae04f-e2d5-41b4-bfda-c1f862c70040","resolution":{"observed_at":"2026-08-11T20:28:45.043226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:28:45.446436Z","title":"We believe this level of resource consumption could be easily reduced","venue":null,"work_id":"7c322c16-a40d-4853-af6b-31e9ca3a9fd7","year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":300,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.048339Z"},"links":{"citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:3fa730091e737917fe6a88ccb15d824343d77a8f581e9511c732b00938cd49a7","observation_id":"04ca557f-b8f5-4957-afbf-ef63cf70af38","resolution":{"observed_at":"2026-08-11T20:28:45.494190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-11T20:28:44.782737Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.782737Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:4c39c2ccd00908a287799b50ca3ecc83d0dfbf6a3449b9601d3d64d0a1a98ee7","observation_id":"4c35734f-9b59-49d9-a1d7-97b26f67b1fe","resolution":{"observed_at":"2026-08-11T20:28:44.782737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-11T20:28:44.611761Z","title":"Hafner, T","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.611761Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:04eb8bb75f3299e2192522e471a32f2f34053e15805d029f4120251fe45988ed","observation_id":"2f380f59-b967-4b6a-8c56-593ca4dcc279","resolution":{"observed_at":"2026-08-11T20:28:44.611761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-11T20:28:44.688087Z","title":"Hafner, T","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.688087Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:0074455b90058febfd7ba53a16c01305130ddfef330d2eab432bb775fbd338ff","observation_id":"ad2e0e10-0ff0-4c11-95fa-176a9f6e83a4","resolution":{"observed_at":"2026-08-11T20:28:44.688087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06548","last_updated":"2023-02-13T17:45:03Z","snapshot_observed_at":"2026-08-10T03:13:16.466090Z","submitted_at":"2023-02-13T17:45:03Z","title":"Automatic Noise Filtering with Dynamic Sparse Training in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06548","snapshot_observed_at":"2026-08-11T20:28:44.570722Z","title":"Grooten, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.570722Z"},"links":{"cited_paper":"/paper/2302.06548","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:914bc28ea3ed46e6e030b635ae28f889ff53779e1bec231e98a54982d4af6263","observation_id":"aab0590e-5cf6-4c1c-ac04-b71506a2d545","resolution":{"observed_at":"2026-08-11T20:28:44.570722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00374","last_updated":"2024-04-03T14:26:32Z","snapshot_observed_at":"2026-08-12T07:29:47.947863Z","submitted_at":"2019-03-01T15:40:19Z","title":"Model-Based Reinforcement Learning for Atari","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00374","snapshot_observed_at":"2026-08-11T20:28:44.771468Z","title":"Kaiser, M","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.771468Z"},"links":{"cited_paper":"/paper/1903.00374","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:c1e617536500c467f4eebd7df0080b6199e2e4e34b756ea95a4c37c3c111936e","observation_id":"6e2ad742-594b-4923-884e-58e8215b2672","resolution":{"observed_at":"2026-08-11T20:28:44.771468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04523","last_updated":"2021-04-19T03:02:59Z","snapshot_observed_at":"2026-07-06T08:56:30.534634Z","submitted_at":"2020-02-11T16:26:07Z","title":"Objective Mismatch in Model-based Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04523","snapshot_observed_at":"2026-08-11T20:28:44.869965Z","title":"Lambert, B","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.869965Z"},"links":{"cited_paper":"/paper/2002.04523","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:0f46a3037e8523910aea8bd89f21f5e817c0dac842453f9e3faa3f2aacfd8f61","observation_id":"e832b5b3-2826-4730-99f8-90621918d39e","resolution":{"observed_at":"2026-08-11T20:28:44.869965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.08229","last_updated":"2022-12-27T22:24:38Z","snapshot_observed_at":"2026-08-09T06:35:09.788305Z","submitted_at":"2022-07-17T17:06:52Z","title":"Guaranteed Discovery of Control-Endogenous Latent States with Multi-Step Inverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.08229","snapshot_observed_at":"2026-08-11T20:28:44.788015Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:44.788015Z"},"links":{"cited_paper":"/paper/2207.08229","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:eb0b81e4401a6216d7715ff82a9b285c13d7ef6fb6b09788007ab23c9f12e73e","observation_id":"7a77ee94-2d1a-4ced-a14a-ed4b329fc617","resolution":{"observed_at":"2026-08-11T20:28:44.788015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01464","last_updated":"2023-06-20T19:28:16Z","snapshot_observed_at":"2026-08-12T08:46:39.573080Z","submitted_at":"2022-04-04T13:28:31Z","title":"Value Gradient weighted Model-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2204.01464","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.01464","snapshot_observed_at":"2026-08-11T20:28:45.185122Z","title":"Value Gradient weighted Model-Based Reinforcement Learning","venue":"cs.LG","work_id":"09e5c5bf-b3c3-4d7f-8ae4-6f3f5bcc3f97","year":2022},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.026651Z"},"links":{"cited_paper":"/paper/2204.01464","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:0869c11e1dacafde586477aef198bf79dd07db1ab1242e1980d21a33d1d8823c","observation_id":"113827e4-2831-4d5e-9a97-95cfe4326c81","resolution":{"observed_at":"2026-08-11T20:28:45.221413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T02:50:21.545843Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2412.05766."}