{"as_of":"2026-08-08T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6d4ff3b285d22499aac6776494c4c6cdffb99f6481e735c208c4dcccacfc8e8","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:09:17.760252Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22772/citation-record","integrity":"/paper/2505.22772/integrity","json":"/paper/2505.22772/citation-record.json","paper":"/paper/2505.22772"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:08.814253Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:08.814253Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:c585c2ba2e358a6cd68c3436f497b1f83eeb75cf6d773e660178a4cd9e1aee45","observation_id":"40ab4bca-eed6-4115-bdb8-002fed1424dd","resolution":{"observed_at":"2026-08-07T13:09:08.814253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.00030","last_updated":"2021-01-04T03:20:54Z","snapshot_observed_at":"2026-08-03T22:45:29.060216Z","submitted_at":"2020-02-28T19:18:18Z","title":"Policy-Aware Model Learning for Policy Gradient Methods","version":2},"cited_work":{"arxiv_id":"2003.00030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.00030","snapshot_observed_at":"2026-08-07T13:09:18.354468Z","title":"Policy-Aware Model Learning for Policy Gradient Methods","venue":"cs.AI","work_id":"cae2945d-45dd-433b-9473-dd787096b4e8","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:08.908887Z"},"links":{"cited_paper":"/paper/2003.00030","citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:6b45214ebd80dc3a5db5c92611ac86fb1cd6d06ac5e92de0be7a8bd01a0d6cf4","observation_id":"6c84c614-a284-4059-8f25-38e4d5dae68b","resolution":{"observed_at":"2026-08-07T13:09:18.464220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:33.231261Z","title":"A., Garg, A., and Farahmand, A.-m","venue":null,"work_id":"85a52105-ce7c-48ea-b3f0-1fa98cb6fe3d","year":2022},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:09.085135Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:42fb6dfcf47259072cba27c55785b2bb68bd2642b99213c886e928b05ae124ff","observation_id":"38b64fb2-39b8-4e48-9c66-aa502d4f677c","resolution":{"observed_at":"2026-08-07T13:09:33.358461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:33.029732Z","title":"Selective dyna-style planning under limited model capacity","venue":null,"work_id":"f19c4512-3229-487c-afbe-bf8a753b65ad","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:09.259916Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:928481591b6e9f20cd32d85fb88c53ef99ef457142169109a5dae5cab7181fe0","observation_id":"818186a2-69b3-468b-97e7-9b23964f91da","resolution":{"observed_at":"2026-08-07T13:09:33.112847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.762586Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":"aa877f26-9086-4532-abf9-43c9f7ff6eb5","year":2021},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:09.396153Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:a95e63028b97f015135fe681df2eb16c23a4e3de811cd91081ed78b20164ec15","observation_id":"4f94333f-ccc8-4e49-b373-d16a42f8d974","resolution":{"observed_at":"2026-08-07T13:09:32.893588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.452984Z","title":"K., and Silver, D","venue":null,"work_id":"1dcfa7a2-a392-4e06-92de-d2593ec34543","year":2022},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:09.549513Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:8a8693a352de239d982610fd17b998f1b902a78b0e40df61953d1debd842cd7e","observation_id":"644ecb9d-0f3c-4e9f-a720-02367f2c07b2","resolution":{"observed_at":"2026-08-07T13:09:32.625519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:32.186772Z","title":"Learning near-optimal policies with bellman-residual minimization based fitted policy iteration and a single sample path","venue":null,"work_id":"fa472e47-cf84-4c05-abd7-68f4f5d53881","year":2008},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:09.661617Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:6f0e3ad0176e15b83df1d04a82cc8288730aa587ea933ddbe27318ce77fc1b12","observation_id":"93d86de0-9806-4b02-a093-00755cd8e645","resolution":{"observed_at":"2026-08-07T13:09:32.322696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.929189Z","title":"Model-based reinforcement learning with value-targeted regression","venue":null,"work_id":"6bd938da-2837-4be4-98db-764869d6a3a6","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:09.823341Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:d1ec03c493a63d269b2660674e74041e48c989f2783b4a1eaf6d84e4977a5c97","observation_id":"0497668d-bf2b-47d5-9ab8-3431ee4c359d","resolution":{"observed_at":"2026-08-07T13:09:32.036642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.584676Z","title":"G., Naddaf , Y., Veness , J., and Bowling , M","venue":null,"work_id":"b439ec8e-c073-4f90-a0e9-27ab7f40b9d1","year":2013},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:09.963850Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:01ef4b3ce6707665566dc935b1499bf02f73cf865870fbc7c3b1fd3a7af67c0c","observation_id":"6fa4c62f-773a-4fe8-820e-67619187298c","resolution":{"observed_at":"2026-08-07T13:09:31.715009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.397681Z","title":null,"venue":null,"work_id":"359dfe14-4a2e-454a-bd76-a949ebf8d8eb","year":1978},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:10.109305Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:f89d2c4a4c29a488d114faad3c3c7f969057e3534c9e779f1482880a95d8ddbc","observation_id":"3446c838-dd06-47ab-830c-cf6246433575","resolution":{"observed_at":"2026-08-07T13:09:31.490259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:31.184673Z","title":null,"venue":null,"work_id":"bcf9aac0-821b-487a-8220-7149fbb71adc","year":2007},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:10.267295Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:17ad3c6fcdad471ffcf7dcf42f8924eff31d80da9d53d17d48863ec8f4679a1c","observation_id":"3e89f9b6-9a7d-4a43-98f1-9cfddfdc8c11","resolution":{"observed_at":"2026-08-07T13:09:31.287134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.895970Z","title":"Sample-efficient reinforcement learning with stochastic ensemble value expansion","venue":null,"work_id":"5a4aa51d-d592-4aad-8377-1a5e539d1487","year":2018},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:10.426359Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:9f353415e512de2358b62df233f0e39239b22628049e00196a9e624ab01a8d7c","observation_id":"5b996a9d-764c-49ed-b47f-05e817eeb11e","resolution":{"observed_at":"2026-08-07T13:09:31.032639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.658876Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":"912ac28e-8d75-46c7-a066-7d9525907bf2","year":2018},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:10.527645Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:b7a290d2b2e8eb5658d7e8db34f1ce216dca20795905d1807510d9380e1f4770","observation_id":"3507d494-9c05-4249-9a01-e113b4ac63c9","resolution":{"observed_at":"2026-08-07T13:09:30.764067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.467594Z","title":"and Rasmussen, C","venue":null,"work_id":"bdbcca33-bb64-4c6f-8598-e35b2e73b5d0","year":2011},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:10.620422Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:8f53b3e5ed3fcba762628ffa44db6d455ffe39908b7b17d826382378be05a961","observation_id":"05d25522-eb37-47d4-b364-589cb7e0c3ba","resolution":{"observed_at":"2026-08-07T13:09:30.546881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.305548Z","title":"M., Tirinzoni, A., Papini, M., and Restelli, M","venue":null,"work_id":"30d3c6d5-c660-4317-ae61-c5905a15c4e3","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:10.724642Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:eacb0f9fca7be7ad4ee895d40cd380c52d800ec064e82b85f34bb2800833a036","observation_id":"2fe62a17-d7a8-4a42-8d21-574f4128e05d","resolution":{"observed_at":"2026-08-07T13:09:30.368864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:30.043787Z","title":null,"venue":null,"work_id":"5fa2614e-75bb-45ed-806e-14d39365327f","year":2022},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:10.838050Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:e52fba206d316ec5bc618c8dacbf4d3106d384432d749dabb43444dbb25cb2d5","observation_id":"d2204801-21ab-4f5d-bed0-2c06dbc57005","resolution":{"observed_at":"2026-08-07T13:09:30.162712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.764501Z","title":"Iterative value-aware model learning","venue":null,"work_id":"e102497b-9af7-4da5-a1ca-62030aea6d5d","year":2018},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:10.997353Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:b37f4776197faec2cd31b03efb1e1b1c9d3c0790a99ef9138e8ed59744461c20","observation_id":"bf3988e7-612e-4f54-a0da-51f72500afdc","resolution":{"observed_at":"2026-08-07T13:09:29.875465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.528734Z","title":"Value-Aware Loss Function for Model-based Reinforcement Learning","venue":null,"work_id":"d434cf88-0cea-4927-b700-f0d29984693b","year":2017},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:11.097785Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:7bf45eecde9bee59a5ff5563ea8ee34f3cd2e32cb772100e92d88deabe8dfe2c","observation_id":"3c3452ea-8c33-4740-b761-b6f7a73472a0","resolution":{"observed_at":"2026-08-07T13:09:29.658586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.311038Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"88e3eb17-c5cd-46c1-aa6e-fb48d7d67efb","year":2018},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:11.249171Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:9339bc8ae4e6c4eed71aeb5f5adb7cf7085dd2de1f94d51d447c597ab174a31d","observation_id":"b018369d-cbae-4ab0-987b-487b422a7dbf","resolution":{"observed_at":"2026-08-07T13:09:29.408897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:29.077314Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"58f7036e-96aa-401b-93df-8499f73fc0f0","year":2018},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:11.358450Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:86ff3691ee791762ccad819df6efe2261a0290c1d25995f4391aad1d1334e2cd","observation_id":"c86cb7e5-572c-4feb-93e2-cd77c76850ca","resolution":{"observed_at":"2026-08-07T13:09:29.194365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.820257Z","title":"Towards general-purpose model-free reinforcement learning","venue":null,"work_id":"bcee2ec3-28cb-46c2-ad02-0313a32e32bb","year":2025},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:11.527733Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:da4a26751bb469f48be27e53ba46f38291847fddfe39c47d904965612289898f","observation_id":"547ca141-76e9-4106-9e87-adc642d4afcd","resolution":{"observed_at":"2026-08-07T13:09:28.943082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.551859Z","title":"Simplifying model-based RL : Learning representations, latent-space models, and policies with one objective","venue":null,"work_id":"504c1052-8c32-4533-92d4-0f6604d03ed2","year":2023},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:11.678634Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:44c8d59b357ea051684dfbcfa97fe3af0f65df53ad3c2ef667f0876ec17afe82","observation_id":"4bda5e53-52a4-49c9-8756-e5ecf575acdb","resolution":{"observed_at":"2026-08-07T13:09:28.675125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.253590Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"910c8230-8676-4b35-af3c-ae34ca091767","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:11.831988Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:3eb50a19e95fd0833719efc904c63c4a3f3627d9ef289735e095ab3f3b4bccf9","observation_id":"26513e54-bead-43e4-849d-097d76b5aafb","resolution":{"observed_at":"2026-08-07T13:09:28.383823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:28.037540Z","title":"The value equivalence principle for model-based reinforcement learning","venue":null,"work_id":"79ea3a2d-f6b3-422d-a2f1-cb91d8164c8f","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:11.963822Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:e12389f1bf2d88c6e2be78c4ab08b504a49128a3ea4f2341d3c977b1e22ad4d8","observation_id":"70d9c609-c380-47d7-aff0-180e88afe18e","resolution":{"observed_at":"2026-08-07T13:09:28.136275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.824362Z","title":"Proper value equivalence","venue":null,"work_id":"dd9076a5-4d85-47f5-ae19-a73de233cdac","year":2021},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:12.103540Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:cc93f1f481c47d6eb8fd8bd6488afe2f873a56f000a12d2eee909d28df17dc2e","observation_id":"93d22613-55ba-427d-8aea-5296be81d6d8","resolution":{"observed_at":"2026-08-07T13:09:27.915824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.567659Z","title":"D., Thakoor, S., Pislar, M., Pires, B","venue":null,"work_id":"c2253336-9710-47bb-8812-a46b2ffdfa40","year":2022},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:12.232045Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:b3b19881036dc96fde53e95086b851f658db76bda381fa564992c943cd1290c3","observation_id":"e3fd006a-8c2b-4dd2-818f-afe413e49161","resolution":{"observed_at":"2026-08-07T13:09:27.686521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.299761Z","title":"A distribution-free theory of nonparametric regression","venue":null,"work_id":"09b7765f-6e39-432b-ab6c-5d64dd17273a","year":2002},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:12.387978Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:3a7e040e6ed9eb7223c83da34448af4101fa5d9bbf5f5104757e9f732fee0bcf","observation_id":"70cbc379-0399-41ba-afeb-9652e995cf23","resolution":{"observed_at":"2026-08-07T13:09:27.422539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:27.092613Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":"8f29ac55-8029-4c82-9885-a61a40ae788c","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:12.498353Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:fffa3a6dc4410483a363f8fa934934349c9d78d459c7ff02a6159e95a84f488f","observation_id":"4c0bafb1-3399-4af4-ba4f-f923b7789996","resolution":{"observed_at":"2026-08-07T13:09:27.154429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:26.865823Z","title":"P., Norouzi, M., and Ba, J","venue":null,"work_id":"c8802f41-2406-4469-9fbd-6ff0e731c19e","year":2021},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:12.605961Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:e51b22ffd4b4d9753c599c164a2f2d0d7338cfee23ac7bd48a58744837146ed3","observation_id":"4d68547c-5b51-457a-a33e-58da00edcfba","resolution":{"observed_at":"2026-08-07T13:09:26.972081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:26.511308Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"00d2bdf7-2e47-48b4-bc2f-16b1f7b047a8","year":2022},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:12.725037Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:b6f2ab5c9892b2eb52cbfc43a279c385fbef6f059690af01933cc35466cd6b56","observation_id":"8b5ba07a-4c0a-417b-80d4-2a0fe2c87680","resolution":{"observed_at":"2026-08-07T13:09:26.724701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:26.232738Z","title":"TD - MPC 2: Scalable, robust world models for continuous control","venue":null,"work_id":"4b57a82b-766b-4c2a-b8a7-e02b56142965","year":2024},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:12.891335Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:5b309354d41857d10966be9d82647249798a468ce2ca91f9c334e781f0763f62","observation_id":"378ade67-eabc-49b9-b470-ecb553fd733e","resolution":{"observed_at":"2026-08-07T13:09:26.367778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:13.037077Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.037077Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:7da7f78ec77f98be5aad8a614a993346a4db0629d544f32d6a8e28b3a4439312","observation_id":"277ad174-847c-4f8c-8c37-8118397c0384","resolution":{"observed_at":"2026-08-07T13:09:13.037077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.929325Z","title":"W., How, J","venue":null,"work_id":"1a3eb46f-e3aa-41f0-99b5-92d5c5d798fb","year":2013},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.192708Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:bfdf0121114af8e0505b063258a65cf2c1fc71a472bafba31ab29435d2e1104b","observation_id":"8fa3e54b-3fdf-4cef-89d7-ac6799fa261c","resolution":{"observed_at":"2026-08-07T13:09:26.070543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.698680Z","title":"and Singh, S","venue":null,"work_id":"5e0edb56-950b-4d1f-91a2-6d90e033ef63","year":2002},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.294474Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:23c940055881238a599cdcf01560b19ec9f56c719b52d46e772853246cf538f8","observation_id":"bb4195a3-8d5c-47d1-ae98-ecf4e74395a6","resolution":{"observed_at":"2026-08-07T13:09:25.821175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.403837Z","title":"Objective mismatch in model-based reinforcement learning","venue":null,"work_id":"994cafa4-b1ff-4882-aec1-0ba56e31608d","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.408671Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:ffe495c6e731a8e0947aabf3c67c36e2c758f917eba1d5ee41ed05ca144c3f9c","observation_id":"5272de2f-0975-47b4-9be6-cc008ec22d17","resolution":{"observed_at":"2026-08-07T13:09:25.530243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:25.159228Z","title":"Efficient deep reinforcement learning requires regulating overfitting","venue":null,"work_id":"207dc99b-88b9-4b19-b692-1336208af504","year":2023},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.498551Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:9508c83bea8e3b4d3c2d917348674bc5d28bbe84bdb95876d4ef70f2aae64dee","observation_id":"805deed8-92e8-4b07-ac2d-77c456cc7435","resolution":{"observed_at":"2026-08-07T13:09:25.284615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.989543Z","title":"I Can't Believe It's Not Better!","venue":null,"work_id":"76964dc4-bad4-4fc7-8243-f0695a48134b","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.625590Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:446dd0f448c9fe425923c0384ecd20fd16178b38de1ff405973c5c8f19b5a068","observation_id":"884ebb71-2402-4532-9cdb-caa595155047","resolution":{"observed_at":"2026-08-07T13:09:25.062792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.721635Z","title":"Understanding and preventing capacity loss in reinforcement learning","venue":null,"work_id":"6988d9ca-48f0-4174-ae57-0c85cf4a2480","year":2021},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.751962Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:4c23a546d0340842f51ff27d8517373bab74d5e1e4c3dad72c69d10fc486fc0d","observation_id":"c062b37c-1eb2-4743-89f2-dbfe544d9439","resolution":{"observed_at":"2026-08-07T13:09:24.840804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.508231Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":"f2900de0-94c7-4829-a88d-1c69c7654754","year":2013},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.867460Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:14f695e9283c95ad2602a7714907a953ab31f39baedac8f62c9427bf5cff27e9","observation_id":"bfdb6ad5-4bcc-422a-a829-2155f3de87f1","resolution":{"observed_at":"2026-08-07T13:09:24.596608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14080","last_updated":"2022-01-28T18:22:02Z","snapshot_observed_at":"2026-07-06T11:23:23.417429Z","submitted_at":"2021-06-26T20:01:28Z","title":"Model-Advantage and Value-Aware Models for Model-Based Reinforcement Learning: Bridging the Gap in Theory and Practice","version":2},"cited_work":{"arxiv_id":"2106.14080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.14080","snapshot_observed_at":"2026-08-07T13:09:18.120724Z","title":"Model-Advantage and Value-Aware Models for Model-Based Reinforcement Learning: Bridging the Gap in Theory and Practice","venue":"cs.LG","work_id":"ff3c0912-341d-4405-a29e-1b8d1e36b3fd","year":2021},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:13.972688Z"},"links":{"cited_paper":"/paper/2106.14080","citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:233fcd3d5215b5466d53d2f205ea280708e867be0e513f0048c22097ee4bdebc","observation_id":"881dab5e-cc3e-4cd6-931c-f7d595fca577","resolution":{"observed_at":"2026-08-07T13:09:18.235808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.350020Z","title":"Sample complexity of reinforcement learning using linearly combined model ensembles","venue":null,"work_id":"000caab9-6d2b-4503-bc2c-a4c34a775e1a","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:14.144990Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:6e4389156e215567ba90a107641c5fbe09d0300d0b34b7068eb78b41381e5740","observation_id":"ec064109-030b-4172-950c-9f8545d70af3","resolution":{"observed_at":"2026-08-07T13:09:24.408689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:24.140292Z","title":"M., Broekens, J., Plaat, A., and Jonker, C","venue":null,"work_id":"3fb6a185-7190-498a-8429-d4fc8154a870","year":2023},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:14.234988Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:fdafef96ed2691d52a4d7672a427558d825f94ffff0e631555460403106dcb81","observation_id":"ae8d72ac-6e4f-4687-9cba-51fa829f623a","resolution":{"observed_at":"2026-08-07T13:09:24.251648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.970006Z","title":null,"venue":null,"work_id":"c3f79815-db8a-43b2-9780-92ab6ddf1683","year":2018},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:14.326438Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:32784678b81b2a38f8594f2d2c5a2c7379cafddc578f3faa2bb4145b5f7bcc06","observation_id":"930dcfbf-4c9b-4266-baa2-c31325c5b43b","resolution":{"observed_at":"2026-08-07T13:09:24.037262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.792560Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":"8b785b07-255b-477f-bc3a-12814a96bd23","year":2024},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:14.478911Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:947ebc0d19cbe86bf5f255fa8d163675964dba70466a9505753318a8d22a334f","observation_id":"efa7bc70-cf19-4f7b-9e97-9c84e50ee18c","resolution":{"observed_at":"2026-08-07T13:09:23.866129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.600805Z","title":"Bridging state and history representations: Understanding self-predictive rl","venue":null,"work_id":"28a4afbc-1144-4b59-a3b9-aa912d2efd87","year":2024},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:14.620672Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:8b0c4498cab2ff7012d27d142c1bb22f6946d16e1676c15d9b3e81f16b60a085","observation_id":"41e1a8f4-b307-447b-8494-df5a6757e824","resolution":{"observed_at":"2026-08-07T13:09:23.680957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03273","last_updated":"2021-06-06T23:15:49Z","snapshot_observed_at":"2026-07-06T11:16:30.999377Z","submitted_at":"2021-06-06T23:15:49Z","title":"Control-Oriented Model-Based Reinforcement Learning with Implicit Differentiation","version":1},"cited_work":{"arxiv_id":"2106.03273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.03273","snapshot_observed_at":"2026-08-07T13:09:17.907720Z","title":"Control-Oriented Model-Based Reinforcement Learning with Implicit Differentiation","venue":"cs.LG","work_id":"c0344a60-74e8-445b-8779-9a5a4a9e86f6","year":2021},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:14.741055Z"},"links":{"cited_paper":"/paper/2106.03273","citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:ded98a9a823d178f957ed05125b871f07e4d1fc55216174f3fa67b7d0c1aa305","observation_id":"aadc641f-e328-4775-8202-489c167daac2","resolution":{"observed_at":"2026-08-07T13:09:18.026469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.344107Z","title":"Value prediction network","venue":null,"work_id":"ba1454c7-a411-490e-8f3d-484842dbb1b7","year":2017},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:14.877508Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:a4debf15fe18232b97ef24874d4f14e6a1c48d73d1fb8d0e3788da0b5a84754b","observation_id":"8335ddd9-78eb-4602-a579-e87adce80ea3","resolution":{"observed_at":"2026-08-07T13:09:23.433123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:23.161987Z","title":"E., McIlraith, S","venue":null,"work_id":"80fb1d4d-6fde-40a7-b745-551c7b100192","year":2021},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:14.993300Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:d0c8c395c3c532bc5f258763ea6ffe0a96b70b36217cff9ee7397bdf5beb484c","observation_id":"d558a703-3af4-4e03-93e6-e7afff1660d3","resolution":{"observed_at":"2026-08-07T13:09:23.239233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:22.856633Z","title":"Empirical design in reinforcement learning","venue":null,"work_id":"c6268c14-d4d6-4de9-a23c-012f8f6bc237","year":2024},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:15.119361Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:e064b24104734baa1b0d99fb1468a349cc695ed6c57c430036fa74c66d7aa842","observation_id":"21fa0460-4769-48ea-ab94-3b93f2569b3e","resolution":{"observed_at":"2026-08-07T13:09:22.991761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:22.607767Z","title":null,"venue":null,"work_id":"e74344e2-0b3a-42f9-a5e2-87d3c95e3817","year":1994},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:15.260266Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:f7549bc2f9400bd0c0104deb7ece980817891a57936a94078ddc59d80407ac20","observation_id":"51f6650f-b716-49aa-a611-560b918ce8e4","resolution":{"observed_at":"2026-08-07T13:09:22.755389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:22.340345Z","title":"Operator splitting value iteration","venue":null,"work_id":"f6053aa1-e44c-483b-aa08-03c59aa98edb","year":2022},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:15.353700Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:49688159bfce6c00c98fab19ae90c1d988df0b9f97fce88fd964bac57c8ce58a","observation_id":"49b4b32f-c328-4fc6-bb5b-f7c89e8b65f7","resolution":{"observed_at":"2026-08-07T13:09:22.466863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:22.072511Z","title":"Maximum entropy model correction in reinforcement learning","venue":null,"work_id":"aa7be02c-0576-43db-8bbc-8923ae0f2ef2","year":2024},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:15.481649Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:2470e58218cfe2c6e0c51ac750569e3da9d49992551e5492abda6f53b45cd3df","observation_id":"0d976d4d-15a2-4146-b927-fe26ebed803e","resolution":{"observed_at":"2026-08-07T13:09:22.198517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:21.821895Z","title":null,"venue":null,"work_id":"b253025e-69f5-460e-b759-cc0c9d30328d","year":1997},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:15.654425Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:76555a83eeb076809accb30a4e2d858f12c3f968a00feec8ebeb8a9c4c4cd7ff","observation_id":"bcc35c69-5a1f-4be8-b260-15525ccd0ea8","resolution":{"observed_at":"2026-08-07T13:09:21.942073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:21.556057Z","title":"Mastering atari, go, chess and shogi by planning with a learned model","venue":null,"work_id":"d6a56554-76e1-45b7-98d1-c8d9e90b0185","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:15.761366Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:e3430e5af75f35805530cb04b563fd575ae8e4338e8620646671b75cf01107e4","observation_id":"d0de21d0-45cf-43e0-a928-2e94dc30772f","resolution":{"observed_at":"2026-08-07T13:09:21.673186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:21.310421Z","title":"The predictron: end-to-end learning and planning","venue":null,"work_id":"6cf28baf-9693-497a-a702-35a71eb9811d","year":2017},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:15.959887Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:f5b1511262e1476264e88a3cb9051c34621ac2c4afb62b2b68e999fb7476d0f9","observation_id":"0011d39f-7327-492a-a1fd-eb9cbd97532a","resolution":{"observed_at":"2026-08-07T13:09:21.438926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:21.120654Z","title":"and Christmann, A","venue":null,"work_id":"51566e89-2203-4fff-9cc6-685d4b446d93","year":2008},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:16.116586Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:826e67aefd57ebdff81088f8c77b57a38a4f1c59e0439c3d46671bdad1594cf0","observation_id":"acdd79cf-fa10-4002-b745-07dc9c1524c1","resolution":{"observed_at":"2026-08-07T13:09:21.200251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:20.895720Z","title":null,"venue":null,"work_id":"9984c12b-5c92-4da5-b494-c763df9bca8e","year":1990},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:16.259699Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:7c02909a1227ebfd30bd826f1f01b24f85be118854600b52c6c25528155d27cc","observation_id":"183002fc-b906-4493-a87b-66f9b7a2fc1e","resolution":{"observed_at":"2026-08-07T13:09:21.005759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:20.684141Z","title":"Self-correcting models for model-based reinforcement learning","venue":null,"work_id":"17f03211-64cf-4a73-ba41-5ea5aa08df82","year":2017},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:16.407456Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:8eb23c6609032b0c9f7018629982d8578a6d3214908902a6756170040d3953dd","observation_id":"68d7c7cc-6960-45b2-9576-61f954963fb9","resolution":{"observed_at":"2026-08-07T13:09:20.786604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:20.438405Z","title":"D., Richemond, P","venue":null,"work_id":"168c990d-06e0-4cd6-a428-6b7f1e8c5a2b","year":2023},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:16.549002Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:e6327e9cab02fcb15ce7ba35e11362f682cd54e6bdda72ac0dffadf9527928be","observation_id":"ae8e201f-b7a0-4f44-ba68-bb9dbc8bc117","resolution":{"observed_at":"2026-08-07T13:09:20.546180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:20.175037Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":"b1b42f63-c503-4671-a827-acad7c6ef979","year":2020},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:16.660389Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:097bc995057c3803897ab60a6f11a1e27e314a6d4b4cb231b81bce248ec286d9","observation_id":"f67a08a6-636c-4daf-8d57-4aef4ce904ac","resolution":{"observed_at":"2026-08-07T13:09:20.292213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:19.936716Z","title":"A., Liao, V., Garg, A., and Farahmand, A.-m","venue":null,"work_id":"04879cf1-15f7-4ea6-96dd-1b80071cf1ae","year":2022},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:16.815489Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:db0e9d0437747bf097492c97b9c22d310d603daa4d96f15e7d6e5cdf53f74091","observation_id":"f7ed46a1-b0f2-47fd-aa6c-8727858f6ed8","resolution":{"observed_at":"2026-08-07T13:09:20.071404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:19.679372Z","title":"A., Kastner, T., Gilitschenski, I., and Farahmand, A.-m","venue":null,"work_id":"ac372009-804b-4a81-b628-f09871ecaa7d","year":2024},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:16.949963Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:be9364d8e2bb1005eab1d626d4dcb14a0f0cb06212242c2ab8912013caf8b8f6","observation_id":"cbe52414-dbd5-4250-a01b-02b61ff5b5a6","resolution":{"observed_at":"2026-08-07T13:09:19.825818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:19.378024Z","title":"A., Hussing, M., Eaton, E., Farahmand, A.-m., and Gilitschenski, I","venue":null,"work_id":"ee7453fb-810d-4b61-84b2-53badeb7f285","year":2025},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:17.062688Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:a51f92de85e9e38e39655b3561ee277f0e6eacce971126714ec0ad0c3fd5adb0","observation_id":"12b1790f-1c83-415b-867e-9716abed2893","resolution":{"observed_at":"2026-08-07T13:09:19.518431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:19.117084Z","title":null,"venue":null,"work_id":"996a47ad-7359-44f2-80d1-7bb7ade0d586","year":2019},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:17.179418Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:4d456cb53dab7d945cf49d7d9249a0e55dd6c6d6e64fc452f032c4b45ea7277c","observation_id":"e2e34706-9676-4334-87b9-ea90b3582e3e","resolution":{"observed_at":"2026-08-07T13:09:19.263211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:18.861618Z","title":"Mastering atari games with limited data","venue":null,"work_id":"7bf5abe5-37e0-408b-a239-79355ba88fa8","year":2021},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:17.366937Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:a09f7a5b8250be5c15457a4fea2a490e591769f0ba748c425b32777cfa050490","observation_id":"33dc1d4a-b64c-4907-9657-800466c5a68b","resolution":{"observed_at":"2026-08-07T13:09:18.952675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:17.473662Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:17.473662Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:1061179d5e950161920f36039a21b11ac137ba9e4a46142d8cbb21b783c6383e","observation_id":"5a99d0f2-4113-45f4-a4a2-6fbae0ef3494","resolution":{"observed_at":"2026-08-07T13:09:17.473662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:17.635262Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:17.635262Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:47c28da04bf4b3c2153aae19b1327c469ffc535412ac80efeecf994a7b707c8f","observation_id":"e4377d2c-cd47-4901-a6bb-d79b807adcb3","resolution":{"observed_at":"2026-08-07T13:09:17.635262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:09:18.604945Z","title":null,"venue":null,"work_id":"37f7660f-9197-4cd0-a518-24e3c0332b4b","year":2024},"citing_paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:17.760252Z"},"links":{"citing_paper":"/paper/2505.22772"},"observation_digest":"sha256:9e3ecc136e85e95afc93f9db2a39f458513a6318fd8aff4ac82c4b5dd3a1a561","observation_id":"79b5efcf-f05b-4965-9a93-6145e883ca8c","resolution":{"observed_at":"2026-08-07T13:09:18.744992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22772","last_updated":"2025-06-09T01:24:44Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:58:24.891208Z","submitted_at":"2025-05-28T18:40:49Z","title":"Calibrated Value-Aware Model Learning with Probabilistic Environment Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":52},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2505.22772."}