{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf74a72977cbbf97de086523b4033e127722bd79a92aecc0dcbe6a7dbcfab8fd","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:47:20.742361Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.01823/citation-record","integrity":"/paper/2507.01823/integrity","json":"/paper/2507.01823/citation-record.json","paper":"/paper/2507.01823"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:23.394489Z","title":"Learning dexterous in-hand manipulation","venue":null,"work_id":"d85002b7-8653-46bb-9fed-e11357563c82","year":2020},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.390346Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:e036df66dee43ddcffbae4f479c123a83f0bee91279c1f0a6db8606d05e17861","observation_id":"04e8cbc0-f772-4358-9ce7-06de442aa9d1","resolution":{"observed_at":"2026-08-06T20:47:23.473018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:23.214208Z","title":"Multitask learning","venue":null,"work_id":"c6ae7966-00ed-462a-b018-be6d2b48bc07","year":1997},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.406344Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:1819be186d2cd53826535f6579982c03180125dff81317efd37276c9cf65785d","observation_id":"9263eaca-20d5-46ab-8758-8c32302f40e5","resolution":{"observed_at":"2026-08-06T20:47:23.314129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:23.030768Z","title":"Deep reinforce- ment learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":"be2d063f-b8b6-40f3-a069-baaf87d789fc","year":2018},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.416301Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:c5a6f2abefe46bf838a6b0991f26fd77443db5d601e74dbf9e8e94a4407c6b22","observation_id":"6c0e3251-fa33-452d-9d3b-12d0c98feaee","resolution":{"observed_at":"2026-08-06T20:47:23.112922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.885757Z","title":"Distilling policy distillation","venue":null,"work_id":"6920c071-c588-4303-a584-d070e1538539","year":2019},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.425545Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:a3c76380ce905dde23af870e4946b2e629b6fbd7cefe147a7f853df058d92bdf","observation_id":"d1468e31-2710-4527-8c86-414adf765016","resolution":{"observed_at":"2026-08-06T20:47:22.951909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.765581Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":"8f86f32c-7ffe-445e-9e88-e67149f81209","year":2017},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.433050Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:e45008d40f7ef00b4a54fa03c5a842acb3f109930a632c7d0fd7d7bc5f90c177","observation_id":"c1a1e3d9-3583-458f-8612-acbcbdb931ac","resolution":{"observed_at":"2026-08-06T20:47:22.809935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:20.444697Z","title":"Model predictive control: Theory and practice—a survey","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.444697Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:bc7e932f0b7248ee0b0c9193f22ccc815ab8e601f684aefd50adcd0202e49fbc","observation_id":"bcaecc37-eca4-461b-a67f-6cf8a4848649","resolution":{"observed_at":"2026-08-06T20:47:20.444697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02466","last_updated":"2025-02-24T06:56:00Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:47:03Z","title":"PWM: Policy Learning with Multi-Task World Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02466","snapshot_observed_at":"2026-08-06T20:47:20.450908Z","title":"Pwm: Policy learning with large world models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.450908Z"},"links":{"cited_paper":"/paper/2407.02466","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:8ca691c22341676057b552f21ce809d0be0acb9c05ba09fd55070f44c3d4c6c3","observation_id":"21171bc0-8935-4a9a-b243-2dcc2542cc23","resolution":{"observed_at":"2026-08-06T20:47:20.450908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13630","last_updated":"2021-06-21T21:01:12Z","snapshot_observed_at":"2026-07-06T10:53:11.986981Z","submitted_at":"2021-03-25T06:57:11Z","title":"A Survey of Quantization Methods for Efficient Neural Network Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13630","snapshot_observed_at":"2026-08-06T20:47:20.455721Z","title":"A survey of quantization methods for efficient neural network inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.455721Z"},"links":{"cited_paper":"/paper/2103.13630","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:e466f1a5d51e99581b743e55304d12f8e6eb01ff6a08cf438528f0301fd284cf","observation_id":"bc07b9b3-bef6-4e53-bf11-8ff2c6c5b35c","resolution":{"observed_at":"2026-08-06T20:47:20.455721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.607372Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"cf663518-4296-4430-be37-624068fe681d","year":2018},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.463610Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:c25021490339c652f6749fd69c88470307eab20a278df445f3e1d1311f484eed","observation_id":"f4157507-8807-432c-8c42-20a3d1227fad","resolution":{"observed_at":"2026-08-06T20:47:22.640716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-03T15:20:23.515607Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-06T20:47:20.472806Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.472806Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:029bb8620e17e58129100b1d24dc33bea9a0f409247f1c9e5b31d823c5b24a32","observation_id":"ae87c9e5-3cd4-492a-9409-56fc1ef5fa57","resolution":{"observed_at":"2026-08-06T20:47:20.472806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-06T20:47:20.479734Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.479734Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:1c36d69534ec00bf612f9bffb0b7c84a48be33bb1c3c39249dd812dfbe03a389","observation_id":"32e106f6-2853-4358-a9fc-d2896720d3ec","resolution":{"observed_at":"2026-08-06T20:47:20.479734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16828","snapshot_observed_at":"2026-08-06T20:47:20.496984Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.496984Z"},"links":{"cited_paper":"/paper/2310.16828","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:64817eda5111776a7c60b7122e268a0ec07a565d0799a1016fa7408b7095e2e1","observation_id":"7d40029d-22c3-4768-b5a5-d251ef5f00fa","resolution":{"observed_at":"2026-08-06T20:47:20.496984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.404606Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"c9aafee9-a351-4a5f-9ddb-2aff2762e2f1","year":2022},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.507509Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:63aec25da644130eeb12b893edaf891933c7566de31f141302424a91ffa2547d","observation_id":"6d46e977-1dfb-4464-b064-fed8fd283b8e","resolution":{"observed_at":"2026-08-06T20:47:22.469698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:22.220242Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":"7d150306-c300-4c1b-bf9c-37e44e525f1f","year":2015},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.520752Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:0032ff7fec97bec49664821e5ff2fc6d062b581bfd96a519b739a1edfcabaf60","observation_id":"27ba02f8-e9c5-41b7-944d-3c14db794a55","resolution":{"observed_at":"2026-08-06T20:47:22.322084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.960528Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"4b6b0635-2cbf-4833-af10-97b50eec14a9","year":2019},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.535323Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:ac97511bc2472ebbe14648bce4c0b6121d31e72a9caecfcf5e762b84b11f74cb","observation_id":"5348b85e-9f2b-4581-aa07-f682510f00ac","resolution":{"observed_at":"2026-08-06T20:47:22.089670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.10293","last_updated":"2018-11-28T02:40:54Z","snapshot_observed_at":"2026-08-02T20:30:39.614115Z","submitted_at":"2018-06-27T04:34:30Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.10293","snapshot_observed_at":"2026-08-06T20:47:20.542059Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.542059Z"},"links":{"cited_paper":"/paper/1806.10293","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:774d2a19d2fa120f7e935042de824cfae0b9364aae1dce55f37e8555a529cd77","observation_id":"b8835014-03a8-4cfd-8a00-e47530bd3960","resolution":{"observed_at":"2026-08-06T20:47:20.542059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.875219Z","title":"Model- ensemble trust-region policy optimization","venue":null,"work_id":"138e93cb-2f5b-4c52-982c-2b36e1652046","year":2018},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.550685Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:ed66e3fc329e4d737abc207532c58f89676300884c345abc67678f6e70fe90bc","observation_id":"86f32bda-427f-4723-aa9e-e3279ec207e5","resolution":{"observed_at":"2026-08-06T20:47:21.912607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.793673Z","title":"Knowledge transfer in model-based reinforcement learning agents for efficient multi-task learning, 2025","venue":null,"work_id":"ba1a3a68-b0b9-4ad1-ac34-083a77bfd05c","year":2025},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.559871Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:2dbe256b7c1610911f49356f1043952d2a142f8c51862fe32251a94ed96c5ba9","observation_id":"bb48e649-4b62-4f98-bddb-3164cd34d21a","resolution":{"observed_at":"2026-08-06T20:47:21.821531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.718529Z","title":"Multimodal reinforcement learning: A survey and taxonomy","venue":null,"work_id":"d1e2fcc2-fa37-458c-8c06-249711a98979","year":2022},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.567465Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:6b96ed56a477ed1f03f2abbd45f6d8c707dd0c389b21b44dda04cb995bc20427","observation_id":"730faa61-02d7-4fd2-ab3a-9bb662814a4e","resolution":{"observed_at":"2026-08-06T20:47:21.759795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:20.578446Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.578446Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:5d91a56875d7a801a5c0d8d7ca44339bc8ce8b2e425025db3b27144a8404bff9","observation_id":"5a7ab240-a1a4-4a21-a017-898f96770a69","resolution":{"observed_at":"2026-08-06T20:47:20.578446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-06T20:47:20.587023Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.587023Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:efbcd2c237c0f0147dc90f7aea3d2d55dc37d996a41efdaae12d6779de57ce9b","observation_id":"c5a911dd-e79b-49be-a946-c364248cf997","resolution":{"observed_at":"2026-08-06T20:47:20.587023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-06T20:47:20.593145Z","title":"Mixed precision training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.593145Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:855e6af164c95a2f57b2c80e433aa1bec2b718fb6edc055619009d7f484cf8a8","observation_id":"783c56b4-a279-4c40-83f3-f2bed757516c","resolution":{"observed_at":"2026-08-06T20:47:20.593145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:20.605112Z","title":"Playing atari with deep reinforcement learning, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.605112Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:c55a15755b9ec6b11abbc388a4350a49beba732bfd80a2e69550e7ce1e35afb8","observation_id":"7b6c0716-2fa1-4c1f-ad24-0ddef9e18747","resolution":{"observed_at":"2026-08-06T20:47:20.605112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.627647Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"d65ce975-a3ea-4d87-8040-446cf5d1e365","year":2015},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.613060Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:c83464052475a48daecfaa08d410771d20373983649a5add0b52c45d61d66845","observation_id":"cb37187b-bee5-4690-8fff-bb312802380e","resolution":{"observed_at":"2026-08-06T20:47:21.635312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.591518Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey","venue":null,"work_id":"66987526-ca59-4f0b-a3cb-6fa1f7475817","year":2020},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.627352Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:045392876fe54cce06ee0ffe694ee28364a8ad4f90c989f2f2ba663adb876c35","observation_id":"36319905-9737-4917-b7e8-8be34e6a0463","resolution":{"observed_at":"2026-08-06T20:47:21.599873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-02T01:15:11.394264Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-08-06T20:47:20.638681Z","title":"Actor-mimic: Deep multitask and transfer reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.638681Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:f8976480b25ae4eed0b82f6d358328ef9768d41da9e17c78ab607a03c6cba401","observation_id":"6eb62eab-a102-4875-a46f-4e3602fb9356","resolution":{"observed_at":"2026-08-06T20:47:20.638681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-06T20:47:20.656768Z","title":"Policy distillation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.656768Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:da882d4333cf2c643b70d1fe1cbfb205141055946ac0648b211d6d4e69ac9888","observation_id":"3269a788-29a1-41cb-8b7d-4c914b02014d","resolution":{"observed_at":"2026-08-06T20:47:20.656768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.544479Z","title":"Deep q-learning with quantized neural networks","venue":null,"work_id":"5d50a1ef-b75f-4025-9d4b-2212654d28af","year":2019},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.664901Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:954915aab96b94963ae0b92f5edb7fb63868bc8077442094ac0a28339435d6c9","observation_id":"302f9915-3495-492a-aec4-3b3abd2e996b","resolution":{"observed_at":"2026-08-06T20:47:21.558810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.08319","last_updated":"2021-05-16T20:44:18Z","snapshot_observed_at":"2026-07-06T09:56:32.308108Z","submitted_at":"2020-09-14T19:11:13Z","title":"Decoupling Representation Learning from Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2009.08319","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.08319","snapshot_observed_at":"2026-08-06T20:47:20.851615Z","title":"Decoupling Representation Learning from Reinforcement Learning","venue":"cs.LG","work_id":"4b61171b-d725-4aa7-b989-65261fe50ba5","year":2020},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.679513Z"},"links":{"cited_paper":"/paper/2009.08319","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:971f15f9dcb79121fbce43d0daca0d826064088e3bcd7b583ea474c9893c35eb","observation_id":"f2cf4044-61c7-444f-902d-c6a24dd9a4ac","resolution":{"observed_at":"2026-08-06T20:47:20.863019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.489487Z","title":"Learning to predict by the methods of temporal differences","venue":null,"work_id":"a11028e6-35fc-4974-9752-f15747c0e233","year":1988},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.689489Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:42d13c3d6b0d53806569e5e031cf059146797b51030aec25c60af3e7cb4a1d47","observation_id":"f97136bf-5aa8-4c47-b6d4-b021f26006f6","resolution":{"observed_at":"2026-08-06T20:47:21.516200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.453246Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"9adad45c-9c98-49b1-b80b-99b912f1f9c4","year":2000},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.697887Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:bfaf0d12878a64d5932986f413489ac87cd7f8fe8de0e5b9e90fab0b523ff623","observation_id":"d15d1547-8fb8-4f92-982a-973fe84e01fb","resolution":{"observed_at":"2026-08-06T20:47:21.467837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12983","last_updated":"2020-09-07T14:28:10Z","snapshot_observed_at":"2026-07-06T09:31:53.000600Z","submitted_at":"2020-06-22T17:52:00Z","title":"dm_control: Software and Tasks for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12983","snapshot_observed_at":"2026-08-06T20:47:20.708057Z","title":"Dm control: Software and tasks for continuous control","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.708057Z"},"links":{"cited_paper":"/paper/2006.12983","citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:d5d93aba0877bd74ae5c07c68d23843a68bdc64e779017b8439bdd884eb6e13a","observation_id":"3be07ffd-7cf5-420b-a070-3daf4ac3127c","resolution":{"observed_at":"2026-08-06T20:47:20.708057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.419249Z","title":"Distral: Robust multitask reinforcement learning","venue":null,"work_id":"df321d42-e971-44d4-9f61-d0f210b06160","year":2017},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.715257Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:6e081994e9ef7ff2892b1b4bf5d80b521740151923f055ef7630930aa5a25657","observation_id":"3ace5a2a-ea29-4d25-a4d0-dc9b791c8d92","resolution":{"observed_at":"2026-08-06T20:47:21.429968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.392949Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"d098fe8a-781c-4a7b-a355-2f82fbb3da41","year":2020},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.725448Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:923c70ddd524465ea972895f6403a96bd2396f4bc7ff577a5354b51dff4ae984","observation_id":"468cf8ab-d718-4d55-b6ae-ae543a14a9ec","resolution":{"observed_at":"2026-08-06T20:47:21.402282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.364940Z","title":"Conservative q-learning for offline reinforcement learn- ing","venue":null,"work_id":"2fdb1b9a-8ba0-40d1-a0d6-bb9f3b51554a","year":2021},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.735378Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:c94005b14dc6d2e76e2653b69d2f9229bc70d98d49276c9df1868f48be20f931","observation_id":"4ee31bc2-f3f4-4faf-9008-9b8082672b42","resolution":{"observed_at":"2026-08-06T20:47:21.372696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:21.327490Z","title":"A survey on multi-task learning","venue":null,"work_id":"8f216e2c-bea7-4846-8c3a-32c87a942159","year":2021},"citing_paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:20.742361Z"},"links":{"citing_paper":"/paper/2507.01823"},"observation_digest":"sha256:23b658851b04d4bc09d20701dd08c8cab8003d9a15659dfe8d9d5c8a109e68be","observation_id":"382e6af6-99ca-431b-83f3-ecad44d038a3","resolution":{"observed_at":"2026-08-06T20:47:21.338061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01823","last_updated":"2025-07-02T15:38:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:39:40.264311Z","submitted_at":"2025-07-02T15:38:49Z","title":"TD-MPC-Opt: Distilling Model-Based Multi-Task Reinforcement Learning Agents"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.01823."}