{"as_of":"2026-08-23T21:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59ad27e6c11591deb2d7221ddf55b453f734d641896e6781415e07f16841d5d6","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T07:44:14.707183Z","state":"measured"},{"denominator":113,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":113,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":209,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:33:00.901351Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":524,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"1906.09205","last_updated":"2019-06-21T15:44:41Z","snapshot_observed_at":"2026-08-16T20:10:32.702672Z","submitted_at":"2019-06-21T15:44:41Z","title":"Continual Reinforcement Learning with Diversity Exploration and Adversarial Self-Correction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T19:05:13.780087Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1906.09205"},"observation_digest":"sha256:7a3719294e9c2662304a681b63c976b690e23a97384951329eb23de83b429078","observation_id":"1da3fe04-a7a1-4e8c-96dd-3207e1013801","resolution":{"observed_at":"2026-05-25T19:06:08.937336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"1907.02057","last_updated":"2019-07-03T17:53:02Z","snapshot_observed_at":"2026-08-12T19:51:32.307910Z","submitted_at":"2019-07-03T17:53:02Z","title":"Benchmarking Model-Based Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-25T10:12:49.348162Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1907.02057"},"observation_digest":"sha256:293c188fe30766e99ffdbb362d8b64a5c3cde5d94a10dd57f2a067c0a0811c28","observation_id":"aee1c70b-09af-465f-9667-305e16b3d165","resolution":{"observed_at":"2026-05-25T10:15:37.042559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"1907.09466","last_updated":"2019-07-19T19:38:02Z","snapshot_observed_at":"2026-08-19T10:56:59.090423Z","submitted_at":"2019-07-19T19:38:02Z","title":"An Actor-Critic-Attention Mechanism for Deep Reinforcement Learning in Multi-view Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T19:00:33.771787Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1907.09466"},"observation_digest":"sha256:438fb556ea136aa44b08e6a84c1478c9b7b510df8da76cda459a34fa95e0b732","observation_id":"e8a13acc-cb8d-414c-87af-0aa75e403a70","resolution":{"observed_at":"2026-05-24T19:04:50.242354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"1907.09467","last_updated":"2019-07-20T05:13:53Z","snapshot_observed_at":"2026-08-19T01:11:18.761310Z","submitted_at":"2019-07-20T05:13:53Z","title":"Arena: a toolkit for Multi-Agent Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T18:35:31.633881Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1907.09467"},"observation_digest":"sha256:b3db5be59ec06c1a4fba5ac619573208255a799a699a0e6a5debd22517577f5f","observation_id":"16d83a09-8b7e-4ce8-9dcd-8ab0ea9f3f65","resolution":{"observed_at":"2026-05-24T18:36:19.050493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T15:04:02.371845Z","title":"Tassa, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.01887","last_updated":"2022-05-24T07:15:00Z","snapshot_observed_at":"2026-08-21T22:19:18.821706Z","submitted_at":"2019-08-05T22:20:32Z","title":"DoorGym: A Scalable Door Opening Environment And Baseline Agent","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T15:04:02.371845Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1908.01887"},"observation_digest":"sha256:a6a26d41f7500143efec5b0b5184573d9030e71f4c02123b14fa1ff8be250cb2","observation_id":"8cbcd9de-289e-4009-88b3-7c1f6ddde25f","resolution":{"observed_at":"2026-08-14T15:04:02.371845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T14:20:23.242776Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-08-18T16:44:13.881109Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-14T14:20:23.242776Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1908.03568"},"observation_digest":"sha256:7ea2b3a6d46964abc62ac47a4e108237898ad83367e8b4a17c39b6b42720cef3","observation_id":"eeab421e-c2d9-4e84-9da8-1404c2f0436f","resolution":{"observed_at":"2026-08-14T14:20:23.242776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T13:22:25.609678Z","title":"Deepmind control suite,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05256","last_updated":"2019-08-14T17:36:33Z","snapshot_observed_at":"2026-08-14T21:33:22.606076Z","submitted_at":"2019-08-14T17:36:33Z","title":"Continuous Control for High-Dimensional State Spaces: An Interactive Learning Approach","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T13:22:25.609678Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1908.05256"},"observation_digest":"sha256:c6cdf08c1de3efd39742a763dce75cf8de0f06ba23ab6838fc4341fb61d2f555","observation_id":"fce1452b-b1f0-4404-8e40-74b21e56e207","resolution":{"observed_at":"2026-08-14T13:22:25.609678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T11:20:28.277370Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.09357","last_updated":"2020-01-14T14:50:13Z","snapshot_observed_at":"2026-08-22T03:59:28.998402Z","submitted_at":"2019-08-25T16:22:04Z","title":"Dynamics-aware Embeddings","version":3},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-14T11:20:28.277370Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1908.09357"},"observation_digest":"sha256:d486ca5a48b4f3897f4e3c3d87abcc5c8a0691fa4ef8b7d2558d592a2d1e85b6","observation_id":"bbf5f46a-224b-4cc9-9304-429984598fb9","resolution":{"observed_at":"2026-08-14T11:20:28.277370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T11:14:41.822364Z","title":"Tassa, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.09506","last_updated":"2021-04-07T00:21:10Z","snapshot_observed_at":"2026-08-18T23:35:08.787980Z","submitted_at":"2019-08-26T07:35:48Z","title":"Constraint Learning for Control Tasks with Limited Duration Barrier Functions","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T11:14:41.822364Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1908.09506"},"observation_digest":"sha256:d821705d64112667b1167a25ace1b4e385906cf502af7c72eac3ecfd180c9027","observation_id":"bd1a0bee-e734-4c36-bf31-d8d88a866bea","resolution":{"observed_at":"2026-08-14T11:14:41.822364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T10:49:33.146230Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.146230Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:c780bd23ac6def1def05f25795c5b6447db3e01776462a14d77ad6e5733ac686","observation_id":"d999fd21-c414-4317-8ded-21298ed57e68","resolution":{"observed_at":"2026-08-14T10:49:33.146230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T05:43:41.468681Z","title":"Tassa, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.00835","last_updated":"2020-02-21T19:21:04Z","snapshot_observed_at":"2026-08-20T09:27:51.766215Z","submitted_at":"2019-09-02T19:07:51Z","title":"Evolutionary reinforcement learning of dynamical large deviations","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T05:43:41.468681Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1909.00835"},"observation_digest":"sha256:6c7c7adc4ac63bbaf29ff2ca683d8b230d4902ea8dcfd8249caf5c195fd47412","observation_id":"88e64274-e44b-4b18-809c-bffb6c53e312","resolution":{"observed_at":"2026-08-14T05:43:41.468681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-20T13:32:55.916408Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T01:16:36.399272Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1912.01603"},"observation_digest":"sha256:9aee1aed3aff78d496b2e04c5a57adf6417bea05db2c20e26f78aef95b2613f0","observation_id":"2107af0d-8c8b-4f7b-a27d-5b7f95de44fa","resolution":{"observed_at":"2026-05-13T07:44:14.794093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-14T09:46:32.787845Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:fee2b7187ba6a28bc4e0e2c58c353887b4baf983d43059320041bd1d61bf0158","observation_id":"6571296c-dd51-420b-9669-e171941ef493","resolution":{"observed_at":"2026-05-13T07:44:14.794093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T09:08:21.677362Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2301.04104"},"observation_digest":"sha256:21b8d5335657c1a7b79652195c4c33590d0280fb3262d7aab25b9648aeb99210","observation_id":"bf152135-6bf3-4b22-ad38-7a6f5f8116c5","resolution":{"observed_at":"2026-05-13T07:44:14.794093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:2ae719856d5c6f0a02105c214d69de2e1d374e9f86bb32705b1e06b0c83eefb5","observation_id":"a86d6b53-1fe0-464b-8612-2f61151fa780","resolution":{"observed_at":"2026-05-16T02:15:18.430063Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2403.09227","last_updated":"2024-03-14T09:48:36Z","snapshot_observed_at":"2026-08-16T07:36:37.508005Z","submitted_at":"2024-03-14T09:48:36Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T23:38:00.611856Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2403.09227"},"observation_digest":"sha256:3cb8b95380028293846f13cc160b072cb17d7e48b3be0232304bc20f57765df5","observation_id":"b8715765-dea1-4596-84ed-0c0a23154d20","resolution":{"observed_at":"2026-05-16T23:38:00.762837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":191,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:4aa50d7ed1990cfd9ceb4ba671483717d2e110297af8d25214a40b7fbd601adf","observation_id":"204c8b6d-ebef-4c13-a9ed-afd580d1965b","resolution":{"observed_at":"2026-05-24T01:25:54.412825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2411.04832","last_updated":"2026-04-18T13:11:19Z","snapshot_observed_at":"2026-08-07T20:09:01.472991Z","submitted_at":"2024-11-07T16:13:54Z","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-23T18:02:30.199552Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2411.04832"},"observation_digest":"sha256:69368635555969842f04863ad35e7a2704a3402c9edafb812278f497885eef4c","observation_id":"c13aac80-e2f4-463e-b2eb-7818c171ad2e","resolution":{"observed_at":"2026-05-23T18:03:18.176824Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-08-20T17:02:33.222284Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-17T16:06:09.448517Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2411.04983"},"observation_digest":"sha256:f25b1c3f68651d0b228c8a5691cfd587a090b5f49860276eca719d73559be677","observation_id":"3b40c114-ac46-4e80-85c3-e0ecafcdfb9c","resolution":{"observed_at":"2026-05-17T16:06:09.612298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-12T19:57:44.019548Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10175","last_updated":"2025-01-15T15:24:32Z","snapshot_observed_at":"2026-08-14T22:09:51.379570Z","submitted_at":"2024-11-15T13:21:26Z","title":"The Surprising Ineffectiveness of Pre-Trained Visual Representations for Model-Based Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T19:57:44.019548Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2411.10175"},"observation_digest":"sha256:b16e89670b0ca91647e17ddea69eeea48facd7eff47ffbecca436136c502b762","observation_id":"1ef484d7-9a17-47bd-864c-62a0bbb620b3","resolution":{"observed_at":"2026-08-12T19:57:44.019548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-12T18:30:34.256641Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11520","last_updated":"2024-11-18T12:29:06Z","snapshot_observed_at":"2026-08-17T11:26:57.281051Z","submitted_at":"2024-11-18T12:29:06Z","title":"A Pre-Trained Graph-Based Model for Adaptive Sequencing of Educational Documents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T18:30:34.256641Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2411.11520"},"observation_digest":"sha256:07d2e90e68623c7a72cd40afcc302c63a05d2049cadde6eca8d9671a476ab470","observation_id":"a7191024-6f99-4ea4-838a-21fc4fe43c2c","resolution":{"observed_at":"2026-08-12T18:30:34.256641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-12T12:37:10.244617Z","title":"DeepMind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17764","last_updated":"2024-11-26T04:17:51Z","snapshot_observed_at":"2026-08-19T10:15:59.671142Z","submitted_at":"2024-11-26T04:17:51Z","title":"PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:37:10.244617Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2411.17764"},"observation_digest":"sha256:755ae563b610a1436e924595e3a8efa0975139eac44e30041bb229089e76a316","observation_id":"936a2caa-1bd3-4ba7-a870-c0edf194c34f","resolution":{"observed_at":"2026-08-12T12:37:10.244617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-12T10:20:26.688224Z","title":"Tassa, Y ., Doron, Y ., Muldal, A., Erez, T., Li, Y ., de Las Casas, D., Budden, D., Abdolmaleki, A., Merel, J., Lefrancq, A., Lillicrap, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19418","last_updated":"2025-03-11T17:41:54Z","snapshot_observed_at":"2026-08-18T20:45:06.627807Z","submitted_at":"2024-11-29T00:09:39Z","title":"Proto Successor Measure: Representing the Behavior Space of an RL Agent","version":2},"reference_index":9879,"source":"pdf_text","source_observed_at":"2026-08-12T10:20:26.688224Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2411.19418"},"observation_digest":"sha256:3a6142f68817d5507a596f18992502a9fa344eddebd56689bd56269305792454","observation_id":"3457a125-7d69-42c0-8586-49cd62777647","resolution":{"observed_at":"2026-08-12T10:20:26.688224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-12T04:48:34.046161Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.01034","last_updated":"2024-12-02T01:33:49Z","snapshot_observed_at":"2026-08-14T15:17:01.572742Z","submitted_at":"2024-12-02T01:33:49Z","title":"Quantization-Aware Imitation-Learning for Resource-Efficient Robotic Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:48:34.046161Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.01034"},"observation_digest":"sha256:320bf54faa6861cdcbd8fd287c40a4fd2f276d538e7f5d161c731b5bba12b34b","observation_id":"1974da99-5b2e-4708-bdbb-e0c3cf56c6ce","resolution":{"observed_at":"2026-08-12T04:48:34.046161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-12T04:25:49.858050Z","title":"P., and Riedmiller, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01441","last_updated":"2025-05-23T11:13:40Z","snapshot_observed_at":"2026-08-15T11:17:03.941662Z","submitted_at":"2024-12-02T12:31:58Z","title":"LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal Demonstrations","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:25:49.858050Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.01441"},"observation_digest":"sha256:f8d68e5a22f7d0bb8127520ad9ced2cf50fe1c27097433e28be62824508766da","observation_id":"1da024ce-5f1e-4160-baa2-d27fe26bfac3","resolution":{"observed_at":"2026-08-12T04:25:49.858050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-11T20:28:45.020457Z","title":"Tassa, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05766","last_updated":"2024-12-08T00:21:37Z","snapshot_observed_at":"2026-08-21T15:07:05.492683Z","submitted_at":"2024-12-08T00:21:37Z","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:45.020457Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.05766"},"observation_digest":"sha256:b7c1a77a6250b5ed32367b58b4b5b0c2a7411c1f61a1562cf766f5c8058baa0b","observation_id":"498ee4d0-47ef-408b-9e8d-d0e330dd76de","resolution":{"observed_at":"2026-08-11T20:28:45.020457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-11T14:25:47.827741Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12098","last_updated":"2025-07-31T14:50:20Z","snapshot_observed_at":"2026-08-13T21:19:52.365622Z","submitted_at":"2024-12-16T18:59:53Z","title":"MaxInfoRL: Boosting exploration in reinforcement learning through information gain maximization","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T14:25:47.827741Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.12098"},"observation_digest":"sha256:3b228cdd7a9dae903756a659d12c115c65728ce5019847159b9d23fa4e1432b7","observation_id":"653571ef-1a73-4cbe-afbd-5a380cf3ba5d","resolution":{"observed_at":"2026-08-11T14:25:47.827741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-11T14:28:18.693950Z","title":"DeepMind Control Suite , January 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12237","last_updated":"2024-12-16T17:51:14Z","snapshot_observed_at":"2026-08-15T00:21:21.953549Z","submitted_at":"2024-12-16T17:51:14Z","title":"Equivariant Action Sampling for Reinforcement Learning and Planning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T14:28:18.693950Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.12237"},"observation_digest":"sha256:b6f89636bded2e2a2ec96db94a2288f13ed1f1e904ce51ffec88c219da2d336e","observation_id":"9a25c4a6-ea0c-43d8-aea4-07b9f4459cdd","resolution":{"observed_at":"2026-08-11T14:28:18.693950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-11T12:59:13.692376Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.13662","last_updated":"2024-12-18T09:39:12Z","snapshot_observed_at":"2026-08-14T16:00:45.899681Z","submitted_at":"2024-12-18T09:39:12Z","title":"When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T12:59:13.692376Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.13662"},"observation_digest":"sha256:752ca41999a8b2facb41cfc5e479c2f6e71739cd15455120f814ab634c0867d3","observation_id":"60759d72-b6ed-4eb5-805d-bc931de3135f","resolution":{"observed_at":"2026-08-11T12:59:13.692376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-11T05:19:19.086253Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.17730","last_updated":"2024-12-23T17:27:30Z","snapshot_observed_at":"2026-08-13T02:38:10.559377Z","submitted_at":"2024-12-23T17:27:30Z","title":"Mimicking-Bench: A Benchmark for Generalizable Humanoid-Scene Interaction Learning via Human Mimicking","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T05:19:19.086253Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2412.17730"},"observation_digest":"sha256:b02d1fdf8ed6d71e95f860fad92e6bd176a58795019d61e231132f5d93e6c695","observation_id":"477d9800-9cd4-4f15-bd20-12d6563daecb","resolution":{"observed_at":"2026-08-11T05:19:19.086253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2501.14377","last_updated":"2026-04-10T10:10:25Z","snapshot_observed_at":"2026-08-17T18:12:10.269803Z","submitted_at":"2025-01-24T10:24:39Z","title":"Dream to Fly: Model-Based Reinforcement Learning for Vision-Based Drone Flight","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T04:53:33.503100Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2501.14377"},"observation_digest":"sha256:208b41d5e297fa862ac0d33e2b39377cc8cc39d1e893181ea5ca2ca6edeffdde","observation_id":"69f9d5b3-9ffe-4d3f-b8eb-03d142fef62d","resolution":{"observed_at":"2026-05-23T04:55:25.139296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-10T14:25:59.006558Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15418","last_updated":"2025-01-26T06:43:45Z","snapshot_observed_at":"2026-08-12T18:01:28.057653Z","submitted_at":"2025-01-26T06:43:45Z","title":"Episodic Novelty Through Temporal Distance","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T14:25:59.006558Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2501.15418"},"observation_digest":"sha256:454706433cce61354e180b70ecb5ec63712611faedd988c724e49c0ef64116d5","observation_id":"dddd86c4-1003-4c99-8cda-baba5dd184d7","resolution":{"observed_at":"2026-08-10T14:25:59.006558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-10T13:47:01.686537Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16142","last_updated":"2025-01-27T15:36:37Z","snapshot_observed_at":"2026-08-18T05:22:20.961370Z","submitted_at":"2025-01-27T15:36:37Z","title":"Towards General-Purpose Model-Free Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:01.686537Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2501.16142"},"observation_digest":"sha256:96a8d5fdc0b580446517d2371e45d8c4100e718cd9698c5eae676e1b3b887917","observation_id":"03f9be27-826b-443c-bd3f-733efbb4037e","resolution":{"observed_at":"2026-08-10T13:47:01.686537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-09T17:46:07.292556Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00802","last_updated":"2025-02-02T13:54:47Z","snapshot_observed_at":"2026-08-16T03:48:31.402251Z","submitted_at":"2025-02-02T13:54:47Z","title":"Fisher-Guided Selective Forgetting: Mitigating The Primacy Bias in Deep Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T17:46:07.292556Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.00802"},"observation_digest":"sha256:16f3ba1cdc39231faf3899c906636f1f9bdec165e4d734e490008f06d6bb72c3","observation_id":"a101682c-8ed7-4680-83a8-a66b30983d51","resolution":{"observed_at":"2026-08-09T17:46:07.292556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-09T15:36:48.688461Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01366","last_updated":"2025-06-09T11:09:01Z","snapshot_observed_at":"2026-08-15T09:07:38.498130Z","submitted_at":"2025-02-03T13:59:08Z","title":"Trajectory World Models for Heterogeneous Environments","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T15:36:48.688461Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.01366"},"observation_digest":"sha256:c51d4c97f63a5fe9eb6aa99ff8194e0e6259d1dd79102fa697f4a1b44c02c801","observation_id":"0571d6fd-0f68-4fae-ba71-14eab8a96cac","resolution":{"observed_at":"2026-08-09T15:36:48.688461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-09T10:56:57.814242Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02853","last_updated":"2025-05-13T03:02:42Z","snapshot_observed_at":"2026-08-19T16:39:30.796029Z","submitted_at":"2025-02-05T03:13:04Z","title":"Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation","version":5},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T10:56:57.814242Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.02853"},"observation_digest":"sha256:423e261f562f420152623c7dbf12cc457022b41d27deb5b50c2944015c24ba8c","observation_id":"6e2de058-a7e6-4ff0-8168-187637aace92","resolution":{"observed_at":"2026-08-09T10:56:57.814242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-09T10:55:38.102479Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02867","last_updated":"2025-02-14T11:57:25Z","snapshot_observed_at":"2026-08-16T04:35:36.887001Z","submitted_at":"2025-02-05T03:52:36Z","title":"Domain-Invariant Per-Frame Feature Extraction for Cross-Domain Imitation Learning with Visual Observations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T10:55:38.102479Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.02867"},"observation_digest":"sha256:bc068d2f65367084322521a79ddd149476f63541dcb1df9c2de963214d606a1a","observation_id":"ff320b2a-65dc-42d1-90f9-2fc5efa76819","resolution":{"observed_at":"2026-08-09T10:55:38.102479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-09T04:38:30.724743Z","title":"Tassa, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03550","last_updated":"2025-02-05T19:08:42Z","snapshot_observed_at":"2026-08-14T17:41:56.786762Z","submitted_at":"2025-02-05T19:08:42Z","title":"TD-M(PC)$^2$: Improving Temporal Difference MPC Through Policy Constraint","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T04:38:30.724743Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.03550"},"observation_digest":"sha256:df2d86620f1e0a5dd7b2e3f5b954a7c5459b6dbf60d40daac032a263b8210483","observation_id":"03b7e3bf-b9ad-4a06-9d3d-d41cd7ab7fc9","resolution":{"observed_at":"2026-08-09T04:38:30.724743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T18:56:45.463706Z","title":"P.; and Riedmiller, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05555","last_updated":"2025-02-08T12:57:02Z","snapshot_observed_at":"2026-08-19T01:07:45.441151Z","submitted_at":"2025-02-08T12:57:02Z","title":"Efficient Reinforcement Learning Through Adaptively Pretrained Visual Encoder","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T18:56:45.463706Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.05555"},"observation_digest":"sha256:04e1b49f525bcf6bb1e04aa710c153dbaa1a19578809459a96fbcb5dbe1f5ff8","observation_id":"5ed334e7-e600-487b-823e-b0184f09bff2","resolution":{"observed_at":"2026-08-08T18:56:45.463706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T17:26:09.347625Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05932","last_updated":"2025-03-16T11:57:19Z","snapshot_observed_at":"2026-08-15T19:14:12.530063Z","submitted_at":"2025-02-09T15:22:38Z","title":"Skill Expansion and Composition in Parameter Space","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T17:26:09.347625Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.05932"},"observation_digest":"sha256:a1f7f2b4a61d6c5a573969ef215de0c4ec5373cd140847cfb647e1d1af4a8ac3","observation_id":"d6b13d53-5601-4e40-b84a-d9868ee27780","resolution":{"observed_at":"2026-08-08T17:26:09.347625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T13:29:10.793596Z","title":"DeepMind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07237","last_updated":"2025-02-11T04:00:21Z","snapshot_observed_at":"2026-08-16T02:57:05.695360Z","submitted_at":"2025-02-11T04:00:21Z","title":"DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T13:29:10.793596Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07237"},"observation_digest":"sha256:0a39ce74693e901aa59d4bffe4030927bf018fe166aa8e8208c0173303ed8400","observation_id":"e2ce34cb-fe22-4df6-a1f3-e20a89ae72cc","resolution":{"observed_at":"2026-08-08T13:29:10.793596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T13:21:18.414534Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07279","last_updated":"2025-05-16T17:18:02Z","snapshot_observed_at":"2026-08-14T17:42:32.702857Z","submitted_at":"2025-02-11T05:48:51Z","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T13:21:18.414534Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07279"},"observation_digest":"sha256:a6bee1646bfd6a3a9f0ba17776527212c6ddc1643deba37c69e934ed339da5dd","observation_id":"55ee6be8-6836-40f9-a899-c5f22e3d4788","resolution":{"observed_at":"2026-08-08T13:21:18.414534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T12:32:20.124594Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-08-16T03:40:46.288368Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T12:32:20.124594Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07523"},"observation_digest":"sha256:035b317412a5e8963586e15ef7ef55dded751a5d310a1ebdc81e3c6763671302","observation_id":"6f15bc57-ea9e-49ba-816d-260ba7d40a00","resolution":{"observed_at":"2026-08-08T12:32:20.124594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T15:14:22.448687Z","title":"Yuval Tassa, Yotam Doron, Alistair Muldal, Tom Erez, Yazhe Li, Diego de Las Casas, David Budden, Abbas Abdolmaleki, Josh Merel, Andrew Lefrancq, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07825","last_updated":"2025-02-10T14:49:09Z","snapshot_observed_at":"2026-08-19T11:40:20.954372Z","submitted_at":"2025-02-10T14:49:09Z","title":"Pre-Trained Video Generative Models as World Simulators","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-08T15:14:22.448687Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.07825"},"observation_digest":"sha256:2559de90cd0abec4fc9272c5f90fe069f869aa96f2e82e415059832ba745ad03","observation_id":"939260c3-2479-44fa-b1c5-9df8e07854eb","resolution":{"observed_at":"2026-08-08T15:14:22.448687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T05:38:20.917891Z","title":"arXiv preprint arXiv:1801.00690","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08336","last_updated":"2025-02-24T12:02:47Z","snapshot_observed_at":"2026-08-13T06:08:46.770813Z","submitted_at":"2025-02-12T12:00:16Z","title":"Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T05:38:20.917891Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.08336"},"observation_digest":"sha256:7a89fe4404b8c0a743da9a29eda906c2760e8cd4909838e6299ee786c91e5c7f","observation_id":"3fe7e0bf-b594-493b-bf54-57c16464c53e","resolution":{"observed_at":"2026-08-08T05:38:20.917891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-08T05:23:43.194046Z","title":"Deep- mind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08378","last_updated":"2025-04-19T20:24:29Z","snapshot_observed_at":"2026-08-14T07:06:18.521079Z","submitted_at":"2025-02-12T13:10:09Z","title":"Learning Humanoid Standing-up Control across Diverse Postures","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T05:23:43.194046Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.08378"},"observation_digest":"sha256:5d9e5450d9419f292060dc3baf90d21c55e3c677c94c154dd76b79ffd901811f","observation_id":"53b22708-c14d-4cac-9678-4e0d9d138082","resolution":{"observed_at":"2026-08-08T05:23:43.194046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T23:34:11.187882Z","title":"Deep- mind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-20T11:06:59.076112Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T23:34:11.187882Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.08844"},"observation_digest":"sha256:76145fe84ad319ddec5d93a24c54327d321a9bb8b0acfb4e072570bde9d0eb91","observation_id":"cf10259e-ff76-491c-bc8b-5636cf06afc0","resolution":{"observed_at":"2026-08-07T23:34:11.187882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T20:08:49.580007Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09923","last_updated":"2025-02-14T05:23:56Z","snapshot_observed_at":"2026-08-17T20:25:43.840464Z","submitted_at":"2025-02-14T05:23:56Z","title":"Self-Consistent Model-based Adaptation for Visual Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:08:49.580007Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.09923"},"observation_digest":"sha256:91f0d6ab8e0273c20b46772dfccf36e74602367939bdf67236227aa41a2a8792","observation_id":"d2b0a6ae-571d-47cf-9568-3c9d58e618cf","resolution":{"observed_at":"2026-08-07T20:08:49.580007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T19:33:43.798577Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10097","last_updated":"2025-02-14T11:44:17Z","snapshot_observed_at":"2026-08-20T09:02:28.984802Z","submitted_at":"2025-02-14T11:44:17Z","title":"Causal Information Prioritization for Efficient Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T19:33:43.798577Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2502.10097"},"observation_digest":"sha256:3e4c2412435a0579f4a83750b91dfb57c79eecf94123af02ef8977a7db1a817e","observation_id":"cf8a8f19-063d-426b-8e24-397832700133","resolution":{"observed_at":"2026-08-07T19:33:43.798577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2503.08751","last_updated":"2026-04-04T16:26:41Z","snapshot_observed_at":"2026-07-06T20:50:56.058448Z","submitted_at":"2025-03-11T13:50:22Z","title":"Disentangled World Models: Learning to Transfer Semantic Knowledge from Distracting Videos for Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T00:23:13.858606Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2503.08751"},"observation_digest":"sha256:956946f8c3dc9095375dc7fbce8dfb7c89693d15a00e4d1d4bba74389f73215f","observation_id":"2838999e-e3fd-40b8-8f79-d6fdce618c82","resolution":{"observed_at":"2026-05-23T00:25:14.356493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-16T11:33:00.901351Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15369","last_updated":"2025-04-21T18:20:13Z","snapshot_observed_at":"2026-08-22T01:38:30.036224Z","submitted_at":"2025-04-21T18:20:13Z","title":"Solving New Tasks by Adapting Internet Video Knowledge","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:33:00.901351Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2504.15369"},"observation_digest":"sha256:d9d2f80f5f2e7fb8843dadb6f2aaefa9cf7b349fb1517e3fad8c62c7ebf9b97e","observation_id":"676a07e8-6f2f-4f10-a3f3-d893aae50b66","resolution":{"observed_at":"2026-08-16T11:33:00.901351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-16T11:16:29.757704Z","title":"Tassa, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-21T17:24:20.608796Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:29.757704Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2504.16078"},"observation_digest":"sha256:ec269f583d48d6242ba06a109ab19d94563fef2738da3998f3343a5309e0532b","observation_id":"b096d802-c938-43e0-bebc-8689bfd7145c","resolution":{"observed_at":"2026-08-16T11:16:29.757704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-16T05:16:16.574453Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.21326","last_updated":"2025-04-30T05:26:51Z","snapshot_observed_at":"2026-08-17T03:41:16.982151Z","submitted_at":"2025-04-30T05:26:51Z","title":"Q-function Decomposition with Intervention Semantics with Factored Action Spaces","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T05:16:16.574453Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2504.21326"},"observation_digest":"sha256:286fa5ea5e7141a5b0693139bc08885c729de81a9c78f8287b5b58cf16c3fe16","observation_id":"5eca6816-fbfc-4852-a254-0379176db644","resolution":{"observed_at":"2026-08-16T05:16:16.574453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-16T04:47:05.770349Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-18T22:23:55.093791Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.770349Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:fbf838e18dfefe4ce8cf43dfe62c6aa430ce1f4ea2afc8bd4b4452e177de5a3f","observation_id":"e5e35a59-79ac-48c1-99df-a0c872ebd9c8","resolution":{"observed_at":"2026-08-16T04:47:05.770349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T23:40:39.938920Z","title":"Deepmind control suite,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.04193","last_updated":"2025-05-07T07:41:29Z","snapshot_observed_at":"2026-08-23T18:32:30.247760Z","submitted_at":"2025-05-07T07:41:29Z","title":"Trajectory Entropy Reinforcement Learning for Predictable and Robust Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:40:39.938920Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.04193"},"observation_digest":"sha256:14e34b16c6662c935a171982f244425f717c7e7161822934182698c74108ce65","observation_id":"49d62347-1b97-4297-a897-17f6214a9bfe","resolution":{"observed_at":"2026-08-15T23:40:39.938920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T21:24:27.462645Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09959","last_updated":"2025-05-15T04:41:21Z","snapshot_observed_at":"2026-08-20T09:39:04.816609Z","submitted_at":"2025-05-15T04:41:21Z","title":"Approximated Behavioral Metric-based State Projection for Federated Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:24:27.462645Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.09959"},"observation_digest":"sha256:4ef4d70d19b0b09f82f76625c32ea025198534f5c84da731fedcf38aa2882bdb","observation_id":"f4924f5c-39ff-4c37-8aa1-a33671b683b7","resolution":{"observed_at":"2026-08-15T21:24:27.462645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T21:26:20.023698Z","title":"Preprint at https://arxiv.org/abs/1801.00690","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09979","last_updated":"2025-05-15T05:32:57Z","snapshot_observed_at":"2026-08-19T08:21:28.217848Z","submitted_at":"2025-05-15T05:32:57Z","title":"Learning Diverse Natural Behaviors for Enhancing the Agility of Quadrupedal Robots","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:26:20.023698Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.09979"},"observation_digest":"sha256:b6e4e49953ca443ae501dc687ecdd06cbee0d74c78ef2248c69c2d2615fc6e29","observation_id":"512581c5-0282-48d5-a51f-b5d11898a776","resolution":{"observed_at":"2026-08-15T21:26:20.023698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T21:22:16.142589Z","title":"P., and Riedmiller, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10010","last_updated":"2025-05-15T06:45:37Z","snapshot_observed_at":"2026-08-17T12:02:34.741857Z","submitted_at":"2025-05-15T06:45:37Z","title":"ImagineBench: Evaluating Reinforcement Learning with Large Language Model Rollouts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:22:16.142589Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.10010"},"observation_digest":"sha256:6536d68842a72a07b9a1ca2e99f020171103e83b28f64c2e72d637d33b57593f","observation_id":"90bb5f1d-81a0-4d9e-96e5-70bce867cb92","resolution":{"observed_at":"2026-08-15T21:22:16.142589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T20:55:25.478527Z","title":"Tassa, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11719","last_updated":"2025-05-16T22:01:46Z","snapshot_observed_at":"2026-08-17T06:22:32.706258Z","submitted_at":"2025-05-16T22:01:46Z","title":"Zero-Shot Visual Generalization in Robot Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:25.478527Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.11719"},"observation_digest":"sha256:819d8bc4a5ceb50a76f03859c86eb5b5f1f8c6f4df933ac98ee3fa9658d53c8e","observation_id":"2b3a41f8-d149-45ed-8003-3e5229198334","resolution":{"observed_at":"2026-08-15T20:55:25.478527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T20:34:23.989147Z","title":"Deepmind control suite,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13549","last_updated":"2025-05-19T04:32:14Z","snapshot_observed_at":"2026-08-19T19:59:41.898426Z","submitted_at":"2025-05-19T04:32:14Z","title":"TD-GRPC: Temporal Difference Learning with Group Relative Policy Constraint for Humanoid Locomotion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:23.989147Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.13549"},"observation_digest":"sha256:7c8c3b9e51d526df838ede382a2f76f2e9257d005409159831d9c383090705a1","observation_id":"ba82ac2c-b88e-4ebc-8a14-984b6a5dac50","resolution":{"observed_at":"2026-08-15T20:34:23.989147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T15:26:45.982042Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15304","last_updated":"2025-05-30T10:57:06Z","snapshot_observed_at":"2026-08-13T08:09:55.249436Z","submitted_at":"2025-05-21T09:35:12Z","title":"Saliency-Aware Quantized Imitation Learning for Efficient Robotic Control","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:45.982042Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.15304"},"observation_digest":"sha256:dc4a8fd7ff54b0250a12ebbcdfe759d471fa5720ddb83aa97a10b169afd14f8d","observation_id":"f29855f9-5e6b-47a6-a869-b01169c27d81","resolution":{"observed_at":"2026-08-07T15:26:45.982042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T15:03:43.855369Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16734","last_updated":"2025-05-22T14:48:00Z","snapshot_observed_at":"2026-08-17T20:19:25.830500Z","submitted_at":"2025-05-22T14:48:00Z","title":"Maximum Total Correlation Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:43.855369Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.16734"},"observation_digest":"sha256:da5fab6b9da362fe646693aa2ff3efb4b2075d985add1cfd21dac396aa24dd40","observation_id":"ea192361-4a4e-46a7-8aef-1e9982e8c62c","resolution":{"observed_at":"2026-08-07T15:03:43.855369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T14:31:30.854731Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18650","last_updated":"2025-05-24T11:35:09Z","snapshot_observed_at":"2026-08-20T10:42:26.378701Z","submitted_at":"2025-05-24T11:35:09Z","title":"ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:30.854731Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.18650"},"observation_digest":"sha256:a509d4ef4e3518bb2ccc04929c03ffffb68e470c16ffd9e97a7bc2df5b0f1a19","observation_id":"600fe287-358e-4acc-8640-28b23aa8ec7b","resolution":{"observed_at":"2026-08-07T14:31:30.854731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T14:27:30.789245Z","title":"Deepmind control suite,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18899","last_updated":"2025-05-24T23:12:23Z","snapshot_observed_at":"2026-08-11T13:01:33.006047Z","submitted_at":"2025-05-24T23:12:23Z","title":"Beyond Domain Randomization: Event-Inspired Perception for Visually Robust Adversarial Imitation from Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:30.789245Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.18899"},"observation_digest":"sha256:94f201820a8e012cd7a342e7e22d497b0643c30e88e9a35558f208b0b3327c9e","observation_id":"91cf2336-d0c9-4b15-bfcd-b2a770fe4511","resolution":{"observed_at":"2026-08-07T14:27:30.789245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:58:54.169006Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-08-17T05:26:20.110799Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:54.169006Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.23150"},"observation_digest":"sha256:4b9a3f920155f47bc181b6e60a6c1af240409b64c2c61db7d4e780a82e3f238c","observation_id":"f4797f4a-225b-42be-bab4-c83fa7fde7b1","resolution":{"observed_at":"2026-08-07T12:58:54.169006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:35:13.961550Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24378","last_updated":"2025-05-30T09:08:52Z","snapshot_observed_at":"2026-08-21T09:24:02.588636Z","submitted_at":"2025-05-30T09:08:52Z","title":"Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:13.961550Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.24378"},"observation_digest":"sha256:5b4738470ac4ee4ce0273f38a92a67915647b0c61ad97e9a6bc0225f43bb510e","observation_id":"2b36b0e9-bb24-401d-8b6f-dc40103a9cc9","resolution":{"observed_at":"2026-08-07T12:35:13.961550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:13:00.774609Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00388","last_updated":"2025-06-10T13:10:39Z","snapshot_observed_at":"2026-08-18T00:48:32.101121Z","submitted_at":"2025-05-31T04:37:07Z","title":"CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:00.774609Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.00388"},"observation_digest":"sha256:7f2b0e4063e380b27f238754c02f90f8814df88ae55c28d569dd25f6783bed02","observation_id":"17e588d6-466d-4205-938a-469714d91c97","resolution":{"observed_at":"2026-08-07T12:13:00.774609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:10:07.623587Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00563","last_updated":"2025-09-08T18:56:14Z","snapshot_observed_at":"2026-08-18T14:43:32.761283Z","submitted_at":"2025-05-31T13:43:41Z","title":"Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:10:07.623587Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.00563"},"observation_digest":"sha256:1a433453886f372d90a5ca76f7772d0630d2b2172252ca2ed14eb8819d770acc","observation_id":"2bdfd756-83ac-44a5-aafa-613e25fea1e5","resolution":{"observed_at":"2026-08-07T12:10:07.623587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T12:07:25.491932Z","title":"P., and Riedmiller, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00592","last_updated":"2025-05-31T14:58:22Z","snapshot_observed_at":"2026-08-14T22:25:58.975534Z","submitted_at":"2025-05-31T14:58:22Z","title":"Mitigating Plasticity Loss in Continual Reinforcement Learning by Reducing Churn","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:25.491932Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.00592"},"observation_digest":"sha256:4ae2c4d4ad99122482247565b9e48b8a3940e896c6155b5e7796f438be85dfde","observation_id":"16b43741-5e71-4deb-b037-c7410b7eb4ad","resolution":{"observed_at":"2026-08-07T12:07:25.491932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T11:46:59.223222Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01546","last_updated":"2025-06-02T11:19:23Z","snapshot_observed_at":"2026-08-17T02:12:57.002805Z","submitted_at":"2025-06-02T11:19:23Z","title":"LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.223222Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.01546"},"observation_digest":"sha256:3944c8903ed13c7b2ca3bc592914883dad12d6021cf2d926acd5b4110ad7d9f4","observation_id":"206a9620-d6d5-408f-9f2f-1fe6f85fa7b9","resolution":{"observed_at":"2026-08-07T11:46:59.223222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T10:47:32.916754Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05418","last_updated":"2025-06-05T00:36:54Z","snapshot_observed_at":"2026-08-17T03:56:38.339333Z","submitted_at":"2025-06-05T00:36:54Z","title":"Self-Predictive Dynamics for Generalization of Vision-based Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:32.916754Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.05418"},"observation_digest":"sha256:a310593450890c14b24569d5870bff564edfe1f4c1216cf8dbc558cd76c07377","observation_id":"74f7e137-fc3e-4938-8567-ff461be12493","resolution":{"observed_at":"2026-08-07T10:47:32.916754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T10:46:33.440488Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05419","last_updated":"2025-06-05T00:39:03Z","snapshot_observed_at":"2026-08-21T15:06:42.864199Z","submitted_at":"2025-06-05T00:39:03Z","title":"Dream to Generalize: Zero-Shot Model-Based Reinforcement Learning for Unseen Visual Distractions","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:33.440488Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.05419"},"observation_digest":"sha256:e7f29382921eed27c8929c26decdafa4c45a61c77ab7d9d5182eaee6c272bb28","observation_id":"3669cb44-9fb7-4db1-9904-ddb582f30561","resolution":{"observed_at":"2026-08-07T10:46:33.440488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2506.08902","last_updated":"2026-05-11T20:21:12Z","snapshot_observed_at":"2026-08-14T17:30:15.799036Z","submitted_at":"2025-06-10T15:27:46Z","title":"Intention-Conditioned Flow Occupancy Models","version":4},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-19T10:24:52.160209Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.08902"},"observation_digest":"sha256:3b4466bd1534b751d077d2874597ccbb5ad72c6356bb5227a6fabf7e43d2c5f8","observation_id":"7d0962a6-04d4-4af0-ae2b-2dceeda5975d","resolution":{"observed_at":"2026-05-19T10:27:14.584457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T04:59:41.401667Z","title":"Todorov, E., Erez, T., and Tassa, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09172","last_updated":"2025-06-17T03:30:48Z","snapshot_observed_at":"2026-08-20T08:51:01.559971Z","submitted_at":"2025-06-10T18:38:19Z","title":"An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:41.401667Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.09172"},"observation_digest":"sha256:06dec26b3a0bdf19f1844feb5c7009588d49d4dfed935d4d2edb1ab0fc3dc01b","observation_id":"60bf0a01-09cd-4194-869f-ddc7a0b9ec41","resolution":{"observed_at":"2026-08-07T04:59:41.401667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T04:59:50.587696Z","title":"Deepmind control suite, 2018 b","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09183","last_updated":"2025-06-17T19:12:50Z","snapshot_observed_at":"2026-08-18T21:55:25.604355Z","submitted_at":"2025-06-10T19:00:19Z","title":"Multi-Task Reward Learning from Human Ratings","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:50.587696Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.09183"},"observation_digest":"sha256:e6c4e79ce0105d6f1591252ccadd7c9df704401f89472f7888d2d6bb5e3fb6e7","observation_id":"8a9c1ad1-640c-4584-826a-93eef9aba65b","resolution":{"observed_at":"2026-08-07T04:59:50.587696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T04:54:02.297439Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09366","last_updated":"2025-06-11T03:24:26Z","snapshot_observed_at":"2026-08-13T22:45:09.284828Z","submitted_at":"2025-06-11T03:24:26Z","title":"SkillBlender: Towards Versatile Humanoid Whole-Body Loco-Manipulation via Skill Blending","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:02.297439Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.09366"},"observation_digest":"sha256:8150b060c5e0e10b92851fc27e9e3eeeeb1a5441d13d52e038767a83bcce837c","observation_id":"4e3cff0f-aa7f-4865-8ef2-41ca97ea3b63","resolution":{"observed_at":"2026-08-07T04:54:02.297439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T20:13:00.369356Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12811","last_updated":"2025-06-15T10:53:35Z","snapshot_observed_at":"2026-08-19T17:37:41.405833Z","submitted_at":"2025-06-15T10:53:35Z","title":"Flow-Based Policy for Online Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:00.369356Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.12811"},"observation_digest":"sha256:367ffddebe48283797b405345e2dc4959d73106b2373341ac65a8e97d060c56c","observation_id":"ca32db8c-638b-4247-8b9d-8dbecc0ca744","resolution":{"observed_at":"2026-08-15T20:13:00.369356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T00:32:53.351761Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13672","last_updated":"2025-06-16T16:30:00Z","snapshot_observed_at":"2026-08-22T06:27:40.031924Z","submitted_at":"2025-06-16T16:30:00Z","title":"The Courage to Stop: Overcoming Sunk Cost Fallacy in Deep Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:32:53.351761Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.13672"},"observation_digest":"sha256:fcd558ea200e453386a4238c9e581aab526734c2263dc541b3cf335b3697246a","observation_id":"364092c5-6388-4b31-afdc-14272e675950","resolution":{"observed_at":"2026-08-07T00:32:53.351761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T00:33:04.252878Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13741","last_updated":"2026-08-03T13:34:59Z","snapshot_observed_at":"2026-08-17T02:57:20.430165Z","submitted_at":"2025-06-16T17:51:33Z","title":"PB$^2$: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:04.252878Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.13741"},"observation_digest":"sha256:eee1ab791c35e041c4d7616753b71d3ef96d53d8fd2d46bf17d79c3994211a8d","observation_id":"8ea88ba8-32ca-403b-9456-f0b60699cb2d","resolution":{"observed_at":"2026-08-07T00:33:04.252878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-07T00:27:00.688031Z","title":"Deepmind control suite,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14420","last_updated":"2025-06-17T11:30:04Z","snapshot_observed_at":"2026-08-17T11:52:55.779294Z","submitted_at":"2025-06-17T11:30:04Z","title":"Unsupervised Skill Discovery through Skill Regions Differentiation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:27:00.688031Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.14420"},"observation_digest":"sha256:266345c245e9f80c4209cb120418ba1869b7bf9387a594f18d90dc23477812c9","observation_id":"66b480bf-5b9a-445a-93bd-0ddbd0d3441a","resolution":{"observed_at":"2026-08-07T00:27:00.688031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T19:37:29.878368Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15446","last_updated":"2025-06-18T13:18:36Z","snapshot_observed_at":"2026-08-18T16:59:18.883544Z","submitted_at":"2025-06-18T13:18:36Z","title":"Zero-Shot Reinforcement Learning Under Partial Observability","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T19:37:29.878368Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.15446"},"observation_digest":"sha256:f0db96a9520577e66199656c37c6c1a7554352c53fc3256feb22c6f899812c40","observation_id":"2a2f8887-3798-40b0-8beb-df1ae25b0f29","resolution":{"observed_at":"2026-08-15T19:37:29.878368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T19:16:29.065972Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17204","last_updated":"2025-06-20T17:54:24Z","snapshot_observed_at":"2026-08-19T22:11:33.663475Z","submitted_at":"2025-06-20T17:54:24Z","title":"Network Sparsity Unlocks the Scaling Potential of Deep Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T19:16:29.065972Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.17204"},"observation_digest":"sha256:fb2739cebaec6856f5590af99b2b665a4d2228e15cb0ddbf3c5a22e0e29e49ea","observation_id":"884867cb-5336-4f9c-8768-509e25106d40","resolution":{"observed_at":"2026-08-15T19:16:29.065972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-15T18:36:10.094539Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19643","last_updated":"2025-06-24T14:08:36Z","snapshot_observed_at":"2026-08-19T15:26:25.045626Z","submitted_at":"2025-06-24T14:08:36Z","title":"Unsupervised Data Generation for Offline Reinforcement Learning: A Perspective from Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T18:36:10.094539Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.19643"},"observation_digest":"sha256:d9c49d88020afd75980fcdb17f5e5db0b2ff5829dcb28f4d1906d274431c2411","observation_id":"c9264219-78f5-4415-86dc-f119aa5a0721","resolution":{"observed_at":"2026-08-15T18:36:10.094539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T22:30:08.646686Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21367","last_updated":"2025-06-26T15:16:35Z","snapshot_observed_at":"2026-08-14T23:32:45.187090Z","submitted_at":"2025-06-26T15:16:35Z","title":"rQdia: Regularizing Q-Value Distributions With Image Augmentation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T22:30:08.646686Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2506.21367"},"observation_digest":"sha256:793ce155d1bc65f92a6ef89282ab0236826e2018c8d92017d414d6f3c1cdfd81","observation_id":"69566d21-3b66-42e4-b757-8d852cfba287","resolution":{"observed_at":"2026-08-06T22:30:08.646686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2507.00435","last_updated":"2026-05-04T20:30:13Z","snapshot_observed_at":"2026-08-16T12:56:51.611123Z","submitted_at":"2025-07-01T05:33:16Z","title":"RoboEval: Where Robotic Manipulation Meets Structured and Scalable Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T07:19:07.662487Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.00435"},"observation_digest":"sha256:7610d2434e2b2d3386e91faf84856a3e474474c829f72411cb9b01f604bd7c60","observation_id":"b1f76eac-f5de-486b-a84d-587b9d6015f2","resolution":{"observed_at":"2026-05-19T07:22:09.348429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T20:59:05.188589Z","title":"& Others Deepmind control suite.ArXiv Preprint ArXiv:1801.00690","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01381","last_updated":"2025-07-11T03:34:59Z","snapshot_observed_at":"2026-08-22T10:00:13.343221Z","submitted_at":"2025-07-02T05:50:10Z","title":"Distributional Soft Actor-Critic with Diffusion Policy","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:05.188589Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.01381"},"observation_digest":"sha256:040ed422ad9ed818364f770d84060dcfe812f91731ffb421b4aaf02a59c9b851","observation_id":"f34593ff-a47b-41dd-b8a5-c7ec3e295d37","resolution":{"observed_at":"2026-08-06T20:59:05.188589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T20:31:07.869907Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-21T03:39:52.664602Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.869907Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:2c97477ed6bea53917ddf56453005120237dd4406241951451b3056d761ea5a1","observation_id":"a3b7639b-7c2d-4fb1-9739-cf884d6fc7b2","resolution":{"observed_at":"2026-08-06T20:31:07.869907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T19:32:35.041566Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05477","last_updated":"2025-07-07T21:09:16Z","snapshot_observed_at":"2026-08-19T01:12:56.588807Z","submitted_at":"2025-07-07T21:09:16Z","title":"Epistemically-guided forward-backward exploration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:32:35.041566Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.05477"},"observation_digest":"sha256:0fabb44ead8587edc1221a4e2312206488c792dc246856dcab4364512785de8d","observation_id":"62811960-c9fe-4002-94d9-59eee7640de7","resolution":{"observed_at":"2026-08-06T19:32:35.041566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T17:12:29.950188Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12496","last_updated":"2025-07-15T21:49:49Z","snapshot_observed_at":"2026-08-15T01:21:18.378106Z","submitted_at":"2025-07-15T21:49:49Z","title":"FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:12:29.950188Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.12496"},"observation_digest":"sha256:a12eafde12337f3dbfabbda2d099d68336aeab9adc82f6ccce582d442a0a63fc","observation_id":"988eac78-cb55-455f-8fa4-138eb22a2724","resolution":{"observed_at":"2026-08-06T17:12:29.950188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T16:34:25.223363Z","title":"Deepmind control suite.arXiv preprint arXiv:1801.00690,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-15T15:23:09.345799Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.223363Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:615d57ff4175cc8aae10ba60b63fb7dc995c39fe56aa27afa8a7f4a2fa19926a","observation_id":"bbeeeba4-80c0-4693-9d85-79b85eef1422","resolution":{"observed_at":"2026-08-06T16:34:25.223363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T15:55:36.701148Z","title":"Deepmind control suite, 2018 b","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14736","last_updated":"2025-07-19T19:53:08Z","snapshot_observed_at":"2026-08-20T12:21:31.901044Z","submitted_at":"2025-07-19T19:53:08Z","title":"Balancing Expressivity and Robustness: Constrained Rational Activations for Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:55:36.701148Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.14736"},"observation_digest":"sha256:470344228ce051a1570c56fb4291f090a45155c42dafa8f29d974f6c99746a85","observation_id":"2c115efa-d84f-46cc-9419-68c1c54c748a","resolution":{"observed_at":"2026-08-06T15:55:36.701148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T13:07:09.689388Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-18T23:52:36.906166Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.689388Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:4af1db75389dc87edf68b0a9a92a9e865d3c7ae1d4c4ebb9c512414e9c8f18a2","observation_id":"f4537ca1-3755-46b8-9780-389e03224349","resolution":{"observed_at":"2026-08-06T13:07:09.689388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T11:03:30.405738Z","title":"Deepmind control suite, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-17T21:31:33.201638Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.405738Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:93639743dbb79eeb973e47e9140c58dffb58cce0491d65c106579874b8173d49","observation_id":"68c89edc-604f-4cc5-9864-f4518319b735","resolution":{"observed_at":"2026-08-06T11:03:30.405738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T04:39:07.992274Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.992274Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:ba7fd9e8dc3804503d71c8a79f200563cceb18a242d15bb8244b6c8d2645d0b0","observation_id":"5a627790-67da-4c89-ad59-60d9bc95771b","resolution":{"observed_at":"2026-08-06T04:39:07.992274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2508.07722","last_updated":"2026-05-11T08:16:34Z","snapshot_observed_at":"2026-08-18T22:38:46.819424Z","submitted_at":"2025-08-11T07:50:25Z","title":"Robust Remote Reinforcement Learning over Unreliable Communication Channels using Homomorphic State Encoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T00:02:34.789456Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2508.07722"},"observation_digest":"sha256:07ce34b40fca3e3dfed5d1f0dfb6f7d5dcc60e457ef3bad4e55186d4289b995d","observation_id":"671c5a40-c46a-437c-bf47-dbadb5d87f7f","resolution":{"observed_at":"2026-05-19T00:02:54.137961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T21:02:04.475954Z","title":"Deepmind control suite,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.09561","last_updated":"2025-08-13T07:29:40Z","snapshot_observed_at":"2026-08-19T21:55:23.314101Z","submitted_at":"2025-08-13T07:29:40Z","title":"Edge General Intelligence Through World Models and Agentic AI: Fundamentals, Solutions, and Challenges","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-05T21:02:04.475954Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2508.09561"},"observation_digest":"sha256:70e5f94622272067619b66e93f274720e66035a431f388b9e0d94214dda46618","observation_id":"41275ee9-78e0-4b8f-900f-bd5c02bcc698","resolution":{"observed_at":"2026-08-05T21:02:04.475954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T16:41:53.442877Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.18066","last_updated":"2025-08-25T14:22:40Z","snapshot_observed_at":"2026-08-20T21:52:23.436096Z","submitted_at":"2025-08-25T14:22:40Z","title":"Arnold: a generalist muscle transformer policy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:53.442877Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2508.18066"},"observation_digest":"sha256:90e27d9c40a33221b8b00590e547ce901bbc1e7b0e351724607e158eb3322331","observation_id":"b7c63e72-f786-46c6-b334-0d12c0924c5c","resolution":{"observed_at":"2026-08-05T16:41:53.442877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2510.02590","last_updated":"2026-05-18T11:40:07Z","snapshot_observed_at":"2026-08-16T16:50:40.382915Z","submitted_at":"2025-10-02T21:48:01Z","title":"Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T21:33:40.229376Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2510.02590"},"observation_digest":"sha256:221373613b637cd855fe625e1236c568725bd0a790505130effa9ad80f152ea1","observation_id":"f64fb178-d907-4734-a8d3-54012a4eafb9","resolution":{"observed_at":"2026-05-21T21:34:22.305967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2510.03508","last_updated":"2026-05-22T04:10:55Z","snapshot_observed_at":"2026-08-19T15:26:37.739797Z","submitted_at":"2025-10-03T20:47:24Z","title":"D2 Actor Critic: Diffusion Actor Meets Distributional Critic","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T07:31:27.330951Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2510.03508"},"observation_digest":"sha256:fbe5603fde3b1352ce73758322396d777792086e68062fd680a00ed36c555859","observation_id":"6b28899f-3b84-4e68-9dde-d8958becdc0e","resolution":{"observed_at":"2026-05-25T07:35:29.478495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-04T10:24:38.082720Z","title":"Lillicrap, and Martin A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.10544","last_updated":"2026-05-28T18:38:46Z","snapshot_observed_at":"2026-08-21T16:01:42.565175Z","submitted_at":"2025-10-12T11:02:18Z","title":"PAC-Bayesian Reinforcement Learning Trains Generalizable Policies","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T10:24:38.082720Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2510.10544"},"observation_digest":"sha256:e8fcba7ade0bdb4a0786f802bfa20461cd1d8fbc0b38920bdbd7a75483698a59","observation_id":"8fc0e4de-9b14-4c3c-966c-2eb11a5a805c","resolution":{"observed_at":"2026-08-04T10:24:38.082720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1801.00690/citation-record","integrity":"/paper/1801.00690/integrity","json":"/paper/1801.00690/citation-record.json","paper":"/paper/1801.00690"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:a5282b74f962aa049fb08c986b6fdc97fd1651246750dea619bc57df5cce1ff8","observation_id":"807f2362-7982-4495-b448-78c7a93bdd25","resolution":{"observed_at":"2026-05-13T07:44:14.738222Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1983.631307","doi":"10.1109/tsmc.1983.6313077","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1109/TSMC.1983.6313077","venue":"IEEE Transactions on Systems Man and Cybernetics","work_id":"5d5d0663-101c-45b7-a8b9-acfc8151271a","year":1983},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:9aa0302482cf79e880e760e5234fa5bbdbaa47bbca3fa7be47f0f6d32437ee36","observation_id":"3854d122-4ec6-4075-b192-77239ad98e89","resolution":{"observed_at":"2026-05-13T07:44:14.725624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06887","last_updated":"2017-07-21T13:21:54Z","snapshot_observed_at":"2026-08-16T02:49:43.047943Z","submitted_at":"2017-07-21T13:21:54Z","title":"A Distributional Perspective on Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1707.06887","doi":"10.48550/arxiv.1707.06887","metadata_source":"pith","pith_arxiv_id":"1707.06887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Distributional Perspective on Reinforcement Learning","venue":"cs.LG","work_id":"79879eb4-5aa1-4764-9aaa-505a0a1c0f7f","year":2017},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1707.06887","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:af8b8d385246ad75a3ec8b0aa41510eca805344dde16b34000ad4ba0b72ccb78","observation_id":"c67eab7a-90c3-417c-9ca5-afe34451d96e","resolution":{"observed_at":"2026-05-13T07:44:14.732296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simulation tools for model-based robotics: Comparison of bullet, havok, mujoco, ode and physx","venue":null,"work_id":"38cf2474-efac-4a24-9dac-7447fb98b1c4","year":2015},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:ffc1e66f5a7467c406e48f1e84331b8c007faf828945a143e3fa352edf85427d","observation_id":"5a9edccc-de44-4a74-82a2-bed0bbf8d511","resolution":{"observed_at":"2026-05-13T07:44:14.784086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04133","last_updated":"2017-08-10T19:20:15Z","snapshot_observed_at":"2026-08-15T03:09:17.358218Z","submitted_at":"2017-08-10T19:20:15Z","title":"Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control","version":1},"cited_work":{"arxiv_id":"1708.04133","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.04133","snapshot_observed_at":"2026-07-03T00:07:28.185044Z","title":"Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control","venue":"cs.LG","work_id":"79bc5b68-7f90-4779-aa0d-5e000bdf6421","year":2017},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1708.04133","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:c8b1f43f91a630684a2013aa88eb6d977a96df2369c7b557e7b8fbfdfa5622ba","observation_id":"b009f6a1-d086-47c7-9cb7-80f05702153e","resolution":{"observed_at":"2026-05-13T07:44:14.763418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:4ef7db48d928c7b8734c7c228838be3cc9de01904e398c974578296df1425381","observation_id":"1a4731eb-07d8-4429-831f-2985294a14b7","resolution":{"observed_at":"2026-05-13T07:44:14.768962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:70d4db974f0790e6d823b14b087f9fd30370fd41835816dd3e63601913ce236e","observation_id":"d1dcd187-9fbb-43ec-850f-2555dd775096","resolution":{"observed_at":"2026-05-13T07:44:14.774862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.02201","last_updated":"2017-07-10T14:02:39Z","snapshot_observed_at":"2026-08-20T18:31:42.259706Z","submitted_at":"2017-07-07T14:46:45Z","title":"Learning human behaviors from motion capture by adversarial imitation","version":2},"cited_work":{"arxiv_id":"1707.02201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1707.02201","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning human behaviors from motion capture by adversarial imitation","venue":null,"work_id":"4ae653b7-9fe3-41d8-87be-ab7e524c93b9","year":null},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1707.02201","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:fb70fc734e97fe5daa953f0d44006d8aa0c6442ab9788776c34f26f94ff0cbe5","observation_id":"6cce8354-23d2-47f4-a76e-1a25442f3eda","resolution":{"observed_at":"2026-06-04T18:11:00.280755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1602.01783","doi":"10.48550/arxiv.1602.01783","metadata_source":"pith","pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asynchronous Methods for Deep Reinforcement Learning","venue":"cs.LG","work_id":"b54058f9-0b3b-46ae-a9a0-f22748625e2a","year":2016},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:1b721ee418f3bb6b9c46a24c47427acf4e14e1a9b577b842fa333ba66e3c9a23","observation_id":"696e50c7-cce6-4c80-9ffe-16489702aa79","resolution":{"observed_at":"2026-05-13T07:44:14.745723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T21:08:26.36902+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03073","last_updated":"2017-04-10T22:29:50Z","snapshot_observed_at":"2026-08-14T21:07:23.151574Z","submitted_at":"2017-04-10T22:29:50Z","title":"Data-efficient Deep Reinforcement Learning for Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":"1704.03073","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.03073","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data-efficient Deep Reinforcement Learning for Dexterous Manipulation","venue":"cs.LG","work_id":"2d9b59b0-1fec-4b87-a037-d8b39bfe3087","year":2017},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1704.03073","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:7451930eddc180109d34557dff1a73472d2138cb5d75864dd7437d199b9e0813","observation_id":"446edd7a-c21b-4b18-855c-86db467ad88b","resolution":{"observed_at":"2026-05-13T07:44:14.751255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-21T06:19:51.244525Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":"1511.05952","doi":"10.48550/arxiv.1511.05952","metadata_source":"pith","pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prioritized Experience Replay","venue":"cs.LG","work_id":"927187c1-c50e-4ca7-b0fa-55589957731f","year":2015},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:8d51808d28999d675f7920f25900c109fafe29748a50d7d498a8e98b4f4f65c7","observation_id":"0815a571-6fdf-45c5-9891-89fcae920a79","resolution":{"observed_at":"2026-05-13T07:44:14.756533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthesis and stabilization of complex be- haviors through online trajectory optimization","venue":null,"work_id":"86d4c5e4-00fb-4286-a6de-ecdff17372ef","year":2012},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:f46642419f8acd078289918775e54f1d3790377bbeb5f08a15ead9114d6aa97a","observation_id":"704f26a3-6e1c-4c1a-9898-d80878ae1136","resolution":{"observed_at":"2026-05-13T07:44:14.792796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mujoco: A physics engine for model- based control","venue":null,"work_id":"75f5dd22-10fe-40a0-b931-a62182c01348","year":2012},"citing_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T07:44:14.707183Z"},"links":{"citing_paper":"/paper/1801.00690"},"observation_digest":"sha256:dfda773837601aa7a769f4c2c6151bae68eaf98dded63735fa3d1ae68ca14254","observation_id":"dfba87fe-73f8-49e7-98a2-7f469ab8dc87","resolution":{"observed_at":"2026-05-13T07:44:14.788345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":3},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 100 inbound Pith citation observations for arXiv:1801.00690."}