{"as_of":"2026-08-07T10:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:632b1ff06b6c6d5f100fbad8f227ad9f90590d51e6507679cc263fe6369ecd34","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:03:32.220111Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:47:59.248127Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T11:46:55.739072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23172","snapshot_observed_at":"2026-08-04T09:47:59.248127Z","title":"Benchmarking massively parallelized multi-task reinforcement learning for robotics tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13704","last_updated":"2026-06-03T03:31:14Z","snapshot_observed_at":"2026-08-04T09:47:43.934006Z","submitted_at":"2025-10-15T16:01:30Z","title":"Simplicial Embeddings Improve Sample Efficiency in Actor-Critic Agents","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T09:47:59.248127Z"},"links":{"cited_paper":"/paper/2507.23172","citing_paper":"/paper/2510.13704"},"observation_digest":"sha256:81f0dc4045f12fdd6211434c9b50ac88a79c7dc5c10b33dc902e6207285bbf63","observation_id":"c1747023-19c3-4ee6-a954-0939abf28fc4","resolution":{"observed_at":"2026-08-04T09:47:59.248127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"cited_work":{"arxiv_id":"2507.23172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23172","snapshot_observed_at":"2026-07-02T11:46:55.739072Z","title":"arXiv preprint arXiv:2507.23172 , year=","venue":null,"work_id":"09750f57-e3c8-48f3-a103-aecca8d9a5b8","year":null},"citing_paper":{"arxiv_id":"2605.11473","last_updated":"2026-05-12T03:40:28Z","snapshot_observed_at":"2026-08-02T04:53:57.647690Z","submitted_at":"2026-05-12T03:40:28Z","title":"TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T01:48:13.679862Z"},"links":{"cited_paper":"/paper/2507.23172","citing_paper":"/paper/2605.11473"},"observation_digest":"sha256:ef4c75ac898c7a695b01502ac48e391cdb8c6d62d94da2a2176ec906767515ae","observation_id":"a1f022c6-d5d9-416e-9437-40c857ca52a9","resolution":{"observed_at":"2026-05-13T01:52:05.702271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"cited_work":{"arxiv_id":"2507.23172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23172","snapshot_observed_at":"2026-07-02T11:46:55.739072Z","title":"arXiv preprint arXiv:2507.23172 , year=","venue":null,"work_id":"09750f57-e3c8-48f3-a103-aecca8d9a5b8","year":null},"citing_paper":{"arxiv_id":"2606.05555","last_updated":"2026-06-04T01:09:20Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T01:09:20Z","title":"Representation Learning Enables Scalable Multitask Deep Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T03:02:59.297911Z"},"links":{"cited_paper":"/paper/2507.23172","citing_paper":"/paper/2606.05555"},"observation_digest":"sha256:10bbc42a3fa399fffdb563e71789046017bf0a1e11b3c20885b7a1859951a3f5","observation_id":"320feb81-15bf-4380-b99e-8748e88b3295","resolution":{"observed_at":"2026-07-02T11:46:55.741036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.23172/citation-record","integrity":"/paper/2507.23172/integrity","json":"/paper/2507.23172/citation-record.json","paper":"/paper/2507.23172"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:21.547614Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.547614Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:65bf17999220e54b399da1079c24705be16988a177384d861c759e4cb2b01d14","observation_id":"e0259aa2-b285-4ab6-9435-193e1a95d66b","resolution":{"observed_at":"2026-08-06T11:03:21.547614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.861446Z","title":"Locomujoco: A comprehensive imitation learning benchmark for locomotion","venue":null,"work_id":"694ef791-bfc6-4ecd-9ca4-2674e349ad0c","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.603099Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:a8c74c11d9f2ac995c1a50e9c6683d5a59024cdd03878539d653b1f9668163d7","observation_id":"a5fa4944-397e-44e1-8606-27211b6b0bf6","resolution":{"observed_at":"2026-08-06T11:03:38.932352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.09779","last_updated":"2022-10-20T20:24:34Z","snapshot_observed_at":"2026-08-06T19:28:48.201474Z","submitted_at":"2021-08-22T16:45:58Z","title":"Transferring Dexterous Manipulation from GPU Simulation to a Remote Real-World TriFinger","version":2},"cited_work":{"arxiv_id":"2108.09779","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.09779","snapshot_observed_at":"2026-08-06T11:03:33.449776Z","title":"Transferring Dexterous Manipulation from GPU Simulation to a Remote Real-World TriFinger","venue":"cs.RO","work_id":"0ed58163-26a3-42df-a614-2f2589c6423d","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.702708Z"},"links":{"cited_paper":"/paper/2108.09779","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:5fb024b96b5a4ed22d64ae58254c4e2bf51b746d1474fbb8258d0c191853f00f","observation_id":"4bad7e69-22dd-4008-acfc-f4649fc76bef","resolution":{"observed_at":"2026-08-06T11:03:33.564907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T11:03:21.846873Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.846873Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:cbc125b5f3b72feeea72f78203ca0f3256c1c05af8a875c40da2ff9da028f35c","observation_id":"3827d9ad-3158-4b90-8100-960951aa70db","resolution":{"observed_at":"2026-08-06T11:03:21.846873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06256","last_updated":"2017-03-02T19:12:19Z","snapshot_observed_at":"2026-07-06T05:19:17.255376Z","submitted_at":"2016-11-18T21:34:47Z","title":"Reinforcement Learning through Asynchronous Advantage Actor-Critic on a GPU","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06256","snapshot_observed_at":"2026-08-06T11:03:21.926066Z","title":"Reinforcement learning through asynchronous advantage actor-critic on a gpu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:21.926066Z"},"links":{"cited_paper":"/paper/1611.06256","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:e7cba50945cd192913210fc4bc314b6c5008f17a39c7ac4e5cc9a8ad3b68d9c4","observation_id":"99b10ff1-ae20-4779-bf81-9719f4b0d411","resolution":{"observed_at":"2026-08-06T11:03:21.926066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09884","last_updated":"2024-03-16T00:02:49Z","snapshot_observed_at":"2026-08-06T08:23:36.728709Z","submitted_at":"2023-06-16T14:52:24Z","title":"Jumanji: a Diverse Suite of Scalable Reinforcement Learning Environments in JAX","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09884","snapshot_observed_at":"2026-08-06T11:03:22.084295Z","title":"Jumanji: a diverse suite of scalable reinforcement learning environments in jax","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.084295Z"},"links":{"cited_paper":"/paper/2306.09884","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:70a537050b19bd727fd9cdebf2ee1eba1577c468b55df3c632527b68c183e1b6","observation_id":"148d73d9-d505-4656-9469-ff55e32f826b","resolution":{"observed_at":"2026-08-06T11:03:22.084295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13066","last_updated":"2023-03-10T07:27:19Z","snapshot_observed_at":"2026-07-06T14:09:28.705784Z","submitted_at":"2022-10-24T09:33:59Z","title":"DaXBench: Benchmarking Deformable Object Manipulation with Differentiable Physics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13066","snapshot_observed_at":"2026-08-06T11:03:22.248755Z","title":"Daxbench: Benchmarking deformable object manipulation with differentiable physics","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.248755Z"},"links":{"cited_paper":"/paper/2210.13066","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:27637fc151e9afcb68612e94d4fe6f00f9c134ac02f88496f2c0c8972fdbeec8","observation_id":"491e358b-41aa-4f9b-9660-e1946ef5fc3b","resolution":{"observed_at":"2026-08-06T11:03:22.248755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.661680Z","title":"Extreme parkour with legged robots","venue":null,"work_id":"2f3f03a2-9558-43f1-a905-2cac06249864","year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.450346Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:5bc29a0a8e3ed20bdc1427fdaeedb3181cc3cf9d4c5a6043e296a4c48ed5a4ef","observation_id":"312e53a3-d87f-4fef-81a8-051d536222d3","resolution":{"observed_at":"2026-08-06T11:03:38.787178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.459525Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":"113beedd-0694-437c-a09b-d1fe33a9b6b2","year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.525109Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:3c0ab5d8372542677f2079e489e151d7ea96c737eb15073d5a214866a75aebdd","observation_id":"35b71f9c-0e24-4310-bd0f-c3675fd4cd26","resolution":{"observed_at":"2026-08-06T11:03:38.564219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.261333Z","title":"Sample-efficient reinforcement learning by breaking the replay ratio barrier","venue":null,"work_id":"f4511169-372c-4bdb-b287-26192f017422","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.601095Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:7d621904394dd51f971608a635ca9c0db89f11b501e644fe598babfd5eab059b","observation_id":"faac1cd1-27bd-4bce-b510-9776a76ae743","resolution":{"observed_at":"2026-08-06T11:03:38.332518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:22.724083Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.724083Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:911c4a1e9b7faf50f441809bbcb7bd4cb743a07802f9f1c56ac53b016d20f444","observation_id":"bfddbf17-7840-428c-8808-b0106f042cda","resolution":{"observed_at":"2026-08-06T11:03:22.724083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:38.053270Z","title":"Franka emika panda robot, 2017","venue":null,"work_id":"d4bf2609-07f4-4cda-8e0e-0291888aba2d","year":2017},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.877103Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:8ec2e83c3aeb86181f55299a1016d640ed8da9fe01acab71bde462efef7ecddf","observation_id":"3870f6e1-a552-42ea-b335-6bc2d11dee6b","resolution":{"observed_at":"2026-08-06T11:03:38.161508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13281","last_updated":"2021-06-24T19:09:12Z","snapshot_observed_at":"2026-07-06T11:22:55.799017Z","submitted_at":"2021-06-24T19:09:12Z","title":"Brax -- A Differentiable Physics Engine for Large Scale Rigid Body Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13281","snapshot_observed_at":"2026-08-06T11:03:22.998932Z","title":"Brax--a differentiable physics engine for large scale rigid body simulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:22.998932Z"},"links":{"cited_paper":"/paper/2106.13281","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c48df83d6cc1c2e837bbc69e6a0a7b432c5eac8aa44456a224cf3c4f3ba5ad1e","observation_id":"54764a4d-0c94-40c1-abf4-a62653d42ccc","resolution":{"observed_at":"2026-08-06T11:03:22.998932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.877415Z","title":"Deep whole-body control: learning a unified policy for manipulation and locomotion","venue":null,"work_id":"54dbb7d8-4d4c-408c-ad3e-52f25e8f8990","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.113116Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:8cacba4f2b8f2216bee18b7c1e14c8cf011cd9c0073fc1963d99a27b0ce375eb","observation_id":"ccd60bd3-ae62-47bd-a072-3bd43242188b","resolution":{"observed_at":"2026-08-06T11:03:37.965262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-03T05:46:16.330368Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-06T11:03:23.236918Z","title":"Simplifying deep temporal difference learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.236918Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c7c5b1be52e56b7f7554a5cb4632981e300d13ff039f162838bcc700fcab1e41","observation_id":"ab8b6e32-c3dd-4343-aa03-25fb4bda2d62","resolution":{"observed_at":"2026-08-06T11:03:23.236918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-06T11:03:23.401536Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.401536Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:1f851af731af84ccf6ec37de8fd9752cceec2906eeebc6a6557813b9b8f0c722","observation_id":"8459246d-52e0-4e88-b6a0-342a40ad399c","resolution":{"observed_at":"2026-08-06T11:03:23.401536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11385","last_updated":"2024-05-05T16:04:52Z","snapshot_observed_at":"2026-07-06T16:49:41.895773Z","submitted_at":"2023-11-19T18:09:25Z","title":"Multi-Task Reinforcement Learning with Mixture of Orthogonal Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11385","snapshot_observed_at":"2026-08-06T11:03:23.515122Z","title":"Multi-task reinforcement learning with mixture of orthogonal experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.515122Z"},"links":{"cited_paper":"/paper/2311.11385","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b00ebbb151e69b23ff34def3dc6c3b529893f3a618c1cbc857b5093ff8285900","observation_id":"7a321585-e291-49c4-9d6e-32adc78b4397","resolution":{"observed_at":"2026-08-06T11:03:23.515122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.691600Z","title":"Multi-task deep reinforcement learning with popart","venue":null,"work_id":"121ad201-d5ca-4ded-a245-b9081bc2778d","year":2019},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.598474Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:e71fd3af59c36ba0a62d7f6ba2675a64cf40a5e7a0a45792aad52b2405d3f31b","observation_id":"d59c6f04-43fc-48a7-9b93-b6c32e809d66","resolution":{"observed_at":"2026-08-06T11:03:37.796592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00933","last_updated":"2018-03-02T16:21:46Z","snapshot_observed_at":"2026-07-06T06:26:20.207918Z","submitted_at":"2018-03-02T16:21:46Z","title":"Distributed Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00933","snapshot_observed_at":"2026-08-06T11:03:23.659631Z","title":"Distributed prioritized experience replay, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.659631Z"},"links":{"cited_paper":"/paper/1803.00933","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:6f506af1d47fa32b11489e1f11d8b5225f06696cf07d20ea530a93a42f46d3a2","observation_id":"a46b7bb0-bc39-44d3-8dbf-881ccef46813","resolution":{"observed_at":"2026-08-06T11:03:23.659631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:23.793351Z","title":"Learning agile and dynamic motor skills for legged robots","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.793351Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b737f01998b616612d6468d6ed8cbce57ea30804b5397592d24e3b51c8f27408","observation_id":"9e9ffe28-7bb2-4d4b-b8a9-1b7cd0c3554b","resolution":{"observed_at":"2026-08-06T11:03:23.793351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-07-06T04:08:54.419941Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-06T11:03:23.880190Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.880190Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f678173ce05ac6ee8f80d977720b99632c6300505385f1ce838c8f5224f58a0d","observation_id":"f3258f4a-b1b9-43b5-b886-798a84a21ba2","resolution":{"observed_at":"2026-08-06T11:03:23.880190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.522815Z","title":null,"venue":null,"work_id":"5cb37d2d-412d-4b8a-b49f-d721f5df3c35","year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:23.976570Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:ccaac00a1c672845fbe627dbc3a0854133460cbdcac2e0e11377570244b87b39","observation_id":"dd30d924-2919-47fd-aa93-5fedc6e7b561","resolution":{"observed_at":"2026-08-06T11:03:37.588503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.370942Z","title":"A survey of zero-shot generalisation in deep reinforcement learning","venue":null,"work_id":"c3218286-d71a-4a6d-8002-8e7c4a907919","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.116467Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:ae449f3c173424e26644f658f668f8a19c4131ac7aaf600aa73556bfe2b892c4","observation_id":"5ab0480f-88c2-482e-8a09-ab1a4f53cc69","resolution":{"observed_at":"2026-08-06T11:03:37.457058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:37.198030Z","title":"Pgx: Hardware-accelerated parallel game simulators for reinforcement learning","venue":null,"work_id":"8a935c8a-7af5-4b43-b055-00ae39816afa","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.267463Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:bf58846df4bf49627e83ae53a57d77ae301c93e5849b2cae59bf98f6aaabb81c","observation_id":"4395375f-7a86-46d0-b96e-855ff9522a56","resolution":{"observed_at":"2026-08-06T11:03:37.298339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.984739Z","title":"gymnax : A JAX -based reinforcement learning environment library, 2022","venue":null,"work_id":"2aa4698a-d976-47ea-abc9-3542f9289408","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.397822Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:659e88bad169d615cd25b352a8b76cfd757e9934b202dafe419e03b4a1aeab02","observation_id":"0e12560f-4329-4fbf-8dd1-372ed53574d4","resolution":{"observed_at":"2026-08-06T11:03:37.121591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.837538Z","title":"Learning quadrupedal locomotion over challenging terrain","venue":null,"work_id":"cafa388e-66b0-47a9-9c77-c70bfa6b7937","year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.559099Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:7f8726687eba8a3fa40825597daa695d160bfe6e39d1bd63ecd501d37b3c78b9","observation_id":"5a40fe96-9794-4111-bade-18bcb46fbbfa","resolution":{"observed_at":"2026-08-06T11:03:36.887243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.663886Z","title":"Parallel q -learning: Scaling off-policy reinforcement learning under massively parallel simulation","venue":null,"work_id":"9789a273-7886-45f3-909f-36acbd947d2f","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.774942Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:732620e0c418929c6f0785423d8228005c33f777997802032e60e9d595374dfd","observation_id":"ae0ec9ea-4485-46d2-9123-ad50587f3a1b","resolution":{"observed_at":"2026-08-06T11:03:36.744012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.471200Z","title":"Rllib: Abstractions for distributed reinforcement learning","venue":null,"work_id":"0c587336-a5c1-414b-b937-5e8f3f4062bb","year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:24.850498Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:027c776f0fe74f862c9d46d75e2e535f0571ad80ec7619a9598b8ed037350921","observation_id":"364232bc-313b-4d15-8146-02d236d6c375","resolution":{"observed_at":"2026-08-06T11:03:36.568419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.321512Z","title":"Gpu-accelerated robotic simulation for distributed reinforcement learning","venue":null,"work_id":"3e81b176-5ef9-432f-9b66-c2233c722a16","year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.062255Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:0dd50bf63e34611fae77b86e82e31f9eeb8fc6b93c73e03cf22c0b69e92398d0","observation_id":"3ab1ae18-ad23-4ec2-a8df-b474ab50a07c","resolution":{"observed_at":"2026-08-06T11:03:36.382119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01775","last_updated":"2024-11-04T03:54:00Z","snapshot_observed_at":"2026-07-06T19:44:34.642049Z","submitted_at":"2024-11-04T03:54:00Z","title":"Eurekaverse: Environment Curriculum Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01775","snapshot_observed_at":"2026-08-06T11:03:25.196049Z","title":"Eurekaverse: Environment curriculum generation via large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.196049Z"},"links":{"cited_paper":"/paper/2411.01775","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:067965b79854cc245e0c468157d8050caabf013df9c3719310c6e60d648ae295","observation_id":"d37a556b-2458-43da-919f-b8703e104bfc","resolution":{"observed_at":"2026-08-06T11:03:25.196049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03792","last_updated":"2023-10-30T02:45:50Z","snapshot_observed_at":"2026-07-06T15:39:18.493629Z","submitted_at":"2023-06-06T15:39:54Z","title":"FAMO: Fast Adaptive Multitask Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03792","snapshot_observed_at":"2026-08-06T11:03:25.316396Z","title":"Famo: Fast adaptive multitask optimization, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.316396Z"},"links":{"cited_paper":"/paper/2306.03792","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:fc2e395d0c814b2d10baa872e17346f5ef06a72a2422ae0706c67d0ecd93d4d5","observation_id":"47eec33a-a586-4242-80be-6a08a54dd6b5","resolution":{"observed_at":"2026-08-06T11:03:25.316396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-06T11:03:25.514380Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.514380Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b8fb866d56c1f875825401ec1d00ddae9c72e017aacb5498019783f87d6c21e4","observation_id":"089e5355-0b7b-4230-b443-348793f2127b","resolution":{"observed_at":"2026-08-06T11:03:25.514380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14048","last_updated":"2024-02-21T04:18:38Z","snapshot_observed_at":"2026-07-06T12:02:19.650098Z","submitted_at":"2021-10-26T22:03:51Z","title":"Conflict-Averse Gradient Descent for Multi-task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14048","snapshot_observed_at":"2026-08-06T11:03:25.650538Z","title":"Conflict-averse gradient descent for multi-task learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.650538Z"},"links":{"cited_paper":"/paper/2110.14048","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:0488ff7ca7107fe9337417bc3e6290b6b03e5ed6756c3a43bb3876ec5d095ad1","observation_id":"9dcc7e5e-a8a9-45e2-b9b0-eefce8af99a2","resolution":{"observed_at":"2026-08-06T11:03:25.650538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:36.125804Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":"a95ea507-03aa-43db-b1b4-6a40be8bc589","year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:25.817066Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:72bd747632797d34dfb33daab9da8a0be8f4c2cfbe4fec3a35d4bc5a61e1f44a","observation_id":"6e5a73cd-437f-4547-aef0-4bc354ce73fd","resolution":{"observed_at":"2026-08-06T11:03:36.210790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.915043Z","title":"rl-games: A high-performance framework for reinforcement learning","venue":null,"work_id":"eef3a711-47c5-4944-8c2e-8407ec6c1685","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.017917Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b34a0ba8692069c737770f50f762be62d154d630c11d0053052d2e41d957f707","observation_id":"54044885-8e42-4ff7-82e6-3826c246efd0","resolution":{"observed_at":"2026-08-06T11:03:36.036181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T11:03:26.184138Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.184138Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:69e838b4470334f98cb3101d0070992900b58b1032bb16e589c5eb69f2b75c26","observation_id":"ce8db6ca-13f9-4303-8011-c66f60ef4308","resolution":{"observed_at":"2026-08-06T11:03:26.184138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:26.290341Z","title":"Rapid locomotion via reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.290341Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:6737ee8bdef6706f27533bdfc7cb8a1267610563079de7fbdf48ecae75a27498","observation_id":"51f0bb4e-13d4-4c88-b0d5-0942b92d19ff","resolution":{"observed_at":"2026-08-06T11:03:26.290341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16801","last_updated":"2024-06-03T14:12:27Z","snapshot_observed_at":"2026-08-06T07:26:12.597538Z","submitted_at":"2024-02-26T18:19:07Z","title":"Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16801","snapshot_observed_at":"2026-08-06T11:03:26.459024Z","title":"Craftax: A lightning-fast benchmark for open-ended reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.459024Z"},"links":{"cited_paper":"/paper/2402.16801","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:559b344ce811c2deb91819e437f0265be66b1ea89ea1a5c0e38dbdc5f5051ac4","observation_id":"d54f2052-a4f1-4f94-88de-cc7103c26e2b","resolution":{"observed_at":"2026-08-06T11:03:26.459024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:26.674694Z","title":"Orbit: A unified simulation framework for interactive robot learning environments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.674694Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:7f5e43a2c12538f51026f17a1367d8a6364ae12a5d47c159ba5dec5efa28fe26","observation_id":"bb8220b2-4ab6-4d99-bfc5-e802104815c9","resolution":{"observed_at":"2026-08-06T11:03:26.674694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-06T11:03:26.825320Z","title":"Playing atari with deep reinforcement learning, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.825320Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:df4a70d39be913f2dee37f23120c086c966b4ad47fe741bfdb95ed6d6c658dd3","observation_id":"549915d5-7361-4756-a42a-b11ed3a2739d","resolution":{"observed_at":"2026-08-06T11:03:26.825320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.764432Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":"8881227d-660e-49f4-b372-19a54171e444","year":2015},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:26.959536Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f973b7aef8f0798ad8fcec46d372072adafe96597aa2ee97d502afeacb73f51c","observation_id":"657a0540-9a52-41b7-9faf-4514d3bfd4bb","resolution":{"observed_at":"2026-08-06T11:03:35.834992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:27.178424Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.178424Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:579200bc95692e1d793571a27d367a933d0e81ded2949f2917efd2420bafca9f","observation_id":"042c9cc2-100a-4ca5-a884-dab096552ee5","resolution":{"observed_at":"2026-08-06T11:03:27.178424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01859","last_updated":"2023-03-03T11:25:33Z","snapshot_observed_at":"2026-07-06T14:58:18.255439Z","submitted_at":"2023-03-03T11:25:33Z","title":"POPGym: Benchmarking Partially Observable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01859","snapshot_observed_at":"2026-08-06T11:03:27.386150Z","title":"Popgym: Benchmarking partially observable reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.386150Z"},"links":{"cited_paper":"/paper/2303.01859","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:8616be00dc2547d0199e7d5ced15d44ba49a2638838175a4e9880dcf0ddc1c9e","observation_id":"6adb8350-b470-4884-8cee-2a8e9ef67971","resolution":{"observed_at":"2026-08-06T11:03:27.386150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.04296","last_updated":"2015-07-16T09:27:06Z","snapshot_observed_at":"2026-07-06T04:23:57.382398Z","submitted_at":"2015-07-15T16:56:56Z","title":"Massively Parallel Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.04296","snapshot_observed_at":"2026-08-06T11:03:27.536045Z","title":"Massively parallel methods for deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.536045Z"},"links":{"cited_paper":"/paper/1507.04296","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:a0fd17628b34033c2452e25594a4266223d6f02500ac2b3a55b237db1e5d78d8","observation_id":"60f8519e-7bb0-4d02-a5dd-db22594ca89e","resolution":{"observed_at":"2026-08-06T11:03:27.536045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00177","last_updated":"2019-01-18T23:26:53Z","snapshot_observed_at":"2026-08-06T13:47:47.004017Z","submitted_at":"2018-08-01T06:02:36Z","title":"Learning Dexterous In-Hand Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.00177","snapshot_observed_at":"2026-08-06T11:03:27.683420Z","title":"Learning dexterous in-hand manipulation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.683420Z"},"links":{"cited_paper":"/paper/1808.00177","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c4b42afbdf4b6338741e6bb7fd7be32db61854eb05fdc9dce817d721c5250396","observation_id":"21094dcb-5b7d-4cdc-9496-eda1c508bba8","resolution":{"observed_at":"2026-08-06T11:03:27.683420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-06T11:03:27.866008Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.866008Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:5c40007531513bb82b7b1774213d05b6b7fd9511976594057822e0ca93d6f3ee","observation_id":"94b606da-e505-4439-a907-8aea010ac98d","resolution":{"observed_at":"2026-08-06T11:03:27.866008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.624075Z","title":"Sample factory: Egocentric 3d control from pixels at 100000 fps with asynchronous reinforcement learning","venue":null,"work_id":"6e3e20a6-1455-4cf7-bcfd-0e4ba6099734","year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.009488Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:6fac3684a395905ad1ccd347ed32c2004db5c20901600167c10f161a6fcf2e1f","observation_id":"8025aec0-f76e-4f0f-80f3-3c664fa6c409","resolution":{"observed_at":"2026-08-06T11:03:35.709263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.09025","last_updated":"2016-09-28T18:13:02Z","snapshot_observed_at":"2026-07-06T05:12:36.053923Z","submitted_at":"2016-09-28T18:13:02Z","title":"Learning to Push by Grasping: Using multiple tasks for effective learning","version":1},"cited_work":{"arxiv_id":"1609.09025","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.09025","snapshot_observed_at":"2026-08-06T11:03:32.898528Z","title":"Learning to Push by Grasping: Using multiple tasks for effective learning","venue":"cs.RO","work_id":"9341ca39-08f8-4146-a071-55998ebbb4ec","year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.133785Z"},"links":{"cited_paper":"/paper/1609.09025","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:44af794f4c232075ecbdabd054b3bbda9634cf0a293e6bfa47e70c229f7c4297","observation_id":"56cf0269-8829-47f6-9178-353ac92748be","resolution":{"observed_at":"2026-08-06T11:03:33.005502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.466681Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":"c5326624-c19b-435b-a161-6e10f0c8551c","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.332033Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:5a4a65441d1d1e1a7a5fe05d404d5a8a70d30aa46e3d118e0a4ca4f5d89919ef","observation_id":"a31f0dba-12cf-4f62-b3ad-670077d431ca","resolution":{"observed_at":"2026-08-06T11:03:35.534278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-07-09T23:17:08.002707Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-08-06T11:03:28.485294Z","title":"Jaxmarl: Multi-agent rl environments and algorithms in jax, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.485294Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:93df30229aba62613cdc40866e4a54faeeea484db6e0aecb983f65e2d2e23726","observation_id":"40a0afb0-41b0-49d2-8666-7bfd43cfeec4","resolution":{"observed_at":"2026-08-06T11:03:28.485294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T11:03:28.602247Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.602247Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:8aed7c91723371a2f451057c4306283a74e95b756cc20d7e82e4fc16d9b9435c","observation_id":"842ede67-ce26-4d2e-9dcf-cef77f684586","resolution":{"observed_at":"2026-08-06T11:03:28.602247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12566","last_updated":"2023-09-25T22:49:51Z","snapshot_observed_at":"2026-08-05T18:50:45.868771Z","submitted_at":"2022-10-22T22:55:50Z","title":"Solving Continuous Control via Q-learning","version":2},"cited_work":{"arxiv_id":"2210.12566","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.12566","snapshot_observed_at":"2026-08-06T11:03:32.537682Z","title":"Solving Continuous Control via Q-learning","venue":"cs.LG","work_id":"b0ac7bb0-ac22-4dc2-8c68-dba6ca29744f","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.770546Z"},"links":{"cited_paper":"/paper/2210.12566","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:d2c74a2d2c72fb4ee6c6043b79295c37659a1a948133a76b7b85d094d0cb9f71","observation_id":"0ee4ca13-facb-48a3-9191-b09fb5d5866d","resolution":{"observed_at":"2026-08-06T11:03:32.734490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-04T05:16:12.953751Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-06T11:03:28.917713Z","title":"Humanoidbench: Simulated humanoid benchmark for whole-body locomotion and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:28.917713Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:4900e39780d02f06cfe75fa309655c2ac8136ebc0bb64921a71fda7769ca6b75","observation_id":"d968c205-8934-42fd-b2a7-ad78bab7f571","resolution":{"observed_at":"2026-08-06T11:03:28.917713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T11:03:29.080753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.080753Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:1c9bb0850dc8d5287d8ffab68112fd45ac416be82b00dc8a5c22b1d0fe3e48fb","observation_id":"8291e303-13cf-4d50-8383-79c9691d366f","resolution":{"observed_at":"2026-08-06T11:03:29.080753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:29.291269Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.291269Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:c2c26c68f42e843d069f7b12aa18b9f5313269c788aa86a481c15f7cca3934c7","observation_id":"0b2a84a9-6694-411d-a3a9-4ee50ab02404","resolution":{"observed_at":"2026-08-06T11:03:29.291269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:35.128592Z","title":"Sapg: Split and aggregate policy gradients","venue":null,"work_id":"f941d7da-a7b5-486a-bb23-c51062b4185f","year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.405988Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:e070e9a574872acdb073e815a6cccd22ef7453d33ed0bbb5cb5f8e4ccc4cbe86","observation_id":"8edd2085-984b-4cd6-a003-1f3f81c939a4","resolution":{"observed_at":"2026-08-06T11:03:35.336689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:34.816529Z","title":"Mtrl - multi task rl algorithms","venue":null,"work_id":"4a481532-7248-43a1-8f29-c86984b622a1","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.509725Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:9d6a5a6983c2ec5dab24b045aa5a24ee3dab1886c8aa9e91f1eebe2f876b143b","observation_id":"b44df3ee-a281-468c-8b6e-fd5c22f9e1ed","resolution":{"observed_at":"2026-08-06T11:03:34.953844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:34.483305Z","title":"Multi-task reinforcement learning with context-based representations","venue":null,"work_id":"ad388d68-2df2-482e-81e1-5c3a24b1fae3","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.666591Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b05fee22b2e87d0b0814c60571cb9fd304c4422ba3b4cb40d8068c17d9368ddb","observation_id":"b98ea7ac-7bc8-4b88-9745-60fcd076016a","resolution":{"observed_at":"2026-08-06T11:03:34.630161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11653","last_updated":"2022-10-21T01:00:10Z","snapshot_observed_at":"2026-07-06T14:08:30.259555Z","submitted_at":"2022-10-21T01:00:10Z","title":"PaCo: Parameter-Compositional Multi-Task Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11653","snapshot_observed_at":"2026-08-06T11:03:29.790459Z","title":"Paco: Parameter-compositional multi-task reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.790459Z"},"links":{"cited_paper":"/paper/2210.11653","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:0a9081e6456bf4b55d0fa5550dafc3d0fa5f015d2d487be33fab6c4b7f9e2de6","observation_id":"73c4d6a4-1bee-416e-a3ef-9a44468a2bb7","resolution":{"observed_at":"2026-08-06T11:03:29.790459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-07-06T05:47:10.770104Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-06T11:03:29.901954Z","title":"Leibo, Karl Tuyls, and Thore Graepel","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:29.901954Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:ec68a31427c49ea8c093fc1c67054a2f33990d00a800a90cf932be3cf9c86799","observation_id":"4c905634-aadf-4819-961e-8212124c9f4b","resolution":{"observed_at":"2026-08-06T11:03:29.901954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:30.091789Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.091789Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:9481cb9c940d917029b4fde23611322638e7fdb5a4f59ba3ab3a9011f1622b41","observation_id":"914f3f29-610e-43fc-bde4-5c3aa65780a4","resolution":{"observed_at":"2026-08-06T11:03:30.091789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00425","last_updated":"2025-05-30T05:49:14Z","snapshot_observed_at":"2026-07-06T19:25:06.162911Z","submitted_at":"2024-10-01T06:10:39Z","title":"ManiSkill3: GPU Parallelized Robotics Simulation and Rendering for Generalizable Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00425","snapshot_observed_at":"2026-08-06T11:03:30.239033Z","title":"Maniskill3: Gpu parallelized robotics simulation and rendering for generalizable embodied ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.239033Z"},"links":{"cited_paper":"/paper/2410.00425","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f41f2a51b1890ad2faa6e416553d242ce221750d8357b2739cce09857d6c1910","observation_id":"9ea2fe3f-5da3-46b9-84fa-74f99b29251f","resolution":{"observed_at":"2026-08-06T11:03:30.239033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T11:03:30.405738Z","title":"Deepmind control suite, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.405738Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:f431c54bc46e135bc2cfacfc1d0f0ed49a091f62c4c40220d88992e9a45489db","observation_id":"68c89edc-604f-4cc5-9864-f4518319b735","resolution":{"observed_at":"2026-08-06T11:03:30.405738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:30.591670Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.591670Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:b41cbf7bc20bcc1a34cac12cafd700295c8de0b6eb127e2c9483bd71e1ed3b19","observation_id":"bcf13415-3bb3-4bda-997f-b352ffbfb748","resolution":{"observed_at":"2026-08-06T11:03:30.591670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:34.190368Z","title":"Go1 User Manual","venue":null,"work_id":"0e4c48ad-3bf6-4e68-9ad0-cd064968e091","year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.727389Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:2676eb11e63c095ab09be9370f5af622910c2ac30434544cc72652096e95bdcd","observation_id":"2e5a82a9-c46a-48eb-9fff-257bfa6a15c9","resolution":{"observed_at":"2026-08-06T11:03:34.371334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06581","last_updated":"2016-04-05T09:03:06Z","snapshot_observed_at":"2026-07-06T04:37:12.487978Z","submitted_at":"2015-11-20T13:07:54Z","title":"Dueling Network Architectures for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06581","snapshot_observed_at":"2026-08-06T11:03:30.851313Z","title":"Dueling network architectures for deep reinforcement learning, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.851313Z"},"links":{"cited_paper":"/paper/1511.06581","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:4ebb0f5fd6ba02d76896befa906f73effc035c7a95019f4f2d60089b49f8d400","observation_id":"79daa933-3cb6-46f4-adc2-430add7b2e7d","resolution":{"observed_at":"2026-08-06T11:03:30.851313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:33.959803Z","title":"Outracing champion gran turismo drivers with deep reinforcement learning","venue":null,"work_id":"d21fcb26-bfde-4624-ae86-7d75ccc99145","year":2022},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:30.999200Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:d7643cf097c7a3899e82411079d50d4e5bc2a1d087a94dbd332e3e1fc3bb6e63","observation_id":"76425055-dca4-44c7-be27-c1107a9aa233","resolution":{"observed_at":"2026-08-06T11:03:34.063335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12089","last_updated":"2025-02-27T19:05:47Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:56:24Z","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12089","snapshot_observed_at":"2026-08-06T11:03:31.098377Z","title":"Stabilizing reinforcement learning in differentiable multiphysics simulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.098377Z"},"links":{"cited_paper":"/paper/2412.12089","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:9acc0b7720d99eb460bfd19b1d2decb250818b5fa6250364b7438619eee83faf","observation_id":"e35af45e-1f0b-448d-b13c-8b2845a3e1bb","resolution":{"observed_at":"2026-08-06T11:03:31.098377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.13661","last_updated":"2020-12-07T07:14:11Z","snapshot_observed_at":"2026-07-06T09:08:28.873280Z","submitted_at":"2020-03-30T17:47:04Z","title":"Multi-Task Reinforcement Learning with Soft Modularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.13661","snapshot_observed_at":"2026-08-06T11:03:31.215734Z","title":"Multi-task reinforcement learning with soft modularization, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.215734Z"},"links":{"cited_paper":"/paper/2003.13661","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:e40e92d23c9281d40fc72bf29d6f9dd6e21733cb2708d5214ed18debfa799f5a","observation_id":"b81ebc2e-3859-43b7-8cf5-1912b4c15131","resolution":{"observed_at":"2026-08-06T11:03:31.215734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06782","last_updated":"2020-12-22T00:35:46Z","snapshot_observed_at":"2026-07-06T08:51:25.168612Z","submitted_at":"2020-01-19T06:33:47Z","title":"Gradient Surgery for Multi-Task Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06782","snapshot_observed_at":"2026-08-06T11:03:31.393593Z","title":"Gradient surgery for multi-task learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.393593Z"},"links":{"cited_paper":"/paper/2001.06782","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:8dee33f7a1eb6839ed5667d20678912c72dfcd37ad045588ba1fd5286b20f6a1","observation_id":"6f03fb84-dc42-4b67-b1a5-abfff31214d3","resolution":{"observed_at":"2026-08-06T11:03:31.393593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-07-06T08:31:50.962710Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-08-06T11:03:31.574523Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.574523Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:da4167404d68b07185d1814dbf1af5c24acd5579de434dbc21e9e1d882b7b885","observation_id":"54e0e1a9-2db9-4aba-94b0-ea133a08d417","resolution":{"observed_at":"2026-08-06T11:03:31.574523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:33.680722Z","title":"Kahrs, Carlo Sferrazza, Yuval Tassa, and Pieter Abbeel","venue":null,"work_id":"160c8d5f-0fba-4fd7-b791-d149adb855b2","year":2025},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.762955Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:cd420a45195bd9f45e79c0a84544e5f72947600c0c20ae13a40d1f186f92fada","observation_id":"1687d3a9-5815-4d30-ad87-3707271c1528","resolution":{"observed_at":"2026-08-06T11:03:33.804878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-08-06T11:03:31.888331Z","title":"robosuite: A modular simulation framework and benchmark for robot learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:31.888331Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:3ca817946299305dc3a0209a0e88181033720cc8fbff79855913f62e54792fdc","observation_id":"745be101-15cf-404c-8fa4-113e362d9d90","resolution":{"observed_at":"2026-08-06T11:03:31.888331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05665","last_updated":"2023-09-12T03:01:55Z","snapshot_observed_at":"2026-07-06T16:17:04.004519Z","submitted_at":"2023-09-11T17:59:17Z","title":"Robot Parkour Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05665","snapshot_observed_at":"2026-08-06T11:03:32.055516Z","title":"Robot parkour learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:32.055516Z"},"links":{"cited_paper":"/paper/2309.05665","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:dfd5b8f5774e94c35f19ae5a562ed8eeb37397fa93c3a82788027813fbf6dc67","observation_id":"a99782d8-5d50-41a7-b8e4-d33ff230ed85","resolution":{"observed_at":"2026-08-06T11:03:32.055516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:03:32.220111Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:32.220111Z"},"links":{"citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:2f280f645b72c222a627431cc32cbf1b7cd0831340ddaca9f8c0b2ab98fa7b39","observation_id":"3610a66a-7b43-46b3-a45f-9d670e20b58c","resolution":{"observed_at":"2026-08-06T11:03:32.220111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":3,"verified_fuzzy":25},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 3 inbound Pith citation observations for arXiv:2507.23172."}