{"as_of":"2026-08-22T18:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53a2e053ef03b7eedbb15619e6eb3510daaae7f19c4dd0f3fcb1f2a02aa2f4ac","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:08:36.024521Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:22:49.641234Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T17:17:25.644428Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2506.15953","last_updated":"2026-05-13T00:42:26Z","snapshot_observed_at":"2026-08-11T23:07:39.134745Z","submitted_at":"2025-06-19T01:38:13Z","title":"ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T09:46:38.742771Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2506.15953"},"observation_digest":"sha256:5a7f3c12fa0589cbae32a5bf5a842da3d46e5332bfd5f13bb78ad0046ec97526","observation_id":"97925b02-2367-49af-a484-f48bd0ff2237","resolution":{"observed_at":"2026-05-19T09:47:13.880014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2507.11019","last_updated":"2026-04-10T20:59:50Z","snapshot_observed_at":"2026-08-13T06:10:19.893970Z","submitted_at":"2025-07-15T06:24:07Z","title":"Relative Entropy Pathwise Policy Optimization","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T04:19:15.018380Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2507.11019"},"observation_digest":"sha256:144295a6a32a86f53165095cd53bf7a5dd6b415c1cf588d44d4f3636831a31cb","observation_id":"b49bccbb-854c-45b7-846e-dc77347ca93a","resolution":{"observed_at":"2026-05-19T04:22:04.004454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-06T13:07:09.649092Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-18T23:52:36.906166Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.649092Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:87021a29d60c95b7fac61e83d925fd579486c5f2f704941d2a3d1d162687381f","observation_id":"fbdc4bdc-a63f-468e-84ca-2fba47c89ba3","resolution":{"observed_at":"2026-08-06T13:07:09.649092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-06T04:39:07.111116Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-11T12:45:17.685609Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.111116Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:c5fda35e185f5c65a8d7ce0840d926f46b6c11caa2a870fe3f753471d1244dbf","observation_id":"2866452a-e27c-4565-b71c-001936c8ccbe","resolution":{"observed_at":"2026-08-06T04:39:07.111116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-04T09:48:07.140767Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13704","last_updated":"2026-06-03T03:31:14Z","snapshot_observed_at":"2026-08-19T19:56:36.331763Z","submitted_at":"2025-10-15T16:01:30Z","title":"Simplicial Embeddings Improve Sample Efficiency in Actor-Critic Agents","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-04T09:48:07.140767Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2510.13704"},"observation_digest":"sha256:94214d938bd95fd8efe2b3a4a56664b117695a119acf5a96c0e6b61363339474","observation_id":"7351708d-747d-4a67-89e9-f54c119cad8a","resolution":{"observed_at":"2026-08-04T09:48:07.140767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-02T21:42:30.811298Z","title":"Seo, Y ., Sferrazza, C., Geng, H., Nauman, M., Yin, Z.- H., and Abbeel, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19373","last_updated":"2026-06-04T04:14:07Z","snapshot_observed_at":"2026-08-13T19:32:21.863609Z","submitted_at":"2026-02-22T22:55:27Z","title":"Stable Deep Reinforcement Learning via Isotropic Gaussian Representations","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:42:30.811298Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2602.19373"},"observation_digest":"sha256:7e95cbe64c5c553183d7f2b49db7c8c71a753c5274e8f1b9d5088b30692dbe09","observation_id":"a27929e4-c029-47d7-8d50-eaff230a2b04","resolution":{"observed_at":"2026-08-02T21:42:30.811298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-02T21:36:20.383255Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-19T20:13:19.062884Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.383255Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:40ce8a2147b82c82db6e3ddffd9c72fba860b8e261b45c3eacb19281532e1a68","observation_id":"9db694ae-f907-40ab-903c-7895f5901824","resolution":{"observed_at":"2026-08-02T21:36:20.383255Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2603.12612","last_updated":"2026-05-04T08:54:07Z","snapshot_observed_at":"2026-07-06T22:48:53.198077Z","submitted_at":"2026-03-13T03:27:25Z","title":"FastDSAC: Unlocking the Potential of Maximum Entropy RL in High-Dimensional Humanoid Control","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:59.392158Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2603.12612"},"observation_digest":"sha256:7933bb547c42a89772d8a1e35512395520057110a99bebeb9649acb8edcbda8a","observation_id":"a8d28a6b-6fde-4bc7-aad6-60991c46c938","resolution":{"observed_at":"2026-05-15T12:20:00.716044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2603.15956","last_updated":"2026-04-20T19:05:45Z","snapshot_observed_at":"2026-08-11T00:29:57.012238Z","submitted_at":"2026-03-16T22:12:48Z","title":"ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T09:37:02.168898Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2603.15956"},"observation_digest":"sha256:3f7354d9de0b15d3837f6960b81c93eb0bfb4eb4c925ac081f0a4143bfc83c57","observation_id":"7965dc9e-b615-46c1-ba23-0db11a6cc1f5","resolution":{"observed_at":"2026-05-15T09:39:55.201294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-03T02:32:25.303069Z","title":"Archit Sharma, Michael Ahn, Sergey Levine, Vikash Kumar, Karol Hausman, and Shixiang Gu","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2603.25464","last_updated":"2026-07-31T08:24:22Z","snapshot_observed_at":"2026-08-18T04:05:21.273296Z","submitted_at":"2026-03-26T14:07:01Z","title":"Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T02:32:25.303069Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2603.25464"},"observation_digest":"sha256:8e09b6ac2c81bc609e49b4f45e63210e8f3990874d05389aa3f885719a844153","observation_id":"6fb8192c-e341-4819-8e94-4c1ba6950290","resolution":{"observed_at":"2026-08-03T02:32:25.303069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-21T02:07:26.432151Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T20:04:56.512544Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:3a422fa5327d72d90be37a3546f26082163c1f93e4034a665c5c0313723f5bbb","observation_id":"4ef4803b-6b08-4199-bd95-e1d9845061b8","resolution":{"observed_at":"2026-05-10T22:15:49.991344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-21T02:07:26.432151Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T17:08:31.770889Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:d84f3f823827e671c3f49e775275003ca2a73783597eb8cd7b805760117c6705","observation_id":"8fc3f8c7-ad06-409c-8f5f-c8b83a3f4394","resolution":{"observed_at":"2026-05-19T17:12:41.347846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2604.06497","last_updated":"2026-04-07T21:58:09Z","snapshot_observed_at":"2026-08-12T12:11:20.261305Z","submitted_at":"2026-04-07T21:58:09Z","title":"Hyperfastrl: Hypernetwork-based reinforcement learning for unified control of parametric chaotic PDEs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T18:09:00.155657Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2604.06497"},"observation_digest":"sha256:0b3f1154be03346a88f7cea9af6cef8d0313d7313ef145136ffc841bf332d14f","observation_id":"859f9511-8d8f-4cc7-bdb3-1dd385583ef7","resolution":{"observed_at":"2026-05-11T05:25:59.098449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2604.25508","last_updated":"2026-04-28T11:14:00Z","snapshot_observed_at":"2026-08-14T00:41:07.154998Z","submitted_at":"2026-04-28T11:14:00Z","title":"Dyna-Style Safety Augmented Reinforcement Learning: Staying Safe in the Face of Uncertainty","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T16:34:33.155628Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2604.25508"},"observation_digest":"sha256:d5d18ec3fe0c8ace72bc2c7758d893d343268fb3a14a1810eb48cdd0ea126fd6","observation_id":"c79f349e-304d-4150-a272-ec80ac21abbb","resolution":{"observed_at":"2026-05-11T23:36:39.975855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-16T00:35:49.068855Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T05:33:19.038889Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:0063096c9be38ff1c8f87d8150b81d27787ff08a52ce0f8c609c5e2b4bef2f10","observation_id":"3f3931e2-3c9e-48d3-80ed-d991a8c0028e","resolution":{"observed_at":"2026-05-12T05:36:24.652733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-16T00:35:49.068855Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T06:27:38.643667Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:88a858e17299e71630dfb2d73e01ebe39085a4988240765e3ad905eab67ab785","observation_id":"fff6a116-00a0-407d-9510-49fc3dde82cd","resolution":{"observed_at":"2026-05-13T06:32:24.780742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-16T00:35:49.068855Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T23:04:12.943222Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:bb7d783b74197d954e711b086c4ef252a8a01ac7e49a5756343459a8148ade76","observation_id":"d2f2f081-93ed-46b5-9226-991718f848a6","resolution":{"observed_at":"2026-05-20T23:09:12.684839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2605.30313","last_updated":"2026-06-02T16:21:55Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:53:50Z","title":"UniLab: A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T07:09:19.137932Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2605.30313"},"observation_digest":"sha256:44f43057041bd9e901efb24c7e97cee9477f962cdcfbc39f67b731ce09ac1265","observation_id":"6a7f2e3b-1d86-4337-a3b3-6cf0714afbee","resolution":{"observed_at":"2026-06-29T07:13:16.550765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2606.05555","last_updated":"2026-06-04T01:09:20Z","snapshot_observed_at":"2026-08-07T21:26:35.552849Z","submitted_at":"2026-06-04T01:09:20Z","title":"Representation Learning Enables Scalable Multitask Deep Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T03:02:59.297911Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2606.05555"},"observation_digest":"sha256:befb160a7cf76893f5368a783a805ec53321812dad07171a4fa50f520d6a7b46","observation_id":"01d556f2-5392-45c8-acd9-ace790219c8d","resolution":{"observed_at":"2026-07-02T11:46:55.700770Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2606.21086","last_updated":"2026-06-19T04:23:10Z","snapshot_observed_at":"2026-08-03T04:20:46.797599Z","submitted_at":"2026-06-19T04:23:10Z","title":"ReFPO: Reflow Regularization for Flow Matching Policy Gradients","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:38:54.754049Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2606.21086"},"observation_digest":"sha256:7714a83e3e9a1ff3c5780bb086a5dcbb9c6a6c3e5ca53aaa357f2049e198e778","observation_id":"06805b5e-9603-4903-a27a-f86b69aa352e","resolution":{"observed_at":"2026-07-04T06:19:37.839390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2606.29209","last_updated":"2026-06-28T05:20:37Z","snapshot_observed_at":"2026-08-13T03:46:05.685929Z","submitted_at":"2026-06-28T05:20:37Z","title":"AnyBody: Free-Form Whole-Body Humanoid Control from Arbitrary Keypoint Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T07:44:51.002937Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2606.29209"},"observation_digest":"sha256:3f4e9458eb90b1a0198999c093e0864c6bdb2c7fcbbd01a5a8f161ea4d11803a","observation_id":"c35be60b-c9be-474a-a549-258d5ca42a73","resolution":{"observed_at":"2026-06-30T08:04:28.870067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2606.30072","last_updated":"2026-07-17T08:08:44Z","snapshot_observed_at":"2026-08-15T10:59:37.209194Z","submitted_at":"2026-06-29T10:04:15Z","title":"ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-30T06:06:42.672173Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2606.30072"},"observation_digest":"sha256:fdf2116638ab99bb6b38a96c3ff885e3a83b3ecb029b44476a0b3960bdd66e03","observation_id":"6fa03dd2-388b-4323-b04e-84fffc7d302a","resolution":{"observed_at":"2026-06-30T08:24:26.913170Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2606.31691","last_updated":"2026-06-30T14:04:26Z","snapshot_observed_at":"2026-08-13T05:18:37.585754Z","submitted_at":"2026-06-30T14:04:26Z","title":"FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:28:28.298787Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2606.31691"},"observation_digest":"sha256:e4820434da902e7eec5f09462b112565b6aacea0ac3c7d5f90271bad1860b571","observation_id":"777d2734-968a-4372-809d-a0cc91583f46","resolution":{"observed_at":"2026-07-01T10:25:42.276740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":"2505.22642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-07-10T17:17:25.644428Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":"cs.RO","work_id":"7a0e4c22-2015-41c5-a8d1-c57f6282eec2","year":2025},"citing_paper":{"arxiv_id":"2607.07830","last_updated":"2026-07-08T18:12:18Z","snapshot_observed_at":"2026-08-14T00:54:48.387623Z","submitted_at":"2026-07-08T18:12:18Z","title":"Physics-Guided Biomechanical Gait Adaptation for Humanoid Locomotion on Extreme Sloped Terrains","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-10T17:11:13.461970Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2607.07830"},"observation_digest":"sha256:07cc27ee0d349339162d13fbc34444d6e290ca936d7e62b598fc8720e55fbc05","observation_id":"1864b3a0-c77c-4262-af4b-0169085e9922","resolution":{"observed_at":"2026-07-10T17:17:25.647597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-02T00:03:18.235978Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control.arXiv preprint arXiv:2505.22642,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15163","last_updated":"2026-07-16T16:08:27Z","snapshot_observed_at":"2026-08-09T18:18:04.147166Z","submitted_at":"2026-07-16T16:08:27Z","title":"Scaling Behavior Foundation Model for Humanoid Robots","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:18.235978Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2607.15163"},"observation_digest":"sha256:4c3fe98adc45235d14ca493bb002d0199d5ed97e8a691ec6ae896106a5ae9c8f","observation_id":"60a3ca50-70f6-42c6-bbec-3d53dd60d464","resolution":{"observed_at":"2026-08-02T00:03:18.235978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-05T00:17:16.510189Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for hu- manoid control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00820","last_updated":"2026-08-01T18:53:02Z","snapshot_observed_at":"2026-08-19T13:28:51.504984Z","submitted_at":"2026-08-01T18:53:02Z","title":"LooperMuscle: Fast and Stable Learning of Humanoid Whole-Body Tracking via Structured Mixture-of-Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T00:17:16.510189Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2608.00820"},"observation_digest":"sha256:d43d6b30ada5cee774909e5f94830bf7b2d23570e6d2a5361494179fe88546db","observation_id":"d1335718-9dcf-4d1a-90b1-8267695f4100","resolution":{"observed_at":"2026-08-05T00:17:16.510189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-16T00:22:49.641234Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12063","last_updated":"2026-08-12T13:48:56Z","snapshot_observed_at":"2026-08-20T23:10:03.710597Z","submitted_at":"2026-08-12T13:48:56Z","title":"Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:22:49.641234Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2608.12063"},"observation_digest":"sha256:0c4fca7bc278d3e0f30b5012694e4cf87157882d02863daa8e4ee4fedcb71633","observation_id":"55562711-9a6d-445e-a4e3-fe6f8c32405a","resolution":{"observed_at":"2026-08-16T00:22:49.641234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22642/citation-record","integrity":"/paper/2505.22642/integrity","json":"/paper/2505.22642/citation-record.json","paper":"/paper/2505.22642"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T13:08:33.100859Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:33.100859Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:bd2b384409df01842232ccd6a220a3011e37ae1e7aad7a57bb5aafcfc455ff72","observation_id":"f5493f3c-5de9-48ed-9fd1-5cb4aace6187","resolution":{"observed_at":"2026-08-07T13:08:33.100859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.02286","last_updated":"2017-07-10T18:52:12Z","snapshot_observed_at":"2026-08-14T20:48:59.676482Z","submitted_at":"2017-07-07T17:56:57Z","title":"Emergence of Locomotion Behaviours in Rich Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.02286","snapshot_observed_at":"2026-08-07T13:08:35.202704Z","title":"Emergence of locomotion behaviours in rich environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.202704Z"},"links":{"cited_paper":"/paper/1707.02286","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:f44dff3f07e4755912515d059888bd235cd142a30267b595eccc64d213f12233","observation_id":"1235b156-3a87-4be4-897f-70b61df95cce","resolution":{"observed_at":"2026-08-07T13:08:35.202704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-07T13:08:35.267219Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.267219Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:657c9dc627bf223a74dcc2b25e315bd2dc691c531d4fd2f521687f17c6b23a7b","observation_id":"7c7a0b44-19dc-4d93-b28a-a96577f12dfe","resolution":{"observed_at":"2026-08-07T13:08:35.267219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:35.668997Z","title":"Reinforcement learning with action sequence for data-efficient robot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.668997Z"},"links":{"citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:ab28aef977f515bec47ee875b5f55d6a7593784963aed18cd874449306004e75","observation_id":"0a71d1f0-90ec-4e8e-9066-b8e3a199f01d","resolution":{"observed_at":"2026-08-07T13:08:35.668997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-20T11:06:59.076112Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08844","snapshot_observed_at":"2026-08-07T13:08:35.735651Z","title":"Mujoco playground","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.735651Z"},"links":{"cited_paper":"/paper/2502.08844","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:eca772396a9df10ff5c476d39ab4f10cb9a127e50541ab3097481e64e461e4ff","observation_id":"2591ff17-1047-4344-9c37-9a96b3937f3d","resolution":{"observed_at":"2026-08-07T13:08:35.735651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17322","last_updated":"2025-02-24T16:55:27Z","snapshot_observed_at":"2026-08-20T03:05:30.613635Z","submitted_at":"2025-02-24T16:55:27Z","title":"TDMPBC: Self-Imitative Reinforcement Learning for Humanoid Robot Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17322","snapshot_observed_at":"2026-08-07T13:08:35.794224Z","title":"Tdmpbc: Self-imitative reinforcement learning for humanoid robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.794224Z"},"links":{"cited_paper":"/paper/2502.17322","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:a135803125b8da2b666eacfb3259780f33cdab5ae293e778e9bd9d26e2676c43","observation_id":"2102bee5-da03-4fa1-bbee-ee651aeb7cb4","resolution":{"observed_at":"2026-08-07T13:08:35.794224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:36.715600Z","title":"We provide learning curves on a 39 tasks from HumanoidBench (Sferrazza et al.,","venue":null,"work_id":"72206727-3739-4911-9c4c-acff9f438bc3","year":2000},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.903647Z"},"links":{"citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:877ccceb4f41809beb3cbe43dfee25c04dff559809023e7985a8a32b6d802c7d","observation_id":"ee650ec6-90b5-4333-a8f0-1fab41780d05","resolution":{"observed_at":"2026-08-07T13:08:36.885361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:36.458521Z","title":null,"venue":null,"work_id":"d4838879-ebfd-435f-9805-98d5f7f7f55f","year":2000},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.955548Z"},"links":{"citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:67f8922e632eeeb88c153f161899a0ccb703b5b6967121199fd19e677491a98c","observation_id":"b9cf310f-1e12-451c-acbb-52133d843f96","resolution":{"observed_at":"2026-08-07T13:08:36.572196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:36.362638Z","title":null,"venue":null,"work_id":"57c08e1e-f25e-4ad4-bcd1-798273a76954","year":2000},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:36.024521Z"},"links":{"citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:220aaf5f0d1f88f9d57d72b8c5a4a23352e6b189521a6a1908b958a70d4ab037","observation_id":"281762aa-177b-4eb7-86f8-0970e67f2d0e","resolution":{"observed_at":"2026-08-07T13:08:36.403039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-07T13:08:34.310435Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:34.310435Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:b7f7e6d0a0eee47c9cc504fb9444473a6b9deb22ee018d72f348c8f518f55163","observation_id":"aaba6a32-545c-4d45-9701-714c57c5d9bc","resolution":{"observed_at":"2026-08-07T13:08:34.310435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06542","last_updated":"2017-10-18T01:10:37Z","snapshot_observed_at":"2026-08-14T20:22:42.955584Z","submitted_at":"2017-10-18T01:10:37Z","title":"Asymmetric Actor Critic for Image-Based Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.06542","snapshot_observed_at":"2026-08-07T13:08:35.397838Z","title":"Asymmetric actor critic for image-based robot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.397838Z"},"links":{"cited_paper":"/paper/1710.06542","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:187217bb63e4665ca5d1972430f754ca676655e240869bbe6126115fe3d515e5","observation_id":"655e306e-0adf-46f3-bb6b-fb417a5520db","resolution":{"observed_at":"2026-08-07T13:08:35.397838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:08:35.543834Z","title":"Schulman, John, Wolski, Filip, Dhariwal, Prafulla, Radford, Alec, and Klimov, Oleg","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.543834Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:a64c72f19facae359738d29e2701fa4fef7f8980d0ce790022b85b8c3109fcfa","observation_id":"159c74a5-f58e-4a50-b4f0-f18c26aaff1d","resolution":{"observed_at":"2026-08-07T13:08:35.543834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:35.336024Z","title":"Nauman, Michal, Bortkiewicz, Michał, Miło ´s, Piotr, Trzcinski, Tomasz, Ostaszewski, Mateusz, and Cygan, Marek","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:35.336024Z"},"links":{"citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:391658cf504926a2da4fcc6ddfe711b1a0f08a5ecb1c358daffc6eef0fd3d59c","observation_id":"fa909e12-d20a-4823-a413-c388ac9228f6","resolution":{"observed_at":"2026-08-07T13:08:35.336024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T13:08:33.335906Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:33.335906Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:1e4c42c1f6db57ee7180669ad221782bc9d8e0e9b4b92716d2c12186674adf0e","observation_id":"070edc42-4871-40cc-b768-1ba36e41730a","resolution":{"observed_at":"2026-08-07T13:08:33.335906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-18T21:41:20.439669Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-07T13:08:33.176135Z","title":"Simplifying deep temporal difference learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:33.176135Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2505.22642"},"observation_digest":"sha256:f1b5235a3dba43e84a23bdab82a46dd552550b0cd2214ef7aeab0b5d8f5dfa78","observation_id":"3349cc25-8617-4799-b1a8-445fb5b43491","resolution":{"observed_at":"2026-08-07T13:08:33.176135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-20T08:41:27.503602Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 27 inbound Pith citation observations for arXiv:2505.22642."}