{"as_of":"2026-08-09T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a184c5aa646a4472acab800f13f2c521cf3266bbd1ff85bb63495d7ef8e7b549","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:30:30.203171Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.10423/citation-record","integrity":"/paper/2508.10423/integrity","json":"/paper/2508.10423/citation-record.json","paper":"/paper/2508.10423"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:31.110578Z","title":"HOVER: Versatile neural whole-body controller for humanoid robots,","venue":null,"work_id":"9530af5f-6648-4ee5-a47d-81c3135a1175","year":2025},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:26.580920Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:9e1651e9492369ede95116d5a7d02cd90b95bff41fdcaf71dfcdb1134e50c23d","observation_id":"77978675-00ca-4485-8090-d5e4154448f3","resolution":{"observed_at":"2026-08-05T20:30:31.115929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:31.093502Z","title":"Distributional policy gradient with distributional value function,","venue":null,"work_id":"45eae31c-6ecb-429f-88ff-854a40db98c0","year":2025},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:26.649591Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:a2512ae8d3da593795c934179591c3941eb68f1da03d9a0872725776342727e4","observation_id":"a7977c1f-a96e-4aa1-8d43-42653518fb8a","resolution":{"observed_at":"2026-08-05T20:30:31.098429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:31.076193Z","title":"Walk these ways: Tuning robot control for generalization with multiplicity of behavior,","venue":null,"work_id":"1b491f1d-0051-4531-b9d7-c7540018360e","year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:26.738893Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:caf0b5801424c5989673e2361dd23c0d55f57d5bc7146bc26d28006f35fd1c07","observation_id":"fe4023d4-eb8b-4e26-a495-6bf5f45352f6","resolution":{"observed_at":"2026-08-05T20:30:31.081654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:31.058474Z","title":"Dreamwaq: Learning robust quadrupedal locomotion with implicit terrain imagination via deep reinforcement learning,","venue":null,"work_id":"bddc313a-bd6d-447a-82ae-6ddd7f4a3bcb","year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:26.795999Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:de0c40f80b19480ac0f5f81c2fa68ed069f3bacc91090e2f8f3e295b35569c32","observation_id":"985e80ca-683d-4f4e-bf17-4fa640ee2d8b","resolution":{"observed_at":"2026-08-05T20:30:31.063656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:31.038415Z","title":"Biped dynamic walking using reinforcement learning,","venue":null,"work_id":"16e1b612-162d-4c19-988b-33cd214f499e","year":1997},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:26.847516Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:a4477129a56e1585864e2b0a22edb222f3da9f2bbf2c29364c2c2be186a3817c","observation_id":"7c9e068d-c598-4426-a027-ebc4b4664807","resolution":{"observed_at":"2026-08-05T20:30:31.045484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:31.015778Z","title":"Learning vision-based bipedal locomotion for challeng- ing terrain,","venue":null,"work_id":"4604eb7d-e820-4948-b0cb-00a1039ec9cd","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:26.945183Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:42f5cfd757c69ebcb7deb6c0dfa38af173f75e436b131af71add3a4a7456f38d","observation_id":"c396c3dd-413b-41e3-8349-abb58f1d29e6","resolution":{"observed_at":"2026-08-05T20:30:31.024478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.986106Z","title":"Motor anomaly detection for unmanned aerial vehicles using reinforcement learning,","venue":null,"work_id":"bdf7727a-aef3-400e-b382-7af092140246","year":2018},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:27.019704Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:b7893d67028dcdc9f097fde4fe4cb9ef516106e644da851830212d8a79909461","observation_id":"0ee0e265-40be-47bb-83e0-2ab770211a81","resolution":{"observed_at":"2026-08-05T20:30:30.993595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.965697Z","title":"Optimization-based control for dynamic legged robots,","venue":null,"work_id":"f018d5f7-311b-406f-bce4-6adc1b5a729e","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:27.111040Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:7c8a2f755d7b09cf7bea0f0ad06f42b1c0c7a8b5bc07220c53a565afdc3343a3","observation_id":"c919e3cd-cf6a-4840-a824-a510f9f64f00","resolution":{"observed_at":"2026-08-05T20:30:30.972502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:27.279483Z","title":"Versatile multicontact planning and control for legged loco-manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:27.279483Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:c94526575e3026c50b51efa479fc399451d8dbb34e6b77d2acf068da36e6dbb6","observation_id":"6b8305bd-9467-4bbb-a3b7-aca9f7e45c64","resolution":{"observed_at":"2026-08-05T20:30:27.279483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:27.398322Z","title":"Combining trajectory optimization, supervised machine learning, and model structure for mitigating the curse of dimensionality in the control of bipedal robots,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:27.398322Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:3c1ac70f13483f5199d3e2ad6bcd23fee36b1fecbf6270c947ab8681e5cf413c","observation_id":"34a470d6-66e6-426a-89b5-32f07bea1041","resolution":{"observed_at":"2026-08-05T20:30:27.398322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:27.567294Z","title":"Real-world humanoid locomotion with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:27.567294Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:b56443ab4781cab7558857c665d82c7c6a33d47192ac591051858abbc2e72abd","observation_id":"db20e7da-e494-42b6-9fa5-c72d95d9758c","resolution":{"observed_at":"2026-08-05T20:30:27.567294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:27.661298Z","title":"Not only rewards but also constraints: Applications on legged robot locomotion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:27.661298Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:63c3b4fe1a7f1d6bb150951c48ca8f1ede56bd567655bd3400da8d6edce39881","observation_id":"796fbf8d-98bb-459e-9f76-c6f243150cdc","resolution":{"observed_at":"2026-08-05T20:30:27.661298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:27.776297Z","title":"Diffusion policy: Visuomotor policy learning via ac- tion diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:27.776297Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:25c02f0819ec7546df1cf977360aa17ef6e223b53161da04e824ea9112ebe8c3","observation_id":"4c7eb530-016d-42ac-9dea-1a50c79ae653","resolution":{"observed_at":"2026-08-05T20:30:27.776297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.883830Z","title":"Learning-based legged locomotion: State of the art and future perspectives,","venue":null,"work_id":"d25d285a-0374-4bb8-aa8a-a16c12f98132","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:27.906470Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:33dfe130e9a4f9533b1703afaf09ba0a957e0a6517bc90340ce3b0d89e969dbf","observation_id":"deca8a10-e073-4628-953f-b38508e1f524","resolution":{"observed_at":"2026-08-05T20:30:30.888448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.864889Z","title":"Learning whole-body loco-manipulation for omni-directional task space pose tracking with a wheeled-quadrupedal-manipulator,","venue":null,"work_id":"584dddf3-a035-42e0-bd9b-c82a07d29eac","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:28.024263Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:5d5d733758c3f560cfe9d4dad76111f0392e29f8a9e1694081271a7cbccae84b","observation_id":"4becff69-4421-4263-b090-a7df74190e7a","resolution":{"observed_at":"2026-08-05T20:30:30.870338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.848287Z","title":"Learning agile soccer skills for a bipedal robot with deep reinforcement learning,","venue":null,"work_id":"ff588d5f-09e7-493e-b48c-23857bc97b3d","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:28.188458Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:969ee2471699fa72ef48253fe2be90c2d4a028b754717533a9f96139a94db30e","observation_id":"46252b04-f802-4a0a-88e7-4d329b2778cf","resolution":{"observed_at":"2026-08-05T20:30:30.853551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.832800Z","title":"Visual whole-body control for legged loco-manipulation,","venue":null,"work_id":"73834532-e8a6-4a42-8915-31f063d49046","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:28.307712Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:2c2617680a80f6f51e04c21263a2f69f345e78c96ba2bdc9ced303b39901e060","observation_id":"cd324124-89f6-4c88-95c0-b2eacca536ee","resolution":{"observed_at":"2026-08-05T20:30:30.837324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.815799Z","title":"Teleoperation of humanoid robots: A survey,","venue":null,"work_id":"57b65d6e-ceb7-4ae4-b856-1f47daf8e9fb","year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:28.432305Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:a206871201fdd07cc02a9c2e257ba1de97a6062242af05b5a47c22f21e23ea6d","observation_id":"bbbe3bc7-956b-48c5-b565-3979b034076e","resolution":{"observed_at":"2026-08-05T20:30:30.822545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.798098Z","title":"Sim-to-real robotic sketching using behavior cloning and reinforcement learning,","venue":null,"work_id":"e9511270-8c7b-439a-89a8-0f6d070fefc3","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:28.565492Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:dd554ae2b4664355ee09520070af427432f2c824d88e42bebba4eb66f0177e7e","observation_id":"b80c870b-c2c3-448b-bcea-1eaf90a43018","resolution":{"observed_at":"2026-08-05T20:30:30.805259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.781334Z","title":"A composite control strategy for quadruped robot by integrating reinforcement learning and model-based control,","venue":null,"work_id":"7466e5c2-b62b-4993-ad88-3cb8bd30de15","year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:28.728125Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:ab6c0f81366e9f8779da2503138f87ccd051c06c01a53e204b7611f622af15c6","observation_id":"a823bc1a-a4d1-4025-b640-27f1e7692334","resolution":{"observed_at":"2026-08-05T20:30:30.787160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.764550Z","title":"Towards human-level bimanual dexterous manipulation with reinforcement learning,","venue":null,"work_id":"eaac58dc-3937-4eb8-92c9-79134b24c51c","year":2022},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:28.852754Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:c9fbb72f2712648c78a468909fc3b9c985d814ae70bbdaa1e598716db2292cb7","observation_id":"edfb33f5-fe21-4ca7-b58f-03b78e567cab","resolution":{"observed_at":"2026-08-05T20:30:30.770371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.748333Z","title":"Monotonic value function factorisation for deep multi- agent reinforcement learning,","venue":null,"work_id":"97f6d8c5-79c8-47b4-aed4-e595b87f6681","year":2020},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.025150Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:3240cf49209c317e36241d181305207dbc726e9e67d15c21d18b08f975c74e70","observation_id":"3ea2df64-31e5-4e72-b1f1-1387ac8df8af","resolution":{"observed_at":"2026-08-05T20:30:30.753663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.731045Z","title":"Data efficient deep reinforcement learning with action-ranked temporal difference learning,","venue":null,"work_id":"3dfa762d-98bb-4680-9e29-92d721f150e7","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.167712Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:a00b1234188bea8cdd7f2cab4c22db8969cb9dc89e695db53f96b91d6190eb89","observation_id":"7c4e3bfc-c2bd-4179-8d5b-6abc35ee01bf","resolution":{"observed_at":"2026-08-05T20:30:30.736318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13759","last_updated":"2024-10-17T15:21:05Z","snapshot_observed_at":"2026-07-06T19:05:36.210400Z","submitted_at":"2024-08-25T08:04:20Z","title":"MASQ: Multi-Agent Reinforcement Learning for Single Quadruped Robot Locomotion","version":2},"cited_work":{"arxiv_id":"2408.13759","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13759","snapshot_observed_at":"2026-08-05T20:30:30.317522Z","title":"MASQ: Multi-Agent Reinforcement Learning for Single Quadruped Robot Locomotion","venue":"cs.RO","work_id":"f5baeae8-d223-4fa1-a5da-4d81133790ab","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.314929Z"},"links":{"cited_paper":"/paper/2408.13759","citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:db2cafa0cde3a3705ea95c860d56a3ddc114022ff9357a8b7f39cc226fe6cd90","observation_id":"578cc9d9-97ad-47af-97ce-8f23987a7746","resolution":{"observed_at":"2026-08-05T20:30:30.324419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.714333Z","title":"Expressive whole-body control for humanoid robots,","venue":null,"work_id":"70bbbbfd-1424-4b4c-ab66-5865743db97f","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.389280Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:c798cb067cb807645ab9d471f6198a6b069b30b02bcad590f825a3a8e35ceedb","observation_id":"e95550f3-e507-4b68-b817-530007f7ea10","resolution":{"observed_at":"2026-08-05T20:30:30.719256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.691326Z","title":"Mobile-television: Predictive motion priors for hu- manoid whole-body control,","venue":null,"work_id":"60093ab3-a1e0-4b80-8319-16dd5abd6b16","year":2025},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.460025Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:24cf9e05ea9395ba5e4491cd822cc34bff0585be551c377d901bab570381f384","observation_id":"33c3c267-bcbf-482c-ac3e-13ba11571aa4","resolution":{"observed_at":"2026-08-05T20:30:30.697923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.671821Z","title":"Wococo: Learning whole-body humanoid control with sequential contacts,","venue":null,"work_id":"a83da7b1-a8a1-4e7d-8fed-6926838351f9","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.550583Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:f8f19b9fb6c141a50d20c096373030e0ae42f11b212c578450b6ebda806cf0fa","observation_id":"c211d33c-216c-4a26-977a-e24b062e3fac","resolution":{"observed_at":"2026-08-05T20:30:30.677407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.653970Z","title":"Learning human-to-humanoid real-time whole-body teleoperation,","venue":null,"work_id":"4013e0d1-9ef1-4a42-8b27-8a2179475728","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.637244Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:d7a733670d2364e23248820659eedb0e517a62c088ebd8d1bd55eb42627b2b4c","observation_id":"58e79e0c-8b28-4c1c-a432-294f41703d36","resolution":{"observed_at":"2026-08-05T20:30:30.659984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.635180Z","title":"Humanplus: Humanoid shadowing and imitation from humans,","venue":null,"work_id":"70fcf648-1c7d-45c8-8ac1-7174cb6f701e","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.738800Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:50ceee16e864c4dacea566a7b73e3279ec1eff942ec9c0c6f3b53e3230e566e2","observation_id":"a15a4892-8a69-4a42-8efe-d4763eda588c","resolution":{"observed_at":"2026-08-05T20:30:30.640690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.619012Z","title":"Okami: Teaching humanoid robots manipulation skills through single video imitation,","venue":null,"work_id":"4911d263-0bd8-4206-881e-cf70120c838d","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.880304Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:9e78f8bf3dfd0ad0ef20af62866cac28a824da93a8f2f9f3d13bb4e1fea3e39d","observation_id":"2e493578-05f6-4ac4-85d4-c5190a5de706","resolution":{"observed_at":"2026-08-05T20:30:30.624099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.599498Z","title":"OmniH2O: Universal and dexterous human-to- humanoid whole-body teleoperation and learning,","venue":null,"work_id":"7cd4e4f4-fe17-4ee1-a171-066f52f8a183","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:29.953977Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:500687438cc1cb3554f85b19523462b2bb3e7abbda91d6ad543ace8c441b6357","observation_id":"4883b107-7c53-4dc5-b71c-e1776702102c","resolution":{"observed_at":"2026-08-05T20:30:30.606108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.035721Z","title":"Perpetual humanoid control for real-time simulated avatars,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.035721Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:703ed3136eda454a8ab64aa7f0eed161efff3fdcac7333cb27a583e48f3ee035","observation_id":"bd3bae68-5775-4fe0-afac-cf3684981887","resolution":{"observed_at":"2026-08-05T20:30:30.035721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.571468Z","title":"Robust and versatile bipedal jumping control through reinforcement learning,","venue":null,"work_id":"808ed4c7-df21-4fec-97e9-14917d426d9b","year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.113842Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:88c139a4bb582b51b8ce99a75ab9af3fdba4cc2161484f6d4bcf22eeea32a7ad","observation_id":"12984db4-c843-4ea9-8300-f16881223180","resolution":{"observed_at":"2026-08-05T20:30:30.576370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.555139Z","title":"Feedback control for cassie with deep reinforcement learning,","venue":null,"work_id":"13f6ae78-5dff-4aa7-8e0f-00c887b1e396","year":2018},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.119322Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:aaab0a60a9d2c36d391cc101736904c24f6213e280bb1cabe0e2675136e67cf1","observation_id":"d69fa8f1-b5db-4d51-9298-7c8e8479ace1","resolution":{"observed_at":"2026-08-05T20:30:30.560029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.536277Z","title":"Sim-to-real learning of all common bipedal gaits via periodic reward composition,","venue":null,"work_id":"5938abea-7eef-4179-b5c0-3e00ddaea2dc","year":2021},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.125124Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:04f26202830cb415f76589eb8bf96435a90ab56d2e50ffedddc8d50bea3c3152","observation_id":"069b8b47-abbf-4977-ae2a-80882c267943","resolution":{"observed_at":"2026-08-05T20:30:30.543052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.517091Z","title":"Amp: Adversarial motion priors for stylized physics-based character control,","venue":null,"work_id":"59c2e8b1-6f13-48d9-810c-da439c30f1a3","year":2021},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.131020Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:8d39fc7cdf1505edd3003c6c09d911a86392640874dd013b8f1e66bafdfdf6e9","observation_id":"a0efdb97-5646-43d2-8fc7-8d0310bd2377","resolution":{"observed_at":"2026-08-05T20:30:30.523071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.494752Z","title":"Advancing humanoid locomotion: Mastering challenging terrains with denoising world model learning,","venue":null,"work_id":"c7d7c218-e7c9-486a-8758-5ab61610daad","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.136272Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:297eadb80a2600c176e6be5f902e5647a8a45e6b9ad45074decccd4bb78b86c6","observation_id":"d23ade03-2480-4779-9685-53f1e942aa9c","resolution":{"observed_at":"2026-08-05T20:30:30.501610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.473052Z","title":"Reinforcement learning for swarm robotics: An overview of applications, algorithms and simulators,","venue":null,"work_id":"15fa6f4e-87aa-41d3-acb7-c7c0c27e0330","year":2023},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.142441Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:cc2af252a2e739647f67e66d5666cee4cc8c8d0b97c815415e56c15264b8f184","observation_id":"b35ec145-653e-4fa0-8472-c6763c42a85b","resolution":{"observed_at":"2026-08-05T20:30:30.480618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.453909Z","title":"Smarts: An open-source scalable multi-agent rl training school for autonomous driving,","venue":null,"work_id":"ae4dda2d-c868-4e85-9883-679dc590983b","year":2021},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.149327Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:7e23707e155b6bf8bc4a120e7eb20c178177b7a40450c06961c8e1d3d12111d1","observation_id":"5d7d7353-b146-4285-a9bf-f050193c4721","resolution":{"observed_at":"2026-08-05T20:30:30.460116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.435793Z","title":"Optimal tethered-uav deployment in a2g communication networks: Multi-agent q-learning approach,","venue":null,"work_id":"83660dd2-cf5c-405b-b28e-da03f6cd54e7","year":2022},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.155078Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:9d1de78b4a2490c696ed5bfa5097061c63271debefd88221c940b3cc728b9efe","observation_id":"68817526-329f-484e-bd46-8fcd099f7438","resolution":{"observed_at":"2026-08-05T20:30:30.441939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13750","last_updated":"2024-10-27T09:09:58Z","snapshot_observed_at":"2026-08-01T22:31:05.698611Z","submitted_at":"2024-08-25T07:32:58Z","title":"Multi-Agent Target Assignment and Path Finding for Intelligent Warehouse: A Cooperative Multi-Agent Deep Reinforcement Learning Perspective","version":3},"cited_work":{"arxiv_id":"2408.13750","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13750","snapshot_observed_at":"2026-08-05T20:30:30.285392Z","title":"Multi-Agent Target Assignment and Path Finding for Intelligent Warehouse: A Cooperative Multi-Agent Deep Reinforcement Learning Perspective","venue":"cs.AI","work_id":"631c6a30-710f-4709-b925-e9f8cfeff03c","year":2024},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.161628Z"},"links":{"cited_paper":"/paper/2408.13750","citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:03d86677fa8009506f23ede5f475bd4039ff1895dcadefc1ee0b4c67a8b8b455","observation_id":"14e78a57-7704-4df5-badf-01df49855e08","resolution":{"observed_at":"2026-08-05T20:30:30.294226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.169226Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.169226Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:57f3e2cf26de961d7fcde3e0cfad0e9357db628ecbc80c727769697aa11599cf","observation_id":"d1d5d281-6f41-495d-b014-22f98124cffd","resolution":{"observed_at":"2026-08-05T20:30:30.169226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T20:30:30.174196Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.174196Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:a982c6fb3e5239a38512c5fc5ecaabf7d23a42d8980bcd587308edb5f78193e5","observation_id":"b0364da9-194a-4e12-940b-d733d99dcb95","resolution":{"observed_at":"2026-08-05T20:30:30.174196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.395307Z","title":"Pomdps for robotic tasks with mixed observability","venue":null,"work_id":"bbff9bf2-527c-404a-afff-6de54de6f2e4","year":2009},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.180731Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:4851ea1dfd27b59db019d88a418405822776da166d76cbd65c4871c47416d5c7","observation_id":"cbe5f669-2f7d-4588-8e75-28bf798b0af0","resolution":{"observed_at":"2026-08-05T20:30:30.405800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.375831Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games,","venue":null,"work_id":"97993f22-862d-4ca0-8f16-9112ae78a722","year":2022},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.187585Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:0b5bd5dbf8ce6fd0be2134eacc368631c672b9c4a7c29ee7df8c4c24d80952f9","observation_id":"29ca6b55-c894-4014-b506-112b19d6c1eb","resolution":{"observed_at":"2026-08-05T20:30:30.381407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.356801Z","title":"Stabilising experience replay for deep multi-agent rein- forcement learning,","venue":null,"work_id":"fc6b3e54-b09d-4fa8-8706-f6b829fdb5e8","year":2017},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.193423Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:a0c5cc61ca8c84c93c9aecff6e637a2cb9e9e87b9b10b1db4b4f8e6c8e4acc65","observation_id":"9dd80522-a6bc-4869-8701-4b789a0946cb","resolution":{"observed_at":"2026-08-05T20:30:30.362079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:30:30.338524Z","title":"Isaac gym: High performance gpu based physics simulation for robot learning,","venue":null,"work_id":"ec1faa7d-e257-4943-8592-ae97153defaf","year":2021},"citing_paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:30:30.203171Z"},"links":{"citing_paper":"/paper/2508.10423"},"observation_digest":"sha256:61d28874717437cf7e0d9071358898e4b9ba91bafdbdb563c4f2a39fdf004d9f","observation_id":"90a0c123-743d-4d53-b95a-8c19013752fc","resolution":{"observed_at":"2026-08-05T20:30:30.344647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10423","last_updated":"2025-08-14T07:54:31Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T20:30:25.670240Z","submitted_at":"2025-08-14T07:54:31Z","title":"MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2508.10423."}