{"as_of":"2026-08-07T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8eea1f9698ef6a7e578cfca03b5554634caa3e1be06ba373775e12dc690e1563","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:04:22.954743Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:48:14.710291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20036","snapshot_observed_at":"2026-08-03T08:48:14.710291Z","title":"Hierar- chical reinforcement learning and value optimization for challenging quadruped locomotion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15995","last_updated":"2026-07-13T08:09:40Z","snapshot_observed_at":"2026-08-04T07:08:46.699349Z","submitted_at":"2026-01-22T14:16:12Z","title":"PUMA: Perception-driven Unified Foothold Prior for Mobility Augmented Quadruped Parkour","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T08:48:14.710291Z"},"links":{"cited_paper":"/paper/2506.20036","citing_paper":"/paper/2601.15995"},"observation_digest":"sha256:e899f6b1f2b75132e8301e8b391acb13a205307a4690d036aef52aa08db7df63","observation_id":"1f1692dc-f9fe-4483-9ca6-3963e6a63028","resolution":{"observed_at":"2026-08-03T08:48:14.710291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20036/citation-record","integrity":"/paper/2506.20036/integrity","json":"/paper/2506.20036/citation-record.json","paper":"/paper/2506.20036"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.11103","last_updated":"2019-06-19T17:40:58Z","snapshot_observed_at":"2026-07-06T07:23:52.401834Z","submitted_at":"2018-12-26T10:07:13Z","title":"Learning to Walk via Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.11103","snapshot_observed_at":"2026-08-06T23:04:22.748967Z","title":"Learning to walk via deep reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.748967Z"},"links":{"cited_paper":"/paper/1812.11103","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:cccdb4028dc8d8eee5e9afa9ab138b5799a06e610828e41f945c852f792ca00f","observation_id":"333d578b-a6ab-4fbd-ba2e-17357ea098cb","resolution":{"observed_at":"2026-08-06T23:04:22.748967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08550","last_updated":"2020-11-03T05:46:51Z","snapshot_observed_at":"2026-08-07T08:54:28.901497Z","submitted_at":"2020-02-20T03:36:39Z","title":"Learning to Walk in the Real World with Minimal Human Effort","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08550","snapshot_observed_at":"2026-08-06T23:04:22.760351Z","title":"Learning to walk in the real world with minimal human effort,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.760351Z"},"links":{"cited_paper":"/paper/2002.08550","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:a0f3b4bf18c927c1c718e177666856afd3a1ab543465d7eac71662af79ce73ee","observation_id":"daa5474c-f09e-4b37-b8b3-29fe1abf5c44","resolution":{"observed_at":"2026-08-06T23:04:22.760351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.766963Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.766963Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:217cd02e6c1e13111c521ead1bddcbbc1949c2acfaba9377f3a84ff45c024add","observation_id":"e9d06fc2-df31-45fa-be57-29e1d76e8880","resolution":{"observed_at":"2026-08-06T23:04:22.766963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:25.008620Z","title":"Learning fast adapta- tion with meta strategy optimization,","venue":null,"work_id":"3f1accae-b50f-461a-b02c-246e4d122e61","year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.785144Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:3a6976d4b8d957aebfe7aa7191504a4e03b554d84a277a74c0ccd534ee93cc27","observation_id":"f0bfe37c-3866-452e-8475-47e3d2a54b7e","resolution":{"observed_at":"2026-08-06T23:04:25.169003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.799138Z","title":"Legged locomotion in challenging terrains using egocentric vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.799138Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:9775e554884924865ff80f89aea6f4f40c1d78b9851265248a4bf76e2ae6621a","observation_id":"0a0c4285-9394-447e-8d87-277170ab32fd","resolution":{"observed_at":"2026-08-06T23:04:22.799138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03996","last_updated":"2022-05-26T04:39:01Z","snapshot_observed_at":"2026-08-04T16:46:26.087930Z","submitted_at":"2021-07-08T17:41:55Z","title":"Learning Vision-Guided Quadrupedal Locomotion End-to-End with Cross-Modal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03996","snapshot_observed_at":"2026-08-06T23:04:22.808203Z","title":"Learning vision-guided quadrupedal locomotion end-to-end with cross-modal transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.808203Z"},"links":{"cited_paper":"/paper/2107.03996","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:c18ad910ce6f8dee3e31865c6fbec9986d4b35960e7f06765124f93dae51225b","observation_id":"fd0a9e0c-9437-4f0f-8f90-e1d92ea97ea1","resolution":{"observed_at":"2026-08-06T23:04:22.808203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:24.789488Z","title":"Policies modulating trajectory generators,","venue":null,"work_id":"b960f831-53e7-40b0-9ecb-ab106918fe3b","year":2018},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.818994Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:1bc795cb873c340ac83c9d63be50e45cde4c13cdfc48d0495823a88c88dd0978","observation_id":"b0f45bd1-3c9a-43e8-872a-7ac3102dc1b4","resolution":{"observed_at":"2026-08-06T23:04:24.857451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.834747Z","title":"Learning quadrupedal locomotion over challenging terrain,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.834747Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:87f4e3a2045f6665b822b6397fc4753a57d71242fda5fd7fb18f1baff1474595","observation_id":"8c895a94-052b-4928-9aad-6c3a901fe411","resolution":{"observed_at":"2026-08-06T23:04:22.834747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:24.561778Z","title":"Visual-locomotion: Learning to walk on complex terrains with vision,","venue":null,"work_id":"f7515d62-a8ca-4245-8a00-aa9f17d742b2","year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.844742Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:874148ebbbfc3caaf43f17065f558cd4fb125ddc75fe537bf4f176c8ac1d848a","observation_id":"0397cb74-f44f-46c3-8611-9b99acfbc0fa","resolution":{"observed_at":"2026-08-06T23:04:24.665324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.05513","last_updated":"2020-11-11T02:10:48Z","snapshot_observed_at":"2026-07-06T10:13:32.281474Z","submitted_at":"2020-11-11T02:10:48Z","title":"Zero-Shot Terrain Generalization for Visual Locomotion Policies","version":1},"cited_work":{"arxiv_id":"2011.05513","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.05513","snapshot_observed_at":"2026-08-06T23:04:23.168814Z","title":"Zero-Shot Terrain Generalization for Visual Locomotion Policies","venue":"cs.RO","work_id":"45140358-5101-4f78-9fff-0304ef109a9c","year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.852843Z"},"links":{"cited_paper":"/paper/2011.05513","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:76ce979d0e5ca802f1e7daff46097b4b18a8675fe52ccd6c904fe00e746cb701","observation_id":"7b72015c-7d05-470d-a77f-4deb24715e94","resolution":{"observed_at":"2026-08-06T23:04:23.198739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:24.270073Z","title":"Learning agile locomotion skills with a mentor,","venue":null,"work_id":"a8db9d41-4760-4159-b436-8afae2575533","year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.860434Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:c4068f852d70d508f41819b3c59b93393804829c6902a59ccdc27d534ffbf397","observation_id":"c4170442-e519-4122-bfae-8d29ba4a321f","resolution":{"observed_at":"2026-08-06T23:04:24.411864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00784","last_updated":"2020-07-21T00:59:24Z","snapshot_observed_at":"2026-07-06T09:09:18.723029Z","submitted_at":"2020-04-02T02:56:16Z","title":"Learning Agile Robotic Locomotion Skills by Imitating Animals","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00784","snapshot_observed_at":"2026-08-06T23:04:22.865462Z","title":"Learning agile robotic locomotion skills by imitating animals,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.865462Z"},"links":{"cited_paper":"/paper/2004.00784","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:4b792d015d9a31524a6fb5e144e8d0a259de2b94336329671c7b74e16f22e832","observation_id":"41f936ba-2ed3-4416-b529-93719e526df9","resolution":{"observed_at":"2026-08-06T23:04:22.865462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:24.044738Z","title":"Real-time trajectory adaptation for quadrupedal locomotion using deep reinforcement learning,","venue":null,"work_id":"eb480c4c-e80b-456f-aa6f-65335e855c0e","year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.871044Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:b960b3809145f9e4d744da6f01ba3a198b3911aa861e23b4cff94e6a34935663","observation_id":"490190c5-0737-4616-9197-d5aa1f5a7118","resolution":{"observed_at":"2026-08-06T23:04:24.154395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.876052Z","title":"Guided constrained policy optimization for dynamic quadrupedal robot locomotion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.876052Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:990aaf844f6fcfc775190e171e705362b338869eddc419dbb7b5dd9334cfebb1","observation_id":"73665f83-3395-4377-966d-2764f7468065","resolution":{"observed_at":"2026-08-06T23:04:22.876052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.880917Z","title":"Deepgait: Planning and control of quadrupedal gaits using deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.880917Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:62020d3d154cf07b65a23a8b6f91930668591c595be2074d425a382adf3716ba","observation_id":"fac83b42-093f-4e70-9f79-15178228f663","resolution":{"observed_at":"2026-08-06T23:04:22.880917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:23.674328Z","title":"Allsteps: Curriculum-driven learning of stepping stone skills,","venue":null,"work_id":"4eac8f61-f13d-4f6f-aa4f-8265a55b8e07","year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.887703Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:840f512cfa3eefa727e6d7c67335d4bb71ed238d12295af5a3ca12691bdcaf27","observation_id":"659f3e14-aedc-4fec-a466-17373a2407d6","resolution":{"observed_at":"2026-08-06T23:04:23.744751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:23.562271Z","title":"Learning gen- eralizable locomotion skills with hierarchical reinforcement learning,","venue":null,"work_id":"8b78910d-cfad-4d08-b110-950ed72f2b30","year":2020},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.892820Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:d0885c1081a33ecd04c8c5208f88b3b287329292ebee1648f7d064ef75b1a34f","observation_id":"2dcdbbc2-1653-43c6-90c6-bc843fb53338","resolution":{"observed_at":"2026-08-06T23:04:23.593917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:23.475748Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation,","venue":null,"work_id":"a48e9190-c221-4a0d-a277-33bf5e6b82b0","year":2018},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.898822Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:f9736b916a7080ac48695710f8e16be1790318db24d821242a0e9798eafc84d3","observation_id":"a7aaf8dc-b9aa-4de5-86ba-380b572d6619","resolution":{"observed_at":"2026-08-06T23:04:23.519591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:04:22.904750Z","title":"Hierarchical plan- ning through goal-conditioned offline reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.904750Z"},"links":{"citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:a607a2be8f677f96db378f972b5423717a78414a8cdef4dcc7caf74611463444","observation_id":"c88ac69d-0779-4e24-b38a-7f1f285a8fd8","resolution":{"observed_at":"2026-08-06T23:04:22.904750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:04:22.917740Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.917740Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:37639c8358d3ec2706fbc29dc64ecf2dfb0afb0f81598d9945e2804c3f3b56ed","observation_id":"f58c29f1-7e1f-4e03-8604-376fb57eed20","resolution":{"observed_at":"2026-08-06T23:04:22.917740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T23:04:22.923351Z","title":"High- dimensional continuous control using generalized advantage estima- tion,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.923351Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:0c11d6724d35e368c34f5a534e8053018c2bf78af7b370c35bbb1c7ea92ab884","observation_id":"11e69b46-db17-4390-b2c5-2987336495f1","resolution":{"observed_at":"2026-08-06T23:04:22.923351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T23:04:22.954743Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:04:22.954743Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2506.20036"},"observation_digest":"sha256:2ba671d1766cf780486ff3a1c6acb55341f1783bcb0626257eccdc7d548ecf82","observation_id":"ab0e3be2-9288-4487-aa34-9c158f627305","resolution":{"observed_at":"2026-08-06T23:04:22.954743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20036","last_updated":"2025-06-24T22:19:15Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T22:55:45.511957Z","submitted_at":"2025-06-24T22:19:15Z","title":"Hierarchical Reinforcement Learning and Value Optimization for Challenging Quadruped Locomotion"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2506.20036."}