{"as_of":"2026-08-19T19:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:492a30a99cc71e198018dbc46699c5ca4c88e655acaffddac61708d55bf0c0f1","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:19:08.987872Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.10759/citation-record","integrity":"/paper/2510.10759/integrity","json":"/paper/2510.10759/citation-record.json","paper":"/paper/2510.10759"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:06.691845Z","title":"Embodied AI beyond embodied cognition and enactivism.Philosophies, 4(3):39, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:06.691845Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:288017ac3bf3806bba9db98d2a46650eae7be88b01eca8c8c19163ad724550c9","observation_id":"d6d19a85-e8e8-4eb2-aaa0-43b4679f0773","resolution":{"observed_at":"2026-08-04T10:19:06.691845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:06.735577Z","title":"MIT press, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:06.735577Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:2e45ab66bddf81ad87bc8ac9a8e1ab041def2d843b9bda9c19520e95c7d7a1b5","observation_id":"2bc32b72-2187-4f4a-95e1-d8bf99e4d856","resolution":{"observed_at":"2026-08-04T10:19:06.735577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:06.801655Z","title":"Reinforcement learning.Journal of Cognitive Neuroscience, 11(1):126– 134, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:06.801655Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:2d5fb621da8911c6f70efd50ae533f472124ee12f154c4e210c18ec6e31a20fa","observation_id":"7d66c528-ba7a-40b7-ba78-98d70205e8d0","resolution":{"observed_at":"2026-08-04T10:19:06.801655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:06.855710Z","title":"Anymal parkour: Learning agile navigation for quadrupedal robots.Science Robotics, 9(88):eadi7566, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:06.855710Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:7f7ab5ffa59ac98b2a091710e72e4e9c956aa689e45124ae7ee4dc21a3b1f783","observation_id":"a42578fb-e2ff-4fc9-a92d-87cd21fa0766","resolution":{"observed_at":"2026-08-04T10:19:06.855710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:06.893356Z","title":"Rapid locomotion via reinforcement learning.The International Journal of Robotics Research, 43(4):572–587, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:06.893356Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:8672565b1fab7c2844ff14491f4a147e27f5cb62f9e8c07ba95b32372fce8b0c","observation_id":"9a1e8029-d177-4547-9ee5-72f60910a0d1","resolution":{"observed_at":"2026-08-04T10:19:06.893356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:06.965684Z","title":"Not only rewards but also constraints: Applications on legged robot locomotion.IEEE Trans- actions on Robotics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:06.965684Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:a0d73582cc3006dfe0e5c3bd0070b3ef01e4e1dc5c277f5fb863e0fa4e47c9c2","observation_id":"d3f4db10-b507-470b-9efe-7b09eba6bcd5","resolution":{"observed_at":"2026-08-04T10:19:06.965684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.034988Z","title":"Demon- strating a walk in the park: Learning to walk in 20 min- utes with model-free reinforcement learning.Robotics: Science and Systems (RSS) Demo, 2(3):4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.034988Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:52b9f0f912bd081a260fc77fcc3081a2ad9493f24f7fc630deaaab9422fa1f44","observation_id":"abe7357b-34d3-47bf-a7cd-941e2e9286ae","resolution":{"observed_at":"2026-08-04T10:19:07.034988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.074531Z","title":"Explor- ing constrained reinforcement learning algorithms for quadrupedal locomotion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.074531Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:592d7ee4f48b9807fa56260def27b3ccf3f02f05a7779feea24a68e4624e87ce","observation_id":"d5d8e089-8fa3-41d0-b096-a535dbae770b","resolution":{"observed_at":"2026-08-04T10:19:07.074531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.161324Z","title":"A review of safe reinforcement learning: Methods, theories and applications.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.161324Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:d8b7194012ed38baf33fb830154b0e86aab67b553d2f489418fdb44e9043c6c8","observation_id":"08391986-fcf8-4bfd-afdb-e44f8b90ab12","resolution":{"observed_at":"2026-08-04T10:19:07.161324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.238346Z","title":"Barrier function-based safe reinforce- ment learning for emergency control of power systems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.238346Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:57033b22250bbc4356bccc69bc439703048bf34f5a712daecd704d2bd8faf3ca","observation_id":"6dc6c1e0-5847-4041-a25c-4e00a85c6bf0","resolution":{"observed_at":"2026-08-04T10:19:07.238346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.280381Z","title":"Hyperparameters in reinforcement learning and how to tune them","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.280381Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:13bf90d177941dcd6a8fab78fa870332f2769e331887314ed72b4abdbcc75346","observation_id":"f3c8d702-8a34-46c6-8148-4eee8be26ce0","resolution":{"observed_at":"2026-08-04T10:19:07.280381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.372579Z","title":"Safe policies for reinforce- ment learning via primal-dual methods.IEEE Transac- tions on Automatic Control, 68(3):1321–1336, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.372579Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:549abce2a13228ce2bc795c929a504bd3053e383d275fc0d1ffa369c3af78ffc","observation_id":"49dea45d-3c52-42fa-a41b-97348226d650","resolution":{"observed_at":"2026-08-04T10:19:07.372579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.433107Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.433107Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:7759bc14c47cbc7722f6a9b92c703e4d73bdf5e1ae246b3e521096283c2cea34","observation_id":"ce697bad-56c4-4d26-8c2e-37f0b64bfb1f","resolution":{"observed_at":"2026-08-04T10:19:07.433107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.514688Z","title":"Trust region-based safe distributional reinforcement learning for multiple constraints.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.514688Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:3110cafcda5aa15c42021d6c888987dc3a681f82128127ad1ccdcfbbf5ba57d4","observation_id":"69ebfb6f-7ab4-4afa-8636-c7e436aaa597","resolution":{"observed_at":"2026-08-04T10:19:07.514688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.605441Z","title":"Ipo: Interior- point policy optimization under constraints","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.605441Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:424ab0c9ca26a9ca3e0a3e12b0cc9a138514816d73f8b7034c6cbc8ef9596128","observation_id":"1232b93f-135e-47e0-ac5f-5032167394ea","resolution":{"observed_at":"2026-08-04T10:19:07.605441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.695163Z","title":"Crpo: A new approach for safe reinforcement learning with convergence guarantee","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.695163Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:78008255df77d585b4d58857a4729614e3149f928573fd4af7e25103a343ce88","observation_id":"bdcc797f-e60e-42e2-bfd2-a66232e29987","resolution":{"observed_at":"2026-08-04T10:19:07.695163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.738071Z","title":"Risk-averse model uncertainty for distributionally robust safe rein- forcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.738071Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:41a4a9951bf1e6dfa828ad42c94cb8ff8c4caadd34841387395d5f90f36e7f9f","observation_id":"3a053759-d171-4c10-8a5e-f5eb17a723c8","resolution":{"observed_at":"2026-08-04T10:19:07.738071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04228","last_updated":"2025-01-09T01:35:56Z","snapshot_observed_at":"2026-08-17T20:03:07.657868Z","submitted_at":"2025-01-08T01:59:47Z","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04228","snapshot_observed_at":"2026-08-04T10:19:07.791607Z","title":"Constraints as rewards: Reinforcement learning for robots without reward functions.arXiv preprint arXiv:2501.04228, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.791607Z"},"links":{"cited_paper":"/paper/2501.04228","citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:b18984fac0c984bcb50009d053ccb4b71f6cf145df68e6456e56b6fa712a21a5","observation_id":"dbf013d3-9484-45d5-972c-d17b4d67a52c","resolution":{"observed_at":"2026-08-04T10:19:07.791607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:07.893507Z","title":"Safe and balanced: A framework for constrained multi-objective reinforcement learning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.893507Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:eaf63182068b22289a469f6e413de7fb2eacd8cb87ec8cd27093d7ebaa55113c","observation_id":"d6102412-02ad-4729-9285-5217b0259029","resolution":{"observed_at":"2026-08-04T10:19:07.893507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05836","last_updated":"2025-03-06T14:33:49Z","snapshot_observed_at":"2026-08-16T12:52:29.143833Z","submitted_at":"2025-03-06T14:33:49Z","title":"Safe Distributed Learning-Enhanced Predictive Control for Multiple Quadrupedal Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05836","snapshot_observed_at":"2026-08-04T10:19:07.963724Z","title":"Safe distributed learning-enhanced predictive con- trol for multiple quadrupedal robots.arXiv preprint arXiv:2503.05836, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:07.963724Z"},"links":{"cited_paper":"/paper/2503.05836","citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:58762e465553c5b30662f5044c1eef2ce3b807c6e38a345fbc9b5920ae724d92","observation_id":"63585a4e-aaaa-4a6d-a1a1-bf988c8663c0","resolution":{"observed_at":"2026-08-04T10:19:07.963724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.002067Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.002067Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:c2dfde2bc187db56e8329b1d85d0391f0c8c41ee46363c37661da28f360368c4","observation_id":"4b911480-d93f-488e-b401-676c696e778b","resolution":{"observed_at":"2026-08-04T10:19:08.002067Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.065725Z","title":"Hybrid reward architecture for reinforcement learning.Advances in Neural Information Processing Systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.065725Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:e4012968775bb026d09682296c3812376baca5167abe02b5856bf71f54dc5fc0","observation_id":"f4ed534f-1b0b-4449-b7ff-f0d82c303157","resolution":{"observed_at":"2026-08-04T10:19:08.065725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.131052Z","title":"The general problem of the stability of motion.International Journal of Control, 55(3):531–534, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.131052Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:9fd79e788d7f238ed5fbd5f8ae96955c788c8281f0dba0cd0b066165009a6258","observation_id":"a8e23f64-ff53-4abf-a0f0-3d5c5b64aedb","resolution":{"observed_at":"2026-08-04T10:19:08.131052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.193016Z","title":"Adaptive auxiliary task weighting for reinforce- ment learning.Advances in Neural Information Process- ing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.193016Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:91e35c3fcaaf4bef95091f0dc1057828d163e00d467c7680fe3333f4de1c10b1","observation_id":"a4fd2b0b-eff0-427f-a1df-17bb8c43a054","resolution":{"observed_at":"2026-08-04T10:19:08.193016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T10:19:08.279170Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.279170Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:bd9e8524ab04cb10ecef0f5289b4be112f0d47f1a2cb7974d31f038011e4176c","observation_id":"ba03d7c6-4de1-4571-9309-a35cd140d429","resolution":{"observed_at":"2026-08-04T10:19:08.279170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.341187Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.341187Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:430f52ba2d6d8e48078eeef58c354eac42f91f7fee2f761827840c88f9a8b1f3","observation_id":"a294bcf6-a5b5-46d4-afd4-d708bb09d88a","resolution":{"observed_at":"2026-08-04T10:19:08.341187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.413168Z","title":"Growable and interpretable neural control with online continual learning for autonomous lifelong locomotion learning machines.The International Journal of Robotics Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.413168Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:d563072a95dda09f452c3981c102c585b186aec6ba4e3d0ac1d9d9aae2dfc07c","observation_id":"c25884f4-0e1e-46af-a48a-7cd3fab3858a","resolution":{"observed_at":"2026-08-04T10:19:08.413168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.499036Z","title":"Consider the Lyapunov candidate function (R 1t), which measures the system’s deviation from equilibrium: V(R 1t) = 0.5R2 1t","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.499036Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:7bbe6ee321227e0a59a02a912cc9127c32877e74278bd6888e7b45164c0f52d7","observation_id":"79f9820a-1b51-45a8-acf7-c92bf9124454","resolution":{"observed_at":"2026-08-04T10:19:08.499036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.551820Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.551820Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:884ca341806dd066f5ff28d66c17c7b8f93007e4a2f533712779afd2c4c6540c","observation_id":"42cf640c-9756-457e-8358-f31a41444f19","resolution":{"observed_at":"2026-08-04T10:19:08.551820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.598743Z","title":"However, as shown in Figure S2, the tuning process is relatively complex","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.598743Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:c419ffa7f9ea6e67d66eb3739542e5f3efa2885a1bb8e4ee9c0c9e417a4b3b7f","observation_id":"9ebc5362-464d-4bf4-90f6-26800ffe6edd","resolution":{"observed_at":"2026-08-04T10:19:08.598743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.673064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.673064Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:610c224c77d5040e9e671b5ad07b12525668653a85c6a60e37c0fd8e85e8f14a","observation_id":"1490b82c-7231-4a02-bf49-72cd80e27571","resolution":{"observed_at":"2026-08-04T10:19:08.673064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.751400Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.751400Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:afdab3739e93d0a78bd0d199850fe6a8455033a60adec955c9043eb51ec9f1c6","observation_id":"cad59e71-d8c7-4cea-9636-83199aacc6d9","resolution":{"observed_at":"2026-08-04T10:19:08.751400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.826452Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.826452Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:b95d510f47ac95730e4950f35b871927b6a73b3e8eefe41d6d027dbc60089aec","observation_id":"a07c088d-c956-4814-a2d8-8a7429d12094","resolution":{"observed_at":"2026-08-04T10:19:08.826452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.895341Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.895341Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:a6dcefef3683645687749b21165361ee963a527132dc84fe2e18e7309e8abd9a","observation_id":"2bfc4e79-9dfb-452f-aca0-63c1c4694093","resolution":{"observed_at":"2026-08-04T10:19:08.895341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:19:08.987872Z","title":"The figure shows that ROGER is less sensitive to the hyperparameter choices than other state-of-the-art methods since none of the tested cases cause the robot to fall","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T10:19:08.987872Z"},"links":{"citing_paper":"/paper/2510.10759"},"observation_digest":"sha256:557db03013fbacf3ed3dd20694e411b01f39e86718ebc36c1b41543b56ce5f44","observation_id":"385dd084-cec4-4d10-8616-02f44eadb617","resolution":{"observed_at":"2026-08-04T10:19:08.987872Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.10759","last_updated":"2026-06-21T14:38:07Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T15:13:21.218682Z","submitted_at":"2025-10-12T18:58:59Z","title":"Gain Tuning Is Not What You Need: Reward Gain Adaptation for Constrained Locomotion Learning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2510.10759."}