{"as_of":"2026-08-18T13:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d0b528977977533421f92878c5952ebfbd3e140311456e185597f43a831f519","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:14:06.354960Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18794/citation-record","integrity":"/paper/2504.18794/integrity","json":"/paper/2504.18794/citation-record.json","paper":"/paper/2504.18794"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.185528Z","title":"Maximum a Posteriori Policy Optimisation","venue":null,"work_id":"7490efd0-2bea-42cb-a623-0d71f9514d67","year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.164424Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:f87deba1e0c4dbdd5f18d1dbf8864a1d9c11c503680b89aa4a62a4b1a2fbb04c","observation_id":"6725a17d-cac4-4f75-bc51-7d457ba343cf","resolution":{"observed_at":"2026-08-16T10:14:07.190349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01495","last_updated":"2018-02-23T10:04:20Z","snapshot_observed_at":"2026-08-14T21:15:56.405766Z","submitted_at":"2017-07-05T17:55:53Z","title":"Hindsight Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01495","snapshot_observed_at":"2026-08-16T10:14:06.173489Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.173489Z"},"links":{"cited_paper":"/paper/1707.01495","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:5baf6523b42cf8c140de163fd3742bd74cbe65715bb635099172e130f06e8ef4","observation_id":"5240400f-ebdb-493a-85c7-36592fc1880b","resolution":{"observed_at":"2026-08-16T10:14:06.173489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.05140","last_updated":"2016-12-03T02:47:51Z","snapshot_observed_at":"2026-08-14T21:59:38.551417Z","submitted_at":"2016-09-16T17:05:55Z","title":"The Option-Critic Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.05140","snapshot_observed_at":"2026-08-16T10:14:06.177882Z","title":"The Option-Critic Architecture","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.177882Z"},"links":{"cited_paper":"/paper/1609.05140","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:d84a9033b95dbc029e9523e944687b72a9657dfd08fd68c733f02b94cf6039bf","observation_id":"6ce205ca-28bf-4aa9-80a8-dc3918f23df5","resolution":{"observed_at":"2026-08-16T10:14:06.177882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.172615Z","title":"Option Discovery using Deep Skill Chaining","venue":null,"work_id":"5d327d92-34a1-49dd-86fc-8ec26d0a8388","year":2020},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.183018Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:76210425dbad0dc235c7365d4554e283815fb923ccbba86ad4612b06eb433a53","observation_id":"596f85c3-0ed6-4b70-8ec6-594e560b1062","resolution":{"observed_at":"2026-08-16T10:14:07.177093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.160451Z","title":null,"venue":null,"work_id":"a5bd60fe-0e0c-4e50-9776-8568e0a8004c","year":2016},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.187284Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:2fbfb830eb4b95ba5c8685d3a5dcb9dde0ba79ac76e09eb4d5a7e997872cd746","observation_id":"517485e4-c931-4c9f-b355-816676ce2209","resolution":{"observed_at":"2026-08-16T10:14:07.164612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.147521Z","title":"FAIRIS: Framework for Autonomous Intelligent Robotic Interaction and Simulation","venue":null,"work_id":"194134ce-4f77-4504-bcdc-3c836883eaf2","year":2025},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.191269Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:a72c3f867abce38acc34fdf7842243282299deb513b21d94e339919c90d9d54c","observation_id":"fea78c63-470e-4df4-805d-7c2ce6db5a9f","resolution":{"observed_at":"2026-08-16T10:14:07.151659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.195309Z","title":"Reservoir computing model of prefrontal cortex creates novel combinations of previous navigation sequences from hip- pocampal place-cell replay with spatial reward propagation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.195309Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:10bfe4b148643faa778074c17d01e594556bf555dd2a50df4743532df3e272c6","observation_id":"6dca1e1f-caae-4784-9dfb-a5a601b7378a","resolution":{"observed_at":"2026-08-16T10:14:06.195309Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02628","last_updated":"2022-01-07T18:44:28Z","snapshot_observed_at":"2026-08-16T17:29:40.635004Z","submitted_at":"2022-01-07T18:44:28Z","title":"Attention Option-Critic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02628","snapshot_observed_at":"2026-08-16T10:14:06.199616Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.199616Z"},"links":{"cited_paper":"/paper/2201.02628","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:2b9b5e991d4fac774e66b64600a299d99aa75759bc20d917f0845c5f5bd9b49c","observation_id":"66303e1b-fa5a-4e54-b6a6-3addd23b1efd","resolution":{"observed_at":"2026-08-16T10:14:06.199616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.135434Z","title":"Feudal Reinforcement Learn- ing","venue":null,"work_id":"95176204-5e98-48fb-a540-52b9b1d0df7e","year":1992},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.203955Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:cb451c466aad0cc61b801cac85dc39a51e637ee280f7607e98ad98267155c6a3","observation_id":"331f04d6-c64e-441e-8584-260efda6c388","resolution":{"observed_at":"2026-08-16T10:14:07.139262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"cs/9905014","last_updated":"1999-05-21T14:26:07Z","snapshot_observed_at":"2026-08-06T12:09:55.160157Z","submitted_at":"1999-05-21T14:26:07Z","title":"Hierarchical Reinforcement Learning with the MAXQ Value Function Decomposition","version":1},"cited_work":{"arxiv_id":"cs/9905014","doi":null,"metadata_source":"pith","pith_arxiv_id":"cs/9905014","snapshot_observed_at":"2026-08-16T10:14:06.887927Z","title":"Hierarchical Reinforcement Learning with the MAXQ Value Function Decomposition","venue":"cs.LG","work_id":"3d80ab62-2a5d-4eea-9c2a-324f2f987b08","year":1999},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.207798Z"},"links":{"cited_paper":"/paper/cs/9905014","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:bdcb894c73c4b552ab92182e468fc469298b3901f138997d73662b3ee881898e","observation_id":"9a7e089a-4f6b-4e2c-9647-30c97a9d3ea2","resolution":{"observed_at":"2026-08-16T10:14:06.892529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.120323Z","title":"Implementation Matters in Deep RL: A Case Study on PPO and TRPO","venue":null,"work_id":"fd12a565-5397-4d33-bf22-fafc72dfbcad","year":2020},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.212411Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:c4af4bedd8a128ab67fb852ce9c9f4f6df9dd6130ccdf134bdb74ea8b3bed3b9","observation_id":"fe52a4cd-cf2f-4eec-bd82-512563f13a89","resolution":{"observed_at":"2026-08-16T10:14:07.126292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05300","last_updated":"2018-07-23T10:10:17Z","snapshot_observed_at":"2026-08-16T17:40:50.571593Z","submitted_at":"2017-07-17T17:53:54Z","title":"Reverse Curriculum Generation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05300","snapshot_observed_at":"2026-08-16T10:14:06.216454Z","title":"Reverse Curriculum Generation for Reinforce- ment Learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.216454Z"},"links":{"cited_paper":"/paper/1707.05300","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:87e330beb935c553bacf92a4146262c00cf854c4b815b838afbc55a170faad1b","observation_id":"2b28c5dc-f49e-4009-bd0d-89239c690a20","resolution":{"observed_at":"2026-08-16T10:14:06.216454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-16T10:14:06.220620Z","title":"Soft Actor-Critic: Off-Policy Maximum En- tropy Deep Reinforcement Learning with a Stochastic Actor.2018.arXiv: 1801.01290 [cs.LG]","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.220620Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:917acc5c41d0d221f4969ebe3afcd2c0c1e2b083916dfd7ae35f774098ae5dd4","observation_id":"c121ca03-81ae-4f9c-9762-4055f8764df0","resolution":{"observed_at":"2026-08-16T10:14:06.220620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09996","last_updated":"2019-02-26T15:26:10Z","snapshot_observed_at":"2026-08-14T17:10:59.074745Z","submitted_at":"2019-02-26T15:26:10Z","title":"The Termination Critic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09996","snapshot_observed_at":"2026-08-16T10:14:06.224572Z","title":"TheTerminationCritic","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.224572Z"},"links":{"cited_paper":"/paper/1902.09996","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:be1be43318dc3e359486db4ffe0cbffb30948e3804bea30e1f104e79cf51abc3","observation_id":"423903b5-1766-4bbf-8045-80d5c83b6708","resolution":{"observed_at":"2026-08-16T10:14:06.224572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.108497Z","title":"Double Q-learning","venue":null,"work_id":"5f8b4172-7f61-4425-af6d-6b729f79ffa8","year":2010},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.228466Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:4b600febdc201dd1b9ce1efa4557490039618bc2f7e3515d0063840b614bd94c","observation_id":"c91f4904-69d5-4e89-8d78-e8b6a28d78c6","resolution":{"observed_at":"2026-08-16T10:14:07.112509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.00271","last_updated":"2020-01-01T21:24:39Z","snapshot_observed_at":"2026-08-13T16:47:24.122253Z","submitted_at":"2020-01-01T21:24:39Z","title":"Options of Interest: Temporal Abstraction with Interest Functions","version":1},"cited_work":{"arxiv_id":"2001.00271","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.00271","snapshot_observed_at":"2026-08-16T10:14:06.833809Z","title":"Options of Interest: Temporal Abstraction with Interest Functions","venue":"cs.LG","work_id":"e6e388d2-5928-4ab6-bb61-8042a0075491","year":2020},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.232294Z"},"links":{"cited_paper":"/paper/2001.00271","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:f26a48e3367dad6608acd36c41f5beb5583e7e8be8422a79b2a5b7a3e2fe840d","observation_id":"27adccd6-b5e7-4a6a-b037-fb2a0419e573","resolution":{"observed_at":"2026-08-16T10:14:06.839554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00004","last_updated":"2017-11-30T00:45:09Z","snapshot_observed_at":"2026-08-14T20:08:37.560971Z","submitted_at":"2017-11-30T00:45:09Z","title":"Learnings Options End-to-End for Continuous Action Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00004","snapshot_observed_at":"2026-08-16T10:14:06.236158Z","title":"Learnings Options End-to-End for Continu- ous Action Tasks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.236158Z"},"links":{"cited_paper":"/paper/1712.00004","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:512e9bcd8e07f67c3e61a747ba5cf2a41d75afc69475bc2a399df63ad4fff7d1","observation_id":"42864449-d36a-470f-8471-6ed6dea4c00d","resolution":{"observed_at":"2026-08-16T10:14:06.236158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.097077Z","title":"Actor-Critic Algorithms","venue":null,"work_id":"1469beb4-ac13-4ca5-be3f-9dbe3f87078a","year":1999},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.240159Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:ca7566c7d8ee78811547732129de656cf70622a27ca70ead4f7f2aed99290b86","observation_id":"ec965bf9-204d-493f-b22f-3c1a886c56a1","resolution":{"observed_at":"2026-08-16T10:14:07.100943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.084636Z","title":"Skill Discovery in Continuous ReinforcementLearningDomainsusingSkillChaining","venue":null,"work_id":"31a94b2b-0e76-42e7-9650-12442725ddc3","year":2009},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.244071Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:2873b0d691b75d32027ff60356fc6a3427d7d612611766faf80bc7ff376c81dd","observation_id":"841c8b3b-1c90-4b94-920b-308a1d6a43af","resolution":{"observed_at":"2026-08-16T10:14:07.088785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32652","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.800790Z","title":"UAV Trajectory Optimization for Spectrum Cartogra- phy: A PPO Approach","venue":null,"work_id":"9519861f-d955-4d3c-8b1a-43b3506950db","year":2023},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.247979Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:cf7cb463134fcc7b1b2ede61c6c76b4b03b632b2ae6781aa8b32d22e682064e1","observation_id":"d89f4a19-6a64-4339-864a-431fe0b0ae4e","resolution":{"observed_at":"2026-08-16T10:14:06.808886Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-16T10:14:06.251800Z","title":"Lillicrap et al.Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.251800Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:f6e8afe695e6dc80cd42c01ce0dc33d84c34f9f77881b6048d7721cb2b19ac56","observation_id":"6e33ab6b-cc4e-4e8e-b31b-a8be883ab559","resolution":{"observed_at":"2026-08-16T10:14:06.251800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.071746Z","title":"Automatic Discovery of Sub- goals in Reinforcement Learning using Diverse Density","venue":null,"work_id":"9f4d277c-0e72-4efc-8b89-c4fa1604c588","year":2001},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.256363Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:7fdf8731133b19525ea7ee5ab1f51c80327d65d00183d7f9a0bc2821daf30615","observation_id":"af93faab-59eb-42f4-8910-3f9bed929ab1","resolution":{"observed_at":"2026-08-16T10:14:07.076492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.259779Z","title":"A Place Cell Model for Spatio-Temporal Navigation Learning with LSTM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.259779Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:2361461602fc924c7f2ea4efce9e57d9016d848f470196ce66586f6427478af6","observation_id":"16947b6e-b6fc-4bc6-b16d-ffb6b69ae7a3","resolution":{"observed_at":"2026-08-16T10:14:06.259779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.059011Z","title":"Q-Cut—Dynamic Discovery of Sub-goals in Reinforcement Learning","venue":null,"work_id":"b9335734-4e36-4778-a36b-8cb43713a7ec","year":2002},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.263620Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:41bb6ab8a518fc6429387f20417b73edde859d7d701a444d520c006aa7446e0d","observation_id":"0321b58a-eb40-46fe-b641-551a9ab9fc52","resolution":{"observed_at":"2026-08-16T10:14:07.063438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-16T10:14:06.271633Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.271633Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:96b1198d1a6350bc65ce66f2ea57fe1ccb389ab277088acc6efa64f067ab8249","observation_id":"72f032a0-577c-4a5e-9367-3a1db2d3abdf","resolution":{"observed_at":"2026-08-16T10:14:06.271633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.032597Z","title":"Human-level control through deep reinforce- ment learning","venue":null,"work_id":"eac29f75-2109-4891-b96f-0b70de28731c","year":2015},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.275519Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:f64b062c80491d227d30b04d8f357401afa36cfb73df5ed6bd9ca283303a8ccf","observation_id":"90a9c514-a67b-4454-a7df-33deac6d7fd4","resolution":{"observed_at":"2026-08-16T10:14:07.037028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.019851Z","title":null,"venue":null,"work_id":"29cc1fc5-b6b3-4453-b19c-ece7d721107b","year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.287691Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:a575196fb37cc5ab0538869c447b90aa2f74c9e42fc1589ac552b784237a5e5b","observation_id":"2c2dfdd9-a4ee-42a8-9474-a7526d74a121","resolution":{"observed_at":"2026-08-16T10:14:07.024103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10618","last_updated":"2019-12-30T17:21:22Z","snapshot_observed_at":"2026-08-15T14:00:42.764198Z","submitted_at":"2019-09-23T21:11:30Z","title":"Why Does Hierarchy (Sometimes) Work So Well in Reinforcement Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10618","snapshot_observed_at":"2026-08-16T10:14:06.296472Z","title":"Why Does Hierarchy (Sometimes) Work So Well in Reinforcement Learning?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.296472Z"},"links":{"cited_paper":"/paper/1909.10618","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:f93f6641b33de1dc63c24061b7dbbc949b299c88c15cc858a828b7b7e8877918","observation_id":"fcddf38a-dbb8-477b-94fe-3c4062320186","resolution":{"observed_at":"2026-08-16T10:14:06.296472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.004203Z","title":"Rectified linear units improve restricted boltzmann machines","venue":null,"work_id":"f96a11cf-9f82-456a-9a8e-d3339be728b9","year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.300470Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:62ceba8fa3c5ee4e35d4a5d5d0baeadb949ca1c08c3a61bc9b9e55f244b41bc2","observation_id":"779b735a-1c88-4ea9-9765-241e2ecd6b9c","resolution":{"observed_at":"2026-08-16T10:14:07.010435Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.990323Z","title":null,"venue":null,"work_id":"9c7c0056-6f50-434d-8f27-4d45593d48c6","year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.304258Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:5e31ca0813b4a02413daa196423c246b0b0fd5726cacdeddb97039c0766ac421","observation_id":"8b0befd2-9f6a-4911-8168-df72176d1b89","resolution":{"observed_at":"2026-08-16T10:14:06.994878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08296","last_updated":"2018-10-05T12:39:37Z","snapshot_observed_at":"2026-08-16T02:50:11.309391Z","submitted_at":"2018-05-21T21:33:44Z","title":"Data-Efficient Hierarchical Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.08296","snapshot_observed_at":"2026-08-16T10:14:06.291650Z","title":"url: https://arxiv.org/abs/ 1805.08296","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.291650Z"},"links":{"cited_paper":"/paper/1805.08296","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:1c222990cdb2e2f41948805146ab50c037e041b7d4aced165108c7ccab228bb2","observation_id":"1ea961e1-d44d-4fc8-8794-5609ecfe4c2c","resolution":{"observed_at":"2026-08-16T10:14:06.291650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06006","last_updated":"2019-02-20T10:46:44Z","snapshot_observed_at":"2026-08-18T12:04:34.605376Z","submitted_at":"2017-11-16T10:05:31Z","title":"Hindsight policy gradients","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06006","snapshot_observed_at":"2026-08-16T10:14:06.316178Z","title":"Hindsight policy gradients","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.316178Z"},"links":{"cited_paper":"/paper/1711.06006","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:5e2acc5e4749d4ff217dd6894f2e981f415514603b7cc80330ce828927e60dfc","observation_id":"6deb098a-b7fd-4403-8e49-29e3719aaf8b","resolution":{"observed_at":"2026-08-16T10:14:06.316178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.320102Z","title":"Comparative Analysis of A3C and PPO Algorithms in Reinforcement Learning: A SurveyonGeneralEnvironments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.320102Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:d72d2410024bd5fd8f93425c16c28536e46a09e0d02140e0c18e58be281fa0ac","observation_id":"b5a702e7-1e4a-419c-9d08-d43236add94a","resolution":{"observed_at":"2026-08-16T10:14:06.320102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T10:14:06.323757Z","title":"Proximal Policy Optimization Algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.323757Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:eb4ed5149a7c0197b14b1a8ef9a044637d4ad09d4256ce64d5d38ff24e3e940d","observation_id":"8915722d-bc70-4c35-a6b3-ef1c1cc15ea6","resolution":{"observed_at":"2026-08-16T10:14:06.323757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-16T10:14:06.327673Z","title":"Trust Region Policy Optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.327673Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:4e965d77e8b89e0498db74b4e39a5fc885febfb54f6b6dec20f4da4df601e45c","observation_id":"3a6ad40f-a2fb-4dc6-bbb1-92e9b0e43051","resolution":{"observed_at":"2026-08-16T10:14:06.327673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.312176Z","title":"Hierarchical Reinforcement Learning: A Com- prehensive Survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.312176Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:467913cbf8d9fd3730df4baf5148916a2b09725db9c46b492049c2687d621381","observation_id":"7952c4dc-f653-4a10-92a6-221ad1e45ec3","resolution":{"observed_at":"2026-08-16T10:14:06.312176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.335494Z","title":"Optimizing Autonomous Driving with Advanced Reinforcement Learning: Evaluating DQN and PPO","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.335494Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:6c167f8bf07656120e69436642d172290fa8ee0f269702d33d5008d6f620165d","observation_id":"befbebda-630b-4f9f-8ae3-97f08b07a671","resolution":{"observed_at":"2026-08-16T10:14:06.335494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.339349Z","title":"Optimizing Autonomous Vehi- cle Navigation with DQN and PPO: A Reinforcement Learning Ap- proach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.339349Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:06e26b3dd5bd16864d0a26b104a474d0f5a6ff64cef81962df1dc8b4ba9443e6","observation_id":"e2a58e2b-5f68-4026-8079-0ed3c2ebb773","resolution":{"observed_at":"2026-08-16T10:14:06.339349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.963751Z","title":"Sutton and Andrew G","venue":null,"work_id":"393cbf9c-2f8c-42d0-95d2-b73feeb2c0c7","year":2018},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.343342Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:2ba0bcf00063d022307b80e5f07d7cd8803f5582d513a90ee45767bea95e4d0f","observation_id":"282501ce-50b9-4c02-b428-fcf7ca7a034b","resolution":{"observed_at":"2026-08-16T10:14:06.968674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.347441Z","title":"Between MDPs and semi-MDPs: A framework for temporal abstraction in reinforce- ment learning","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.347441Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:698306c6684bbcbfc6f16be8816a35e67db3bb2ccfd2c15191134d0cf33682c8","observation_id":"19dfadaa-2898-4df2-9ed3-6fca729cdd01","resolution":{"observed_at":"2026-08-16T10:14:06.347441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.977686Z","title":"Integration of velocity-dependent spatio- temporal structure of place cell activation during navigation in a reser- voir model of prefrontal cortex","venue":null,"work_id":"16aa0e59-4218-465f-9214-d320d69eaa72","year":2022},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.331784Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:0b1af17739f54bb51678bdb9611d52f29c4560e0bd174479613ed64c45f7a499","observation_id":"30b954bc-e8aa-4cad-85e7-2a44d5d9e457","resolution":{"observed_at":"2026-08-16T10:14:06.981797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01161","last_updated":"2017-03-06T18:17:18Z","snapshot_observed_at":"2026-08-14T21:13:42.372055Z","submitted_at":"2017-03-03T14:05:11Z","title":"FeUdal Networks for Hierarchical Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01161","snapshot_observed_at":"2026-08-16T10:14:06.354960Z","title":"FeUdal Networks for Hierarchi- cal Reinforcement Learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.354960Z"},"links":{"cited_paper":"/paper/1703.01161","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:f8d8a99a22b17c2c69af1a89c3ee0f4f0e09b0a4ee27f97211102d9b9308b917","observation_id":"4fa73f28-d5ec-47dd-99d5-908b72b790c2","resolution":{"observed_at":"2026-08-16T10:14:06.354960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.950139Z","title":"Policy Gradient Methods for Reinforcement Learning with Function Approximation","venue":null,"work_id":"6a33cf8b-1e27-4788-ab6b-2fc9534a4a2d","year":1999},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.351314Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:b187f32e1e443613e642cf9fa5ea0d4d592683df629e14bc32b2fe333b639706","observation_id":"62199170-666a-48b2-a084-e6b100d9f4c5","resolution":{"observed_at":"2026-08-16T10:14:06.955104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:07.045565Z","title":null,"venue":null,"work_id":"4bfb3431-a496-44fb-935e-81eebadf78dd","year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":306,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.267698Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:a9d62933b8b2fe416c6b3b3bc98c1fd2e333f6e69c2653a8dbd89181cb8be756","observation_id":"54167c48-cbd3-4eb5-9d96-dbf9dc99d517","resolution":{"observed_at":"2026-08-16T10:14:07.050110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01626","last_updated":"2017-04-07T15:20:05Z","snapshot_observed_at":"2026-08-14T21:31:51.183672Z","submitted_at":"2016-11-05T10:49:37Z","title":"Combining policy gradient and Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01626","snapshot_observed_at":"2026-08-16T10:14:06.308149Z","title":"url: https://arxiv.org/abs/ 1611.01626","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.308149Z"},"links":{"cited_paper":"/paper/1611.01626","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:5ba72637a10693f0b6881072df190b4f88bbed9de8a2f54353fe3aca7ff5293a","observation_id":"02c08d37-87f2-432b-9528-56c8b49d409c","resolution":{"observed_at":"2026-08-16T10:14:06.308149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-08-15T08:36:52.193486Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-16T10:14:06.169240Z","title":"url: https://arxiv.org/abs/ 1806.06920","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.169240Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:d6e056000a9191ba0210483b6f1ea513b9da4ff866038e19e36c25935da1ad65","observation_id":"167cbeb5-afbc-4f51-a6a7-a7eda3f8d605","resolution":{"observed_at":"2026-08-16T10:14:06.169240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:06.279366Z","title":"url: https://doi.org/10.1038/ nature14236","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots","version":3},"reference_index":4687,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:06.279366Z"},"links":{"citing_paper":"/paper/2504.18794"},"observation_digest":"sha256:302c7fc9b7c9286ae88ea422735c15fca9bc434058dc300569afa435c0e82ef8","observation_id":"05b328b3-5c85-426f-b954-48f89d07700a","resolution":{"observed_at":"2026-08-16T10:14:06.279366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18794","last_updated":"2025-08-18T18:48:07Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T11:03:26.243150Z","submitted_at":"2025-04-26T04:30:10Z","title":"Hierarchical Reinforcement Learning in Multi-Goal Spatial Navigation with Autonomous Mobile Robots"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2504.18794."}