{"as_of":"2026-08-09T11:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4901f16ea2c3866a07a784aa00f25d9a3a50a03edf26a0bb577f51f8a6baf1e2","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T14:49:29.225582Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23726/citation-record","integrity":"/paper/2607.23726/integrity","json":"/paper/2607.23726/citation-record.json","paper":"/paper/2607.23726"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:28.975703Z","title":"doi: 10.3389/frobt.2025.1567211","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:28.975703Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:fda0c510d399d870f6e31b9bf155a250523f256214399ac56dc5180d8d469d4a","observation_id":"de6624ef-83b6-4868-b8e7-69758832922e","resolution":{"observed_at":"2026-07-30T14:49:28.975703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-981-97-5035-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 978-981-97-5035-1","venue":"Lecture notes in networks and systems","work_id":"c2924efa-f6ab-4d56-9886-467db6d58441","year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.074750Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:822d93fbd8150e738a7e1033aa7ffe6f05b7ae9287741a4e6c581a46e4b68fec","observation_id":"2ee8f3fd-2c78-4d56-9063-4e3ead66ba83","resolution":{"observed_at":"2026-07-30T14:50:53.366090Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.02829","last_updated":"2020-02-07T15:01:20Z","snapshot_observed_at":"2026-07-06T08:55:37.851828Z","submitted_at":"2020-02-07T15:01:20Z","title":"Off-policy Maximum Entropy Reinforcement Learning : Soft Actor-Critic with Advantage Weighted Mixture Policy(SAC-AWMP)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.02829","snapshot_observed_at":"2026-07-30T14:49:29.131546Z","title":"Zhimin Hou, Kuangen Zhang, Yi Wan, Dongyu Li, Chenglong Fu, and Haoyong Yu","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.131546Z"},"links":{"cited_paper":"/paper/2002.02829","citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:63f211a85d71278a281941d96cfb9a3cd3ac4d2123fd5b2a429a96b74a4e788f","observation_id":"e540d67b-2188-418b-b546-5bc8c3045a16","resolution":{"observed_at":"2026-07-30T14:49:29.131546Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00948","last_updated":"2019-09-03T21:05:21Z","snapshot_observed_at":"2026-08-06T00:36:08.175723Z","submitted_at":"2017-12-04T08:18:08Z","title":"Learning Multi-Level Hierarchies with Hindsight","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00948","snapshot_observed_at":"2026-07-30T14:49:29.163862Z","title":"Chenghao Liu, Fei Zhu, Quan Liu, and Yuchen Fu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.163862Z"},"links":{"cited_paper":"/paper/1712.00948","citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:0b29924d0361e2037852984f5bb28040ed0d5db78d22abef2daf5b7ff9ac6a33","observation_id":"e82ab8b3-acef-4e7a-a1df-96add91289d3","resolution":{"observed_at":"2026-07-30T14:49:29.163862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.168343Z","title":"Chao Lv, Ming Zhu, Xiao Guo, Jiajun Ou, and Wenjie Lou","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.168343Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:5277f7659cfd43dae35d04e415a3839664e572fdaf0f278c197f5f28e26cf398","observation_id":"3f2ec826-c1a8-4a9a-a0ef-73a03fbc7537","resolution":{"observed_at":"2026-07-30T14:49:29.168343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.172612Z","title":"doi: https://doi.org/10.1016/j","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.172612Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:fec72f9d76d9f442ff90e1cb53408baadac9a14738c6e3cfc7660ad933dfa4cc","observation_id":"1498600a-6106-42e9-a1c1-082cc01dc09d","resolution":{"observed_at":"2026-07-30T14:49:29.172612Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.176253Z","title":"Andrew Y Ng, Daishi Harada, and Stuart Russell","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.176253Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:e302a3f49521b6246b8de0646d4a502ca482cf0b2933849a13752685c3ac36dc","observation_id":"af259677-0dc2-4111-a467-f297a97dc073","resolution":{"observed_at":"2026-07-30T14:49:29.176253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/345316","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:50:53.106664Z","title":"RescuedBy","venue":null,"work_id":"f83d041a-13bc-4a25-8a75-bb359fe46488","year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.183389Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:4d5f5462d04ff9fda82818dec6399f9b1fe7b4799dfb6574bd59f8df4a3aabf9","observation_id":"b60851a7-cd1b-4d9c-ba1a-f7ce0bdcb7a2","resolution":{"observed_at":"2026-07-30T14:50:53.144310Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.188910Z","title":"Version 1, 1980 images, CC BY 4.0, Accessed: February 12,","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.188910Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:a6ef58b93a410725ce90cea76d37d970761d93fc2831d3993e886b898b920ba9","observation_id":"74e21419-114d-420c-a697-2603ef0fcf6c","resolution":{"observed_at":"2026-07-30T14:49:29.188910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-30T14:49:29.193226Z","title":"26 Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning Qianli Shen, Yan Li, Haoming Jiang, Zhaoran Wang, and Tuo Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.193226Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:5dfa5144d14ed27fe18476b10ebb8deb0d4bfd5b3bfbd33165589613c044606c","observation_id":"5632b7b4-5eb9-45d5-8fb9-2c118d360f47","resolution":{"observed_at":"2026-07-30T14:49:29.193226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4018/978-1-60960-165-2.ch004","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Richard S Sutton, Doina Precup, and Satinder Singh","venue":"IGI Global eBooks","work_id":"00e11a93-26cf-4325-a77a-e71e61ce2b2d","year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.198475Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:b0e359c47b8ca2b45feaa7a49d6e7807da2f48410be8135e647594baf4b13b04","observation_id":"b806cbc4-3d3e-48fd-8e0c-7d7bd88721ff","resolution":{"observed_at":"2026-07-30T14:50:53.017794Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12786","last_updated":"2022-12-24T17:21:58Z","snapshot_observed_at":"2026-08-06T13:46:13.980215Z","submitted_at":"2022-12-24T17:21:58Z","title":"SHIRO: Soft Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.12786","snapshot_observed_at":"2026-07-30T14:49:29.207423Z","title":"Yiqing Xu and Eddie Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.207423Z"},"links":{"cited_paper":"/paper/2212.12786","citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:b36a259fb8ce50b4c1d6d41db3f847cfc4632907e397c9c963053b0625046997","observation_id":"492dc1b7-eeac-4f43-8489-29515e4f5cef","resolution":{"observed_at":"2026-07-30T14:49:29.207423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.216684Z","title":"Jiarui Yang, Bin Zhu, Jingjing Chen, and Yu-Gang Jiang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.216684Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:8cd72316d2ef3ddd527f95a67993508675bcc84cb2754a0fef356b5071e91cf4","observation_id":"b060fd3a-194b-4d3a-b24f-fe91dfb76067","resolution":{"observed_at":"2026-07-30T14:49:29.216684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.220989Z","title":"48550/arXiv.2508.11143","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.220989Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:cf51ec3aa80714e5ecee502b3e34eddb5917bf01348ed232a91de779435e2fdf","observation_id":"f990ca5e-e7de-4e09-a792-0958609e7e83","resolution":{"observed_at":"2026-07-30T14:49:29.220989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.225582Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.225582Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:d8c78325462d61980686d28cf1f2bd60b9347c50f1a445b8a84bbb014d08447b","observation_id":"b0df5e0c-38d5-42ca-a02e-0e8bdbc2495f","resolution":{"observed_at":"2026-07-30T14:49:29.225582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0004-3702(99","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:50:52.736110Z","title":"URLhttps://doi.org/10.1016/S0004-3702(99) 00052-1","venue":null,"work_id":"fbb7cc29-8f90-4968-b84e-2a4a54f12280","year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.203473Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:54a2d2b6f5ba766eefb2ac4404a6ee7e3e33f70825050bc6218be707d7980114","observation_id":"8f024449-3b0e-4c6c-a2d0-9c05ccb418a1","resolution":{"observed_at":"2026-07-30T14:50:52.824752Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.113814Z","title":"Botao Dong, Longyang Huang, Ning Pang, Hongtian Chen, and Weidong Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.113814Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:c015eb5c110a6c081276c4710a8a232e4564935cf9caf5fb55b6ec8a23942216","observation_id":"f1e540b0-6f2c-4286-9aea-4d72b2420d3d","resolution":{"observed_at":"2026-07-30T14:49:29.113814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.12785/ijcds/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:50:53.427546Z","title":"Mohammad Al Homsi, Maja Trumi´ c, Adriano Fagiolini, and Giansalvo Cirrincione","venue":null,"work_id":"39538e50-de4f-49a6-aab1-ac9c9ac61484","year":2025},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:28.970720Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:cafa3019ee2632509103227760e97f0544c921f8fea9579e7aeee1683f7b3ade","observation_id":"5a5e4796-f0dc-4f98-ba3f-bd888bf8ed04","resolution":{"observed_at":"2026-07-30T14:50:53.473403Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.153847Z","title":"Michael Laskin, Aravind Srinivas, and Pieter Abbeel","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.153847Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:0577e3c53490a11bd592c7a870f239c3100963656d1999056768bac23207fea9","observation_id":"baac3ab8-4536-4ff0-a891-14085507671b","resolution":{"observed_at":"2026-07-30T14:49:29.153847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-02T13:41:53.507553Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-07-30T14:49:28.994745Z","title":"v31i1.10916","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:28.994745Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:5753dc295192107c4f640e8b3a5f8b6405a753e4de2a12c7728ce3fe1a257bff","observation_id":"d1b7c7fb-ee14-4065-b7e3-98477741ef57","resolution":{"observed_at":"2026-07-30T14:49:28.994745Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-02T13:41:53.507553Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-07-30T14:49:29.035790Z","title":"Timothy Chang, Kourosh Neshatian, and James Atlas","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.035790Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:bb93a492393567faa8e889c26693c55293aee77cd63dca45c0d750a51bced29c","observation_id":"b6abb979-3707-465b-b990-17cf6a5d0515","resolution":{"observed_at":"2026-07-30T14:49:29.035790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.02829","last_updated":"2020-02-07T15:01:20Z","snapshot_observed_at":"2026-07-06T08:55:37.851828Z","submitted_at":"2020-02-07T15:01:20Z","title":"Off-policy Maximum Entropy Reinforcement Learning : Soft Actor-Critic with Advantage Weighted Mixture Policy(SAC-AWMP)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.02829","snapshot_observed_at":"2026-07-30T14:49:29.137552Z","title":"Matthias Hutsebaut-Buysse, Kevin Mets, and Steven Latr´ e","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.137552Z"},"links":{"cited_paper":"/paper/2002.02829","citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:f3de710b470b99ad6fed5f08032df0a9eb7118657872a5ce1fb2eff5167a8b74","observation_id":"1a40db98-bb95-44ea-b329-24d0d2ff932c","resolution":{"observed_at":"2026-07-30T14:49:29.137552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:28.980244Z","title":"24 Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning Pierre-Luc Bacon, Jean Harb, and Doina Precup","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:28.980244Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:af95a30d5f191bd52e26857bc100af063b578823049d1bbc4eea44a4fdd0b22d","observation_id":"71793d86-e21e-4908-943f-7c122a9fed3b","resolution":{"observed_at":"2026-07-30T14:49:28.980244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/make4010009","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.3390/make4010009","venue":"Machine Learning and Knowledge Extraction","work_id":"3641889f-d396-4bc9-a2d0-d96441401e0c","year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.146078Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:1b2b1205559e8954a161cd368830e09b2babfcac1dc2b9ab64bb75c2eaf26298","observation_id":"9ee3656f-18f9-4e4b-aa52-c9ed85da9786","resolution":{"observed_at":"2026-07-30T14:50:53.235189Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/pan.2022.12","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jiangyue Yan, Biao Luo, and Xiaodong Xu","venue":"Political Analysis","work_id":"a621a8a5-a6d9-470e-b959-aced80abe5e8","year":2022},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.212740Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:535c9384dc2921f05ba76d8c477d341ae488ec63ea864c30fb97e4653610ea17","observation_id":"982eef5a-619f-43ad-bdaa-0262b4c8fe08","resolution":{"observed_at":"2026-07-30T14:50:52.684655Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T14:49:29.124761Z","title":"Nikolas Gegenava","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:29.124761Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:e6f06baf6a21ae2ea1c1dc1ceef71e20dd75081e79540f54080d0dd704bb079e","observation_id":"9dbd8e67-502b-4cb4-845f-4da8c81c8a7a","resolution":{"observed_at":"2026-07-30T14:49:29.124761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1142/s219688882550023x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mostafa Al-Emran","venue":"Vietnam Journal of Computer Science","work_id":"71649141-d395-4958-9fae-45b88dd0611e","year":null},"citing_paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-30T14:49:28.964206Z"},"links":{"citing_paper":"/paper/2607.23726"},"observation_digest":"sha256:f9a672887c8102d35ca904e6cb6b1805dd426a48367c32b774f6022a7ea1d27c","observation_id":"fee421ed-faa5-4ca6-9f17-76f81655ad7f","resolution":{"observed_at":"2026-07-30T14:50:53.638804Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.23726","last_updated":"2026-07-26T15:41:52Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T06:25:45.831329Z","submitted_at":"2026-07-26T15:41:52Z","title":"Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.23726."}