{"as_of":"2026-08-08T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ffe54153c7126fb82849552969545195ad894b4d6ad56f918e5d7d28e3f7474","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:02:49.070216Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02050/citation-record","integrity":"/paper/2506.02050/integrity","json":"/paper/2506.02050/citation-record.json","paper":"/paper/2506.02050"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.29032","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:50.010882Z","title":"PRIMAL: Pathfinding via reinforcement and imita- tion multi-agent learning,","venue":null,"work_id":"1d12b8d6-4375-474d-917f-458d5d7d4775","year":2019},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.015269Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:deaaab72fe1fe5d88844f5bcdee96b172f074407a4326b99426468611f97852d","observation_id":"ba773b24-6544-4327-b213-00a06a0c35fd","resolution":{"observed_at":"2026-08-07T12:02:50.115300Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/pds.2021.17","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:49.650483Z","title":"A multi-agent reinforcement learning framework for intelligent manufac- turing with autonomous mobile robots,","venue":null,"work_id":"9407fa83-e0a4-418a-a06e-35e6f1fde523","year":2021},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.083933Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:d93a4b30b09c02aadad77308bdb8801c23cebd7484536d4ccaf799920580067b","observation_id":"f6d6718c-0ce0-449e-93b2-abd2bc0d6e3a","resolution":{"observed_at":"2026-08-07T12:02:49.752862Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:47.191731Z","title":"A multi-agent deep reinforcement learning method for cooperative load frequency control of multi-area power systems,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.191731Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:dcb507c51ad9f1ac7ba3bd078c7b8b6997dbbff5ae33a13803142a2f4f1c9ef9","observation_id":"684cebfb-530f-402b-9b3d-7f51bf405ecd","resolution":{"observed_at":"2026-08-07T12:02:47.191731Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:51.293961Z","title":"Why generalization in RL is difficult: Epistemic POMDPs and implicit partial observability,","venue":null,"work_id":"768d8d09-c7a1-4816-9f4b-1f2d5a0b7aff","year":2021},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.241336Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:54a55656c70fef5eb1c1bee4cf6a0bcf0976f2c88f9851c919609561c33966e3","observation_id":"dcc5b023-ce02-44d1-9d90-607117829b47","resolution":{"observed_at":"2026-08-07T12:02:51.394775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:47.356136Z","title":"Managing engineer- ing systems with large state and action spaces through deep re- inforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.356136Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:b03a8ba7fc0c9f96c825550693d81232ef5bb71f02a96412b80b7365176d2847","observation_id":"a5b195d0-0aab-4607-acf5-adb5609f441b","resolution":{"observed_at":"2026-08-07T12:02:47.356136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:51.138854Z","title":"Hi- erarchical deep reinforcement learning: Integrating temporal abstraction and intrinsic motivation,","venue":null,"work_id":"725e40b1-9318-4f21-832d-8c3da9d90656","year":2016},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.458518Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:37f7dbc2ab0414b657e2977b9a3a7cd12a3bd8d81cf6611d1b2257960c819d3c","observation_id":"fb8f6e1c-0d81-46c5-bf8e-750f6c9341d8","resolution":{"observed_at":"2026-08-07T12:02:51.185287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:47.525361Z","title":"The option-critic architecture,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.525361Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:b959b6335fec3ba67b937efb44e939195ca32544ed00302ef6a4f5ab1ec6de6c","observation_id":"c47b6f73-0f11-4766-8a59-4bf3a6b562b4","resolution":{"observed_at":"2026-08-07T12:02:47.525361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-025-94163-2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:49.441083Z","title":"Hierarchical reinforcement learning with central pattern generator for enabling a quadruped robot simulator to walk on a variety of terrains,","venue":null,"work_id":"bb375fd2-261c-4a2a-bf4b-f230b027d359","year":2025},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.668773Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:0a71554f0b8bb3596e705724e468e47c9835ca33aae1160d42bd4c7b4711129a","observation_id":"ff098868-228c-4071-ba70-81db38fcac21","resolution":{"observed_at":"2026-08-07T12:02:49.519586Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14237","last_updated":"2024-06-28T11:34:56Z","snapshot_observed_at":"2026-07-06T16:23:22.439333Z","submitted_at":"2023-09-25T15:54:32Z","title":"Hierarchical Reinforcement Learning Based on Planning Operators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14237","snapshot_observed_at":"2026-08-07T12:02:47.762140Z","title":"Hierarchical reinforcement learning based on planning operators,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.762140Z"},"links":{"cited_paper":"/paper/2309.14237","citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:fd88bbcd66e0deffb9932450c5d4a44456b649d9fe393a303cba0acbc0bea338","observation_id":"cc0eed5d-bf49-4ceb-9ed2-e73b7a2143de","resolution":{"observed_at":"2026-08-07T12:02:47.762140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:50.933886Z","title":"Towards a unified theory of state abstraction for MDPs,","venue":null,"work_id":"2001af6e-94ce-4cec-a56f-8212d4dd598e","year":2006},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.991873Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:7b2f358fc463b3c0b3b23931c9f7aab92dd23976cda715906a992187791bdc4b","observation_id":"bdfc6162-5d2e-4433-aa9a-c5df48169d38","resolution":{"observed_at":"2026-08-07T12:02:51.054101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:50.774553Z","title":"DeepMDP: Learning continuous latent space models for representation learning,","venue":null,"work_id":"d9e5fb93-06ab-450b-8a0f-291159f56fbe","year":2019},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.085374Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:16509cad8c37322cde3712379a159ddc696d91bcf02137a58aeb04bfee2f17df","observation_id":"541046b0-2ec2-4e77-9d4c-214944c752ea","resolution":{"observed_at":"2026-08-07T12:02:50.846115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10742","last_updated":"2021-04-07T01:57:14Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:59:35Z","title":"Learning Invariant Representations for Reinforcement Learning without Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10742","snapshot_observed_at":"2026-08-07T12:02:48.124549Z","title":"Learning invariant representations for reinforcement learning without reconstruc- tion,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.124549Z"},"links":{"cited_paper":"/paper/2006.10742","citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:91b2dc1dcd92513e3c38998b3a79a4143bb9fed18494ff7be4ae3fd4a91cc7ef","observation_id":"745bc053-2879-47b3-a394-eea2e7e30507","resolution":{"observed_at":"2026-08-07T12:02:48.124549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:50.647082Z","title":"Monte-Carlo planning in large POMDPs,","venue":null,"work_id":"42da0d53-8af5-4405-8370-d350e34d286e","year":2010},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.239352Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:a7d52bc46b5787c228f78beef3814cd1b6a79f935497e8367587c3ecd3a99c9f","observation_id":"8d64442d-2c84-487e-b6a9-05422ee551a5","resolution":{"observed_at":"2026-08-07T12:02:50.724811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:48.358902Z","title":"Memory-based deep rein- forcement learning for POMDPs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.358902Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:de07f7731112b691089152ef928621e5e25ae6d331f58de122185f8f407dd744","observation_id":"0a5a2638-a7d5-4a95-ab00-2cca434cb8da","resolution":{"observed_at":"2026-08-07T12:02:48.358902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05038","last_updated":"2022-06-05T01:19:29Z","snapshot_observed_at":"2026-07-06T11:56:24.775449Z","submitted_at":"2021-10-11T07:09:14Z","title":"Recurrent Model-Free RL Can Be a Strong Baseline for Many POMDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05038","snapshot_observed_at":"2026-08-07T12:02:48.448037Z","title":"Recurrent model-free RL can be a strong baseline for many POMDPs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.448037Z"},"links":{"cited_paper":"/paper/2110.05038","citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:88fb36720511ef9b76a0b21bf2d8ff73bcea1724fa4451bd0d4205d71e1dbb0b","observation_id":"69a54379-6bff-43dd-99dd-511513960743","resolution":{"observed_at":"2026-08-07T12:02:48.448037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.08843","last_updated":"2021-09-03T18:54:23Z","snapshot_observed_at":"2026-07-06T10:05:22.965365Z","submitted_at":"2020-10-17T18:30:30Z","title":"Approximate information state for approximate planning and reinforcement learning in partially observed systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.08843","snapshot_observed_at":"2026-08-07T12:02:48.559019Z","title":"Approximate information state for approximate planning and reinforcement learning in partially observed systems,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.559019Z"},"links":{"cited_paper":"/paper/2010.08843","citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:56ba31560515d98466a01edf893f8332368cffab76664238d86104e1e0daae1d","observation_id":"421da93b-2386-4471-9143-59ef34ed0b56","resolution":{"observed_at":"2026-08-07T12:02:48.559019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:50.533314Z","title":"A closer look at invalid action masking in policy gradient algorithms,","venue":null,"work_id":"376a4354-6a32-4d2c-b432-86308c94dc65","year":null},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.626138Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:9185e6432444a17669d91054bbaec450e4bf74d6dc47e9f4890ec40247962fb4","observation_id":"a7a72e96-1230-4266-9e9d-463bb8b4ab94","resolution":{"observed_at":"2026-08-07T12:02:50.578069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:50.319209Z","title":"Reinforcement learning with augmented data,","venue":null,"work_id":"fd4d3aa8-79a2-4747-b50c-dcad3c39a6d3","year":2020},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.807077Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:98817a625a6f025ccc306ed0a9bb7b21bda484422ee99d8fb38d8b5bb208ec40","observation_id":"c6f8f742-93b3-441e-bec1-126edc8388ac","resolution":{"observed_at":"2026-08-07T12:02:50.429922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:50.191194Z","title":null,"venue":null,"work_id":"fa7d4d1e-335d-442c-891f-957c6a7d0c8c","year":null},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:49.070216Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:2f32d2bc0a24146694f64b37ff8ddd03f7ba85cf1c41747dc29a6ae0acee3408","observation_id":"e8c2f43a-a0a9-4cc7-8d21-3402183c67ae","resolution":{"observed_at":"2026-08-07T12:02:50.268879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:48.696580Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.696580Z"},"links":{"citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:8a97c1d4f070fbbe618378beb695dc5cedf2bab1f85c4e351f6f690cd8f193f2","observation_id":"b22a6630-04ae-47e3-a289-673fa63e7c13","resolution":{"observed_at":"2026-08-07T12:02:48.696580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14237","last_updated":"2024-06-28T11:34:56Z","snapshot_observed_at":"2026-07-06T16:23:22.439333Z","submitted_at":"2023-09-25T15:54:32Z","title":"Hierarchical Reinforcement Learning Based on Planning Operators","version":2},"cited_work":{"arxiv_id":"2309.14237","doi":"10.48550/arxiv.2309.14237","metadata_source":"pith","pith_arxiv_id":"2309.14237","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Hierarchical Reinforcement Learning Based on Planning Operators","venue":"cs.RO","work_id":"e7910559-72da-4980-83e6-06711750b6f4","year":2023},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:47.846453Z"},"links":{"cited_paper":"/paper/2309.14237","citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:ba741a2aabaadd0a7dfcc0c9f8f311f1a4073a7fffc1e5588de5f0c4357cf333","observation_id":"85e08b15-f4c5-4e8d-a65d-b46aef6f7d1e","resolution":{"observed_at":"2026-08-07T12:02:49.318576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-02T19:59:00.409439Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-07T12:02:48.964756Z","title":"Available: https://arxiv.org/abs/2306.13831","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.964756Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:53b12e3253a64f8e6d21f5301e33e61147f29cd084ecde5d47b7a84373a7a0bc","observation_id":"5e37d9c1-1727-492a-8ec1-68c3528442f5","resolution":{"observed_at":"2026-08-07T12:02:48.964756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":3,"verified_fuzzy":7},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2506.02050."}