{"as_of":"2026-08-15T06:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:086138ad73581463ec120aba64e31d370dadcbe119105cd7fd80e14710871251","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:33:31.287184Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2402.05284","last_updated":"2026-05-02T21:42:12Z","snapshot_observed_at":"2026-08-13T08:27:58.494968Z","submitted_at":"2024-02-07T21:58:40Z","title":"Analyzing Adversarial Inputs in Deep Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T03:40:04.265426Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2402.05284"},"observation_digest":"sha256:6e894f217bfa08da8d0c90a629f7a887c988e9b7058713976c76b891285e80d4","observation_id":"9c2beb96-954f-46f4-bb67-e7fe4fd3646b","resolution":{"observed_at":"2026-05-24T03:43:50.399138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T22:53:59.590929Z","title":"S.; and Terry, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01463","last_updated":"2024-12-31T16:44:20Z","snapshot_observed_at":"2026-08-10T22:46:16.559285Z","submitted_at":"2024-12-31T16:44:20Z","title":"Goal Recognition using Actor-Critic Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:53:59.590929Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.01463"},"observation_digest":"sha256:ccf0c4255b3e48b2e5c2e7f3c8983a928a2614f72d6add96478a60467ab76edb","observation_id":"2cc7cd32-c3fa-4324-a7e8-4cfa79d27183","resolution":{"observed_at":"2026-08-10T22:53:59.590929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T21:48:59.286757Z","title":"CoRR abs/2306.13831 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03888","last_updated":"2025-04-23T21:30:44Z","snapshot_observed_at":"2026-08-15T06:05:08.484748Z","submitted_at":"2025-01-07T15:51:49Z","title":"Neural DNF-MT: A Neuro-symbolic Approach for Learning Interpretable and Editable Policies","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T21:48:59.286757Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.03888"},"observation_digest":"sha256:ac12933640e80d5d3fecd2d520171ed7bac1b5edc7be4df461417b8187aadb48","observation_id":"0ad3e190-2755-4481-9646-9530c15d4b20","resolution":{"observed_at":"2026-08-10T21:48:59.286757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T23:33:31.287184Z","title":"Mini- grid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10395","last_updated":"2024-12-28T21:13:48Z","snapshot_observed_at":"2026-08-13T16:56:44.274703Z","submitted_at":"2024-12-28T21:13:48Z","title":"Towards General Purpose Robots at Scale: Lifelong Learning and Learning to Use Memory","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:31.287184Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.10395"},"observation_digest":"sha256:00b264d51a143bdcdaccefb1c542af1ce6259355ef17c90e2d68993cca5e06ab","observation_id":"16c48ef7-5a52-47a3-b811-8b765277d97b","resolution":{"observed_at":"2026-08-10T23:33:31.287184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T18:11:48.331467Z","title":"CoRR abs/2306.13831 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11533","last_updated":"2025-01-20T15:17:24Z","snapshot_observed_at":"2026-08-14T12:39:10.034760Z","submitted_at":"2025-01-20T15:17:24Z","title":"The impact of intrinsic rewards on exploration in Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:48.331467Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.11533"},"observation_digest":"sha256:0e640b856eb2fd79a3e61c99f7d75b7bc0b7331ceaa3f7c46a8e34efe0fac9df","observation_id":"42dad2b2-8000-4a36-8231-92966b1ed133","resolution":{"observed_at":"2026-08-10T18:11:48.331467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T17:09:05.477155Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks.CoRR, abs/2306.13831,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12539","last_updated":"2025-01-21T23:06:34Z","snapshot_observed_at":"2026-08-15T03:52:39.755135Z","submitted_at":"2025-01-21T23:06:34Z","title":"Compositional Instruction Following with Language Models and Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:05.477155Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.12539"},"observation_digest":"sha256:05b7c3de4b1aa23c2bba19260dd4d469568ff50af6e55e4e137b94c896be6b97","observation_id":"b7aa9363-60c5-4f48-aa07-d78c3ef7f23d","resolution":{"observed_at":"2026-08-10T17:09:05.477155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T14:25:58.783770Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15418","last_updated":"2025-01-26T06:43:45Z","snapshot_observed_at":"2026-08-12T18:01:28.057653Z","submitted_at":"2025-01-26T06:43:45Z","title":"Episodic Novelty Through Temporal Distance","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T14:25:58.783770Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.15418"},"observation_digest":"sha256:b264fc03b802c734d5697f103d26a1f54b1129736e99a2da44e4ff5e850c302d","observation_id":"5e9349a1-0eba-42cd-a382-7b7e4d20e845","resolution":{"observed_at":"2026-08-10T14:25:58.783770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T14:18:10.241911Z","title":"Minigrid & miniworld: Modular & custom- izable reinforcement learning environments for goal-oriented tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15495","last_updated":"2025-01-26T11:53:18Z","snapshot_observed_at":"2026-08-15T05:46:48.513786Z","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T14:18:10.241911Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.15495"},"observation_digest":"sha256:7c984d6a68cb160f0f9d0b57ddb3446d93b46c0ee4e54361b29b2bf37517582f","observation_id":"47b2dff7-585a-4102-b177-11276443a59b","resolution":{"observed_at":"2026-08-10T14:18:10.241911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T05:41:41.993955Z","title":"CoRR abs/2306.13831 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16922","last_updated":"2025-01-28T13:09:08Z","snapshot_observed_at":"2026-08-13T17:51:52.803994Z","submitted_at":"2025-01-28T13:09:08Z","title":"Agential AI for Integrated Continual Learning, Deliberative Behavior, and Comprehensible Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T05:41:41.993955Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.16922"},"observation_digest":"sha256:068434d1beceaf5e01a0edb46739eaff787599b5b279cea84b65ba296b125b41","observation_id":"5e0e6c17-95be-45f2-b09f-ed4b93673c9e","resolution":{"observed_at":"2026-08-10T05:41:41.993955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-09T22:20:04.893504Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-13T17:40:41.015920Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.893504Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:932f611405efc479ce5731211c84558228d82edd2e9387a8b2ee2c477b9bedfb","observation_id":"b0c901bf-0618-4309-8938-32634bdd20f6","resolution":{"observed_at":"2026-08-09T22:20:04.893504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-08T18:17:14.652499Z","title":"Chevalier-Boisvert, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05726","last_updated":"2025-02-08T23:59:41Z","snapshot_observed_at":"2026-08-10T20:02:39.640691Z","submitted_at":"2025-02-08T23:59:41Z","title":"Improving Environment Novelty Quantification for Effective Unsupervised Environment Design","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:17:14.652499Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2502.05726"},"observation_digest":"sha256:3c9d1a94403fb04a739b78c64592b56cf8a37f8b8a253142e0415e5f39c291c7","observation_id":"734c8811-00fc-40b2-9f03-b4be1aece8e2","resolution":{"observed_at":"2026-08-08T18:17:14.652499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-07T15:36:25.068363Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks.CoRR, abs/2306.13831, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-10T19:06:19.246966Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:25.068363Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:48aff18a8c3cf0ef2cff285cedce183f331b776c9e0347393375db3deef6bd4c","observation_id":"fbd77ceb-c0ea-462a-ae9a-d395ec67d38b","resolution":{"observed_at":"2026-08-07T15:36:25.068363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-07T12:02:48.964756Z","title":"Available: https://arxiv.org/abs/2306.13831","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02050","last_updated":"2025-06-01T06:36:19Z","snapshot_observed_at":"2026-08-07T11:54:12.395783Z","submitted_at":"2025-06-01T06:36:19Z","title":"Decoupled Hierarchical Reinforcement Learning with State Abstraction for Discrete Grids","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:48.964756Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2506.02050"},"observation_digest":"sha256:423f0bc72070a869989ccd5131ce24e25d6d00703a7e5f443cf87b07c661fbb8","observation_id":"5e37d9c1-1727-492a-8ec1-68c3528442f5","resolution":{"observed_at":"2026-08-07T12:02:48.964756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-07T11:14:12.974112Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environ- ments for goal-oriented tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03046","last_updated":"2025-06-03T16:28:33Z","snapshot_observed_at":"2026-08-15T04:16:03.407898Z","submitted_at":"2025-06-03T16:28:33Z","title":"EDEN: Entorhinal Driven Egocentric Navigation Toward Robotic Deployment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:12.974112Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2506.03046"},"observation_digest":"sha256:73d45b243a1e4a27d076ca8dcafc43252d4d6b4c5f675dd54d13b0df4993246a","observation_id":"1eff20ee-290f-42e4-b015-bb96db40f900","resolution":{"observed_at":"2026-08-07T11:14:12.974112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-07T00:28:23.677281Z","title":"d., Willems, L., Lahlou, S., Pal, S., Castro, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14224","last_updated":"2025-06-17T06:27:42Z","snapshot_observed_at":"2026-08-09T06:53:57.242931Z","submitted_at":"2025-06-17T06:27:42Z","title":"From Black Boxes to Transparent Minds: Evaluating and Enhancing the Theory of Mind in Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:28:23.677281Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2506.14224"},"observation_digest":"sha256:c469047f17f74d8d407d38285b671513963c358cea444ea550bd13af184956c7","observation_id":"806965e1-0ce4-4b89-b66d-9da4b55bbcb6","resolution":{"observed_at":"2026-08-07T00:28:23.677281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-06T22:18:38.982999Z","title":"Chevalier-Boisvert, M., Dai, B., Towers, M., de Lazcano, R., Willems, L., Lahlou, S., Pal, S., Castro, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21899","last_updated":"2025-06-27T04:36:05Z","snapshot_observed_at":"2026-08-13T08:33:12.569008Z","submitted_at":"2025-06-27T04:36:05Z","title":"Advancements and Challenges in Continual Reinforcement Learning: A Comprehensive Review","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:38.982999Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2506.21899"},"observation_digest":"sha256:eab508c39ddb816bf4996c7453a799bc519805f11baee00da6f97245f99d286a","observation_id":"1fd94e55-4c98-44fd-be41-e5f1d093587e","resolution":{"observed_at":"2026-08-06T22:18:38.982999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-06T18:09:03.036371Z","title":"Minigrid & Miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09127","last_updated":"2025-07-12T03:29:59Z","snapshot_observed_at":"2026-08-13T08:28:49.738243Z","submitted_at":"2025-07-12T03:29:59Z","title":"A Study of Value-Aware Eigenoptions","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:03.036371Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2507.09127"},"observation_digest":"sha256:e3c16ba333502df618a892110a08a1f0895dad3063b5199d45ea5293e6572058","observation_id":"c423d529-de9e-4faf-8203-f7d6c1a3a172","resolution":{"observed_at":"2026-08-06T18:09:03.036371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-06T10:34:35.458936Z","title":"Maxime Chevalier-Boisvert, Bolun Dai, Mark Towers, Rodrigo de Lazcano, Lucas Willems, Salem Lahlou, Suman Pal, Pablo Samuel Castro, and Jordan Terry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00046","last_updated":"2025-07-31T16:11:37Z","snapshot_observed_at":"2026-08-12T09:24:32.321683Z","submitted_at":"2025-07-31T16:11:37Z","title":"Benchmarking Partial Observability in Reinforcement Learning with a Suite of Memory-Improvable Domains","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T10:34:35.458936Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2508.00046"},"observation_digest":"sha256:3363d5bb55a47abecdb27544a76c684eaf392c1ae50fcbfc9f302d34176b6d84","observation_id":"88d47128-e266-4562-9d1e-19f0acf8ba87","resolution":{"observed_at":"2026-08-06T10:34:35.458936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:4e79974d9c2d55089b516794ab31cd5a0f2c6f67127e6452292b45d116607da0","observation_id":"c0e503b3-e523-4b8f-a701-ff9a49998555","resolution":{"observed_at":"2026-05-18T11:56:20.033957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2509.25438","last_updated":"2026-04-03T16:34:50Z","snapshot_observed_at":"2026-08-13T08:27:13.793339Z","submitted_at":"2025-09-29T19:43:44Z","title":"Beyond Noisy-TVs: Noise-Robust Exploration Via Learning Progress Monitoring","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T11:50:46.257332Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2509.25438"},"observation_digest":"sha256:26b81694c04df1452ae256499e38b27bc5b4679c71aa1dc93d5299bbe01a68a1","observation_id":"db822c03-c3cf-441c-8dfd-29405fb16ab6","resolution":{"observed_at":"2026-05-18T11:51:20.166205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-03T13:00:52.054561Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01075","last_updated":"2026-05-28T18:42:26Z","snapshot_observed_at":"2026-08-08T07:29:12.731200Z","submitted_at":"2026-01-03T05:22:27Z","title":"Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T13:00:52.054561Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2601.01075"},"observation_digest":"sha256:193bb8dd667e26422971905b53cf977da92af564f3ff44bcd27f9020ee8aefa6","observation_id":"e594b534-a988-416c-8c5d-7f54c2ed0b20","resolution":{"observed_at":"2026-08-03T13:00:52.054561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2601.02850","last_updated":"2026-04-10T09:49:22Z","snapshot_observed_at":"2026-08-11T07:20:53.848967Z","submitted_at":"2026-01-06T09:28:53Z","title":"Sample-Efficient Neurosymbolic Deep Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T17:32:45.526619Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2601.02850"},"observation_digest":"sha256:bdbc8048421b18c2380caeaf188bc39836cf5c371f37ed2568d9c82b9259f3ef","observation_id":"4a4586f3-e19b-4a25-b8e1-10ac83b2683f","resolution":{"observed_at":"2026-05-16T17:33:09.876015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2604.14440","last_updated":"2026-04-09T13:39:12Z","snapshot_observed_at":"2026-07-06T23:02:13.885476Z","submitted_at":"2026-04-09T13:39:12Z","title":"On Tackling Complex Tasks with Reward Machines and Signal Temporal Logics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:48:46.133244Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2604.14440"},"observation_digest":"sha256:562aeefedd8f2e0a0969a7f9b7d003f8b88c3ee11c48e6a5d1f0b84636613e07","observation_id":"4f95205a-9ef8-4466-ad84-e4664be53a97","resolution":{"observed_at":"2026-05-11T08:06:01.467154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2604.21640","last_updated":"2026-04-23T12:55:45Z","snapshot_observed_at":"2026-08-13T08:27:59.076202Z","submitted_at":"2026-04-23T12:55:45Z","title":"Task-specific Subnetwork Discovery in Reinforcement Learning for Autonomous Underwater Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T22:49:56.078405Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2604.21640"},"observation_digest":"sha256:79f4f6702a7707d92d15c10f8b1ad2f64f91fda1a829385cbf8916fc318fba6c","observation_id":"249b7768-812c-43a1-9dcd-1c7541eff87b","resolution":{"observed_at":"2026-05-09T22:54:16.622894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2604.25534","last_updated":"2026-04-28T12:02:10Z","snapshot_observed_at":"2026-08-15T00:59:50.158497Z","submitted_at":"2026-04-28T12:02:10Z","title":"Sample-efficient Neuro-symbolic Proximal Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T16:38:19.806439Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2604.25534"},"observation_digest":"sha256:ac6dbaf69c3f75689ffe938be73210314a8e395a57d648021537c7af3a4b1850","observation_id":"37896462-2845-4da1-acad-c6e543a1ef69","resolution":{"observed_at":"2026-05-11T23:36:34.774065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2604.27162","last_updated":"2026-04-29T20:09:13Z","snapshot_observed_at":"2026-08-13T08:27:55.370720Z","submitted_at":"2026-04-29T20:09:13Z","title":"A High-Throughput Compute-Efficient POMDP Hide-And-Seek-Engine (HASE) for Multi-Agent Operations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T10:27:55.337253Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2604.27162"},"observation_digest":"sha256:a9606b132092f875776cabfe7138f702c5f04fe39178b2e7cc26e008ec83face","observation_id":"c7daf9c3-7f3d-4f72-8d80-2390cabacc55","resolution":{"observed_at":"2026-05-12T09:36:26.209121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2605.12261","last_updated":"2026-05-12T15:28:32Z","snapshot_observed_at":"2026-08-13T22:40:14.931790Z","submitted_at":"2026-05-12T15:28:32Z","title":"Delay-Empowered Causal Hierarchical Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:46:51.659283Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2605.12261"},"observation_digest":"sha256:996271468f9129b0eebe113945b017548faf2f200871c3ca2783aa06564fc3eb","observation_id":"19046d83-b390-4b5c-b529-100f47526c42","resolution":{"observed_at":"2026-05-13T05:47:21.226559Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2605.23372","last_updated":"2026-05-22T08:36:49Z","snapshot_observed_at":"2026-07-06T23:33:34.409634Z","submitted_at":"2026-05-22T08:36:49Z","title":"Curriculum reinforcement learning with measurable task representation learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T05:19:03.596677Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2605.23372"},"observation_digest":"sha256:26f15c9f79eb2a7b5d7e72f7142b7033fac2e8c42a7247b257c5fc424856db2f","observation_id":"5f437c8c-8633-4489-83ce-e7ef3467e6d9","resolution":{"observed_at":"2026-05-25T05:20:24.560240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2605.26357","last_updated":"2026-05-27T14:46:11Z","snapshot_observed_at":"2026-08-14T23:15:15.303806Z","submitted_at":"2026-05-25T22:05:32Z","title":"Balancing Plasticity and Stability with Fast and Slow Successor Features","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T22:16:25.136354Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2605.26357"},"observation_digest":"sha256:2f546f89278e6ed49fe353560cb0fa88e22900765d447094f9fb48b2c20ff47e","observation_id":"b89d3eee-efee-4c50-a362-d86d727babf0","resolution":{"observed_at":"2026-06-29T22:24:00.754884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2605.31444","last_updated":"2026-05-29T15:40:10Z","snapshot_observed_at":"2026-08-02T04:52:08.562980Z","submitted_at":"2026-05-29T15:40:10Z","title":"Answer-Set-Programming-based Abstractions for Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T22:10:11.084288Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2605.31444"},"observation_digest":"sha256:51988ab7a404b62a4eeaa93f3ad7640ca635eda9e183d39fb064b77f31866778","observation_id":"bf40035a-c24f-4595-953c-a7ff044669e2","resolution":{"observed_at":"2026-06-28T22:12:41.160903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2606.06673","last_updated":"2026-06-04T19:46:45Z","snapshot_observed_at":"2026-08-04T00:52:00.771854Z","submitted_at":"2026-06-04T19:46:45Z","title":"Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T02:47:16.737433Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2606.06673"},"observation_digest":"sha256:768fd21d8fcbac0505bcfb1d5897182f2e5989bd8b1c812f6d7bfbe5daf1e9f7","observation_id":"66648b06-833f-4527-83c1-5066dfd4b23a","resolution":{"observed_at":"2026-07-02T11:56:55.194573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:ad0b5378146f0c6c141817c45bda0e5df5c585b2956c0aded7437ccf048a022f","observation_id":"4d1b2123-ab5a-46f2-9d21-892bee0dba0b","resolution":{"observed_at":"2026-07-03T10:58:02.930938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2606.21350","last_updated":"2026-06-19T11:47:54Z","snapshot_observed_at":"2026-08-13T08:27:56.904825Z","submitted_at":"2026-06-19T11:47:54Z","title":"A Reward-Petri-Net Interpretation of Temporal Behavior Trees","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:21:52.629708Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2606.21350"},"observation_digest":"sha256:cb21ec6067114cda7549cd7666971ee1cdc9fcfc1375168141b5df2e90f610f2","observation_id":"b8ccee83-874f-40ce-a4bb-7477470645b7","resolution":{"observed_at":"2026-07-04T06:39:37.076843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2606.24622","last_updated":"2026-06-23T14:20:42Z","snapshot_observed_at":"2026-08-11T07:47:02.770685Z","submitted_at":"2026-06-23T14:20:42Z","title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-25T23:35:03.577967Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2606.24622"},"observation_digest":"sha256:fb5f9eee0d0a57bb915548a784bba760a315f21a8297a882457016f0730aa337","observation_id":"8cc002af-4a8a-4e1d-96da-5b2b677bff84","resolution":{"observed_at":"2026-07-04T17:40:00.106038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2607.02087","last_updated":"2026-07-10T20:58:05Z","snapshot_observed_at":"2026-08-13T13:40:51.349383Z","submitted_at":"2026-07-02T12:27:54Z","title":"SUNTA: Hierarchical Video Prediction with Surprise-based Chunking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T13:20:21.237349Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2607.02087"},"observation_digest":"sha256:47d514baec0b1ca023346113c89bafdb7150f5b2031c00ef2fe01d64ac11b9db","observation_id":"655bdfa1-6890-4f0f-8c0c-4e5c034c284e","resolution":{"observed_at":"2026-07-03T13:28:18.361038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-07-14T16:42:04.979573Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks.CoRR, abs/2306.13831, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02087","last_updated":"2026-07-10T20:58:05Z","snapshot_observed_at":"2026-08-13T13:40:51.349383Z","submitted_at":"2026-07-02T12:27:54Z","title":"SUNTA: Hierarchical Video Prediction with Surprise-based Chunking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T16:42:04.979573Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2607.02087"},"observation_digest":"sha256:3fee3a24a42281714637f29744b5429d2a02c978e233b8713af6e51a89695b72","observation_id":"b6f03681-b386-4b97-bf31-5408cf38ca32","resolution":{"observed_at":"2026-07-14T16:42:04.979573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2607.02440","last_updated":"2026-07-02T17:10:13Z","snapshot_observed_at":"2026-07-07T00:07:52.110955Z","submitted_at":"2026-07-02T17:10:13Z","title":"EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-03T13:11:58.158818Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2607.02440"},"observation_digest":"sha256:c1e1e94c609a6ef2fd132ab14875242b88065511c17fad496c15ebdc72232988","observation_id":"159416f4-d00b-48cf-bd71-380b66e2c62d","resolution":{"observed_at":"2026-07-03T13:18:12.241595Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":"2306.13831","doi":"10.48550/arxiv.2306.13831","metadata_source":"pith","pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Minigrid & mini- world: Modular & customizable reinforcement learning environments for goal-oriented tasks","venue":"cs.LG","work_id":"5af58a25-08fc-470d-9baf-2b7e691d4ac5","year":2023},"citing_paper":{"arxiv_id":"2607.07753","last_updated":"2026-07-21T12:45:07Z","snapshot_observed_at":"2026-08-14T11:34:17.923294Z","submitted_at":"2026-07-08T12:20:19Z","title":"A Transdiagnostic Space of Disorder Like Phenotypes in Reinforcement Learning Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-10T19:29:04.724592Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2607.07753"},"observation_digest":"sha256:2ac8565dd5f0f78c994093f3e158cd736762ee5b7671bf0b71d834e99e70396d","observation_id":"9a263dd0-8452-4895-8445-7a9cd3f65b74","resolution":{"observed_at":"2026-07-10T19:37:34.036674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-02T08:08:18.854750Z","title":"S.; and Terry, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07753","last_updated":"2026-07-21T12:45:07Z","snapshot_observed_at":"2026-08-14T11:34:17.923294Z","submitted_at":"2026-07-08T12:20:19Z","title":"A Transdiagnostic Space of Disorder Like Phenotypes in Reinforcement Learning Agents","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T08:08:18.854750Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2607.07753"},"observation_digest":"sha256:526335bffb844b41edb6d71c852a2d4254655376d126aa28cc97914da46d6e4a","observation_id":"abcac59a-317c-4e67-a7d2-b933c8cec857","resolution":{"observed_at":"2026-08-02T08:08:18.854750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-10T04:22:03.615292Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks.CoRR, abs/2306.13831,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06595","last_updated":"2026-08-06T21:11:16Z","snapshot_observed_at":"2026-08-14T20:47:00.766806Z","submitted_at":"2026-08-06T21:11:16Z","title":"Flowing Through States: Neural ODE Regularization for Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T04:22:03.615292Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2608.06595"},"observation_digest":"sha256:edcfa3e96911b891ec094bc72206bf6f04684ccbd88bc478d05b2235cb471b98","observation_id":"0c5909dd-f9d5-400d-9bd2-c38eb8a43d17","resolution":{"observed_at":"2026-08-10T04:22:03.615292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.13831/citation-record","integrity":"/paper/2306.13831/integrity","json":"/paper/2306.13831/citation-record.json","paper":"/paper/2306.13831"},"outbound":[],"paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T11:10:18.712074Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2306.13831."}