{"as_of":"2026-08-04T12:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf513769ea786d9a5d5277a40c14ef3825d4f1b64a592a57b722d941ad7d5ad5","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T17:29:49.186565Z","state":"measured"},{"denominator":134,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":134,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":151,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:44:10.273710Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2408.11328","last_updated":"2025-01-20T07:30:21Z","snapshot_observed_at":"2026-08-02T13:37:46.782596Z","submitted_at":"2024-08-21T04:21:30Z","title":"Fast State Stabilization using Deep Reinforcement Learning for Measurement-based Quantum Feedback Control","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T21:51:19.092922Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2408.11328"},"observation_digest":"sha256:fa2533fb2c3319197bae393270cc6c127a3008d4edac9de1e6fa46703edddd72","observation_id":"1ad05e3f-1abb-400b-8ee8-3e6c7d5bc467","resolution":{"observed_at":"2026-05-23T21:53:29.693750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2502.10932","last_updated":"2026-04-17T16:12:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-15T23:46:58Z","title":"Simultaneous Multi-die Floorplanning and Technology Assignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T03:12:22.952242Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2502.10932"},"observation_digest":"sha256:87aa0d8f822515a552e9bb9a5fe2598ac4fca62bfb6fee3b023c908711cfbfee","observation_id":"e3984839-5ff8-4ae8-a313-c5bbae50d858","resolution":{"observed_at":"2026-05-23T03:12:27.823806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2504.13541","last_updated":"2026-04-17T06:31:21Z","snapshot_observed_at":"2026-07-06T21:11:24.852957Z","submitted_at":"2025-04-18T08:12:59Z","title":"Scalable Multi-Task Learning through Spiking Neural Networks with Adaptive Task-Switching Policy for Intelligent Autonomous Agents","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T19:45:07.172201Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2504.13541"},"observation_digest":"sha256:cb2caaec0ef3d43be7f4da939ce93cf442eb854fbfbc5d65f60c5de8cd39aeaf","observation_id":"dc687816-0c83-40b4-9119-be571fae50fa","resolution":{"observed_at":"2026-05-22T19:47:01.207783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2505.04310","last_updated":"2026-05-05T14:58:08Z","snapshot_observed_at":"2026-07-06T21:20:17.283199Z","submitted_at":"2025-05-07T10:49:53Z","title":"Parameter-Efficient Distributional RL via Normalizing Flows and a Geometry-Aware Cram\\'er Surrogate","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T16:36:48.916557Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2505.04310"},"observation_digest":"sha256:4f52eb6540eba80efe8b17f56032cb11fe3f04b91fe85bba8a6940d29c3919b1","observation_id":"76ee0218-c645-4b50-a96e-061bf73025c9","resolution":{"observed_at":"2026-05-22T16:41:47.655473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2506.01665","last_updated":"2026-05-07T07:15:27Z","snapshot_observed_at":"2026-08-02T21:48:00.489948Z","submitted_at":"2025-06-02T13:35:03Z","title":"Leveraging Analytic Gradients in Provably Safe Reinforcement Learning","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T11:04:23.284562Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2506.01665"},"observation_digest":"sha256:83d1b53fd74b237472029a572d51e9b15f122162e19d37819dd281cf65a9afce","observation_id":"26fcbf04-c1e7-4db9-9f69-92a9ccdc7c54","resolution":{"observed_at":"2026-05-19T11:07:15.364046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2506.12622","last_updated":"2026-04-18T21:54:34Z","snapshot_observed_at":"2026-08-02T08:28:01.941809Z","submitted_at":"2025-06-14T20:36:44Z","title":"DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T09:09:51.531488Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2506.12622"},"observation_digest":"sha256:ea3d16af73aca437b7d4bab7bd0315e373a710fa8ec698b2b68e09349cd91c7c","observation_id":"f45010df-8e02-4ec1-adec-3a1a9117f319","resolution":{"observed_at":"2026-05-19T09:12:14.637710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2506.21872","last_updated":"2026-04-07T07:52:44Z","snapshot_observed_at":"2026-07-06T21:48:26.210695Z","submitted_at":"2025-06-27T03:10:20Z","title":"A Survey of Continual Reinforcement Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T08:27:03.376909Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2506.21872"},"observation_digest":"sha256:d039713ad38bc055c69764c7eb42f61623f05bf96af4820ed9cd5fe16af694f5","observation_id":"ddd202c7-ae37-4a30-8447-3b99b380b73b","resolution":{"observed_at":"2026-05-19T08:27:11.186560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2507.00275","last_updated":"2026-05-14T20:49:30Z","snapshot_observed_at":"2026-07-06T21:50:11.849401Z","submitted_at":"2025-06-30T21:32:46Z","title":"Deep Double Q-learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-22T00:23:41.373753Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2507.00275"},"observation_digest":"sha256:3e958af5d38761973df01a668ce801f29462f3bbd4e18b565b53ff82fb1b016b","observation_id":"a59e7710-90a6-467e-bbb0-bb781937730f","resolution":{"observed_at":"2026-05-22T00:24:27.686506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2507.23501","last_updated":"2026-05-06T14:50:11Z","snapshot_observed_at":"2026-07-31T14:58:14.768285Z","submitted_at":"2025-07-31T12:40:50Z","title":"Adaptive Ensemble Aggregation for Actor-Critics","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T02:14:26.752215Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2507.23501"},"observation_digest":"sha256:9cc35822c153e90b52d076d124349a74689d937eee953bbb3e0d078fa64acbe0","observation_id":"f7f68170-0374-4a9d-acd1-92ff3a8dc84a","resolution":{"observed_at":"2026-05-19T02:16:59.343268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2508.07555","last_updated":"2026-04-25T21:30:41Z","snapshot_observed_at":"2026-07-06T22:10:54.210191Z","submitted_at":"2025-08-11T02:30:44Z","title":"Multimodal Remote Inference","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T00:28:59.722036Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2508.07555"},"observation_digest":"sha256:a04e593713e2007bdc6f582201cbc971ab8124e06625ca291c43965912241536","observation_id":"5080fb25-fd1f-480b-8f92-a5523977057c","resolution":{"observed_at":"2026-05-19T00:31:55.722803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2508.09128","last_updated":"2026-05-12T01:20:33Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:55:36Z","title":"A Review On Safe Reinforcement Learning Using Lyapunov and Barrier Functions","version":4},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-18T22:37:32.388931Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2508.09128"},"observation_digest":"sha256:60e128cb94d17a16b12f0ec9645c7813c4a261ddd2f87a0f0fb9dc84229cd805","observation_id":"702ff302-e68b-4952-a337-6e711e05ce63","resolution":{"observed_at":"2026-05-18T22:41:53.816999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2509.19771","last_updated":"2026-07-22T07:13:47Z","snapshot_observed_at":"2026-07-25T23:19:51.619342Z","submitted_at":"2025-09-24T05:42:38Z","title":"Frictional Q-Learning","version":5},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T14:47:49.452254Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2509.19771"},"observation_digest":"sha256:7630193567d5484a452ef137a9796515e6be2f1180c200419dc1ca89637a5912","observation_id":"07600789-4410-451c-9e67-1c81d76bf389","resolution":{"observed_at":"2026-05-18T14:51:30.330206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2509.22562","last_updated":"2026-04-30T15:40:29Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T16:41:47Z","title":"Activation Function Design Sustains Plasticity in Continual Learning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T13:00:27.749673Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2509.22562"},"observation_digest":"sha256:b0cc6ef6859dfe6e8ff2b2a9d1cc6d66fb2a42bdbe64c5dbae78d2b12de97a8e","observation_id":"6887066f-0c03-4bd1-97f9-612a5687b85b","resolution":{"observed_at":"2026-05-18T13:01:23.654432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2510.05706","last_updated":"2026-05-11T08:36:49Z","snapshot_observed_at":"2026-07-06T22:31:53.944103Z","submitted_at":"2025-10-07T09:16:28Z","title":"Sample-Efficient and Smooth Cross-Entropy Method Model Predictive Control Using Deterministic Samples","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T09:41:09.249720Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2510.05706"},"observation_digest":"sha256:2f44d5e5621b877d5282ae1ffb74998a5f0a30ddc480e8b9dd0fc2515f1cb326","observation_id":"b4df839b-8ef7-49df-8dae-7dab23f409c4","resolution":{"observed_at":"2026-05-18T09:41:11.868668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-04T10:44:10.273710Z","title":"Gymnasium: A standard interface for reinforcement learning environments.arXiv preprint arXiv:2407.17032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09222","last_updated":"2026-06-01T11:49:06Z","snapshot_observed_at":"2026-08-04T10:44:01.525320Z","submitted_at":"2025-10-10T10:08:10Z","title":"FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T10:44:10.273710Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2510.09222"},"observation_digest":"sha256:093f9eff74470d5fe7997a221fb74cdc4c0f9158a601dde4b870fb55fd1547d3","observation_id":"34092251-1bfb-4445-b1f7-954df86d5d26","resolution":{"observed_at":"2026-08-04T10:44:10.273710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-04T10:24:38.370792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10544","last_updated":"2026-05-28T18:38:46Z","snapshot_observed_at":"2026-08-04T10:24:30.098237Z","submitted_at":"2025-10-12T11:02:18Z","title":"PAC-Bayesian Reinforcement Learning Trains Generalizable Policies","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T10:24:38.370792Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2510.10544"},"observation_digest":"sha256:3949df6666d37fd00ebd6894c1f23ef8665f0fce56bd3f4571eed8554ffc4188","observation_id":"1679701d-c456-44c8-b4d4-e2602b7dcfd4","resolution":{"observed_at":"2026-08-04T10:24:38.370792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-04T08:23:18.615603Z","title":"Gymnasium: A standard in- terface for reinforcement learning environments.arXiv preprint arXiv:2407.17032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-04T08:23:16.054617Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.615603Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:c4ba4120694dc753bc92d45452922fa87b3c8d4792c5a815f5c1b172ac5ce9c6","observation_id":"14589165-7326-40fa-86ab-bda16ccf679e","resolution":{"observed_at":"2026-08-04T08:23:18.615603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2511.14887","last_updated":"2026-05-04T21:14:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T20:11:54Z","title":"Transformer-Guided Deep Reinforcement Learning for Optimal Takeoff Trajectory Design of an eVTOL Drone","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:14.574161Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2511.14887"},"observation_digest":"sha256:c82cacf7455c748f13dbd2bde48596ee24f8f79ec951815f5a52334fd8e42e3a","observation_id":"0e918685-e03b-490d-8bf8-5b012e6cfbc8","resolution":{"observed_at":"2026-05-17T20:25:11.603806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2511.21356","last_updated":"2026-04-21T18:32:02Z","snapshot_observed_at":"2026-08-02T14:15:25.964863Z","submitted_at":"2025-11-26T13:04:24Z","title":"Hybrid-AIRL: Enhancing Inverse Reinforcement Learning with Supervised Expert Guidance","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T04:59:49.126016Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2511.21356"},"observation_digest":"sha256:86941d293c45fa1bb322beea5484054232b86e6c8a4b07f5ffbf763cac2150e3","observation_id":"2424d9ec-c41b-4199-a6d3-96a67b382a48","resolution":{"observed_at":"2026-05-17T05:01:31.980297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T16:50:39.504717Z","title":"Gymnasium: A standard interface for reinforcement learning environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.11736","last_updated":"2026-06-16T18:35:41Z","snapshot_observed_at":"2026-08-03T16:50:36.586378Z","submitted_at":"2025-12-12T17:25:32Z","title":"Bench-Push: Benchmarking Pushing-based Navigation and Manipulation Tasks for Mobile Robots","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:50:39.504717Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2512.11736"},"observation_digest":"sha256:feb41b882cafc5a50783847b55b5b77fec6f57c4107131c86facec92ab4e7149","observation_id":"6fa6eba9-beb3-414e-8c84-3f9f0a826e2d","resolution":{"observed_at":"2026-08-03T16:50:39.504717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2512.12116","last_updated":"2026-05-08T01:30:43Z","snapshot_observed_at":"2026-07-06T22:38:54.914862Z","submitted_at":"2025-12-13T01:17:05Z","title":"Neural CDEs as Correctors for Learned Time Series Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T23:23:44.658505Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2512.12116"},"observation_digest":"sha256:f6c39827a523126a236d0619f43f119038e85685b808f597cab8aee85b90f932","observation_id":"e3c5a018-ffd2-4a77-aa52-d87da4bbf2b6","resolution":{"observed_at":"2026-05-16T23:28:41.114510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T15:16:58.894784Z","title":"Gymnasium: A standard inter- face for reinforcement learning environments.arXiv preprint arXiv:2407.17032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17534","last_updated":"2026-06-30T16:25:53Z","snapshot_observed_at":"2026-08-03T15:16:51.749592Z","submitted_at":"2025-12-19T12:58:06Z","title":"The HydroGym Reinforcement Learning Platform for Fluid Dynamics","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T15:16:58.894784Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2512.17534"},"observation_digest":"sha256:70675775e8bd441b9cd93dafc9f5cbeb7126dad96bc17df504cc8218b8e59b1f","observation_id":"d9f81cab-8180-4215-9a49-47f63f87206c","resolution":{"observed_at":"2026-08-03T15:16:58.894784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2512.17637","last_updated":"2026-05-12T16:44:19Z","snapshot_observed_at":"2026-07-06T22:39:33.919723Z","submitted_at":"2025-12-19T14:39:03Z","title":"About Time: Model-free Reinforcement Learning with Timed Reward Machines","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T21:00:52.571711Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2512.17637"},"observation_digest":"sha256:79639a5807d6a4f0ab9ec9049dcd4b146979e7fecbff016341f1d80b1f401364","observation_id":"be4c433f-3587-481d-9bfb-28318e12f44e","resolution":{"observed_at":"2026-05-16T21:01:16.070561Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T12:51:11.368695Z","title":"Towers, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01690","last_updated":"2026-06-17T23:24:39Z","snapshot_observed_at":"2026-08-03T12:51:04.658306Z","submitted_at":"2026-01-04T23:08:48Z","title":"Quantum Nonlinearity for Optical Neural Computing","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T12:51:11.368695Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2601.01690"},"observation_digest":"sha256:cab6939621b60ee754938e4ca8335aad75afa05fe30f5aec71408bc7e865c857","observation_id":"e6f94848-e6ac-44c4-b7c4-2a52a9098c75","resolution":{"observed_at":"2026-08-03T12:51:11.368695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T09:03:32.549413Z","title":"U., De Cola, G., Deleu, T., Goul˜ao, M., Kallinteris, A., Krimmel, M., KG, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15015","last_updated":"2026-05-27T13:43:47Z","snapshot_observed_at":"2026-08-03T09:03:27.189262Z","submitted_at":"2026-01-21T14:13:44Z","title":"Plug-and-Play Benchmarking of Reinforcement Learning Algorithms for Large-Scale Flow Control","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T09:03:32.549413Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2601.15015"},"observation_digest":"sha256:b0bcb1251b9fbf7db3cd69452a6d19b36903329b1dee012af080f420aa18d85e","observation_id":"be9ed1c7-6ae6-4714-acfd-bb9e1c5669a7","resolution":{"observed_at":"2026-08-03T09:03:32.549413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T07:16:24.426964Z","title":"Gymnasium: A standard interface for reinforcement learning environments.arXiv preprint arXiv:2407.17032,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.20753","last_updated":"2026-07-07T10:01:44Z","snapshot_observed_at":"2026-08-03T07:16:21.008910Z","submitted_at":"2026-01-28T16:36:37Z","title":"GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning","version":4},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-03T07:16:24.426964Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2601.20753"},"observation_digest":"sha256:4582c4d472e04c998b9eb252e0da0ec1eba29a32b2685b3c1361a1469febd911","observation_id":"a6654283-b7bc-4612-bdc2-65b07539f193","resolution":{"observed_at":"2026-08-03T07:16:24.426964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T06:26:45.267364Z","title":"dominant axes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22970","last_updated":"2026-06-18T12:14:31Z","snapshot_observed_at":"2026-08-03T06:20:35.156070Z","submitted_at":"2026-01-30T13:32:52Z","title":"Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic Methods","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T06:26:45.267364Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2601.22970"},"observation_digest":"sha256:7c31d31ea8f68b365236931da12ebb6529e49d41ea17d0c20f2076e8af9f0c02","observation_id":"6ecb2fed-6451-453d-9547-b6a274ba7a3f","resolution":{"observed_at":"2026-08-03T06:26:45.267364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T06:13:01.613750Z","title":"U., De Cola, G., Deleu, T., Goul˜ao, M., Kallinteris, A., Krimmel, M., KG, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.23225","last_updated":"2026-06-27T19:54:11Z","snapshot_observed_at":"2026-08-03T13:58:34.969644Z","submitted_at":"2026-01-30T17:47:36Z","title":"Agile Reinforcement Learning through Separable Neural Architecture and Applications","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T06:13:01.613750Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2601.23225"},"observation_digest":"sha256:3e7daa6edc78c71bfaf2f541c4d0f8b7f68b8571cd108ac825300ef234a7507d","observation_id":"aeb34403-e2bb-4364-9ba7-e810f91b3b1f","resolution":{"observed_at":"2026-08-03T06:13:01.613750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T05:40:30.125476Z","title":"Gymnasium: A standard interface for reinforcement learning environments.arXiv preprint arXiv:2407.17032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.01619","last_updated":"2026-06-03T07:46:26Z","snapshot_observed_at":"2026-08-03T13:07:22.368201Z","submitted_at":"2026-02-02T04:21:33Z","title":"SUSD: Structured Unsupervised Skill Discovery through State Factorization","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-03T05:40:30.125476Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2602.01619"},"observation_digest":"sha256:1119bb010fc3dc5f56dd46bd734db075d7a0bd6e0ffb6077b70d4f2de331fd29","observation_id":"938737e7-a3c8-49b3-8879-d20a0ff525ce","resolution":{"observed_at":"2026-08-03T05:40:30.125476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2602.06603","last_updated":"2026-04-29T10:13:20Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T11:02:06Z","title":"The hidden risks of temporal resampling in clinical reinforcement learning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:16.379996Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2602.06603"},"observation_digest":"sha256:d9f88b35f32897b3f8fe14fdd4e1b9e1fb74e64f9db305b335e2236a9785d807","observation_id":"46381aa2-bfae-4a83-83a6-21bda85e38d4","resolution":{"observed_at":"2026-05-16T07:07:29.623534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-03T00:13:28.882418Z","title":"U., De Cola, G., Deleu, T., Goul˜ao, M., Kallinteris, A., Krimmel, M., KG, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11351","last_updated":"2026-06-28T23:49:44Z","snapshot_observed_at":"2026-08-03T00:13:22.529238Z","submitted_at":"2026-02-11T20:40:43Z","title":"Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T00:13:28.882418Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2602.11351"},"observation_digest":"sha256:aa69b7bcce4b2d96ac5563097b4f5437684d0478434d1eca7bce7a90624b87ef","observation_id":"8ce43951-02aa-4c32-9da1-fd317ea5175d","resolution":{"observed_at":"2026-08-03T00:13:28.882418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2602.13372","last_updated":"2026-05-21T13:32:14Z","snapshot_observed_at":"2026-08-02T07:04:47.415467Z","submitted_at":"2026-02-13T15:40:32Z","title":"MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-22T10:49:35.846590Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2602.13372"},"observation_digest":"sha256:85ac380ddf23a39b2f61b6a8a673427883e5702bd527b6633f50a80076e02fcb","observation_id":"d07f17c4-bf89-49c1-82cd-606914e9b0c2","resolution":{"observed_at":"2026-05-22T10:51:25.902030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2602.17276","last_updated":"2026-04-14T00:51:01Z","snapshot_observed_at":"2026-07-06T22:46:26.082843Z","submitted_at":"2026-02-19T11:25:22Z","title":"RLGT: A reinforcement learning framework for extremal graph theory","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T21:21:07.914983Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2602.17276"},"observation_digest":"sha256:9b59bd0e6921f28c36df0f7d9997dddbb82408698e509c00167177feb7329475","observation_id":"68e8a048-bded-4632-a9cf-b15a1136354f","resolution":{"observed_at":"2026-05-15T21:21:38.151961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-02T22:20:34.201622Z","title":"Tuynman, A., Degenne, R., and Kaufmann, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.17587","last_updated":"2026-05-29T10:41:53Z","snapshot_observed_at":"2026-08-02T22:20:31.736399Z","submitted_at":"2026-02-19T18:11:02Z","title":"Asymptotically Optimal Sequential Testing with Markovian Data","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:20:34.201622Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2602.17587"},"observation_digest":"sha256:597a9498f1ed9e810ea88fb4f49b367b7d6adf51261c9379b7806dd1b09ade77","observation_id":"412567f6-b7de-4094-85a3-813aadda6717","resolution":{"observed_at":"2026-08-02T22:20:34.201622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-02T20:06:58.253783Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24121","last_updated":"2026-06-18T20:45:16Z","snapshot_observed_at":"2026-08-03T20:57:43.200904Z","submitted_at":"2026-02-27T15:58:11Z","title":"Online World Modeling Enables Real-World Inverse Reinforcement Learning from Observation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T20:06:58.253783Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2602.24121"},"observation_digest":"sha256:f3989120836d6472f0491fb509808185b607060a3c7e435d5ca094c065c38ef9","observation_id":"e04756ea-2138-4fbc-9f8b-6d4201bd6a28","resolution":{"observed_at":"2026-08-02T20:06:58.253783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-15T13:24:24.041663Z","title":"Gymnasium: A standard interface for reinforcement learning environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07236","last_updated":"2026-06-18T10:10:21Z","snapshot_observed_at":"2026-07-15T13:24:20.530376Z","submitted_at":"2026-03-07T14:40:05Z","title":"HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-15T13:24:24.041663Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2603.07236"},"observation_digest":"sha256:ebf9a299ffea0bfde42ab1de39ff809a6d8ddd0d8e01fc1dcc8e590b83c9f99d","observation_id":"b95d71bc-a1f9-49af-906e-eeb623321e46","resolution":{"observed_at":"2026-07-15T13:24:24.041663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-02T18:34:54.957047Z","title":"Terry, John U","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-02T18:34:45.449070Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:54.957047Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:2121ce2515accd4315c261a18620ab7f3da0e56d59bf29f50a77f14ed1f5b9fd","observation_id":"1f82c125-154d-45af-aa97-ec4c8389fe68","resolution":{"observed_at":"2026-08-02T18:34:54.957047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2603.12145","last_updated":"2026-05-17T22:47:12Z","snapshot_observed_at":"2026-07-06T22:48:53.198077Z","submitted_at":"2026-03-12T16:45:47Z","title":"Automatic Generation of High-Performance RL Environments","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T11:04:11.718672Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2603.12145"},"observation_digest":"sha256:ee37dca4bedf80a77d89df2fd1638dd90a1e156e0b19ef76f4374ebc7fb30bd0","observation_id":"0983aeb4-6f21-4a5f-bc14-1ddbf0418525","resolution":{"observed_at":"2026-05-21T11:05:01.478494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2603.14392","last_updated":"2026-05-19T22:32:16Z","snapshot_observed_at":"2026-08-03T02:51:25.795638Z","submitted_at":"2026-03-15T14:12:43Z","title":"WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T11:40:28.002606Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2603.14392"},"observation_digest":"sha256:7d1d7ad14cd71bf7a4800e12a2dde6e7dd787b04c8fffb746e6734f245761c40","observation_id":"0d12ab06-5198-4034-8ee9-93d26aa0eb85","resolution":{"observed_at":"2026-05-21T11:44:09.358367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2603.19312","last_updated":"2026-06-03T18:50:40Z","snapshot_observed_at":"2026-07-14T21:44:46.992364Z","submitted_at":"2026-03-13T19:48:14Z","title":"LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T04:09:22.328844Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2603.19312"},"observation_digest":"sha256:f6cc428cf7f350e35a21fe4ce756bab55a5e76327fdb2538fd236af894aeed74","observation_id":"0b8a735f-c51c-41e5-a642-9a0b52630854","resolution":{"observed_at":"2026-05-15T04:09:22.556119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-15T11:52:28.028968Z","title":"Gymnasium: A standard interface for reinforcement learning environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22510","last_updated":"2026-07-15T01:44:53Z","snapshot_observed_at":"2026-08-03T03:59:14.300464Z","submitted_at":"2026-03-23T19:16:54Z","title":"Research Novelty in Information Systems Journals After ChatGPT: Differences Across Institutional Language Contexts","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-15T11:52:28.028968Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2603.22510"},"observation_digest":"sha256:2e942d61a16e0f2989dfd7a2729849f8eb78e3abf2ef2d7c4a64e2c8741bf6d4","observation_id":"eb33c335-3a86-411a-93e6-c0eea64e0500","resolution":{"observed_at":"2026-07-15T11:52:28.028968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.01372","last_updated":"2026-04-04T05:25:50Z","snapshot_observed_at":"2026-07-06T22:51:35.522923Z","submitted_at":"2026-04-01T20:31:37Z","title":"Temporal Logic Control of Nonlinear Stochastic Systems with Online Performance Optimization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T21:47:55.704455Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.01372"},"observation_digest":"sha256:18045c0ceaa95cd02087bcf2550e3881fd04eda08556e16d785c9cf2fa0b9647","observation_id":"2da56bd9-ac95-45da-9a9c-979ccd5fb88c","resolution":{"observed_at":"2026-05-13T21:48:18.951183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-02T17:13:51.910717Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T20:04:56.512544Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:f4d04f4cc18e62dc14785cfc73b7d2a37984e9bf2b9a83a454c10c28802639f1","observation_id":"82c0e00a-6532-41c3-b085-c0ed6ff1c9fc","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-02T17:13:51.910717Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T17:08:31.770889Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:1d3b228ff48805d281403dcb5f8c89f021fe1e9b2eb20582985fb7078fe280e9","observation_id":"ac930a4a-9087-4b3b-8972-4a2775899f8e","resolution":{"observed_at":"2026-05-19T17:12:41.330190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.06126","last_updated":"2026-04-07T17:38:15Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:38:15Z","title":"Gym-Anything: Turn any Software into an Agent Environment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T19:34:42.621666Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.06126"},"observation_digest":"sha256:730515b2c6e390be29ddb03757dc04fe6408bde04d100fb3a063c07d063475f2","observation_id":"35d27494-b206-40b0-96cb-47564bfeb305","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.08685","last_updated":"2026-04-09T18:16:19Z","snapshot_observed_at":"2026-07-06T22:57:45.084987Z","submitted_at":"2026-04-09T18:16:19Z","title":"RAMP: Hybrid DRL for Online Learning of Numeric Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T17:06:22.252782Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.08685"},"observation_digest":"sha256:eed3bddef72d7d29d249dfe2a6da01548b959f04c6a762171c1cbbf6f1b7a3db","observation_id":"f5c93907-05d9-4019-bc1f-a31a7a913153","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.09452","last_updated":"2026-04-10T16:09:39Z","snapshot_observed_at":"2026-07-31T10:39:12.384743Z","submitted_at":"2026-04-10T16:09:39Z","title":"SafeAdapt: Provably Safe Policy Updates in Deep Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T17:50:56.101903Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.09452"},"observation_digest":"sha256:0937f47cccec6a9409f590c5f8c921db8a7c8eee65d7314c969da608765d0bc1","observation_id":"b0edf386-0068-491b-a43a-595b228b0729","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.09993","last_updated":"2026-04-11T02:40:29Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T02:40:29Z","title":"GPU-Accelerated Continuous-Time Successive Convexification for Contact-Implicit Legged Locomotion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:33.010827Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.09993"},"observation_digest":"sha256:1cb05460c78aa541feed22aad4064da342807f5b853ec871da7370976c6437fc","observation_id":"c71f7138-7a7a-4d13-9d0b-2260efe82d3f","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.13914","last_updated":"2026-04-15T14:21:30Z","snapshot_observed_at":"2026-07-06T23:01:50.745555Z","submitted_at":"2026-04-15T14:21:30Z","title":"[COMP25] The Automated Negotiating Agents Competition (ANAC) 2025 Challenges and Results","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T12:13:21.122831Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.13914"},"observation_digest":"sha256:53be9b3bd312c9692aa3c5a69bce774f579a9b07e95cc642c8d91af543345341","observation_id":"e3c9d446-9494-4470-9654-b63c66a024a7","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-12T19:46:39.624903Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2604.15414","last_updated":"2026-06-09T00:58:37Z","snapshot_observed_at":"2026-07-12T19:46:39.068858Z","submitted_at":"2026-04-16T17:06:54Z","title":"Beyond Single-Model Optimization: Preserving Plasticity in Continual Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T19:46:39.624903Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.15414"},"observation_digest":"sha256:732e9888b7fa2d1dab666ea4fe70f26950226dd4d2af492cbfb7013c8800c46d","observation_id":"4f003452-8588-4760-9c6d-b6d6b6097cda","resolution":{"observed_at":"2026-07-12T19:46:39.624903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.17747","last_updated":"2026-04-20T03:04:12Z","snapshot_observed_at":"2026-08-02T19:51:15.952118Z","submitted_at":"2026-04-20T03:04:12Z","title":"Efficient Federated RLHF via Zeroth-Order Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T04:48:15.394329Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.17747"},"observation_digest":"sha256:4b3cee0978c3554aa878732ae7e7606e7c1af20c379506aad8dc1368ee9d2ee7","observation_id":"f60a74c0-6484-4a8a-8930-4ad7b94ce600","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.18972","last_updated":"2026-05-07T18:45:20Z","snapshot_observed_at":"2026-08-02T12:30:32.367952Z","submitted_at":"2026-04-21T01:53:11Z","title":"Beyond Bellman: High-Order Generator Regression for Continuous-Time Policy Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T02:32:58.434291Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.18972"},"observation_digest":"sha256:f3a3c05e7272cf1dfbe719b55b004312e1cb0a3c84baca9ab768968acafcdd22","observation_id":"67f64fa7-21cb-408d-bbad-219f4bdd540e","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.19146","last_updated":"2026-04-21T06:52:36Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T06:52:36Z","title":"RL-ABC: Reinforcement Learning for Accelerator Beamline Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T03:18:53.581919Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.19146"},"observation_digest":"sha256:573b37c447038cbd1b1214ab4b2990ca87a91fb29c97658e03773fa9e4b1731e","observation_id":"c24c3f55-33f8-4999-b328-8d0c7dd47223","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.19533","last_updated":"2026-04-23T17:59:02Z","snapshot_observed_at":"2026-08-02T14:56:41.255829Z","submitted_at":"2026-04-21T14:53:23Z","title":"Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:23:56.777888Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.19533"},"observation_digest":"sha256:6ebdf5cbb95056dadd03be2b9f88306c4ebfc0cf951daff976590e4bc39f1444","observation_id":"c9ae02b6-77aa-452e-8942-b0f8eb253b20","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.20365","last_updated":"2026-04-22T09:02:14Z","snapshot_observed_at":"2026-07-31T16:18:31.194212Z","submitted_at":"2026-04-22T09:02:14Z","title":"Benefits of Low-Cost Bio-Inspiration in the Age of Overparametrization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T00:21:37.686664Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.20365"},"observation_digest":"sha256:bbb6709f744b8d805ff0af696c3bd6533073022cbef44853dd71727f3a69f086","observation_id":"843bb37b-6d6e-4a03-9df5-8633bf4045d2","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.21863","last_updated":"2026-04-23T16:59:40Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T16:59:40Z","title":"Replay-buffer engineering for noise-robust quantum circuit optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-09T22:11:29.151910Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.21863"},"observation_digest":"sha256:2451cee77b25a66f0010d63cccfe76c0a88365d2617acdf704bb262572e934b0","observation_id":"846606e3-da43-46a0-9da3-4d1f94647727","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.24729","last_updated":"2026-04-27T17:40:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:40:18Z","title":"SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:01:31.928056Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.24729"},"observation_digest":"sha256:5c59f6bf74f9b9133eb3e17fa5d7fef04bd6236bef6dfc55bd64493d054c2f2e","observation_id":"eb4729b3-9039-45f5-ae73-17271a39e760","resolution":{"observed_at":"2026-05-11T21:51:30.614872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.25788","last_updated":"2026-05-04T04:14:46Z","snapshot_observed_at":"2026-07-06T23:11:34.854305Z","submitted_at":"2026-04-28T15:58:09Z","title":"KinDER: A Physical Reasoning Benchmark for Robot Learning and Planning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-07T15:39:17.505374Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.25788"},"observation_digest":"sha256:ddd95342ec5460fa5ac36e3ee439591c2aabe8932890ac9b97f948ede3e11729","observation_id":"aee757c0-49d9-46de-98a6-b48d0997e3b4","resolution":{"observed_at":"2026-05-12T00:16:20.265668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2604.27162","last_updated":"2026-04-29T20:09:13Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T20:09:13Z","title":"A High-Throughput Compute-Efficient POMDP Hide-And-Seek-Engine (HASE) for Multi-Agent Operations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T10:27:55.337253Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2604.27162"},"observation_digest":"sha256:9d191a8ffba7d71b70b7434f3f2202269de7136f7f9919c88f3121b1d0437c89","observation_id":"6cef9daf-55b2-4021-848d-24eb401a2ca5","resolution":{"observed_at":"2026-05-12T09:36:26.187420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.01025","last_updated":"2026-05-01T18:37:58Z","snapshot_observed_at":"2026-07-06T23:14:20.123289Z","submitted_at":"2026-05-01T18:37:58Z","title":"Your Loss is My Gain: Low Stake Attacks on Liquid Staking Pools","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-09T17:57:37.260492Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.01025"},"observation_digest":"sha256:d6f74eb7edb1bd6b7883c2f254007c7d51d36ec8b4df147abcdc8ed1d5dde7ac","observation_id":"1a18a7ab-c157-464b-8c4b-646c84dd8d1c","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.01242","last_updated":"2026-05-02T04:46:54Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T04:46:54Z","title":"Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-09T15:12:54.575483Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.01242"},"observation_digest":"sha256:29169bf78fb2882c92167820de63b690e2375ea53b2bb1abc6c0229ba5826810","observation_id":"2180fb82-a11c-4be6-b42b-be9544e69170","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.01336","last_updated":"2026-05-02T09:17:53Z","snapshot_observed_at":"2026-07-06T23:14:33.653260Z","submitted_at":"2026-05-02T09:17:53Z","title":"A Multi-View Media Profiling Suite: Resources, Evaluation, and Analysis","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-09T15:22:45.263415Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.01336"},"observation_digest":"sha256:60d927ba71fe1afed6210d698d7adbb92b60c65014d759d23234731e8e15360a","observation_id":"5045a22c-35ab-447d-9b57-45b74d31c37b","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.01358","last_updated":"2026-05-02T10:07:59Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T10:07:59Z","title":"PACE: Parameter Change for Unsupervised Environment Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T14:21:34.002785Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.01358"},"observation_digest":"sha256:188e47fe284920d0d55a326b6eba1b84a688541ed5975a8507aef9338712e4c5","observation_id":"c36c3f00-1402-40bc-8a79-fd8900a8d0af","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.01632","last_updated":"2026-05-02T22:48:11Z","snapshot_observed_at":"2026-07-06T23:14:47.444386Z","submitted_at":"2026-05-02T22:48:11Z","title":"Perturb and Correct: Post-Hoc Ensembles using Affine Redundancy","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-09T14:27:18.519853Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.01632"},"observation_digest":"sha256:d0c64651e7a6c4f447ddbcb109d59f5cb5ba754007d76356b0373ce88a221a9b","observation_id":"e74b8414-3dea-40a7-a85c-03f7683dced1","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.01729","last_updated":"2026-05-03T05:57:17Z","snapshot_observed_at":"2026-08-01T01:53:28.821946Z","submitted_at":"2026-05-03T05:57:17Z","title":"Stable GFlowNets with Probabilistic Guarantees","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T19:22:03.198766Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.01729"},"observation_digest":"sha256:4859f00f62922ea7014b917d8c49136d8d774fa5007c24f80023acb407de3cd3","observation_id":"b12f7b7a-b0d2-478c-be31-5fe0b5064eb7","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.01787","last_updated":"2026-05-03T09:00:15Z","snapshot_observed_at":"2026-08-02T14:15:07.981182Z","submitted_at":"2026-05-03T09:00:15Z","title":"Zero-Shot, Safe and Time-Efficient UAV Navigation via Potential-Based Reward Shaping, Control Lyapunov and Barrier Functions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T17:01:36.202798Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.01787"},"observation_digest":"sha256:78a2832be8d431675d9297d458707209f6a00d47f345aa1d7174ff7454219b46","observation_id":"1e8a6a7f-572f-4583-9f9a-37aa4dd0cb5b","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.01928","last_updated":"2026-05-03T15:20:56Z","snapshot_observed_at":"2026-07-06T23:15:07.159340Z","submitted_at":"2026-05-03T15:20:56Z","title":"Training Non-Differentiable Networks via Optimal Transport","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T15:37:42.167420Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.01928"},"observation_digest":"sha256:82103a4f16d6cf80af5b29e07a95c44ae1a242c7cee52bedd48be42c1e0e1b9c","observation_id":"207a6697-804f-4d84-951d-7d65cd4d25e1","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.02103","last_updated":"2026-05-03T23:54:36Z","snapshot_observed_at":"2026-08-02T11:11:27.466641Z","submitted_at":"2026-05-03T23:54:36Z","title":"Bridging the Gap Between Average and Discounted TD Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:19.065418Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.02103"},"observation_digest":"sha256:990bca6d4adee2077b1f8f26ab79491ee3539c7a78e967fd60ddb0f288fce759","observation_id":"3fd50936-1b7d-423e-9448-324f3a2867ae","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.02320","last_updated":"2026-05-06T13:24:45Z","snapshot_observed_at":"2026-08-02T22:49:58.340073Z","submitted_at":"2026-05-04T08:15:52Z","title":"ANO: A Principled Approach to Robust Policy Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:12.002351Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.02320"},"observation_digest":"sha256:fc5f5d741037d089641c7a09dc523cdda43811c1926e92c2a17c4f40015ce5ca","observation_id":"158da49e-1e54-4dae-bdf4-f70888606603","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.02867","last_updated":"2026-06-22T14:29:50Z","snapshot_observed_at":"2026-07-06T23:15:51.008483Z","submitted_at":"2026-05-04T17:41:04Z","title":"Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T19:29:51.400740Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.02867"},"observation_digest":"sha256:97cf2ed676312ad23aac8f8e269c0a27794b28275c5ca235dd6ed2a44cc81c9e","observation_id":"5b13e0b7-7c9e-44a6-83b8-8998fc5256c2","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.02867","last_updated":"2026-06-22T14:29:50Z","snapshot_observed_at":"2026-07-06T23:15:51.008483Z","submitted_at":"2026-05-04T17:41:04Z","title":"Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T00:16:02.179335Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.02867"},"observation_digest":"sha256:61610db272bcf35d0fe09fe39d109e4d78dd5ff78febb1d65df61a9ee9ab7c02","observation_id":"162b1949-5a21-4f25-87a3-c75fae374c83","resolution":{"observed_at":"2026-07-01T00:25:09.191771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.04368","last_updated":"2026-05-06T00:10:17Z","snapshot_observed_at":"2026-07-06T23:17:09.246351Z","submitted_at":"2026-05-06T00:10:17Z","title":"Extending Differential Temporal Difference Methods for Episodic Problems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:57.472765Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.04368"},"observation_digest":"sha256:40227216ab9285e8a6b21f798a133c7214bda082db07bb1b2bc98cea8d20aa16","observation_id":"67c23977-be50-4503-ba65-2dd429e54f54","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.05115","last_updated":"2026-05-06T16:46:03Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:46:03Z","title":"Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-08T17:47:09.591001Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.05115"},"observation_digest":"sha256:40ecf57e6d76c97733c07c84caac5070d28e9a414298743fe09ccbbb9822cd56","observation_id":"8d3081a2-af6b-42e8-b0f6-04f455eb6e29","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.05863","last_updated":"2026-05-20T07:46:09Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T08:32:09Z","title":"SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T14:54:30.895137Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.05863"},"observation_digest":"sha256:85dc93241bea379b8f9edb5d7cd11354c1f5f279c0f0d1c5f8c70d3f83fc88f7","observation_id":"95470c55-0608-4c4b-8887-a4a54a6580d5","resolution":{"observed_at":"2026-05-11T18:41:08.425241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.05863","last_updated":"2026-05-20T07:46:09Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T08:32:09Z","title":"SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T09:15:11.280343Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.05863"},"observation_digest":"sha256:97f2a22608894f79ddcf0bbc279c1a2d9fa8f6b6daacb76f3937659acbdea9c3","observation_id":"acd0fd55-2ae8-4abe-a073-f7b53325d2ee","resolution":{"observed_at":"2026-05-21T09:19:56.733509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.06066","last_updated":"2026-05-07T11:53:56Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T11:53:56Z","title":"Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T13:59:01.188044Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.06066"},"observation_digest":"sha256:3a61888c01ea766a8d78680402feb271515bacd31ddb1e07b578b916d0e869fc","observation_id":"336dcce8-05a3-40ab-803c-2688c86a6353","resolution":{"observed_at":"2026-05-11T18:46:09.927990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.06149","last_updated":"2026-05-07T12:42:46Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:42:46Z","title":"AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T13:47:18.720944Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.06149"},"observation_digest":"sha256:55385eea6259a3e0488719810b7e790a370f40f29cdbf5735a55c0a8507d15f5","observation_id":"a78fd08b-e7c9-46aa-9f4c-5d22555b8d53","resolution":{"observed_at":"2026-05-11T18:51:06.882767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.06373","last_updated":"2026-05-07T14:52:37Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:52:37Z","title":"Beyond the Independence Assumption: Finite-Sample Guarantees for Deep Q-Learning under $\\tau$-Mixing","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T05:01:53.381535Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.06373"},"observation_digest":"sha256:38ca24dc5bb6c34d2403551575d72b95f9c027ba8077899dc30376ca45c21c9a","observation_id":"fa132447-0738-46ef-af65-b86162cde18b","resolution":{"observed_at":"2026-05-11T21:36:13.901669Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.06869","last_updated":"2026-05-12T18:33:33Z","snapshot_observed_at":"2026-07-31T07:18:07.162544Z","submitted_at":"2026-05-07T19:12:03Z","title":"Agentick: A Unified Benchmark for General Sequential Decision-Making Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-11T01:22:32.713175Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.06869"},"observation_digest":"sha256:27f8a6c75b0103f003ac9c43516c2f7b9fb4d4096fa8cdc1a22dbdbd0cc833b9","observation_id":"e7486c67-4604-407b-be41-54b9499ba9b0","resolution":{"observed_at":"2026-05-11T17:29:49.696310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.06869","last_updated":"2026-05-12T18:33:33Z","snapshot_observed_at":"2026-07-31T07:18:07.162544Z","submitted_at":"2026-05-07T19:12:03Z","title":"Agentick: A Unified Benchmark for General Sequential Decision-Making Agents","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-14T20:51:26.063471Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.06869"},"observation_digest":"sha256:9967978db8b478600d1b7a9e093a2cb4ba9f2fc9eb58a5eaf4fd140f4f4f1d21","observation_id":"a62cd7d9-b02e-4c33-9fba-1f821390babc","resolution":{"observed_at":"2026-05-14T20:52:57.917077Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.08315","last_updated":"2026-05-08T14:26:40Z","snapshot_observed_at":"2026-07-31T18:56:01.160228Z","submitted_at":"2026-05-08T14:26:40Z","title":"Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:58.315109Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.08315"},"observation_digest":"sha256:2401189ff1c54c1bf0e35df93e3d5b03509bc1aa01abc6f0a4138e1fa0b667cf","observation_id":"ec253524-8436-41c9-a6dd-a2256f406f7f","resolution":{"observed_at":"2026-05-12T08:41:23.994400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.09183","last_updated":"2026-05-16T18:02:16Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T21:48:04Z","title":"Learning When to Stop: Selective Imitation Learning Under Arbitrary Dynamics Shift","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-12T03:27:41.845716Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.09183"},"observation_digest":"sha256:3e11ecda2b62ba08e6821da1b42957fa48641268f7f9a877cfbfc3f03270a141","observation_id":"32d6f508-ee97-4b25-990f-7081447cdc9b","resolution":{"observed_at":"2026-05-12T07:21:25.340301Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.09183","last_updated":"2026-05-16T18:02:16Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T21:48:04Z","title":"Learning When to Stop: Selective Imitation Learning Under Arbitrary Dynamics Shift","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-20T22:04:57.245024Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.09183"},"observation_digest":"sha256:5d60f68ca6b518ce7049c58eabd8e953a73860c69e2db2700aab82798419330a","observation_id":"77669a96-ff19-4e39-8ecc-1cc8cf0ad116","resolution":{"observed_at":"2026-05-20T22:09:07.577044Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:24.844859Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:fc9d183a77eddf53348cc787053ce1b6487cd57a9cc28129edb13ecae6d96893","observation_id":"e046d3de-47df-49ed-a95b-636afa8a1255","resolution":{"observed_at":"2026-05-12T03:26:18.997445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.09965","last_updated":"2026-05-12T15:54:46Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:16:41Z","title":"Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse","version":2},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:28.552513Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.09965"},"observation_digest":"sha256:e54b064337dd07619e5fe0f115991ad7a7da31fab6beb2fb6ea21b65a615b1d2","observation_id":"6ace471f-92f0-40f3-be52-3920914b9610","resolution":{"observed_at":"2026-05-13T06:47:27.046006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.10293","last_updated":"2026-05-11T09:54:30Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:54:30Z","title":"Robust Probabilistic Shielding for Safe Offline Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T04:28:30.722268Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.10293"},"observation_digest":"sha256:61a1fe2b5fe4e86cc33c12f4496d0b2aaf6c3c90dbf6d29475272c66d9959cd0","observation_id":"6ab60d41-7c0f-4098-90bb-ad112c1ef884","resolution":{"observed_at":"2026-05-12T06:16:24.938712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.11375","last_updated":"2026-05-12T00:58:42Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-12T00:58:42Z","title":"TuniQ: Autotuning Compilation Passes for Quantum Workloads at Scale for Effectiveness and Efficiency","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-13T02:50:20.040271Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.11375"},"observation_digest":"sha256:402b1a23e61fbcbd85a3b6d209d6e90131eb3e661d4eb9e27d3afd14f215f972","observation_id":"86cd9959-e117-4691-9a7a-f24d9fef8575","resolution":{"observed_at":"2026-05-13T02:52:08.791092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.11694","last_updated":"2026-05-12T07:51:18Z","snapshot_observed_at":"2026-08-02T18:47:17.148107Z","submitted_at":"2026-05-12T07:51:18Z","title":"Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T07:27:12.302109Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.11694"},"observation_digest":"sha256:3d0a363a5e14f6a07b841119b0068e7d72231ae06eb5b15a6ebb885d57f93b04","observation_id":"6c8800c4-36c0-480a-920a-9039effada32","resolution":{"observed_at":"2026-05-13T07:27:29.077799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.12561","last_updated":"2026-05-11T23:55:15Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-11T23:55:15Z","title":"Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T20:42:06.571221Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.12561"},"observation_digest":"sha256:d42352355aaf0eae8c32345cb180c8e5a92f3f7a6097036024c92960f661f0ef","observation_id":"c0607a29-0cae-4f0b-88b5-5e8e094bac8d","resolution":{"observed_at":"2026-05-14T20:42:57.299765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.14897","last_updated":"2026-05-14T14:38:56Z","snapshot_observed_at":"2026-07-06T23:26:18.733776Z","submitted_at":"2026-05-14T14:38:56Z","title":"Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T21:15:15.155369Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.14897"},"observation_digest":"sha256:c85cb2ac0c9ceb79956d675097874b577176d6d6e5a7fea23411ecc5fc240557","observation_id":"7f60a866-ded5-4b7c-ae9c-3ad0fe4700ac","resolution":{"observed_at":"2026-06-30T21:25:04.202338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.14911","last_updated":"2026-05-14T14:45:28Z","snapshot_observed_at":"2026-08-02T18:32:13.349477Z","submitted_at":"2026-05-14T14:45:28Z","title":"Chrono-Gymnasium: An Open-Source, Gymnasium-Compatible Distributed Simulation Framework","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T20:41:31.816389Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.14911"},"observation_digest":"sha256:0ee05abe181b97c5ae3e7d59a3eadb0749241df3c965c9c7b916c852f0184b76","observation_id":"c6832d17-d591-4e2c-9597-18ad1de8311e","resolution":{"observed_at":"2026-06-30T20:45:03.897568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.15236","last_updated":"2026-05-22T22:27:15Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-13T22:18:30Z","title":"Learning Selective Merge Policies for Deadline-Constrained Coded Caching via Deep Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T17:26:04.762451Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.15236"},"observation_digest":"sha256:81419cf431335811bc47ddb0be9cc0b1fa0be8e80ee7d600893d3cb4106bb963","observation_id":"236bb79c-c07c-40fe-b1b0-2de68588f6d4","resolution":{"observed_at":"2026-05-19T17:27:41.312843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.15236","last_updated":"2026-05-22T22:27:15Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-13T22:18:30Z","title":"Learning Selective Merge Policies for Deadline-Constrained Coded Caching via Deep Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T21:08:47.084947Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.15236"},"observation_digest":"sha256:83cc427fe435682b218e0c0a419f3079f4aa97b2538903bb2e93ff38ee56abbe","observation_id":"f5214580-3491-490f-a012-b1ecb8bd8cc5","resolution":{"observed_at":"2026-06-30T21:15:04.597378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.17933","last_updated":"2026-05-18T06:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-18T06:41:14Z","title":"AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T11:24:48.558423Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.17933"},"observation_digest":"sha256:9b11f41b7b1cb407ce0460f07475b86307effdf51fc19ce58ac6b70c9ec0429f","observation_id":"6f7ee100-2056-4600-a74e-5b8bebabeb3b","resolution":{"observed_at":"2026-05-20T11:28:14.503778Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.20423","last_updated":"2026-05-19T19:19:26Z","snapshot_observed_at":"2026-08-02T08:56:18.389445Z","submitted_at":"2026-05-19T19:19:26Z","title":"OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T07:09:37.399954Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.20423"},"observation_digest":"sha256:d7f0dd39f1d522f9275f72d84712b8dd3c0297ff0c747fe4994804aa845a1d9c","observation_id":"ec72341c-efe2-43c7-b204-e6b7fd44e9e6","resolution":{"observed_at":"2026-05-21T07:09:46.256886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.20744","last_updated":"2026-05-20T05:46:52Z","snapshot_observed_at":"2026-08-01T19:34:25.326316Z","submitted_at":"2026-05-20T05:46:52Z","title":"Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T06:56:27.532299Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.20744"},"observation_digest":"sha256:d381040da3101e334a15d2601979742d42957567ed00f09db1ac0b46843c7426","observation_id":"434d659b-ceb6-4c72-aad6-a97ac7ce6634","resolution":{"observed_at":"2026-05-21T06:59:45.569781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.21800","last_updated":"2026-05-20T22:58:15Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T22:58:15Z","title":"stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T08:57:19.834179Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.21800"},"observation_digest":"sha256:49decb4c27b4aab1a512fdac7e078a2e66f553e287552c8e6e64041f84be25f7","observation_id":"0d9ceeef-ef5f-4ede-a589-277ab7314472","resolution":{"observed_at":"2026-05-22T09:01:20.238336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.23365","last_updated":"2026-05-22T08:28:51Z","snapshot_observed_at":"2026-08-02T21:24:36.066827Z","submitted_at":"2026-05-22T08:28:51Z","title":"Score-Based One-step MeanFlow Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T05:21:52.748214Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.23365"},"observation_digest":"sha256:cddd1b151600aff00079592cc9c023fee8d2792220621ca53446dc73fadbd487","observation_id":"2fb51365-d222-4e43-98f5-7ba26eb10f64","resolution":{"observed_at":"2026-05-25T05:26:39.029853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.23930","last_updated":"2026-04-22T00:55:08Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-04-22T00:55:08Z","title":"Quantum Frog: Emergent Cooperation and Difficulty Scaling in a Quantized-Time Cooperative Game","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-05T05:56:17.409844Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.23930"},"observation_digest":"sha256:59a4bd458bd08f4eb4d2b02268bdda28c75b345eccca2fc26f2cede63dfc8f6f","observation_id":"f47238c6-5d8b-4993-80bc-02e0e25620f5","resolution":{"observed_at":"2026-07-05T06:00:43.858829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":"2407.17032","doi":"10.48550/arxiv.2407.17032","metadata_source":"pith","pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","venue":"cs.LG","work_id":"5382dc1c-a327-49b9-afda-4794d5847698","year":2024},"citing_paper":{"arxiv_id":"2605.24375","last_updated":"2026-05-23T03:30:36Z","snapshot_observed_at":"2026-08-02T01:12:42.276720Z","submitted_at":"2026-05-23T03:30:36Z","title":"Distilling Game Code World Model Generation into Lightweight Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T13:58:37.956333Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2605.24375"},"observation_digest":"sha256:7b9df52acc4cab27c88c457fb705c820dab5402a1aa8396c6c49bfac1a3276ce","observation_id":"0dfdb80a-7112-49be-92c5-ba8fc8deea52","resolution":{"observed_at":"2026-06-30T14:04:44.683226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.751241+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.17032/citation-record","integrity":"/paper/2407.17032/integrity","json":"/paper/2407.17032/citation-record.json","paper":"/paper/2407.17032"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.01495","last_updated":"2018-02-23T10:04:20Z","snapshot_observed_at":"2026-07-06T05:49:54.014069Z","submitted_at":"2017-07-05T17:55:53Z","title":"Hindsight Experience Replay","version":3},"cited_work":{"arxiv_id":"1707.01495","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.01495","snapshot_observed_at":"2026-07-09T02:25:55.908762Z","title":"Hindsight Experience Replay","venue":"cs.LG","work_id":"a7ba78be-3bef-4f48-b954-7a5dfbc0d5b6","year":2017},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1707.01495","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:11b32e240a28597d8a65de8f3d79197c2c566ab46f8c4c0f3827ea7c4f1b61c2","observation_id":"4cd2fe2d-4ae0-4f3b-bcb7-695472a7e997","resolution":{"observed_at":"2026-05-11T17:29:49.674922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.07027","last_updated":"2020-12-12T20:56:32Z","snapshot_observed_at":"2026-08-04T07:19:20.880483Z","submitted_at":"2020-11-13T17:29:26Z","title":"DeepMind Lab2D","version":2},"cited_work":{"arxiv_id":"2011.07027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.07027","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6891cf67-0dc4-46f0-8975-362c393f4b76","year":2011},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2011.07027","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:13aa3018aa7b16516aeebe5205a7f30c0453ff836e68370614bde4315da25ef3","observation_id":"7a2ab3fb-be5c-48af-a7a1-597576227b25","resolution":{"observed_at":"2026-05-11T17:29:49.543978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1912.06680","doi":"10.5281/zenodo.17096679","metadata_source":"pith","pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","venue":"cs.LG","work_id":"b047dc18-e9a3-4d11-8ff6-cd59d41a6357","year":2019},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:bfbfd9a366eb1a877354c6cfaf17c28a2bf6d89f21cda8daecd2bf51621f9795","observation_id":"47ba3158-f8f6-4f10-99d9-13016bb3d87d","resolution":{"observed_at":"2026-05-12T22:18:16.018301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09884","last_updated":"2024-03-16T00:02:49Z","snapshot_observed_at":"2026-07-06T15:43:31.881201Z","submitted_at":"2023-06-16T14:52:24Z","title":"Jumanji: a Diverse Suite of Scalable Reinforcement Learning Environments in JAX","version":2},"cited_work":{"arxiv_id":"2306.09884","doi":"10.48550/arxiv.2306.09884","metadata_source":"pith","pith_arxiv_id":"2306.09884","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Jumanji: A","venue":"cs.LG","work_id":"64834bf5-ebb6-4b6f-9300-49f2ada83fbf","year":2023},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2306.09884","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:b47543872786dbd811e5340594201b5f044dab879ab79f2ab6ef0cad41271946","observation_id":"c2b8b9d1-3d81-43d4-8c9f-0bc4ced60bf3","resolution":{"observed_at":"2026-05-11T17:29:49.581158Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5163.2023","doi":"10.1109/iemdc55163.2023.10239044","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"10 Yann Bouteiller, Edouard GEZE, GobeX, Stefan Kuhn, and pius","venue":null,"work_id":"87c1bed9-4afd-40b0-b02a-e80762a3e929","year":2023},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:c871e15e72c2699ead46330d6cbc4fa6633747e31b3b1523f4de6df851b2b6ff","observation_id":"b1ccc781-d854-4b8a-8e83-e8c95781704c","resolution":{"observed_at":"2026-05-11T17:29:49.350796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.15344778","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"James Bradbury, Roy Frostig, Peter Hawkins, Matthew James Johnson, Chris Leary, Dougal Maclaurin, George Necula, Adam Paszke, Jake VanderPlas, Skye Wanderman-Milne, and Qiao Zhang","venue":null,"work_id":"156a9fcb-51f5-4d67-bf33-237ea8982612","year":null},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:4d119d97e8c0a6ab5b2fb77f61da665ab0fbabd27f55c9d8398cdcd01bb64b72","observation_id":"2140442b-99ea-4ae9-a6a9-444fdf8c3e9b","resolution":{"observed_at":"2026-05-11T17:29:49.294340Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":"1606.01540","doi":"10.1109/jssc.2019","metadata_source":"pith","pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenAI Gym","venue":"cs.LG","work_id":"6af98f3f-f074-41ae-a689-7dd7b4b8efde","year":2016},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:fdba58faf7e06cba7bf1abd75f999e7b2f86e0277dbbf1ea2a5c0e5496ac1da1","observation_id":"82dfe8da-00d1-4e51-af99-91d2ef66bc45","resolution":{"observed_at":"2026-05-11T19:49:39.087655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06110","last_updated":"2018-12-14T19:03:38Z","snapshot_observed_at":"2026-07-06T07:21:17.184817Z","submitted_at":"2018-12-14T19:03:38Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1812.06110","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.06110","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","venue":"cs.LG","work_id":"a0c1e29f-e775-49dc-977e-bbbca0daa6d8","year":2018},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1812.06110","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:19cfeaf0c6899489673e4f4b1c16f8362f789b21518fff7bf79242802da7d599","observation_id":"29c766d6-d04f-443d-9164-287c68df9a9d","resolution":{"observed_at":"2026-05-11T17:29:49.633591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05646","last_updated":"2024-10-14T06:57:38Z","snapshot_observed_at":"2026-08-02T06:20:27.655986Z","submitted_at":"2024-06-09T05:11:00Z","title":"ICU-Sepsis: A Benchmark MDP Built from Real Medical Data","version":2},"cited_work":{"arxiv_id":"2406.05646","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05646","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2406.05646 , year=","venue":null,"work_id":"1b97116f-3eca-4816-96d2-e15b8ffeb965","year":null},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2406.05646","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:d8bc768f7703eadf24b795ed51b4fd3290fdee33014e20448bec3a1007f0b19c","observation_id":"b9d3c1e1-02ec-42ad-b175-483b43ce798d","resolution":{"observed_at":"2026-05-11T17:29:49.646206Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.08467","last_updated":"2020-10-05T18:49:48Z","snapshot_observed_at":"2026-07-31T22:41:16.911747Z","submitted_at":"2019-07-19T11:36:10Z","title":"Accelerating Reinforcement Learning through GPU Atari Emulation","version":2},"cited_work":{"arxiv_id":"1907.08467","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.08467","snapshot_observed_at":"2026-07-04T08:39:42.450293Z","title":"Rodrigo de Lazcano, Kallinteris Andreas, Jun Jet Tai, Seungjae Ryan Lee, and Jordan Terry","venue":null,"work_id":"b96765b4-d8b1-4031-baa1-c51ed3077f7c","year":1907},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1907.08467","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:3f0fd289fee50a9fc93f382c85526aadabc256a8ab3bb54a5525615ec9d0d06b","observation_id":"43309982-9de4-4ee2-b6e5-20e8161f5ba2","resolution":{"observed_at":"2026-05-11T17:29:49.361174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08649","last_updated":"2024-02-27T17:34:43Z","snapshot_observed_at":"2026-07-06T15:42:37.055739Z","submitted_at":"2023-06-14T17:28:46Z","title":"OCAtari: Object-Centric Atari 2600 Reinforcement Learning Environments","version":2},"cited_work":{"arxiv_id":"2306.08649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.08649","snapshot_observed_at":"2026-07-04T08:39:42.459157Z","title":"Prafulla Dhariwal, Christopher Hesse, Oleg Klimov, Alex Nichol, Matthias Plappert, Alec Radford, John Schulman, Szymon Sidor, Yuhuai Wu, and Peter Zhokhov","venue":null,"work_id":"3cae80f4-f904-4474-a0dd-acf6c7935b5f","year":2023},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2306.08649","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:4059c15a32a07f7c745bd59ac9fe37a19efca4028efcb57aadbdd05b83c916e6","observation_id":"45f8087c-9b2e-4864-869b-69f171fa9bac","resolution":{"observed_at":"2026-05-11T17:29:49.375358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alegre, Ann Nowé, Ana L","venue":null,"work_id":"774a6d83-48ea-4944-9320-def61fcfd2f4","year":2023},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:7ed7acafdd6d7f4aac44ef76df32309d92513e80dd812a969a5b821b7edcbcbc","observation_id":"e505c5a5-281e-4d75-9c32-a743585f3e73","resolution":{"observed_at":"2026-05-11T17:29:49.690741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":"1801.01290","doi":"10.48550/arxiv.1801.01290","metadata_source":"pith","pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":"cs.LG","work_id":"6674e5db-4e1c-49c0-b598-c108a0ecadb6","year":2018},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:6da3cd81fa85553125534a1a454ec158954e85511252c289b63fe89e8b7417fc","observation_id":"6a9d7e02-f680-4442-9920-1cce1b8bb4b7","resolution":{"observed_at":"2026-05-13T01:48:10.852058Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.00979","last_updated":"2022-09-20T17:15:51Z","snapshot_observed_at":"2026-07-06T09:25:03.937338Z","submitted_at":"2020-06-01T14:38:52Z","title":"Acme: A Research Framework for Distributed Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2006.00979","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.00979","snapshot_observed_at":"2026-07-09T08:56:06.429861Z","title":"Acme: A research framework for distributed reinforcement learning","venue":"cs.LG","work_id":"c4ca8a7d-7eaf-4ce6-b960-d9b6f72a62eb","year":2020},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2006.00979","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:908b4867139844c0b811c6131b9434735bd725ad2f4cc9f117853088e6854253","observation_id":"5a4769fb-9a4c-44e1-934a-12ae09581d4b","resolution":{"observed_at":"2026-05-11T17:29:49.403651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03046","last_updated":"2024-02-05T14:32:00Z","snapshot_observed_at":"2026-07-06T17:25:31.223077Z","submitted_at":"2024-02-05T14:32:00Z","title":"Open RL Benchmark: Comprehensive Tracked Experiments for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2402.03046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.03046","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyde, G.; and Santos Jr, E","venue":null,"work_id":"0239db55-6664-4f09-a994-05d76412a0a3","year":2024},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2402.03046","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:ca4b1fe023dd361443a8ae074d5f5cf59e02d9ace07ffd4a07d80cfff08e50be","observation_id":"3986d04a-32dc-415c-8fcb-d5f74d588f80","resolution":{"observed_at":"2026-05-11T17:29:49.414324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0004-3702(98)00023-x","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:25.582764Z","title":"Littman, and Anthony R","venue":"Artificial Intelligence","work_id":"b3ea0098-466e-4f58-abfe-1641bbce18de","year":1998},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:bba28cf574bc80a1e0621004fb9d6d31debd7ac1ddc8b077d07f6d8b394ea273","observation_id":"a56f97f1-baa0-4e74-b9cb-987d8424917e","resolution":{"observed_at":"2026-05-11T17:29:49.269427Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:42.305036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:42.305036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01584","last_updated":"2025-02-18T14:09:38Z","snapshot_observed_at":"2026-07-06T18:56:18.489052Z","submitted_at":"2024-08-02T21:37:46Z","title":"GPUDrive: Data-driven, multi-agent driving simulation at 1 million FPS","version":3},"cited_work":{"arxiv_id":"2408.01584","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.01584","snapshot_observed_at":"2026-07-04T06:49:38.028458Z","title":"Gpudrive: Data-driven, multi-agent driving simulation at 1 million fps","venue":null,"work_id":"d7082c39-b299-48e9-a0fd-b2bbcdcabe1e","year":2024},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2408.01584","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:967d6b7d1470591e5dc1fef4b304f2c6f19a215cee49f8b435f94ff3a0a8a345","observation_id":"8dfd740d-e136-4f10-a72a-2dcf61f958e5","resolution":{"observed_at":"2026-05-11T17:29:49.426309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.02097","last_updated":"2016-09-20T19:12:49Z","snapshot_observed_at":"2026-08-01T04:14:14.998323Z","submitted_at":"2016-05-06T20:46:34Z","title":"ViZDoom: A Doom-based AI Research Platform for Visual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1605.02097","doi":null,"metadata_source":"pith","pith_arxiv_id":"1605.02097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ViZDoom: A Doom-based AI Research Platform for Visual Reinforcement Learning","venue":"cs.LG","work_id":"8ad0fe71-abde-47eb-939f-bbe37906b465","year":2016},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1605.02097","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:1e50577f27c48d2c8a4b050d1e696aa187fdd517905fd201da0239011710646d","observation_id":"28b4214c-4e7e-482a-84d7-be39b08f8ab4","resolution":{"observed_at":"2026-05-11T17:29:49.441443Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08802","last_updated":"2018-02-24T05:32:47Z","snapshot_observed_at":"2026-07-06T06:25:09.401059Z","submitted_at":"2018-02-24T05:32:47Z","title":"Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration","version":1},"cited_work":{"arxiv_id":"1802.08802","doi":"10.48550/arxiv.1802.08802","metadata_source":"pith","pith_arxiv_id":"1802.08802","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration","venue":"cs.AI","work_id":"a790be26-7c4c-4e58-ab4a-906e2570cc69","year":2018},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1802.08802","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:f00afacc5cd4b350f7c5aac4e383e407f147bbc61e17139ce362633f87cc74cd","observation_id":"9f0b7086-9d97-4fd3-9433-66dfd4d0b058","resolution":{"observed_at":"2026-05-11T17:29:49.458516Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:b6d79d01ba281944b67afcd27dfe78f15260babfa2e7e2585bd8ca21c7f2544d","observation_id":"1d64acc1-f01a-4972-8322-7a90de2d153e","resolution":{"observed_at":"2026-05-11T17:29:49.467867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/nature14236","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.004459Z","title":"Human-level control through deep reinforcement learning","venue":"Nature","work_id":"1ff30834-09de-4b27-9602-0bd5ea024dd0","year":2015},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:6103806d3396a3a092d039a31e62aca5ddcb0ae00bc515e85dff8bc8c6a1fab1","observation_id":"e8131224-c63d-4fd7-a1fc-9185ed1cd0b9","resolution":{"observed_at":"2026-05-11T17:29:49.280781Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-18T13:51:14.811373+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T13:51:14.811373+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03568","last_updated":"2020-02-14T15:18:17Z","snapshot_observed_at":"2026-07-06T08:13:26.248817Z","submitted_at":"2019-08-09T08:34:08Z","title":"Behaviour Suite for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1908.03568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Conway, A., Cowan, N., Donkin, C., Farrell, S., Hitch, G","venue":null,"work_id":"7927ac5a-af41-429f-9403-6ab889c8b5c4","year":2018},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1908.03568","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:7875df4d0b589f6ccfc9864c90ca31154d7eb2511e5a929297972e29a1c9e150","observation_id":"951569ed-fd37-43a5-82d5-0f64b2f2ceb3","resolution":{"observed_at":"2026-05-11T17:29:49.477736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:19d57cd65f8d911a5bddcccaabb8757f176c5b22bc2a6dfee80772142c626e68","observation_id":"05960e65-0149-4b05-a8f7-30612bab9e4e","resolution":{"observed_at":"2026-05-11T17:29:49.484894Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16777","last_updated":"2022-03-31T03:34:02Z","snapshot_observed_at":"2026-08-03T16:12:57.997281Z","submitted_at":"2022-03-31T03:34:02Z","title":"Mask Atari for Deep Reinforcement Learning as POMDP Benchmarks","version":1},"cited_work":{"arxiv_id":"2203.16777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16777","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"David Silver, Julian Schrittwieser, Karen Simonyan, Ioannis Antonoglou, Aja Huang, Arthur Guez, Thomas Hubert, Lucas Baker, Matthew Lai, Adrian Bolton, et al","venue":null,"work_id":"df1985c9-5c3f-422d-a673-fcd349e9356b","year":null},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2203.16777","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:cf75c1d68b0b98a92df45eb5a76df0dd6bd9667f22d03a43a735ceeab92da0c6","observation_id":"ba409965-1b10-484d-936f-75b5a6402f34","resolution":{"observed_at":"2026-05-11T17:29:49.493298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12905","last_updated":"2024-06-11T21:13:34Z","snapshot_observed_at":"2026-07-06T18:33:11.370375Z","submitted_at":"2024-06-11T21:13:34Z","title":"PufferLib: Making Reinforcement Learning Libraries and Environments Play Nice","version":1},"cited_work":{"arxiv_id":"2406.12905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12905","snapshot_observed_at":"2026-07-04T01:29:22.376416Z","title":"Pufferlib: Making reinforcement learning libraries and environments play nice","venue":null,"work_id":"9dcf0c48-620a-406f-b977-2598122556fe","year":2024},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2406.12905","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:6f1f723dea151818d3fad4f0a0dbc3a0ffb2c3c198772d17100976c0a99ee196","observation_id":"7f1aee20-8479-4610-9cc4-a576405ad418","resolution":{"observed_at":"2026-05-11T17:29:49.500000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01305","last_updated":"2023-04-03T19:12:20Z","snapshot_observed_at":"2026-08-03T15:41:43.946539Z","submitted_at":"2023-04-03T19:12:20Z","title":"PyFlyt -- UAV Simulation Environments for Reinforcement Learning Research","version":1},"cited_work":{"arxiv_id":"2304.01305","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.01305","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jun Jet Tai, Jim Wong, Mauro Innocente, Nadjim Horri, James Brusey, and Swee King Phang","venue":null,"work_id":"db0f4199-3723-4f1b-a729-d0ecc1518a68","year":null},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2304.01305","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:497cebb87c4ff2d4bf4dd5ae7d85d61d917c2c1c6c60eccb58a8618444105e4b","observation_id":"40010bf7-6710-44fa-8473-23467e9d535f","resolution":{"observed_at":"2026-05-11T17:29:49.510529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09341","last_updated":"2021-01-17T22:21:57Z","snapshot_observed_at":"2026-07-06T09:57:06.539646Z","submitted_at":"2020-09-20T03:19:12Z","title":"Multiplayer Support for the Arcade Learning Environment","version":2},"cited_work":{"arxiv_id":"2009.09341","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.09341","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pettingzoo: Gym for multi-agent reinforcement learning","venue":null,"work_id":"e89b6f15-0eb6-4f4b-b1f0-a7ac21b781c1","year":2009},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2009.09341","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:456963d9547d5c17a81655c5f19de29aa3f3ae0bed2689f6e83cc50c74319075","observation_id":"aaf865b1-736a-4343-adaf-663e70cd6bfc","resolution":{"observed_at":"2026-05-11T17:29:49.520253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2012.638610","doi":"10.1109/iros.2012.6386109","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Mujoco: A physics en- gine for model-based control, in: 2012 IEEE/RSJ International Con- ference on Intelligent Robots and Systems, IEEE","venue":null,"work_id":"5f5e6f59-3edd-4ba3-9cc2-7e7483d4d151","year":2012},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:fdc0786bbf9565d2f1e8363baa0b89594391e7a3ccbb9110e00c9799cb0b742e","observation_id":"b6698461-fc85-434a-867e-7f4fd4d33335","resolution":{"observed_at":"2026-05-11T17:29:49.318904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:50:40.398486+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:50:40.398486+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.100022","doi":"10.1016/j.metip.2020.100022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"2020 , issn =","venue":null,"work_id":"028533b1-6bce-4c06-ad37-88ff5746a3f2","year":2025},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:3778e3c56a05c732b89a58e50f880b351e440f3aa8cd7d0aa176703297b47933","observation_id":"5d71b5d0-159d-40d0-a35c-4a37b0eccf94","resolution":{"observed_at":"2026-05-11T17:29:49.338382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14171","last_updated":"2022-08-10T16:20:23Z","snapshot_observed_at":"2026-08-01T11:11:33.392958Z","submitted_at":"2021-07-29T16:49:03Z","title":"Tianshou: a Highly Modularized Deep Reinforcement Learning Library","version":3},"cited_work":{"arxiv_id":"2107.14171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.14171","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv: 2107.14171","venue":null,"work_id":"43a1c909-ce73-4923-b6c8-2a638f74c2f1","year":null},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/2107.14171","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:ec7083d93043ccc307356e321e334e7a0bd7d571c56fee5b648aa0e0a8988775","observation_id":"22b1d74f-e0e4-4154-9188-acb09ad8e412","resolution":{"observed_at":"2026-05-11T17:29:49.526610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kenny Young and Tian Tian","venue":null,"work_id":"91c2accd-0eb0-432d-a2f4-5a809753f50d","year":2022},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:20659171a9b31676f3b0e2f48c93e3744263427444af79d58facfec6f674911d","observation_id":"69376ba7-5857-4018-81b4-35b60e4d6ff4","resolution":{"observed_at":"2026-05-11T17:29:49.681594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-07-06T07:37:51.655095Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":"1903.03176","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-07-09T21:36:34.225692Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","venue":"cs.LG","work_id":"b0356c0a-a542-4219-8643-47b4320a50ff","year":2019},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:e55c2bef76f2eb6649e9454e9b1751620ee9ff0c6c4b74c00328a29a5344ad30","observation_id":"b918eef3-a7da-4d4f-b861-6ee4a0c7baba","resolution":{"observed_at":"2026-05-11T17:29:49.654592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.13767625","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Siyuan Zhang and Nan Jiang","venue":null,"work_id":"27c5ea8e-8a1b-44fc-91c0-eebfe10fb01e","year":2024},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:294e74cdfea28ddc7ddbbb481fdcac14e80cfef3c3f61d0e142861aa61344031","observation_id":"e9ac05e1-c4d7-4699-b34f-433c7a1c65d8","resolution":{"observed_at":"2026-05-11T17:29:49.254957Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-07-06T08:31:50.962710Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1910.10897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-07-04T14:09:52.691576Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"42b3081e-43bd-451c-b777-259c81be7953","year":2021},"citing_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T17:29:49.186565Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2407.17032"},"observation_digest":"sha256:83fe1a0c9b3af0cbcf4f82f6fea255ebe66c3be5dcef556dad4e9ff43fd26024","observation_id":"dcf5e911-491b-4013-b9ad-76fa0aa02644","resolution":{"observed_at":"2026-05-11T17:29:49.533695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":16,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":2},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 100 inbound Pith citation observations for arXiv:2407.17032."}