{"as_of":"2026-08-10T23:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da73af0cb6f432de239d0eeb7db5b116b8f77450f306f8b8e6d0f777c9e3375d","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:45:23.213117Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:56:51.940356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:51:25.700420Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"cited_work":{"arxiv_id":"2603.06009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.06009","snapshot_observed_at":"2026-07-21T01:19:54.005423Z","title":"Preventing learning stagnation in ppo by scaling to 1 million parallel environments.arXiv preprint arXiv:2603.06009","venue":null,"work_id":"9ea7382c-c3e8-4edc-821c-2f43d3edb749","year":null},"citing_paper":{"arxiv_id":"2604.26326","last_updated":"2026-05-10T00:50:42Z","snapshot_observed_at":"2026-07-06T23:12:01.813588Z","submitted_at":"2026-04-29T06:16:33Z","title":"Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T13:34:06.461850Z"},"links":{"cited_paper":"/paper/2603.06009","citing_paper":"/paper/2604.26326"},"observation_digest":"sha256:56bfcb8f9c3965119d0ac8d268017411399c62f2e17713c980834d4436fbb1f3","observation_id":"783a5005-aee6-441d-b65a-5f2230404964","resolution":{"observed_at":"2026-07-21T01:19:54.005423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"cited_work":{"arxiv_id":"2603.06009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.06009","snapshot_observed_at":"2026-07-21T01:19:54.005423Z","title":"Preventing learning stagnation in ppo by scaling to 1 million parallel environments.arXiv preprint arXiv:2603.06009","venue":null,"work_id":"9ea7382c-c3e8-4edc-821c-2f43d3edb749","year":null},"citing_paper":{"arxiv_id":"2604.26326","last_updated":"2026-05-10T00:50:42Z","snapshot_observed_at":"2026-07-06T23:12:01.813588Z","submitted_at":"2026-04-29T06:16:33Z","title":"Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:56:51.940356Z"},"links":{"cited_paper":"/paper/2603.06009","citing_paper":"/paper/2604.26326"},"observation_digest":"sha256:bc9f27ac3a0a720236ab22e4f58c1fb3bb72deb94be1e6cc8fb49535a043fc1d","observation_id":"b8e32634-548b-434a-9051-726edda6527f","resolution":{"observed_at":"2026-07-21T01:19:54.005423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.06009/citation-record","integrity":"/paper/2603.06009/integrity","json":"/paper/2603.06009/citation-record.json","paper":"/paper/2603.06009"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.203273Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.203273Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:328a340731668fd1c1951846bab711584c0d6b1fcaab8586b66dc19e1e9a2cd6","observation_id":"324d468a-0ef7-41ab-b8a8-d109b3222946","resolution":{"observed_at":"2026-08-02T18:45:20.203273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-07-06T09:27:47.020846Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-02T18:45:20.216901Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.216901Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:47811463cf9b7535df809c2e634fed255bf0e0c08bdd00c0900694b78e788200","observation_id":"16ea3926-2720-442f-ae65-02428ba04317","resolution":{"observed_at":"2026-08-02T18:45:20.216901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.229450Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.229450Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:7b59f89747e4bf667fe590162f9405444c0176c14f5c46f7f48f6080f51934df","observation_id":"faf2f041-1fb4-4e78-9f94-50969c0b27b6","resolution":{"observed_at":"2026-08-02T18:45:20.229450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.241718Z","title":"Nonlinear programming","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.241718Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:2bd4b90031ea8501bde0ced01ba6e79f60091b6a30d47b7387aeb9dedc61139e","observation_id":"28fb3107-307e-41a2-8469-f286488a6e10","resolution":{"observed_at":"2026-08-02T18:45:20.241718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.253010Z","title":"Staggered environment resets improve massively parallel on-policy reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.253010Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:ed43d491cfd0bda21246ecf0f530464241b05aab464699d12767797c9cfbf81a","observation_id":"1df8c173-9bf6-4d1f-ac95-936ba5d5a96f","resolution":{"observed_at":"2026-08-02T18:45:20.253010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.267228Z","title":"Towards deeper deep reinforcement learning with spectral normalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.267228Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:c943732643d0b23bf1835f73bedfe4bc07acdc57fedbdd368b75f64718fd9dbb","observation_id":"eb988d13-6dab-4f1c-b529-8a7da5239187","resolution":{"observed_at":"2026-08-02T18:45:20.267228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09884","last_updated":"2024-03-16T00:02:49Z","snapshot_observed_at":"2026-08-06T08:23:36.728709Z","submitted_at":"2023-06-16T14:52:24Z","title":"Jumanji: a Diverse Suite of Scalable Reinforcement Learning Environments in JAX","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09884","snapshot_observed_at":"2026-08-02T18:45:20.286849Z","title":"Midgley, Elshadai Tegegn, Tristan Kalloniatis, Omayma Mahjoub, Matthew Macfarlane, Andries P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.286849Z"},"links":{"cited_paper":"/paper/2306.09884","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:857275ad00c5e1aed4151e9ba10c57e15233d2bd3f74d600be6c262b0f9d5057","observation_id":"5888563a-2747-4fc3-b190-2c4515fb867d","resolution":{"observed_at":"2026-08-02T18:45:20.286849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.303337Z","title":"Mixtures of experts unlock parameter scaling for deep RL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.303337Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:7a7941c5f6555fe4ead530db0083dc737b36a566b1e33985ca56994eb44eebf1","observation_id":"ef4fe975-aabb-4c6f-92e3-5ef0f4d70094","resolution":{"observed_at":"2026-08-02T18:45:20.303337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.319817Z","title":"Two-timescale networks for nonlinear value function approximation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.319817Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:47ecf9e576923f88e37b6ffbd9b04f2e1f53197726a5c8f62c0f86b7d3da6386","observation_id":"f7eca6dc-852f-436d-8d4b-ad834820aeea","resolution":{"observed_at":"2026-08-02T18:45:20.319817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.332979Z","title":"Bayen, Stuart Russell, Andrew Critch, and Sergey Levine","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.332979Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:27ab30d68f1e946e35da2ab3ae56309b95b74a2deab2c4c2603a3241673329e6","observation_id":"b1301120-9d07-4b2a-9c3e-3a6924f17330","resolution":{"observed_at":"2026-08-02T18:45:20.332979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.346469Z","title":"Revisiting lars for large batch training generalization of neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.346469Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:253c1cf9793fb4a3c9a7326b57cffa241070d827bc2a0492e556a9d44737bde7","observation_id":"2954065a-4892-47da-8cff-e2e127b8d2b8","resolution":{"observed_at":"2026-08-02T18:45:20.346469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.411579Z","title":"First return, then explore","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.411579Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:030accf5bf96d07754eabf81e8804dc51081f5fabe0c188fa0cbfc5ca0fed7a3","observation_id":"e25f19ba-1351-4903-a07a-df1185db8a76","resolution":{"observed_at":"2026-08-02T18:45:20.411579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-02T18:45:20.537597Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.537597Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:b8d24d2b161df448d6deec2f596132419f6c66f7e3b130bf7a9ec60c656ee2b3","observation_id":"43518c25-4e3d-4773-8eda-17dedb3c887c","resolution":{"observed_at":"2026-08-02T18:45:20.537597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.648056Z","title":"Daniel Freeman, Erik Frey, Anton Raichuk, Sertan Girgin, Igor Mordatch, and Olivier Bachem","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.648056Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:f068144c3eb1448082a2b20da85b95cd678219266ae08211ca4e0549e12938cf","observation_id":"84acd0c9-d1fa-439f-ada0-722524b2f624","resolution":{"observed_at":"2026-08-02T18:45:20.648056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T18:45:20.779259Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.779259Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:7fd98292256729ed223515a50de894141ef047c1bf27a02bd9c45f5644821b0e","observation_id":"c0f8730c-77fb-48c0-ac05-e358dc8b2efb","resolution":{"observed_at":"2026-08-02T18:45:20.779259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-02T18:45:20.901597Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.901597Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:28338d9024d73cd2741ef8f2e01580ac2c5d98e3e6efe101c61cf430811fad1c","observation_id":"7c7485fc-90ed-4c3c-8089-40ae59723b91","resolution":{"observed_at":"2026-08-02T18:45:20.901597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:20.987553Z","title":"Learning rates as a function of batch size: A random matrix theory approach to neural network training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.987553Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:ea560f958748376bf2f11e5fb324f0dfd682bf788ed81368739590ddcfe6d339","observation_id":"f8e47bd5-a90c-43b4-8454-cfca8ed370d0","resolution":{"observed_at":"2026-08-02T18:45:20.987553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:21.086389Z","title":"Batch size-invariance for policy optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.086389Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:4b140658f920d6fe12699d0707c92b6fe3754d59a62740d80a043a96230f3337","observation_id":"5d6d2f4c-d71e-477b-934b-848029d12e20","resolution":{"observed_at":"2026-08-02T18:45:21.086389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13442","last_updated":"2023-02-19T01:24:51Z","snapshot_observed_at":"2026-08-06T01:50:31.974402Z","submitted_at":"2023-01-31T06:38:53Z","title":"Scaling laws for single-agent reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13442","snapshot_observed_at":"2026-08-02T18:45:21.203626Z","title":"Scaling laws for single-agent reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.203626Z"},"links":{"cited_paper":"/paper/2301.13442","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:d04185db73903a533675b952dfe1a15747053965bf94045c7e5cea64773560df","observation_id":"23e6dcbc-c46c-4c9a-bfac-ee5c337af806","resolution":{"observed_at":"2026-08-02T18:45:21.203626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:21.320970Z","title":"Position: Open-endedness is essential for artificial superhuman intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.320970Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:4695996f69fd0b5a14d91d0aae6d35451e37249f11832f0d0e19683a25aa334d","observation_id":"1fb6e709-9532-4297-ae33-d5c542ea6ebf","resolution":{"observed_at":"2026-08-02T18:45:21.320970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02553","last_updated":"2020-05-25T16:24:26Z","snapshot_observed_at":"2026-07-06T07:13:05.887491Z","submitted_at":"2018-11-06T18:54:21Z","title":"A Closer Look at Deep Policy Gradients","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02553","snapshot_observed_at":"2026-08-02T18:45:21.412418Z","title":"Are deep policy gradient algorithms truly policy gradient algorithms","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.412418Z"},"links":{"cited_paper":"/paper/1811.02553","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:3cd5c40d45d2ac26bf6b8e617768f8cd5716c3dc26e29a83e7e5b29f70b92fd3","observation_id":"7dd5cc85-b604-4cb7-af86-976b18d92667","resolution":{"observed_at":"2026-08-02T18:45:21.412418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:21.492814Z","title":"Prioritized level replay","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.492814Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:064cfae8cb72b0ff22bd6d4843f59e2c197ec31a332b524fa3cd8b3f466efa5c","observation_id":"6cf2602e-2935-463b-bfca-1da5cd997345","resolution":{"observed_at":"2026-08-02T18:45:21.492814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-02T18:45:21.623678Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.623678Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:108b92e56f5d90e861e3958208378414780967c068e0c4c523b745edc2778a89","observation_id":"6ea2447c-fc09-4fd3-ab26-5eb21f0958eb","resolution":{"observed_at":"2026-08-02T18:45:21.623678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.5997","last_updated":"2014-04-26T23:10:51Z","snapshot_observed_at":"2026-08-06T11:52:03.941771Z","submitted_at":"2014-04-23T22:37:56Z","title":"One weird trick for parallelizing convolutional neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.5997","snapshot_observed_at":"2026-08-02T18:45:21.702560Z","title":"One weird trick for parallelizing convolutional neural networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.702560Z"},"links":{"cited_paper":"/paper/1404.5997","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:5390783bea1b073d11ea00a3403f6a4b6f2cef644a24c8bbb677ce0509eb3c81","observation_id":"993ae644-4fa5-4a2f-bea7-cbd992480a14","resolution":{"observed_at":"2026-08-02T18:45:21.702560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:21.850672Z","title":"u ttler, Nantas Nardelli, Alexander Miller, Roberta Raileanu, Marco Selvatici, Edward Grefenstette, and Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.850672Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:8527faac6f5cf6d98c1162cceb97b6190acbd001421909256ade70d24604ae17","observation_id":"92ef049f-6854-45cd-a5fb-b9f56bc40c82","resolution":{"observed_at":"2026-08-02T18:45:21.850672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:21.931314Z","title":"gymnax : A JAX -based reinforcement learning environment library, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:21.931314Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:d244fb64e95d2080b1899aaa09711d1a606f8a41343c2ec2e3a42131d2b67cdc","observation_id":"d44a1b1d-885f-44a0-80f2-e25c2b5b5dd8","resolution":{"observed_at":"2026-08-02T18:45:21.931314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:22.011868Z","title":"Wurman, Jaegul Choo, Peter Stone, and Takuma Seno","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.011868Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:5d26dc2c5e4f43018256191367888f8cb5709b485f004e5f2dd994159ef4f878","observation_id":"838de2d9-fb23-4d12-b0b4-99a48bdbe22a","resolution":{"observed_at":"2026-08-02T18:45:22.011868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15280","last_updated":"2025-05-29T14:58:32Z","snapshot_observed_at":"2026-08-10T06:30:44.145319Z","submitted_at":"2025-02-21T08:17:24Z","title":"Hyperspherical Normalization for Scalable Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15280","snapshot_observed_at":"2026-08-02T18:45:22.126026Z","title":"Hyperspherical normalization for scalable deep reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.126026Z"},"links":{"cited_paper":"/paper/2502.15280","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:808b6ec440cf65331feaac894439feced0dc54bd346d8fba4f1fbf3cd7fcae96","observation_id":"4f9d073a-5ea2-4f7f-a7d9-3f3f246c324d","resolution":{"observed_at":"2026-08-02T18:45:22.126026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:22.251346Z","title":"Linear and nonlinear programming, volume 2","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.251346Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:962ddb2c5a9a9d5e97dd930385fd7179bfd95c93d95cfba2d8483b15fdc479eb","observation_id":"f861d90e-6353-42d7-87e6-c02021e58cae","resolution":{"observed_at":"2026-08-02T18:45:22.251346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:22.373975Z","title":"Understanding and preventing capacity loss in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.373975Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:ab94e01f18ffe704a1adb37385997a4c0bbb2c8852d0074b139b133d3de9ade0","observation_id":"a2b46b9e-831e-4f74-8524-fb4bc35f4966","resolution":{"observed_at":"2026-08-02T18:45:22.373975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:22.423849Z","title":"Disentangling the causes of plasticity loss in neural networks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.423849Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:5d622bd4a05c05d5e96fe31a1b96375ee046c9e2f60da366cc536b8af0cef3ff","observation_id":"fe001b47-43e7-46af-9320-0ad2ea4bede0","resolution":{"observed_at":"2026-08-02T18:45:22.423849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:22.489621Z","title":"Isaac gym: High performance GPU based physics simulation for robot learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.489621Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:6fb689550242d89b01afd5f1571719b26124b3da711a0ffee44248267fbda852","observation_id":"fe17d574-42d3-444e-ac1e-727b272e7504","resolution":{"observed_at":"2026-08-02T18:45:22.489621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:22.574471Z","title":"On the sdes and scaling rules for adaptive gradient algorithms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.574471Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:a40e373d32a96791ab251266fb333d5684e4e48aaf91f9c9e8a4dfb9f003ec35","observation_id":"a551a44c-467b-461f-9d42-f1d455fc40b9","resolution":{"observed_at":"2026-08-02T18:45:22.574471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:22.677138Z","title":"Craftax: A lightning-fast benchmark for open-ended reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.677138Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:81a60971afbbecf63f305c36f86a332d5ffe0346b4b6ace02068d282ca672271","observation_id":"c67d8891-9c09-4bc8-b702-32f708d5aaba","resolution":{"observed_at":"2026-08-02T18:45:22.677138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23208","last_updated":"2025-03-03T14:29:16Z","snapshot_observed_at":"2026-07-06T19:42:21.306600Z","submitted_at":"2024-10-30T16:59:41Z","title":"Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23208","snapshot_observed_at":"2026-08-02T18:45:22.786428Z","title":"Kinetix: Investigating the training of general agents through open-ended physics-based control tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.786428Z"},"links":{"cited_paper":"/paper/2410.23208","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:f8c83bb6dfe8ca7a7ec2e5239d3e3aa17543bd669696d9de63052af194c96a48","observation_id":"f068f8c5-a260-429a-a3cb-6ec93fe5ea20","resolution":{"observed_at":"2026-08-02T18:45:22.786428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-02T18:45:22.899915Z","title":"An empirical model of large-batch training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.899915Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:3410b691c6fe8cf96f321f6d1f8bb34019d0da741323e1f0dc66fbd79ca24011","observation_id":"de666f82-b53d-4177-8517-a5745efb7be0","resolution":{"observed_at":"2026-08-02T18:45:22.899915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:22.948817Z","title":"Multi-task reinforcement learning enables parameter scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:22.948817Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:13aeec53843995b9268f64e19792531c79302b9ff0954b8310bf700e6552b9c2","observation_id":"8cbd09d7-fade-4eab-b894-4cf64e724026","resolution":{"observed_at":"2026-08-02T18:45:22.948817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.005083Z","title":"Bigger, regularized, optimistic: scaling for compute and sample efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.005083Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:3178637e8fdc97043ef4f94bde78ba84c60d88dab900058a4ae63cb0dff8310d","observation_id":"7ae9d672-186c-45b1-99fe-59c41a664d58","resolution":{"observed_at":"2026-08-02T18:45:23.005083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.062351Z","title":"The primacy bias in deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.062351Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:26093f706ee67340f9eadcc233c0ae2331010554b8ba1490a048309ae2c06f8b","observation_id":"01f8fc35-d3ca-401d-a589-16f3f8687429","resolution":{"observed_at":"2026-08-02T18:45:23.062351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.094899Z","title":"XL and-minigrid: Scalable meta-reinforcement learning environments in JAX","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.094899Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:42056811a1bc9a0ae58af5ccd96f8d8067d6cf1a728e68d5f6811ef820eb3caa","observation_id":"c8744c93-dc41-4b3f-bdbd-866b779031bf","resolution":{"observed_at":"2026-08-02T18:45:23.094899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08973","last_updated":"2025-03-01T09:36:02Z","snapshot_observed_at":"2026-07-06T18:30:10.950834Z","submitted_at":"2024-06-13T10:04:17Z","title":"XLand-100B: A Large-Scale Multi-Task Dataset for In-Context Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2406.08973","doi":"10.48550/arxiv.2406.08973","metadata_source":"pith","pith_arxiv_id":"2406.08973","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"XLand-100B: A Large-Scale Multi-Task Dataset for In-Context Reinforcement Learning","venue":"cs.LG","work_id":"af25648f-bb10-4774-8b6f-4cd37c960f4c","year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.099039Z"},"links":{"cited_paper":"/paper/2406.08973","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:e465f2e0b8eeab2aeb2dafb9536031a75ca9057b5a16b08a03698d92b4f0b374","observation_id":"cb04fbd9-728a-441e-80c6-3c6487dd0c41","resolution":{"observed_at":"2026-08-02T18:48:31.995581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.103513Z","title":"Numerical optimization","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.103513Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:f64bc7c5f3d865c1cb44fbbb7b152a54097a4392cdee864d63ed17e91261abe5","observation_id":"25a4f697-d4df-4743-8780-96d65cf35f4a","resolution":{"observed_at":"2026-08-02T18:45:23.103513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.07920","last_updated":"2021-02-16T02:16:54Z","snapshot_observed_at":"2026-08-05T03:21:02.807911Z","submitted_at":"2021-02-16T02:16:54Z","title":"Training Larger Networks for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.07920","snapshot_observed_at":"2026-08-02T18:45:23.108589Z","title":"Training larger networks for deep reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.108589Z"},"links":{"cited_paper":"/paper/2102.07920","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:cf8f8d0920b2ca37b26ece9f365f2f4423b8a1ee731adc31aa2bd2fd5fb15c0c","observation_id":"4b20b069-19e4-4ba2-8f6e-040ab9f682c0","resolution":{"observed_at":"2026-08-02T18:45:23.108589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.113006Z","title":"Evolving curricula with regret-based environment design","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.113006Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:38acb8dcb5e87b5326be35c58905c761fb2225a61a02d560ba6f98a6d47d14fa","observation_id":"bc16fb24-25c5-4cc7-be89-c9b5748c58fc","resolution":{"observed_at":"2026-08-02T18:45:23.113006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.117078Z","title":"Some methods of speeding up the convergence of iteration methods","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.117078Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:d2caa22ab24f3335b39df923268ca16321ca151638884698360febf2ec9444ce","observation_id":"5d7f2e7d-8748-499a-af22-96db5cc90e98","resolution":{"observed_at":"2026-08-02T18:45:23.117078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.121237Z","title":"A stochastic approximation method","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.121237Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:c132c50aa0dcae561828f3a7ebee70b2747058343f95e448751b9a22bd0602fa","observation_id":"2b763ee1-377f-43f5-a79f-e43d3f2b647e","resolution":{"observed_at":"2026-08-02T18:45:23.121237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10090","last_updated":"2026-07-04T05:19:25Z","snapshot_observed_at":"2026-08-09T03:06:29.095333Z","submitted_at":"2023-11-16T18:58:43Z","title":"JaxMARL: Multi-Agent RL Environments and Algorithms in JAX","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10090","snapshot_observed_at":"2026-08-02T18:45:23.125183Z","title":"Jaxmarl: Multi-agent rl environments in jax","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.125183Z"},"links":{"cited_paper":"/paper/2311.10090","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:231e186e403927600b586515f1b33de8206b809d6cb71558ff98264e4a65a1c1","observation_id":"ec434f3f-33f7-441b-a989-de607ede3ee9","resolution":{"observed_at":"2026-08-02T18:45:23.125183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.129183Z","title":"No regrets: Investigating and improving regret approximations for curriculum discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.129183Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:b501386d627427766de0075254a843dc0bef2da443e722d3d3767c63fe0b1d7e","observation_id":"0ba84456-3169-4b8a-8839-d9cba76eae96","resolution":{"observed_at":"2026-08-02T18:45:23.129183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.133253Z","title":"Value-based deep RL scales predictably","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.133253Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:0dd1fb5beeec949c61b55db88602670d76fd967e987efa98fa4cd95b13a6efd1","observation_id":"5377ea3c-39fd-4430-a539-6e3b7fb450d0","resolution":{"observed_at":"2026-08-02T18:45:23.133253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-02T18:45:23.137181Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.137181Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:abe2a01909e1345751db9b2ba34deae799641c26166ac69a6106ea46dff9db7a","observation_id":"c8a4a067-209c-474a-ba56-eca104e763b0","resolution":{"observed_at":"2026-08-02T18:45:23.137181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T18:45:23.141968Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.141968Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:b54e7fbd77cd5f43d4f0bea48b294366b37ec04d23ef64d5540a70072f86837b","observation_id":"1b01029d-8b70-44eb-a41b-3577843ee218","resolution":{"observed_at":"2026-08-02T18:45:23.141968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.145966Z","title":"Bigger, better, faster: Human-level atari with human-level efficiency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.145966Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:a609647901ae0674c65d6011ed25033d9b7023162a9b7e5884150477c86d76f7","observation_id":"16f3a565-b1f6-40be-8766-d6f0c9ed186c","resolution":{"observed_at":"2026-08-02T18:45:23.145966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20230","last_updated":"2024-07-29T17:59:50Z","snapshot_observed_at":"2026-08-09T21:34:41.405925Z","submitted_at":"2024-07-29T17:59:50Z","title":"SAPG: Split and Aggregate Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20230","snapshot_observed_at":"2026-08-02T18:45:23.149868Z","title":"Sapg: split and aggregate policy gradients","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.149868Z"},"links":{"cited_paper":"/paper/2407.20230","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:9927164928920e4df123a8c39598ffced55040f1e1187778ebf3a82730bff1de","observation_id":"1224cad9-23c2-4029-8ef8-44a43e3a4e2c","resolution":{"observed_at":"2026-08-02T18:45:23.149868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.153984Z","title":"Smith, Pieter-Jan Kindermans, and Quoc V","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.153984Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:bae30125865d5c313782e6568f405a1f87eac8d1ec144a7db8088786db8faff9","observation_id":"abc960eb-0465-489d-9429-06cd16a32162","resolution":{"observed_at":"2026-08-02T18:45:23.153984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.158003Z","title":"Why open-endedness matters","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.158003Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:760853b10df2aab725f9194a9c31591310cc727bbd36290bbc289a47e37090b1","observation_id":"92398630-9fb0-470f-8327-f3ce3b78e661","resolution":{"observed_at":"2026-08-02T18:45:23.158003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20752","last_updated":"2025-06-25T18:25:08Z","snapshot_observed_at":"2026-08-09T12:08:21.616173Z","submitted_at":"2025-06-25T18:25:08Z","title":"Characterization and Mitigation of Training Instabilities in Microscaling Formats","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20752","snapshot_observed_at":"2026-08-02T18:45:23.162011Z","title":"Characterization and mitigation of training instabilities in microscaling formats","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.162011Z"},"links":{"cited_paper":"/paper/2506.20752","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:0c7ee1c2bd7a5e5260ef07893a701cfd1794f45a94e48b7289e609f0b990428f","observation_id":"ded6a708-c11a-47c7-a5ac-091b9e5bdee0","resolution":{"observed_at":"2026-08-02T18:45:23.162011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11052","last_updated":"2021-09-22T21:54:21Z","snapshot_observed_at":"2026-08-09T04:10:22.167720Z","submitted_at":"2021-09-22T21:54:21Z","title":"On Bonus-Based Exploration Methods in the Arcade Learning Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11052","snapshot_observed_at":"2026-08-02T18:45:23.166185Z","title":"On bonus-based exploration methods in the arcade learning environment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.166185Z"},"links":{"cited_paper":"/paper/2109.11052","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:0eeff9da1559fd7378d0de77c7f1479c34cc6e573b53b27ca88d3035f7066ab9","observation_id":"276c54a0-5753-4591-b5aa-47e461ed3223","resolution":{"observed_at":"2026-08-02T18:45:23.166185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00666","last_updated":"2024-11-01T15:29:10Z","snapshot_observed_at":"2026-08-06T09:39:34.103148Z","submitted_at":"2024-11-01T15:29:10Z","title":"Beyond the Boundaries of Proximal Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00666","snapshot_observed_at":"2026-08-02T18:45:23.170247Z","title":"Beyond the boundaries of proximal policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.170247Z"},"links":{"cited_paper":"/paper/2411.00666","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:e676a876258fc8730ffb897b72e735d45cbc0df18bb9338f83fb64a97ebd01e5","observation_id":"058f5053-c8a0-4149-a692-54718f1bd4a8","resolution":{"observed_at":"2026-08-02T18:45:23.170247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07608","last_updated":"2023-01-18T15:39:21Z","snapshot_observed_at":"2026-07-06T14:42:30.096301Z","submitted_at":"2023-01-18T15:39:21Z","title":"Human-Timescale Adaptation in an Open-Ended Task Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.07608","snapshot_observed_at":"2026-08-02T18:45:23.174550Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.174550Z"},"links":{"cited_paper":"/paper/2301.07608","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:1953a1910e72f649ec353dfef55f2a5e4efa5453cf0318d408c8ded02e370145","observation_id":"438a996f-6afd-4a5e-9be5-15d374122f90","resolution":{"observed_at":"2026-08-02T18:45:23.174550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.12808","last_updated":"2021-07-31T16:55:19Z","snapshot_observed_at":"2026-08-09T10:48:10.505366Z","submitted_at":"2021-07-27T13:30:07Z","title":"Open-Ended Learning Leads to Generally Capable Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.12808","snapshot_observed_at":"2026-08-02T18:45:23.178594Z","title":"Open-ended learning leads to generally capable agents","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.178594Z"},"links":{"cited_paper":"/paper/2107.12808","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:df537e8c04be73f46a57698841558dc995e396790c26f36c77b7d5fc2173bcab","observation_id":"4fb0f036-004b-491f-abaa-551f1b531280","resolution":{"observed_at":"2026-08-02T18:45:23.178594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.182591Z","title":"Efficient exploration in reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.182591Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:eeb1254d2779873e3a056b0fdb200d3fe51f4930bbe7ba2391f02937b3372186","observation_id":"68765e25-3cf7-4553-8bc6-45ea749fe06e","resolution":{"observed_at":"2026-08-02T18:45:23.182591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.186289Z","title":"Stoix: Distributed Single-Agent Reinforcement Learning End-to-End in JAX , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.186289Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:99de91c9d6967c663bb7c53590f991752f1a5a91b6d928997adc3a85d97c8cb5","observation_id":"06f0c469-6455-43a9-ab8b-b8f11ad12f5b","resolution":{"observed_at":"2026-08-02T18:45:23.186289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.189894Z","title":"1000 layer networks for self-supervised RL : Scaling depth can enable new goal-reaching capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.189894Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:9060293dc05e300483b9e886b44973d299b02f98444dbcdcaa4544f75d08188c","observation_id":"d1eab8c5-2e04-4362-a662-209a46724942","resolution":{"observed_at":"2026-08-02T18:45:23.189894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.193619Z","title":"Truly proximal policy optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.193619Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:bd4cad8240dcd5791668eb006a99863b265c3b4b518dfce28499c8f78f854250","observation_id":"a12b9ae3-56ba-47c9-97dd-068273d774d4","resolution":{"observed_at":"2026-08-02T18:45:23.193619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.197554Z","title":"A finite-time analysis of two time-scale actor-critic methods","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.197554Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:a7c370ddd4952112d665ac8cfbb9bbd07e03bcb9a5658bf7e71b2ffc7870aff0","observation_id":"58b54141-451e-44eb-83bd-2b6fda085b36","resolution":{"observed_at":"2026-08-02T18:45:23.197554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.201163Z","title":"Kahrs, Carlo Sferrazza, Yuval Tassa, and Pieter Abbeel","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.201163Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:f33563eb6e8eac15d9deb9d8c767537d2a933f79fdc39466169d321d11e59f8c","observation_id":"615725cc-be96-4575-8c2d-cecc3ccf8d5a","resolution":{"observed_at":"2026-08-02T18:45:23.201163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.205161Z","title":"Fast two-time-scale stochastic gradient method with applications in reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.205161Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:3d26d2e144e836eab63b8a04bba1d438fdb5bc235f1bca21eeb3efc84aa0aefc","observation_id":"719932f3-f12e-4724-8a26-baa72efd50e6","resolution":{"observed_at":"2026-08-02T18:45:23.205161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.209039Z","title":"A two-time-scale stochastic optimization framework with applications in control and reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.209039Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:6185b86c5b78d8ed21d479326d26d13f7dac91d95deb200829f5af4642a40608","observation_id":"cccd674e-dd4a-47b1-9455-cc35bd91bd20","resolution":{"observed_at":"2026-08-02T18:45:23.209039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:45:23.213117Z","title":"Stabilizing reinforcement learning with llms: Formulation and practices","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:23.213117Z"},"links":{"citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:aac77f523c1399ea22c329b0287c645fa63ee65826117cd0d12868ea640d2bca","observation_id":"97d2c54e-5a2d-460d-983a-cfc813566cd2","resolution":{"observed_at":"2026-08-02T18:45:23.213117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:01:23.378136Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 2 inbound Pith citation observations for arXiv:2603.06009."}