{"as_of":"2026-08-07T07:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21d0e8acf0888f31d066e2de782c07be861c1f07296969ee8d87542ac05b16a9","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:10.038427Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.03194/citation-record","integrity":"/paper/2508.03194/integrity","json":"/paper/2508.03194/citation-record.json","paper":"/paper/2508.03194"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1910.01465","last_updated":"2019-12-02T16:00:20Z","snapshot_observed_at":"2026-08-01T19:44:03.464325Z","submitted_at":"2019-10-03T13:40:46Z","title":"Reducing Overestimation Bias in Multi-Agent Domains Using Double Centralized Critics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01465","snapshot_observed_at":"2026-08-06T04:39:01.594756Z","title":"Reducing overestimation bias in multi-agent domains using double centralized critics","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.594756Z"},"links":{"cited_paper":"/paper/1910.01465","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:a748c87049b5fd1a25f65e349a7ec4d1bbe693ef913022cfaa58f4857c55f5a9","observation_id":"f31cc6b1-dd95-41d7-a058-ac0fba07e79b","resolution":{"observed_at":"2026-08-06T04:39:01.594756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T04:39:02.097893Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.097893Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:03b0152ae7c45ba9805501ef4823b443fe8dfe75e03b0eec66c7a1fffb151e58","observation_id":"92cfd7de-2a3c-40c0-a7fb-d1657f3d4f4a","resolution":{"observed_at":"2026-08-06T04:39:02.097893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T04:39:02.167095Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.167095Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:e25dae83e381e88fd267eac9b1599299aba9dea5224c4b637b8aea8d6fdd66c1","observation_id":"296bd663-b3a3-44d7-bc7d-4bd91fe21d45","resolution":{"observed_at":"2026-08-06T04:39:02.167095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.646411Z","title":"Girshick","venue":null,"work_id":"108ea4c2-d509-4f18-96f2-46ecc0d6096b","year":2020},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.300702Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:6ab6ecc072995b8be6a211dd8a34f52f33bfedcd3a7d862be6416e77dd0c5ca2","observation_id":"35bd2519-08ce-4023-b351-bbb96f5dc2d8","resolution":{"observed_at":"2026-08-06T04:39:13.713021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-06T04:39:02.375698Z","title":"Scaling laws for autoregressive generative modeling.arXiv preprint arXiv:2010.14701,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.375698Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:5fd522592fb8dbce1abb43cbd41d69480dffd09053aa63ef1a8bcd0529247f36","observation_id":"96e5cc89-4cfe-4d15-ab9a-c4abf82b6a4d","resolution":{"observed_at":"2026-08-06T04:39:02.375698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T04:39:02.650942Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.650942Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:5d65358a387beb44dac3f5588eb46118a363b73c825fbbe40cc3b89cd16a8a7d","observation_id":"5d04cc46-6e85-4cf5-9072-1bfbf717c71d","resolution":{"observed_at":"2026-08-06T04:39:02.650942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-06T04:39:02.714676Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.714676Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:f7186f8e140e4e62e9db31e9b705a23974a767afc9b6a1c16412285ef654f95c","observation_id":"47ec75fa-639c-468d-930a-43b7db5d5488","resolution":{"observed_at":"2026-08-06T04:39:02.714676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09754","last_updated":"2025-05-29T15:02:38Z","snapshot_observed_at":"2026-07-06T19:32:28.772012Z","submitted_at":"2024-10-13T07:20:53Z","title":"SimBa: Simplicity Bias for Scaling Up Parameters in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09754","snapshot_observed_at":"2026-08-06T04:39:02.901710Z","title":"Simba: Simplicity bias for scaling up parameters in deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.901710Z"},"links":{"cited_paper":"/paper/2410.09754","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:a9f9563c96f287be3fddd7b81158858d00597aef988cf153cf6411ecde766006","observation_id":"6bf65cda-86bb-4f74-8cc7-f8bb7f90a255","resolution":{"observed_at":"2026-08-06T04:39:02.901710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15280","last_updated":"2025-05-29T14:58:32Z","snapshot_observed_at":"2026-07-06T20:40:20.211665Z","submitted_at":"2025-02-21T08:17:24Z","title":"Hyperspherical Normalization for Scalable Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15280","snapshot_observed_at":"2026-08-06T04:39:02.965845Z","title":"Hyperspherical normalization for scalable deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.965845Z"},"links":{"cited_paper":"/paper/2502.15280","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:d1d974e02a049d299b1ea0477c9ca2b22502845fbadac3fcd0d61813f130a7fd","observation_id":"c276368b-ee5a-4e92-a097-6a6b93eaab6a","resolution":{"observed_at":"2026-08-06T04:39:02.965845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06329","last_updated":"2023-06-10T01:49:01Z","snapshot_observed_at":"2026-07-06T15:41:02.198577Z","submitted_at":"2023-06-10T01:49:01Z","title":"HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach","version":1},"cited_work":{"arxiv_id":"2306.06329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.06329","snapshot_observed_at":"2026-08-06T04:39:12.650683Z","title":"HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach","venue":"cs.LG","work_id":"90dfd7bd-085d-4ba7-9563-2d9127269cde","year":2023},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.194469Z"},"links":{"cited_paper":"/paper/2306.06329","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:0e9800cb7e48d86de77c3e62af0ffc0ae0980f983a1023c9be93208a023a192d","observation_id":"8aeb3b80-7dba-4d80-92f9-104d6f66f7a0","resolution":{"observed_at":"2026-08-06T04:39:12.697025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-06T18:49:43.181677Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-06T04:39:03.382391Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.382391Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9455679becd6775415613ff1103df76147f2e7bafcc24dff52b888b4f012f910","observation_id":"56a88053-8484-4f20-8e2e-d2afacf86fab","resolution":{"observed_at":"2026-08-06T04:39:03.382391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.378899Z","title":"Encouraging divergent thinking in large language models through multi-agent debate","venue":null,"work_id":"3d8d3ddb-da19-4193-b266-c7b34b100ca2","year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.493412Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:283453a0da5818ee5d313054635409691df6287a8d66b14f119fbea54a7ea93c","observation_id":"07612d32-42f0-4bb3-aa7b-7ae7f7c8a48a","resolution":{"observed_at":"2026-08-06T04:39:13.524958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20379","last_updated":"2025-02-27T18:53:30Z","snapshot_observed_at":"2026-07-31T02:25:03.070138Z","submitted_at":"2025-02-27T18:53:30Z","title":"Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20379","snapshot_observed_at":"2026-08-06T04:39:03.647835Z","title":"doi: 10.18653/v1/2024.emnlp-main.992","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.647835Z"},"links":{"cited_paper":"/paper/2502.20379","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:faaaea574bdfe3fc466c8172997c81cb709239d359c97a9e4a03173a27816534","observation_id":"ae716863-0aee-4800-8dcb-9cc490fe3269","resolution":{"observed_at":"2026-08-06T04:39:03.647835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-06T04:39:03.814369Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.814369Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:4ddc99ead7cc14a509649efba45211b2c187d0e5724d8590529d7441b132609f","observation_id":"e62efe48-f42d-494a-8f2f-e426e9358a9c","resolution":{"observed_at":"2026-08-06T04:39:03.814369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-08-06T04:39:04.024925Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.024925Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:dd887c03fd80b3aedd37017cde7e88d1d1e694870031f871b3309cdd68f493ac","observation_id":"74b92fd2-80fe-457e-8dfc-f7d363cc0b3b","resolution":{"observed_at":"2026-08-06T04:39:04.024925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.04286","last_updated":"2022-09-16T12:32:55Z","snapshot_observed_at":"2026-07-06T12:26:37.330653Z","submitted_at":"2022-01-12T03:31:21Z","title":"Evolutionary Action Selection for Gradient-based Policy Learning","version":4},"cited_work":{"arxiv_id":"2201.04286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.04286","snapshot_observed_at":"2026-08-06T04:39:12.413521Z","title":"Evolutionary Action Selection for Gradient-based Policy Learning","venue":"cs.NE","work_id":"8fa032c1-da76-48ca-8a20-6373a2b94351","year":2022},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.163212Z"},"links":{"cited_paper":"/paper/2201.04286","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:1863913e948d83c7ed9cd1895989db50c1956e7bd7a000a1ca77ba1523ac10ed","observation_id":"fc48908a-06b0-4ce2-b747-1ddc66b74c69","resolution":{"observed_at":"2026-08-06T04:39:12.504235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T04:39:04.390690Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.390690Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:105bba351114b903ef65fd062f69479c4c41182b254931353100c0eb89ea426e","observation_id":"51f80b10-ba54-4325-9ee9-7544de71c491","resolution":{"observed_at":"2026-08-06T04:39:04.390690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-06T04:39:04.547064Z","title":"Smolvlm: Redefining small and efficient multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.547064Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9ab61ef4aa3c9c83e0888a3397dfe9cb9f16cf181829ef473e66331eec563a5c","observation_id":"92c82929-f926-4f15-9a69-7230b4fb38e3","resolution":{"observed_at":"2026-08-06T04:39:04.547064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03404","last_updated":"2025-06-03T21:27:17Z","snapshot_observed_at":"2026-08-05T03:52:55.824517Z","submitted_at":"2025-06-03T21:27:17Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","version":1},"cited_work":{"arxiv_id":"2506.03404","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03404","snapshot_observed_at":"2026-08-06T04:39:12.260604Z","title":"The Impact of On-Policy Parallelized Data Collection on Deep Reinforcement Learning Networks","venue":"cs.LG","work_id":"1dd0baea-8f36-494c-a9ec-b7a99a6a6425","year":2025},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.763706Z"},"links":{"cited_paper":"/paper/2506.03404","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:fb0285897ff876027fa01884b7408628a937af9f0bec2d63d3da44c7fc812c9a","observation_id":"b41a1983-3b77-479e-b2b4-547f72c1f91f","resolution":{"observed_at":"2026-08-06T04:39:12.305554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-06T04:39:04.975317Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.975317Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:3e4a2ddc44f213ce95bc5f09bea1fca4b2426c86da6c0db36a7e38c8ccd7a3d2","observation_id":"da9c01ce-fac7-4106-a460-3eab38e783ba","resolution":{"observed_at":"2026-08-06T04:39:04.975317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T04:39:05.355060Z","title":"Candès, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.355060Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:8332367b23bd34f81d1013c2ba5f472f5c1d2f9537ba34a66cd7c8b3c14acbb0","observation_id":"4ac0e78e-37c2-4042-a3bb-e7e062983975","resolution":{"observed_at":"2026-08-06T04:39:05.355060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23150","last_updated":"2025-05-29T06:41:45Z","snapshot_observed_at":"2026-07-06T21:32:43.441417Z","submitted_at":"2025-05-29T06:41:45Z","title":"Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23150","snapshot_observed_at":"2026-08-06T04:39:05.516882Z","title":"Bigger, regularized, categorical: High-capacity value functions are efficient multi-task learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.516882Z"},"links":{"cited_paper":"/paper/2505.23150","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:3ffa7dcbcb463d50c6feefe967e76677e309610ed22d700e5f2dac5a2ccb8aac","observation_id":"bc77ead2-1f30-42fd-9916-5280d93a49ee","resolution":{"observed_at":"2026-08-06T04:39:05.516882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11092","last_updated":"2023-01-30T11:30:19Z","snapshot_observed_at":"2026-07-06T14:20:54.903780Z","submitted_at":"2022-11-20T21:48:25Z","title":"Q-Ensemble for Offline RL: Don't Scale the Ensemble, Scale the Batch Size","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11092","snapshot_observed_at":"2026-08-06T04:39:05.661675Z","title":"Q-ensemble for offline rl: Don’t scale the ensemble, scale the batch size","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.661675Z"},"links":{"cited_paper":"/paper/2211.11092","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:4f4abaa9090fd3e9c05f24bf537764f8b3d9fb0bc9399b2da8c449bd2a92ddd1","observation_id":"d69bd5f6-b29c-4465-8e1a-1022b874b711","resolution":{"observed_at":"2026-08-06T04:39:05.661675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T04:39:05.858336Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.858336Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:64b64764a8fa95c9296964f3029adaffa25fc10aa7c5d5ca336342f93a0224e6","observation_id":"4a4c2d2b-a15e-4637-9c60-fc9a674349fd","resolution":{"observed_at":"2026-08-06T04:39:05.858336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07523","last_updated":"2025-05-22T12:39:27Z","snapshot_observed_at":"2026-07-06T20:34:44.083385Z","submitted_at":"2025-02-11T12:55:32Z","title":"Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07523","snapshot_observed_at":"2026-08-06T04:39:06.014406Z","title":"Scaling off-policy reinforcement learning with batch and weight normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.014406Z"},"links":{"cited_paper":"/paper/2502.07523","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:6b10e71d6cac3c2f58e8c71b0432a5a97c896f8e257358cdacdc0ebf66f10815","observation_id":"47bb1096-30d7-43a5-a96a-02dbf597181b","resolution":{"observed_at":"2026-08-06T04:39:06.014406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03442","last_updated":"2023-08-06T00:21:19Z","snapshot_observed_at":"2026-07-06T15:13:13.695535Z","submitted_at":"2023-04-07T01:55:19Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03442","snapshot_observed_at":"2026-08-06T04:39:06.216173Z","title":"O’Brien, Carrie J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.216173Z"},"links":{"cited_paper":"/paper/2304.03442","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:343bbb3102d557029d6603c99dc27f24da4c3cb3d3d4bbeef04a8f7e2f4d4c3b","observation_id":"91a7e734-9132-4d03-924d-422473fb67a7","resolution":{"observed_at":"2026-08-06T04:39:06.216173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:06.374492Z","title":"Horizon reduction makes rl scalable","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.374492Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:8d5ca44a702be20d7e643007c1bb9f490b377b5636eac6b3e901544472c2b794","observation_id":"c74ba78b-7db9-4f46-8b3c-08b0b3c1f5da","resolution":{"observed_at":"2026-08-06T04:39:06.374492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T04:39:06.606659Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.606659Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:f9f6049962ca76da8560522753ab7b291a7ad138bc4dd277c98714882d03913e","observation_id":"4322a865-7636-4446-89a9-6b6f44e3eac0","resolution":{"observed_at":"2026-08-06T04:39:06.606659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04327","last_updated":"2025-07-25T01:10:02Z","snapshot_observed_at":"2026-08-05T01:44:07.276914Z","submitted_at":"2025-02-06T18:59:47Z","title":"Value-Based Deep RL Scales Predictably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04327","snapshot_observed_at":"2026-08-06T04:39:06.797394Z","title":"Value-based deep rl scales predictably","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.797394Z"},"links":{"cited_paper":"/paper/2502.04327","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:9be95dc60d0502db1ec0968a9603a6e4d43326fdcce40a7a38726c6f8e4f0988","observation_id":"e7d746db-8c02-4bce-8d81-72aab31f19d0","resolution":{"observed_at":"2026-08-06T04:39:06.797394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T04:39:06.960332Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:06.960332Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:c4c4f4fe2153918ffaf5d0b22c867245dc008182b5b405e783ad46b3c06b14a4","observation_id":"0977ce65-9c9f-4280-b9d4-0b48ef20c4eb","resolution":{"observed_at":"2026-08-06T04:39:06.960332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-04T04:26:28.690005Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-06T04:39:07.111116Z","title":"Fasttd3: Simple, fast, and capable reinforcement learning for humanoid control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.111116Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:c0d2677cbb6bb7471fc2c4c981110a1db8a04d6673d7616e8b99717761610aeb","observation_id":"2866452a-e27c-4565-b71c-001936c8ccbe","resolution":{"observed_at":"2026-08-06T04:39:07.111116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-04T05:16:12.953751Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-06T04:39:07.312483Z","title":"Humanoidbench: Simulated humanoid benchmark for whole-body locomotion and manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.312483Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:67ba046a3ae8b1ab694b0135723076319e6003387a71cb7eef4937004007866b","observation_id":"14655a44-f98d-4c09-9a60-a5429f3718e3","resolution":{"observed_at":"2026-08-06T04:39:07.312483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T04:39:07.470093Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.470093Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:442b623ff75102c492ceffd19b8b37da28dc50ad5cf349e385e0f3c9285d4424","observation_id":"8e775b0e-68c3-4b0e-923c-35b5b6e8b0b1","resolution":{"observed_at":"2026-08-06T04:39:07.470093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.10605","last_updated":"2019-07-01T21:03:09Z","snapshot_observed_at":"2026-08-04T09:26:06.848914Z","submitted_at":"2019-03-25T21:46:58Z","title":"Q-Learning for Continuous Actions with Cross-Entropy Guided Policies","version":3},"cited_work":{"arxiv_id":"1903.10605","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.10605","snapshot_observed_at":"2026-08-06T04:39:11.650771Z","title":"Q-Learning for Continuous Actions with Cross-Entropy Guided Policies","venue":"cs.AI","work_id":"8325e832-1263-4ae0-8adc-3289c83da9d9","year":2019},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.677891Z"},"links":{"cited_paper":"/paper/1903.10605","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b72a4424fe2072e90a1f53b863faee65f8324c3cf09ceffa70752df8d705ac2b","observation_id":"04bfc398-424b-4cec-927b-236058396c63","resolution":{"observed_at":"2026-08-06T04:39:11.817965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02811","last_updated":"2019-01-10T20:48:11Z","snapshot_observed_at":"2026-08-05T15:01:05.847055Z","submitted_at":"2018-03-07T18:39:12Z","title":"Accelerated Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02811","snapshot_observed_at":"2026-08-06T04:39:07.841303Z","title":"Accelerated methods for deep reinforcement learning.arXiv preprint arXiv:1803.02811,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.841303Z"},"links":{"cited_paper":"/paper/1803.02811","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:d564fab292d2417671d105c98ece25e9935740a972c49605b1610f0b73e06d86","observation_id":"7ede08de-cc52-470f-b1a8-d678163e58ef","resolution":{"observed_at":"2026-08-06T04:39:07.841303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-06T04:39:07.992274Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:07.992274Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:151635e2f56d75824f7dc1ff5079ae89eddf4139659c289cbc1ad6268bf1d7d6","observation_id":"5a627790-67da-4c89-ad59-60d9bc95771b","resolution":{"observed_at":"2026-08-06T04:39:07.992274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08896","last_updated":"2025-04-02T18:17:24Z","snapshot_observed_at":"2026-08-04T20:57:43.814693Z","submitted_at":"2024-10-11T15:13:17Z","title":"MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL","version":2},"cited_work":{"arxiv_id":"2410.08896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08896","snapshot_observed_at":"2026-08-06T04:39:11.292081Z","title":"MAD-TD: Model-Augmented Data stabilizes High Update Ratio RL","venue":"cs.LG","work_id":"919b31fe-603b-4e7a-9d39-339c96d5f6e9","year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.410191Z"},"links":{"cited_paper":"/paper/2410.08896","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:d3e71304278047d7bae263b65553c9bea164e362e2a67c70cf12a7c219f9e485","observation_id":"7141075c-d58a-45f0-8b00-941519ddc798","resolution":{"observed_at":"2026-08-06T04:39:11.383388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:08.569861Z","title":"1000 layer networks for self-supervised rl: Scaling depth can enable new goal-reaching capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.569861Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:075088a220b4692f342dc7c2eb13e8e4a78b54e7cddf4471fbf557df9634b591","observation_id":"84e66027-628c-4006-9e36-350330d06cc5","resolution":{"observed_at":"2026-08-06T04:39:08.569861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18082","last_updated":"2025-05-08T23:56:41Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:59:52Z","title":"Prioritized Generative Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18082","snapshot_observed_at":"2026-08-06T04:39:08.778688Z","title":"Prioritized generative replay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.778688Z"},"links":{"cited_paper":"/paper/2410.18082","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:84b5a61033eaf2c230541a24f3582dcc1aa19a508bbf15e1dcf0210258e368c9","observation_id":"337e92b0-c427-4c5a-89f0-58d39828bdf0","resolution":{"observed_at":"2026-08-06T04:39:08.778688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09159","last_updated":"2022-11-17T02:24:57Z","snapshot_observed_at":"2026-08-05T11:28:22.878426Z","submitted_at":"2021-11-17T14:48:52Z","title":"Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance","version":3},"cited_work":{"arxiv_id":"2111.09159","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.09159","snapshot_observed_at":"2026-08-06T04:39:10.927974Z","title":"Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance","venue":"cs.LG","work_id":"48bbba1d-43cc-4347-8227-58924c6e61c7","year":2021},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.949726Z"},"links":{"cited_paper":"/paper/2111.09159","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:dea2b8a61fc04fe381b827ab4a01187ecb98c74fbec076062d35253a3d839c89","observation_id":"0b721e05-0aca-4a3c-acb4-07f2f438a046","resolution":{"observed_at":"2026-08-06T04:39:11.084778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.029321Z","title":"Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning","venue":null,"work_id":"1851fc4d-e9c7-494c-9626-f04e62b97aeb","year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.151122Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b54538f59ba6ecf070e29b3ed6b2c18eca2410f2771b5b92dc760668ebdc35f1","observation_id":"cabf089c-1e07-48ef-ae7f-f1337a470e7f","resolution":{"observed_at":"2026-08-06T04:39:13.115603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:09.364581Z","title":"ISBN 979-8-3503-5067-8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.364581Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:db910f4a37e070f169b07ae28252167493fb9b4efab0ed4afd90dcd75def023e","observation_id":"31bb396d-a529-48b7-9603-00011f03b0a5","resolution":{"observed_at":"2026-08-06T04:39:09.364581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09284","last_updated":"2022-05-19T02:25:32Z","snapshot_observed_at":"2026-07-06T13:11:26.091152Z","submitted_at":"2022-05-19T02:25:32Z","title":"Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble","version":1},"cited_work":{"arxiv_id":"2205.09284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.09284","snapshot_observed_at":"2026-08-06T04:39:10.578335Z","title":"Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble","venue":"cs.LG","work_id":"39ff0c97-f171-4aa9-a60b-8680006919f0","year":2022},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.528457Z"},"links":{"cited_paper":"/paper/2205.09284","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:d0cf4db8458500899263ab96a0927c72973a068727c9575f6d641c2b02fc33dd","observation_id":"876de244-d1a8-43a5-949e-3d1b876a59b0","resolution":{"observed_at":"2026-08-06T04:39:10.681491Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-06T04:39:09.721695Z","title":"Image augmentation is all you need: Regularizing deep reinforcement learning from pixels","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.721695Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:4a793459937de9ab9d8f6350e5842742d3fe9841a99a90250ff29f31bd597ada","observation_id":"7d462103-b0b5-4e41-af02-4e275f73f6ba","resolution":{"observed_at":"2026-08-06T04:39:09.721695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3233/faia230609","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:10.221927Z","title":"doi: 10.3233/FAIA230609","venue":null,"work_id":"83ef6fd9-65cb-47b3-9f67-c3101f6156a6","year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:09.891263Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b9271aeed254aa905f8f031d537f8ce68f917972939d526a4085cf381eed2958","observation_id":"4b44c69d-357d-472a-9f0c-5501184607d3","resolution":{"observed_at":"2026-08-06T04:39:10.335341Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07696","last_updated":"2022-09-16T03:41:50Z","snapshot_observed_at":"2026-08-07T01:30:00.020201Z","submitted_at":"2022-09-16T03:41:50Z","title":"Towards A Unified Policy Abstraction Theory and Representation Learning Approach in Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07696","snapshot_observed_at":"2026-08-06T04:39:10.038427Z","title":"Towards A unified policy abstraction theory and representation learning approach in markov decision processes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:10.038427Z"},"links":{"cited_paper":"/paper/2209.07696","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:7e74b33bc7e32197314f07b8689cdee81a93786560a70728aa9b163dd86bf713","observation_id":"862ee5f6-ec79-47a6-9c0c-48aa3c87c5a4","resolution":{"observed_at":"2026-08-06T04:39:10.038427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-07-06T12:03:06.452840Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-06T04:39:02.796315Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":1989,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.796315Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b835b1ded2ac7def7dac5a13405ea08547d2c701ce35e55ad2d8d9336786bcd9","observation_id":"f8ff49ef-a2ff-469f-a26a-7272292de7a0","resolution":{"observed_at":"2026-08-06T04:39:02.796315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T04:39:08.202891Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:08.202891Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:03edbe3c806834615711ad79cd5929d6032ed22e7a5ef5cca864ed7b0f6789cf","observation_id":"7187d104-04a6-4c4b-a531-0a2095337020","resolution":{"observed_at":"2026-08-06T04:39:08.202891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.208617Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":"c3dc8bb3-06c8-4876-8002-953959efdef2","year":1928},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:05.143346Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:f67b92491c6cee0dc23bb289ef8a466d91c51d0ea1b8239bec767a17583e9327","observation_id":"a134f84a-fae4-43cf-b484-559d0e84c0b2","resolution":{"observed_at":"2026-08-06T04:39:13.306588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13600","last_updated":"2022-05-26T20:11:23Z","snapshot_observed_at":"2026-07-06T13:14:26.331614Z","submitted_at":"2022-05-26T20:11:23Z","title":"MyoSuite -- A contact-rich simulation suite for musculoskeletal motor control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13600","snapshot_observed_at":"2026-08-06T04:39:01.907116Z","title":"Myosuite–a contact-rich simulation suite for musculoskeletal motor control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.907116Z"},"links":{"cited_paper":"/paper/2205.13600","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:983e9a3d5d01e61046e37ec752b2eb364d83c568a559a8533794ec280ee13518","observation_id":"6a5219e7-61fd-45cc-965a-1298248ee48f","resolution":{"observed_at":"2026-08-06T04:39:01.907116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13442","last_updated":"2023-02-19T01:24:51Z","snapshot_observed_at":"2026-08-06T01:50:31.974402Z","submitted_at":"2023-01-31T06:38:53Z","title":"Scaling laws for single-agent reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13442","snapshot_observed_at":"2026-08-06T04:39:02.461192Z","title":"Scaling laws for single-agent reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.461192Z"},"links":{"cited_paper":"/paper/2301.13442","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:5be4636396e5c441c58b1b1f484dd35a63f40d413a64df4a67964b6ff43fd760","observation_id":"60cc0364-9d78-44e9-bb00-880a11a28b55","resolution":{"observed_at":"2026-08-06T04:39:02.461192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04811","last_updated":"2025-04-21T20:21:44Z","snapshot_observed_at":"2026-08-03T05:46:16.330368Z","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04811","snapshot_observed_at":"2026-08-06T04:39:02.239780Z","title":"Simplifying deep temporal difference learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.239780Z"},"links":{"cited_paper":"/paper/2407.04811","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:48d8ea84bdd10c99171434ed99860f1f18a241590ac4f0c32ad2d0736bb1e183","observation_id":"0a5445b3-83e8-45f8-bdab-b98429e1a043","resolution":{"observed_at":"2026-08-06T04:39:02.239780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01502","last_updated":"2017-11-07T20:45:59Z","snapshot_observed_at":"2026-07-06T05:45:39.485902Z","submitted_at":"2017-06-05T19:01:26Z","title":"UCB Exploration via Q-Ensembles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01502","snapshot_observed_at":"2026-08-06T04:39:01.982238Z","title":"Ucb exploration via q-ensembles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.982238Z"},"links":{"cited_paper":"/paper/1706.01502","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:8dfae6cc6b6dd1b10f046c1e89af0240dd72c595d0503e814d1d1798bada6ada","observation_id":"f1ea7b3f-1edb-49f9-93a2-677f9a47c633","resolution":{"observed_at":"2026-08-06T04:39:01.982238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-06T04:39:01.830561Z","title":"Openai gym","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.830561Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:c1269f19688242c83a50041672775cc991d85648f9b362aec0fd2964d038850e","observation_id":"115464bc-a918-4615-9f44-a6b1b78e8fdc","resolution":{"observed_at":"2026-08-06T04:39:01.830561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.770535Z","title":"Phasic policy gradient","venue":null,"work_id":"5b8b5235-81cc-41d4-9537-5c64849f1ffa","year":2020},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.050002Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:be7a4303918e942e88a68e7074743acfbb3835283b662b203ac6277384bf7935","observation_id":"41b4c15e-3f08-4f6d-a758-9d2b65e1d10a","resolution":{"observed_at":"2026-08-06T04:39:13.844864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02957","last_updated":"2025-01-17T11:59:23Z","snapshot_observed_at":"2026-07-06T18:09:59.472962Z","submitted_at":"2024-05-05T14:53:51Z","title":"Agent Hospital: A Simulacrum of Hospital with Evolvable Medical Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02957","snapshot_observed_at":"2026-08-06T04:39:03.060592Z","title":"Keep various trajectories: promoting exploration of ensemble policies in continuous control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.060592Z"},"links":{"cited_paper":"/paper/2405.02957","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:7a232054825f0a386db37d2da792291228a6d3a4a6201242779fc9070cb463a0","observation_id":"b7addc73-5c8a-44e7-ac44-dd8f8b35bfbe","resolution":{"observed_at":"2026-08-06T04:39:03.060592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-06T04:39:01.745617Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.745617Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:a9a2449a6dbff7d4e102a3d1351466cd6e1bff68c336ca9a76c0bcea671bde41","observation_id":"4cb6c6bc-60cc-4f75-89d2-424822a76ed4","resolution":{"observed_at":"2026-08-06T04:39:01.745617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04133","last_updated":"2017-08-10T19:20:15Z","snapshot_observed_at":"2026-08-05T17:11:34.773264Z","submitted_at":"2017-08-10T19:20:15Z","title":"Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.04133","snapshot_observed_at":"2026-08-06T04:39:02.562616Z","title":"Reproducibility of benchmarked deep reinforcement learning tasks for continuous control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:02.562616Z"},"links":{"cited_paper":"/paper/1708.04133","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:f2f487874f19ef722771968eaa66e15c858cca6e2398cd94cd2136858df27174","observation_id":"decb3e77-a2a3-4f19-9afd-b62762b65cb1","resolution":{"observed_at":"2026-08-06T04:39:02.562616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:39:13.938721Z","title":"Gaon An, Seungyong Moon, Jang-Hyun Kim, and Hyun Oh Song","venue":null,"work_id":"667a357e-2f2a-4f43-9ed3-84a3740d6479","year":2025},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:01.673860Z"},"links":{"citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:b4e22559788c0307e3522a1ba76139cb5fb625d4d3938c928c6b70f54877e6e3","observation_id":"469c9732-ca93-42e9-ba3f-7db283b79c39","resolution":{"observed_at":"2026-08-06T04:39:14.006027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":45,"verified_exact":6,"verified_fuzzy":6},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2508.03194."}