{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2016:77M3W4GBAK6KW4BUWTTSSHI7U2","short_pith_number":"pith:77M3W4GB","schema_version":"1.0","canonical_sha256":"ffd9bb70c102bcab7034b4e7291d1fa693a43b664fb77608b5e13cc07ad9a9b8","source":{"kind":"arxiv","id":"1602.01783","version":2},"attestation_state":"computed","paper":{"title":"Asynchronous Methods for Deep Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Adri\\`a Puigdom\\`enech Badia, Alex Graves, David Silver, Koray Kavukcuoglu, Mehdi Mirza, Tim Harley, Timothy P. Lillicrap, Volodymyr Mnih","submitted_at":"2016-02-04T18:38:41Z","abstract_excerpt":"We propose a conceptually simple and lightweight framework for deep reinforcement learning that uses asynchronous gradient descent for optimization of deep neural network controllers. We present asynchronous variants of four standard reinforcement learning algorithms and show that parallel actor-learners have a stabilizing effect on training allowing all four methods to successfully train neural network controllers. The best performing method, an asynchronous variant of actor-critic, surpasses the current state-of-the-art on the Atari domain while training for half the time on a single multi-c"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"1602.01783","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2016-02-04T18:38:41Z","cross_cats_sorted":[],"title_canon_sha256":"991fe6f4bc1975bac9f95081205828ba86a141492c744055b5c736692005cd08","abstract_canon_sha256":"5d94b75a1fdb5ada50f9ede6ff6d4f52b3854c5de09c36540ba51ddf13788c29"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-05-18T01:12:22.591894Z","signature_b64":"HDcPWF8crDNx8TYWRWfAlaRLvZFNxAmUxLnVSsPIQvlIgxKU2gWzrnyL92qKQGuRDP2uaBR518JtL/jSQqYTBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ffd9bb70c102bcab7034b4e7291d1fa693a43b664fb77608b5e13cc07ad9a9b8","last_reissued_at":"2026-05-18T01:12:22.591566Z","signature_status":"signed_v1","first_computed_at":"2026-05-18T01:12:22.591566Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Asynchronous Methods for Deep Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Adri\\`a Puigdom\\`enech Badia, Alex Graves, David Silver, Koray Kavukcuoglu, Mehdi Mirza, Tim Harley, Timothy P. Lillicrap, Volodymyr Mnih","submitted_at":"2016-02-04T18:38:41Z","abstract_excerpt":"We propose a conceptually simple and lightweight framework for deep reinforcement learning that uses asynchronous gradient descent for optimization of deep neural network controllers. We present asynchronous variants of four standard reinforcement learning algorithms and show that parallel actor-learners have a stabilizing effect on training allowing all four methods to successfully train neural network controllers. The best performing method, an asynchronous variant of actor-critic, surpasses the current state-of-the-art on the Atari domain while training for half the time on a single multi-c"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1602.01783","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"1602.01783","created_at":"2026-05-18T01:12:22.591615+00:00"},{"alias_kind":"arxiv_version","alias_value":"1602.01783v2","created_at":"2026-05-18T01:12:22.591615+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1602.01783","created_at":"2026-05-18T01:12:22.591615+00:00"},{"alias_kind":"pith_short_12","alias_value":"77M3W4GBAK6K","created_at":"2026-05-18T12:30:04.600751+00:00"},{"alias_kind":"pith_short_16","alias_value":"77M3W4GBAK6KW4BU","created_at":"2026-05-18T12:30:04.600751+00:00"},{"alias_kind":"pith_short_8","alias_value":"77M3W4GB","created_at":"2026-05-18T12:30:04.600751+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":30,"internal_anchor_count":16,"sample":[{"citing_arxiv_id":"2607.08703","citing_title":"MPFlow: Learning Budgeted Max-Flow Optimization on the Lightning Network with Deep Graph Reinforcement Learning","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2606.25497","citing_title":"SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation","ref_index":6,"is_internal_anchor":true},{"citing_arxiv_id":"2606.24622","citing_title":"Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback","ref_index":49,"is_internal_anchor":true},{"citing_arxiv_id":"2606.24937","citing_title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","ref_index":178,"is_internal_anchor":true},{"citing_arxiv_id":"2606.05800","citing_title":"SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter","ref_index":26,"is_internal_anchor":true},{"citing_arxiv_id":"2605.02405","citing_title":"Closed-Loop CO2 Storage Control With History-Based Reinforcement Learning and Latent Model-Based Adaptation","ref_index":70,"is_internal_anchor":true},{"citing_arxiv_id":"2605.26478","citing_title":"Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient","ref_index":34,"is_internal_anchor":true},{"citing_arxiv_id":"1906.10182","citing_title":"Planning Robot Motion using Deep Visual Prediction","ref_index":12,"is_internal_anchor":true},{"citing_arxiv_id":"1907.03098","citing_title":"Playing Flappy Bird via Asynchronous Advantage Actor Critic Algorithm","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"1907.10097","citing_title":"Learning-based Hamilton-Jacobi-Bellman Methods for Optimal Control","ref_index":26,"is_internal_anchor":true},{"citing_arxiv_id":"2412.02818","citing_title":"RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields","ref_index":52,"is_internal_anchor":true},{"citing_arxiv_id":"2412.19538","citing_title":"Scalable Hierarchical Reinforcement Learning for Hyper Scale Multi-Robot Task Planning","ref_index":34,"is_internal_anchor":true},{"citing_arxiv_id":"2509.00338","citing_title":"Scalable Option Learning in High-Throughput Environments","ref_index":42,"is_internal_anchor":true},{"citing_arxiv_id":"2102.01293","citing_title":"Scaling Laws for Transfer","ref_index":113,"is_internal_anchor":true},{"citing_arxiv_id":"2409.12917","citing_title":"Training Language Models to Self-Correct via Reinforcement Learning","ref_index":72,"is_internal_anchor":true},{"citing_arxiv_id":"2309.00267","citing_title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","ref_index":68,"is_internal_anchor":true},{"citing_arxiv_id":"1801.00690","citing_title":"DeepMind Control Suite","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12261","citing_title":"Delay-Empowered Causal Hierarchical Reinforcement Learning","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11316","citing_title":"Error whitening: Why Gauss-Newton outperforms Newton","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05812","citing_title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26095","citing_title":"Distill-Belief: Closed-Loop Inverse Source Localization and Characterization in Physical Fields","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"1606.01540","citing_title":"OpenAI Gym","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05812","citing_title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02405","citing_title":"Closed-Loop CO2 Storage Control With History-Based Reinforcement Learning and Latent Model-Based Adaptation","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2112.00861","citing_title":"A General Language Assistant as a Laboratory for Alignment","ref_index":155,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2","json":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2.json","graph_json":"https://pith.science/api/pith-number/77M3W4GBAK6KW4BUWTTSSHI7U2/graph.json","events_json":"https://pith.science/api/pith-number/77M3W4GBAK6KW4BUWTTSSHI7U2/events.json","paper":"https://pith.science/paper/77M3W4GB"},"agent_actions":{"view_html":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2","download_json":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2.json","view_paper":"https://pith.science/paper/77M3W4GB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=1602.01783&json=true","fetch_graph":"https://pith.science/api/pith-number/77M3W4GBAK6KW4BUWTTSSHI7U2/graph.json","fetch_events":"https://pith.science/api/pith-number/77M3W4GBAK6KW4BUWTTSSHI7U2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2/action/storage_attestation","attest_author":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2/action/author_attestation","sign_citation":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2/action/citation_signature","submit_replication":"https://pith.science/pith/77M3W4GBAK6KW4BUWTTSSHI7U2/action/replication_record"}},"created_at":"2026-05-18T01:12:22.591615+00:00","updated_at":"2026-05-18T01:12:22.591615+00:00"}