{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2019:NVVQACU7UQF6LM3TWAHBMCDPXG","short_pith_number":"pith:NVVQACU7","schema_version":"1.0","canonical_sha256":"6d6b000a9fa40be5b373b00e16086fb99be1034799d386b26048658fd2978f52","source":{"kind":"arxiv","id":"1902.04043","version":5},"attestation_state":"computed","paper":{"title":"The StarCraft Multi-Agent Challenge","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.MA","stat.ML"],"primary_cat":"cs.LG","authors_text":"Chia-Man Hung, Christian Schroeder de Witt, Gregory Farquhar, Jakob Foerster, Mikayel Samvelyan, Nantas Nardelli, Philip H. S. Torr, Shimon Whiteson, Tabish Rashid, Tim G. J. Rudner","submitted_at":"2019-02-11T18:43:53Z","abstract_excerpt":"In the last few years, deep multi-agent reinforcement learning (RL) has become a highly active area of research. A particularly challenging class of problems in this area is partially observable, cooperative, multi-agent learning, in which teams of agents must learn to coordinate their behaviour while conditioning only on their private observations. This is an attractive research area since such problems are relevant to a large number of real-world systems and are also more amenable to evaluation than general-sum problems. Standardised environments such as the ALE and MuJoCo have allowed singl"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"1902.04043","kind":"arxiv","version":5},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-02-11T18:43:53Z","cross_cats_sorted":["cs.MA","stat.ML"],"title_canon_sha256":"2df179af12ba50d31a571cd2036eea8b8191ddff166969e8ca99cd6e9ad34b57","abstract_canon_sha256":"7e9d265694e77078c7b092378a070ae5403fe7dc46d533cb978ac536880be960"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:24:36.801020Z","signature_b64":"9PG4KWjlECHYGTDzfoQZFa83YM5ixqlytSK1o9laLuaMelfKokxZGyJHPBzhpJ2zz+HdKaKz4WPuk/x4n9hzDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6d6b000a9fa40be5b373b00e16086fb99be1034799d386b26048658fd2978f52","last_reissued_at":"2026-07-05T00:24:36.800532Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:24:36.800532Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The StarCraft Multi-Agent Challenge","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.MA","stat.ML"],"primary_cat":"cs.LG","authors_text":"Chia-Man Hung, Christian Schroeder de Witt, Gregory Farquhar, Jakob Foerster, Mikayel Samvelyan, Nantas Nardelli, Philip H. S. Torr, Shimon Whiteson, Tabish Rashid, Tim G. J. Rudner","submitted_at":"2019-02-11T18:43:53Z","abstract_excerpt":"In the last few years, deep multi-agent reinforcement learning (RL) has become a highly active area of research. A particularly challenging class of problems in this area is partially observable, cooperative, multi-agent learning, in which teams of agents must learn to coordinate their behaviour while conditioning only on their private observations. This is an attractive research area since such problems are relevant to a large number of real-world systems and are also more amenable to evaluation than general-sum problems. Standardised environments such as the ALE and MuJoCo have allowed singl"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1902.04043","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/1902.04043/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"1902.04043","created_at":"2026-07-05T00:24:36.800588+00:00"},{"alias_kind":"arxiv_version","alias_value":"1902.04043v5","created_at":"2026-07-05T00:24:36.800588+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1902.04043","created_at":"2026-07-05T00:24:36.800588+00:00"},{"alias_kind":"pith_short_12","alias_value":"NVVQACU7UQF6","created_at":"2026-07-05T00:24:36.800588+00:00"},{"alias_kind":"pith_short_16","alias_value":"NVVQACU7UQF6LM3T","created_at":"2026-07-05T00:24:36.800588+00:00"},{"alias_kind":"pith_short_8","alias_value":"NVVQACU7","created_at":"2026-07-05T00:24:36.800588+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":33,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25526","citing_title":"Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.24601","citing_title":"ASALT: Adaptive State Alignment for Lateral Transfer in Multi-agent Reinforcement Learning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18308","citing_title":"TRIDENT: Breaking the Hybrid-Safety-Physics Coupling for Provably Safe Multi-Agent Reinforcement Learning","ref_index":81,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12281","citing_title":"CCKS: Consensus-based Communication and Knowledge Sharing","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11284","citing_title":"Phi-Actor-Critic: Steering General-Sum Games to Pareto-Efficient Correlated Equilibria","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00190","citing_title":"Play Like Champions: Counterfactual Feedback Generation in Latent Space","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04492","citing_title":"Episodic Memory Temporal Consistency for Cooperative Multi-Agent Reinforcement Learning","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18024","citing_title":"Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01665","citing_title":"TABX: A High-Throughput Sandbox Battle Simulator for Multi-Agent Reinforcement Learning","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23027","citing_title":"PIMbot: A Self-Adaptive Attack Framework for Adversarial Manipulation of Multi-Robot Reinforcement Learning","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"1907.09467","citing_title":"Arena: a toolkit for Multi-Agent Reinforcement Learning","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2404.10976","citing_title":"Group-Aware Coordination Graph for Multi-Agent Reinforcement Learning","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2502.03506","citing_title":"Optimistic {\\epsilon}-Greedy Exploration for Cooperative Multi-Agent Reinforcement Learning","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2502.02844","citing_title":"Wolfpack Adversarial Attack for Robust Multi-Agent Reinforcement Learning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08391","citing_title":"SACHI: Structured Agent Coordination via Holistic Information Integration in Multi-Agent Reinforcement Learning","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18591","citing_title":"Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation","ref_index":128,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18024","citing_title":"Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15400","citing_title":"Beyond Partner Diversity: An Influence-Based Team Steering Framework for Zero-Shot Human-Machine Teaming","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2506.02387","citing_title":"VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2506.07548","citing_title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2506.19417","citing_title":"Focusing Influence Mechanism for Multi-Agent Reinforcement Learning","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2509.15519","citing_title":"Fully Decentralized Cooperative Multi-Agent Reinforcement Learning is A Context Modeling Problem","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2511.20857","citing_title":"Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory","ref_index":106,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01457","citing_title":"CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01457","citing_title":"CoFlow: Coordinated Few-Step Flow for Offline Multi-Agent Decision Making","ref_index":41,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG","json":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG.json","graph_json":"https://pith.science/api/pith-number/NVVQACU7UQF6LM3TWAHBMCDPXG/graph.json","events_json":"https://pith.science/api/pith-number/NVVQACU7UQF6LM3TWAHBMCDPXG/events.json","paper":"https://pith.science/paper/NVVQACU7"},"agent_actions":{"view_html":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG","download_json":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG.json","view_paper":"https://pith.science/paper/NVVQACU7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=1902.04043&json=true","fetch_graph":"https://pith.science/api/pith-number/NVVQACU7UQF6LM3TWAHBMCDPXG/graph.json","fetch_events":"https://pith.science/api/pith-number/NVVQACU7UQF6LM3TWAHBMCDPXG/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG/action/storage_attestation","attest_author":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG/action/author_attestation","sign_citation":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG/action/citation_signature","submit_replication":"https://pith.science/pith/NVVQACU7UQF6LM3TWAHBMCDPXG/action/replication_record"}},"created_at":"2026-07-05T00:24:36.800588+00:00","updated_at":"2026-07-05T00:24:36.800588+00:00"}