{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2019:F3JA4A4WBTOU6NKS2AOQDVHH5B","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"7031626a1cdc6f0d8aadb80231beacae76a1875f22561ebd875d078a11887047","cross_cats_sorted":["stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-21T05:07:42Z","title_canon_sha256":"04b413733ce2cf12b3132000e163babecd77d61f451e5a0117b7e5d7002328cb"},"schema_version":"1.0","source":{"id":"1910.09152","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"1910.09152","created_at":"2026-07-05T00:13:23Z"},{"alias_kind":"arxiv_version","alias_value":"1910.09152v1","created_at":"2026-07-05T00:13:23Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1910.09152","created_at":"2026-07-05T00:13:23Z"},{"alias_kind":"pith_short_12","alias_value":"F3JA4A4WBTOU","created_at":"2026-07-05T00:13:23Z"},{"alias_kind":"pith_short_16","alias_value":"F3JA4A4WBTOU6NKS","created_at":"2026-07-05T00:13:23Z"},{"alias_kind":"pith_short_8","alias_value":"F3JA4A4W","created_at":"2026-07-05T00:13:23Z"}],"graph_snapshots":[{"event_id":"sha256:0b4bb3a4aa274aec5a5825675114046e28bcfe082c403038d5b8bd8d392c409c","target":"graph","created_at":"2026-07-05T00:13:23Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/1910.09152/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Deep reinforcement learning (DRL) is a booming area of artificial intelligence. Many practical applications of DRL naturally involve more than one collaborative learners, making it important to study DRL in a multi-agent context. Previous research showed that effective learning in complex multi-agent systems demands for highly coordinated environment exploration among all the participating agents. Many researchers attempted to cope with this challenge through learning centralized value functions. However, the common strategy for every agent to learn their local policies directly often fail to ","authors_text":"Gang Chen","cross_cats":["stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-21T05:07:42Z","title":"A New Framework for Multi-Agent Reinforcement Learning -- Centralized Training and Exploration with Decentralized Execution via Policy Distillation"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1910.09152","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:0fea87ca58a15107760adb4a6e3ea6aabc54f08128fa346783d736553759404c","target":"record","created_at":"2026-07-05T00:13:23Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"7031626a1cdc6f0d8aadb80231beacae76a1875f22561ebd875d078a11887047","cross_cats_sorted":["stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-10-21T05:07:42Z","title_canon_sha256":"04b413733ce2cf12b3132000e163babecd77d61f451e5a0117b7e5d7002328cb"},"schema_version":"1.0","source":{"id":"1910.09152","kind":"arxiv","version":1}},"canonical_sha256":"2ed20e03960cdd4f3552d01d01d4e7e86b83253433e25003b0dc1268db041f27","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"2ed20e03960cdd4f3552d01d01d4e7e86b83253433e25003b0dc1268db041f27","first_computed_at":"2026-07-05T00:13:23.015587Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T00:13:23.015587Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"r+KvtpnRnVxyYtsx/e/NzPtLA0nwHo23yzjQ5+qi1Qsj5pxEpM8RXguFbhDkzmNXd7iVwSKa99h3HXsrPbu3Bg==","signature_status":"signed_v1","signed_at":"2026-07-05T00:13:23.016082Z","signed_message":"canonical_sha256_bytes"},"source_id":"1910.09152","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:0fea87ca58a15107760adb4a6e3ea6aabc54f08128fa346783d736553759404c","sha256:0b4bb3a4aa274aec5a5825675114046e28bcfe082c403038d5b8bd8d392c409c"],"state_sha256":"d448cea924525995b10e6b5a63107e28cf71364e2d1c25d53113632269d772d6"}