{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:MD2XWLEXXVEACL7G7E7HQBH4LJ","short_pith_number":"pith:MD2XWLEX","schema_version":"1.0","canonical_sha256":"60f57b2c97bd48012fe6f93e7804fc5a7286c05b0657ae131a551af71229c4c8","source":{"kind":"arxiv","id":"2305.17330","version":5},"attestation_state":"computed","paper":{"title":"MADiff: Offline Multi-agent Learning with Diffusion Models","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.AI","authors_text":"Bingyi Kang, Liyuan Mao, Minghuan Liu, Minkai Xu, Stefano Ermon, Weinan Zhang, Yong Yu, Zhengbang Zhu","submitted_at":"2023-05-27T02:14:09Z","abstract_excerpt":"Offline reinforcement learning (RL) aims to learn policies from pre-existing datasets without further interactions, making it a challenging task. Q-learning algorithms struggle with extrapolation errors in offline settings, while supervised learning methods are constrained by model expressiveness. Recently, diffusion models (DMs) have shown promise in overcoming these limitations in single-agent learning, but their application in multi-agent scenarios remains unclear. Generating trajectories for each agent with independent DMs may impede coordination, while concatenating all agents' informatio"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2305.17330","kind":"arxiv","version":5},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.AI","submitted_at":"2023-05-27T02:14:09Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"3a576f2344d0d768ec6332e6bc2c5bfc8648ab58b5cd263be0bc3da32a1ccb8b","abstract_canon_sha256":"b7a735ff8ef4e73df77d5a8c6a0db04d190a7ed45d1ffa17d1a979ac427c6a54"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:55:52.041781Z","signature_b64":"hayjBKibfxQAICvLwJWzGbsOil8AYETyrfIXeebkeHm0tgv+wEsYMAXsuy8nSubtaTLnQZKkzE0+2NBj1WEPDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"60f57b2c97bd48012fe6f93e7804fc5a7286c05b0657ae131a551af71229c4c8","last_reissued_at":"2026-07-05T09:55:52.041251Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:55:52.041251Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MADiff: Offline Multi-agent Learning with Diffusion Models","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.AI","authors_text":"Bingyi Kang, Liyuan Mao, Minghuan Liu, Minkai Xu, Stefano Ermon, Weinan Zhang, Yong Yu, Zhengbang Zhu","submitted_at":"2023-05-27T02:14:09Z","abstract_excerpt":"Offline reinforcement learning (RL) aims to learn policies from pre-existing datasets without further interactions, making it a challenging task. Q-learning algorithms struggle with extrapolation errors in offline settings, while supervised learning methods are constrained by model expressiveness. Recently, diffusion models (DMs) have shown promise in overcoming these limitations in single-agent learning, but their application in multi-agent scenarios remains unclear. Generating trajectories for each agent with independent DMs may impede coordination, while concatenating all agents' informatio"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.17330","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.17330/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2305.17330","created_at":"2026-07-05T09:55:52.041319+00:00"},{"alias_kind":"arxiv_version","alias_value":"2305.17330v5","created_at":"2026-07-05T09:55:52.041319+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.17330","created_at":"2026-07-05T09:55:52.041319+00:00"},{"alias_kind":"pith_short_12","alias_value":"MD2XWLEXXVEA","created_at":"2026-07-05T09:55:52.041319+00:00"},{"alias_kind":"pith_short_16","alias_value":"MD2XWLEXXVEACL7G","created_at":"2026-07-05T09:55:52.041319+00:00"},{"alias_kind":"pith_short_8","alias_value":"MD2XWLEX","created_at":"2026-07-05T09:55:52.041319+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2509.17244","citing_title":"Scalable Multi Agent Diffusion Policies for Coverage Control","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2512.02535","citing_title":"AID: Agent Intent from Diffusion for Multi-Agent Informative Path Planning","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12388","citing_title":"Events as Triggers for Behavioral Diversity in Multi-Agent Reinforcement Learning","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12388","citing_title":"Events as Triggers for Behavioral Diversity in Multi-Agent Reinforcement Learning","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03075","citing_title":"Refining Compositional Diffusion for Reliable Long-Horizon Planning","ref_index":85,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09035","citing_title":"Advantage-Guided Diffusion for Model-Based Reinforcement Learning","ref_index":31,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ","json":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ.json","graph_json":"https://pith.science/api/pith-number/MD2XWLEXXVEACL7G7E7HQBH4LJ/graph.json","events_json":"https://pith.science/api/pith-number/MD2XWLEXXVEACL7G7E7HQBH4LJ/events.json","paper":"https://pith.science/paper/MD2XWLEX"},"agent_actions":{"view_html":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ","download_json":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ.json","view_paper":"https://pith.science/paper/MD2XWLEX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2305.17330&json=true","fetch_graph":"https://pith.science/api/pith-number/MD2XWLEXXVEACL7G7E7HQBH4LJ/graph.json","fetch_events":"https://pith.science/api/pith-number/MD2XWLEXXVEACL7G7E7HQBH4LJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ/action/storage_attestation","attest_author":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ/action/author_attestation","sign_citation":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ/action/citation_signature","submit_replication":"https://pith.science/pith/MD2XWLEXXVEACL7G7E7HQBH4LJ/action/replication_record"}},"created_at":"2026-07-05T09:55:52.041319+00:00","updated_at":"2026-07-05T09:55:52.041319+00:00"}