{"as_of":"2026-08-14T21:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9784a200fb899393e422e0c221be01ba14283ebdbbaa9fdbc27ef526511b20b","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:04:28.337206Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T02:09:08.378144Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T02:17:07.063482Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"cited_work":{"arxiv_id":"2602.18291","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.18291","snapshot_observed_at":"2026-06-11T02:08:43.143878Z","title":"Diffusing to coordinate: Efficient online multi-agent diffusion policies","venue":null,"work_id":"5856b38b-0274-4ebb-8e5f-d550e92feeb1","year":2026},"citing_paper":{"arxiv_id":"2605.11485","last_updated":"2026-05-12T04:03:11Z","snapshot_observed_at":"2026-08-12T20:35:17.745065Z","submitted_at":"2026-05-12T04:03:11Z","title":"Coordinated Diffusion: Generating Multi-Agent Behavior Without Multi-Agent Demonstrations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T02:09:08.378144Z"},"links":{"cited_paper":"/paper/2602.18291","citing_paper":"/paper/2605.11485"},"observation_digest":"sha256:81683db68ecf5dfbb0bc06c297c7c9b8c06096e2bbdd27981b483a1bc743de9e","observation_id":"da7a6cb4-c6d0-4186-a5d2-0114d72cb8ec","resolution":{"observed_at":"2026-06-11T02:08:43.143878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.18291/citation-record","integrity":"/paper/2602.18291/integrity","json":"/paper/2602.18291/citation-record.json","paper":"/paper/2602.18291"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:21.353437Z","title":"Reducing over- estimation bias in multi-agent domains using double centralized critics.Advances in Neural Information Processing Systems: Deep Reinforcement Learning Workshop, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:21.353437Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:cb4b9a485af73c2053bda15a5a5854e85d2ac84f0e9b09599cb64c5bf7cef2a1","observation_id":"8aa0585d-5ab1-4f53-8af0-466412b8de62","resolution":{"observed_at":"2026-08-02T22:04:21.353437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:21.409314Z","title":"Is conditional generative modeling all you need for decision making? InThe Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:21.409314Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:a02b75d9d624f87dcb4e09f84ab404fd72115ea58556755ef8f9602435b3e0ec","observation_id":"0edcfc78-4495-4699-82d9-b2bec4ede4b5","resolution":{"observed_at":"2026-08-02T22:04:21.409314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:21.554562Z","title":"Heterogeneous agent q-weighted policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:21.554562Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:4812e78c86cf90cd186773ad56b1d70da66760ee18e39e9e71e017590baa9d68","observation_id":"d463945b-6886-47fa-a9b5-5b6c964e2a34","resolution":{"observed_at":"2026-08-02T22:04:21.554562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:21.658257Z","title":"A distributional perspective on reinforce- ment learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:21.658257Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:fa7ae8f366f3af6acbc6c659f9b7c3c678dfaa361b0c35a84615b51e3323b178","observation_id":"09a54f33-e86c-405e-a452-c8e610f0edd2","resolution":{"observed_at":"2026-08-02T22:04:21.658257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:21.790972Z","title":"The complexity of decentralized control of markov decision processes.Mathematics of operations research, 27(4):819–840, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:21.790972Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:ba02bd5762e616e43e960f584a9704144c7722cec4e85e7ecc3c18cae79b9ad6","observation_id":"07baafda-2862-491e-83a4-c8976017d7f5","resolution":{"observed_at":"2026-08-02T22:04:21.790972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:21.886299Z","title":"Crossq: Batch normalization in deep reinforcement learning for greater sample efficiency and simplicity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:21.886299Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:25bf9c96f702feeb6a5b2988d8168f264bfb24c6f2fd31e0112d11354e39f68c","observation_id":"5e76e748-7506-4273-8dbb-6bf2e7cfa2f3","resolution":{"observed_at":"2026-08-02T22:04:21.886299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.024329Z","title":"Video generation models as world simulators.OpenAI Blog, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.024329Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:345707e1616ed166b3a7459e4cd36396c0e6cf7580c3052005e766a8a8df339a","observation_id":"fda59a7a-484e-4ba2-9acf-fe379e1fc0b1","resolution":{"observed_at":"2026-08-02T22:04:22.024329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.107650Z","title":"Dime: Diffusion-based maximum entropy reinforcement learn- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.107650Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:de6f29cf61c5e03a06365052b37331f1924ce330df2fa82e35a06589f31eb9d8","observation_id":"67c50d4b-b926-4457-a400-8f085394252d","resolution":{"observed_at":"2026-08-02T22:04:22.107650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.248648Z","title":"Offline reinforcement learn- ing via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.248648Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:2d1947b5dc42e05d6f2e2ec164029a18cbcfb441d9500e93e2c239b702cc836e","observation_id":"4632eb1b-4764-4a87-be1c-d9fca1a47a7c","resolution":{"observed_at":"2026-08-02T22:04:22.248648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.303616Z","title":"Multi-agent systems for robotic autonomy with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.303616Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:048fe056cb67fc88828b228d2eca746dfbff42e7e513299a75fb83d43dd448d6","observation_id":"799e4683-82bc-47e2-b4e7-6b1fa48ebdf6","resolution":{"observed_at":"2026-08-02T22:04:22.303616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.362502Z","title":"Novelty-guided data reuse for efficient and diversified multi-agent reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.362502Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:296a18f57a68126d8fc6bd5a9220a6996ee7a89dad014fd38f46150756287e2f","observation_id":"d61f4dbc-23d7-4bfc-baef-afb2bd27b1cf","resolution":{"observed_at":"2026-08-02T22:04:22.362502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.420165Z","title":"Continuous q-score matching: Diffusion guided reinforcement learning for continuous-time control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.420165Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:769376a3473ac4ccf6c38d470837f58caa7bcd16e192950c99d1988b38add356","observation_id":"1b96bde8-613c-410c-9406-c529ea269af3","resolution":{"observed_at":"2026-08-02T22:04:22.420165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.495890Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.495890Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:ca9527ae4b0474e018bf0c35b48c1274e3b3605eecb1a48f664eade9c8ddb804","observation_id":"82761d8e-209e-4384-ab04-0a31f903b255","resolution":{"observed_at":"2026-08-02T22:04:22.495890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.09533","last_updated":"2020-11-18T20:29:59Z","snapshot_observed_at":"2026-08-12T16:12:05.550917Z","submitted_at":"2020-11-18T20:29:59Z","title":"Is Independent Learning All You Need in the StarCraft Multi-Agent Challenge?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.09533","snapshot_observed_at":"2026-08-02T22:04:22.549456Z","title":"Is independent learning all you need in the starcraft multi-agent challenge?arXiv preprint arXiv:2011.09533, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.549456Z"},"links":{"cited_paper":"/paper/2011.09533","citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:126dd1d481d561041daa3aea15ca0bc56b7fe153f8c29f40258b6d0dc380f91a","observation_id":"b05aa95b-e6cf-4be0-823d-dde141e83ccf","resolution":{"observed_at":"2026-08-02T22:04:22.549456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.616890Z","title":"Diffusion-based reinforcement learning via q-weighted variational policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.616890Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:f285bf32c2b9939da7e676e392f999461fea50e586874c04f783a26f5cd894ee","observation_id":"b3af9bd1-ab6a-4233-8f63-7eeb5f421f7d","resolution":{"observed_at":"2026-08-02T22:04:22.616890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.661495Z","title":"Maximum entropy reinforcement learning with diffusion policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.661495Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:55a41b8e59f3ad03d26f76f9b98d3919247a431b08c8b4ed72e1c5599ed1e874","observation_id":"663ce302-8b4f-484e-9dd1-fb29515736c6","resolution":{"observed_at":"2026-08-02T22:04:22.661495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.736830Z","title":"Diffusion actor-critic: Formulating constrained policy iteration as diffusion noise regression for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.736830Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:3b65a9a88b63a792be48b9c22b2c514a9d5c087b6873d9b63fa4a44d6637fa0e","observation_id":"0bd1f0fe-d024-49bb-bdb5-0740687bac60","resolution":{"observed_at":"2026-08-02T22:04:22.736830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.792076Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.792076Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:9b5864a455899b2bfb389c91e719983e99244ff6bba15163d055dafe90ac207a","observation_id":"0f49e7df-6b59-42e2-b179-a16c2dc9b560","resolution":{"observed_at":"2026-08-02T22:04:22.792076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.868522Z","title":"INS: Interaction-aware synthesis to enhance offline multi-agent reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.868522Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:4b06d0020b9dfe9f42ec5f35644aa34bd706fc2db7873ebe97d74a9268e6e52d","observation_id":"3bd49bc0-0bbe-473b-8f4a-7e2950fe5051","resolution":{"observed_at":"2026-08-02T22:04:22.868522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:22.972612Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:22.972612Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:89cdff3859bdfb67bed6db38a174a73583eabec52fe35d21af9d8a1eccbd1b8d","observation_id":"ac1dc2d7-cc3d-4f59-b3ff-3af4bf9df954","resolution":{"observed_at":"2026-08-02T22:04:22.972612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.058320Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.058320Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:9e60e0133227fd2f8ecba2dbf9c8ebd6eb748f8e8d818f662097cb525549a498","observation_id":"fbeb0abf-df4c-4d79-a5f3-8d74e0f4cf14","resolution":{"observed_at":"2026-08-02T22:04:23.058320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-02T22:04:23.206034Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.arXiv preprint arXiv:2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.206034Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:aa9372357080b3ba582705536d35b8b84ba4755c12ccc334fc8fb7b689e72ca8","observation_id":"2e9b247a-b8c4-4db6-b760-e86f77e3b138","resolution":{"observed_at":"2026-08-02T22:04:23.206034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.370859Z","title":"Denoising diffusion probabilistic models.Advances in Neural Information Processing Systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.370859Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:c5895a4be9e3a7b7b535a5a01e0928f257f35c794c7a6d84857c3bc128ed4bcf","observation_id":"85723d21-12ca-48d9-96ba-a0e76320a84b","resolution":{"observed_at":"2026-08-02T22:04:23.370859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.446965Z","title":"Value diffusion reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.446965Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:cd8b2b098da28358563722e160236914df19b98878802d226b9d62595ad10738","observation_id":"5bbb4517-1014-499d-8767-4994dfd49b5a","resolution":{"observed_at":"2026-08-02T22:04:23.446965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.540653Z","title":"Diffuseloco: Real-time legged locomotion control with diffusion from offline datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.540653Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:5143a27ad2f4b10bebede3eecf7ca230395f37b839c9c4dbcc9804c557a62a6b","observation_id":"43490b08-84e7-47af-adb1-e147b1267be1","resolution":{"observed_at":"2026-08-02T22:04:23.540653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.580921Z","title":"Diffuseloco: Real-time legged locomotion control with diffusion from offline datasets","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.580921Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:aed8b5c31194ce6dbaecd004846bc4e761757829efe6b1d90e02bf454c1e5980","observation_id":"cb96d947-19fe-4f2c-899a-5e252f95472d","resolution":{"observed_at":"2026-08-02T22:04:23.580921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.626124Z","title":"Planning with diffusion for flexible behavior synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.626124Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:8ed96f002122bae1c3cc658d38c35af65a312ae000cda75940f2b121d7e87bea","observation_id":"feb40cb8-1c11-4ec3-987f-487a6281f3f3","resolution":{"observed_at":"2026-08-02T22:04:23.626124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.703971Z","title":"Agent- centric actor-critic for asynchronous multi-agent reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.703971Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:b869988738520281aabd8060b98f611c3e57f60dae2b5067310c25f28365d910","observation_id":"9ab555b2-6de4-453c-9a13-d710bd142a22","resolution":{"observed_at":"2026-08-02T22:04:23.703971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.746367Z","title":"Efficient diffusion poli- cies for offline reinforcement learning.Advances in Neural Information Processing Systems, 36:67195–67212, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.746367Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:d61e388ce25c6f2364e7b50a7f1c0ee9a965dadb7779df17c69bbb39fe321b78","observation_id":"8f0679dd-387c-4ce2-b8ca-edcb5a2077a6","resolution":{"observed_at":"2026-08-02T22:04:23.746367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.793464Z","title":"Enhancing cooperative multi-agent reinforcement learning with state modelling and adversarial exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.793464Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:2b547ddd6912db78ee5b190e08ac77697f83f91556516636d45907fe1a8b4e0a","observation_id":"d90a251c-2c0b-4ef2-b90a-b2fd4f02f819","resolution":{"observed_at":"2026-08-02T22:04:23.793464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.907200Z","title":"Gta: Generative trajectory aug- mentation with guidance for offline reinforcement learning.Advances in Neural Information Processing Systems, 37:56766–56801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.907200Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:d94aaa6f9c0966a6d4ca4ab18707dfa6836d5ae3a30c737db089d7e35d859710","observation_id":"ffae433b-0756-43ff-af77-81ac47cfdee5","resolution":{"observed_at":"2026-08-02T22:04:23.907200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:23.997509Z","title":"Dof: A diffusion factorization framework for offline multi-agent decision making","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:23.997509Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:74a541bfc41d1a53cf79af777cbea364ea6aab39e92bbfa2450a5e76d1d0240d","observation_id":"b0374e21-61ad-43a9-baa3-3cb0443f0e01","resolution":{"observed_at":"2026-08-02T22:04:23.997509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:24.134696Z","title":"Race: improve multi-agent reinforcement learning with representation asymmetry and collaborative evolution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:24.134696Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:80fd5d49b0d7e53e0b2a965f702844d1c2e20c96de7918e8fa220d3372a5e8ad","observation_id":"e3fed53a-03fc-4507-ac70-a62003398cae","resolution":{"observed_at":"2026-08-02T22:04:24.134696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:24.290599Z","title":"Revisiting cooperative off-policy multi-agent reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:24.290599Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:5811d6ccadeb2821c5c7b27dc6ccf8c6b2d56374ff816916add7daacb30e8b78","observation_id":"44cd21bf-5ce7-40c3-bccc-de5beccb5af5","resolution":{"observed_at":"2026-08-02T22:04:24.290599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:24.463731Z","title":"Beyond conservatism: Diffusion policies in offline multi-agent reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:24.463731Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:a01d773467fb71564f72b66ef46f701c54cf012771fe95a2e7b61bb4f87dae6b","observation_id":"ba7aa86f-93e3-421b-ae74-7263d2ce5661","resolution":{"observed_at":"2026-08-02T22:04:24.463731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:24.577770Z","title":"Maximum entropy heterogeneous-agent reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:24.577770Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:d8cad548d4645bacb69a042e0ed6ee0dc6ea102614af3f5db7f0ccd47ae865ca","observation_id":"c1a30748-be35-465d-8249-93e81cb93cb9","resolution":{"observed_at":"2026-08-02T22:04:24.577770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:24.720043Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:24.720043Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:5af3ea40f8f3f0c0b66edd600b22897c97fd9d940c9f70ab5c88d64ae8e1e453","observation_id":"da47b002-9793-4460-9c1a-be8802cfcd34","resolution":{"observed_at":"2026-08-02T22:04:24.720043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:24.825764Z","title":"Contrastive energy prediction for exact energy-guided diffusion sampling in offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:24.825764Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:9363112c00d103b629d1d8072d12f6ce364e1b798a520c0ddf2b4ac49180cd54","observation_id":"adcda0d4-dfeb-4616-99e1-f4f6b480de7c","resolution":{"observed_at":"2026-08-02T22:04:24.825764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:24.986702Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.Advances in neural information processing systems, 35:5775–5787, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:24.986702Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:5ff711a9e58da5091c26f9f32cd0b3e185f100d348d1409f0bdad8fbdf266dc4","observation_id":"af3f3405-2da2-4785-a63c-7529943d029e","resolution":{"observed_at":"2026-08-02T22:04:24.986702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:25.087793Z","title":"Synthetic experience replay","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:25.087793Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:ef3f54070344e8fa8eb0d74eb897233c2328f02c0c2c3e457d0eba79c24f158f","observation_id":"428fa515-8be7-42a9-b45d-3d8b48460055","resolution":{"observed_at":"2026-08-02T22:04:25.087793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:25.240463Z","title":"Efficient online reinforcement learning for diffusion policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:25.240463Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:69d70f3d5774d6bf5e092d66738e2f954952320e967e36ba6f0cda02e533de3e","observation_id":"01b9b2a9-f57b-4b5a-b520-741750ccfe74","resolution":{"observed_at":"2026-08-02T22:04:25.240463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:25.376586Z","title":"Coordinated multi-robot exploration under communication constraints using decentralized markov decision processes","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:25.376586Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:4fb52e79af4f4691ff9c004dfdd92fc572d3245033dd2797880a8fc8febd432c","observation_id":"32954f35-5902-4992-92b3-a1183ba4017a","resolution":{"observed_at":"2026-08-02T22:04:25.376586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:25.507543Z","title":"Springer, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:25.507543Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:e873c3cf1a74ba0d8ff44c0851f42019c78d1389690cbcb53c144833a793885a","observation_id":"0db3259b-bd14-4f20-8970-3a20b242a678","resolution":{"observed_at":"2026-08-02T22:04:25.507543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:25.654360Z","title":"Optimal and approximate q-value functions for decentralized pomdps.Journal of Artificial Intelligence Research, 32:289–353, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:25.654360Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:826bf4952bcce727f1fea2638f2049ab9bcb7e5ec953795ae213a6517fa7c958","observation_id":"ac5dc06c-64e2-4f20-80de-c15f7ca36f90","resolution":{"observed_at":"2026-08-02T22:04:25.654360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:25.787566Z","title":"Regularized softmax deep multi-agent q-learning.Advances in Neural Information Processing Systems, 34:1365–1377, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:25.787566Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:d1d765b1974ae22d99bd3b0cbaaca197469db50147f205972a5cd7961d24e1d3","observation_id":"b0332c0e-26e0-49f1-bcfc-09de53732ba9","resolution":{"observed_at":"2026-08-02T22:04:25.787566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:25.923902Z","title":"Imitating human behaviour with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:25.923902Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:f49d83d12114dd0bc1f00ed51dc784908c6ec0b2c97366276879c7e00a549601","observation_id":"006b0cce-ab73-406f-87c5-d3600ac8bc26","resolution":{"observed_at":"2026-08-02T22:04:25.923902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.069456Z","title":"Facmac: Factored multi-agent centralised policy gradients.Advances in Neural Information Processing Systems, 34:12208–12221, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.069456Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:362516b2bc4c57bdd68b0988f8cb75dcc2c4e373f3b09e8235b7fffd7558d1fd","observation_id":"a49f2ac6-cd40-46ab-a13b-72fc3f204ef6","resolution":{"observed_at":"2026-08-02T22:04:26.069456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.187590Z","title":"Learning a diffusion model policy from rewards via q-score matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.187590Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:bbbef990d4994c051519e0447f06558e5d5f5cee0922782cea43fcf668864fd6","observation_id":"b33d97f5-84e8-4b4f-bb7a-7b0cf6f1551c","resolution":{"observed_at":"2026-08-02T22:04:26.187590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.258377Z","title":"Offline multi- agent reinforcement learning via score decomposition, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.258377Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:07ad078e399e94f530626b9e4205736de3fc6f0e99d2932ccef217051423e8a2","observation_id":"c615cfca-10b0-424a-8515-20246f653564","resolution":{"observed_at":"2026-08-02T22:04:26.258377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.299270Z","title":"Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.299270Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:c4fa75ec0e5e8e79d786d219f2c137f6a3b9c3e391f63e317b83fd877eb0833b","observation_id":"8354513a-2915-49a5-87bc-5397a5c11fdc","resolution":{"observed_at":"2026-08-02T22:04:26.299270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.376396Z","title":"Diffusion policy policy op- timization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.376396Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:9a9e8014ec9d64447cd554f64344fb5f144255a08f99d0bf2d68c9cc0d8a2570","observation_id":"1dfe89fe-c934-43eb-815a-1ad402d9021c","resolution":{"observed_at":"2026-08-02T22:04:26.376396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.433524Z","title":"Cambridge University Press, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.433524Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:a4b681c499fcf5ca80a1a7b502ee1b7cdd0ff178e5f762ca06fb05c3cae5090e","observation_id":"18573499-073d-4276-abcf-a5d0827711ba","resolution":{"observed_at":"2026-08-02T22:04:26.433524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.477404Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.477404Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:b0694f2c3fcae32250dcd6f633cc528982b9e730c0075882b7b2004e1a4b39c5","observation_id":"09732023-1356-4ad4-b559-4124bd17bb6f","resolution":{"observed_at":"2026-08-02T22:04:26.477404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.523923Z","title":"Qtran: Learning to factorize with transformation for cooperative multi-agent reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.523923Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:c7225a78619cd38fc688e94879005ed62f87afe8ff0747aabd3464d30bb164c3","observation_id":"a5d05d26-4c9a-4bd1-887c-d167ef1cca15","resolution":{"observed_at":"2026-08-02T22:04:26.523923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.560397Z","title":"Generative modeling by estimating gradients of the data distribution.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.560397Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:5597d0db3af1b766598b3ab959a3f0704d6bfbc92fefdb993d2dcdf6a54ea2da","observation_id":"fc62605d-a25b-4575-bd5a-48920336f2f8","resolution":{"observed_at":"2026-08-02T22:04:26.560397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.636123Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.636123Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:f616940b3e5e4d430b7974c56386635e9c78bbfc520a4d3c5b947b8de5c051ed","observation_id":"5eca49e0-f487-41b4-9a84-4b4e1ce2d1dc","resolution":{"observed_at":"2026-08-02T22:04:26.636123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.722252Z","title":"Value- decomposition networks for cooperative multi-agent learning based on team reward","venue":null,"work_id":null,"year":2085},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.722252Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:b1c5a034361c28cd641aa124366dcbaf1f2819558ab2e9e4653d9612dfa77e53","observation_id":"22a449f3-5bee-405b-8a21-f0d3095deb35","resolution":{"observed_at":"2026-08-02T22:04:26.722252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.825836Z","title":"Multiagent cooperation and competition with deep reinforcement learning.PloS one, 12(4):e0172395, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.825836Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:ee865a9d1e640224678f60cc0d5634722f4a2733614551caec35615d6d758918","observation_id":"69d0f040-3a44-49c5-a2f4-0e19ca4ccbc9","resolution":{"observed_at":"2026-08-02T22:04:26.825836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:26.926284Z","title":"Multi-agent reinforcement learning: Independent vs","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:26.926284Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:034f56e82e4d11f2898b29c741281d92bf28ecafbbb6557dbf5c606fe318a37e","observation_id":"5e072159-5d89-4d28-be9f-8cfd2f07a4ba","resolution":{"observed_at":"2026-08-02T22:04:26.926284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.018340Z","title":"Qplex: Duplex dueling multi-agent q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.018340Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:d30c9f277ed326662c8fcd028bb2a2a66a07c276f8addb19664dade062580445","observation_id":"05cf5ec7-49c5-4160-af66-449e38478cc2","resolution":{"observed_at":"2026-08-02T22:04:27.018340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.084343Z","title":"Diffusion actor-critic with entropy regulator","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.084343Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:13e7db2f8c370280b878a4112a4cc22e1b6b937d7912f313a03f220d77898848","observation_id":"5ef2290f-b7b6-4e14-8ac3-b95d98e4fdd8","resolution":{"observed_at":"2026-08-02T22:04:27.084343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.162734Z","title":"Enhanced dacer algorithm with high diffusion efficiency.arXiv preprint arXiv:2505.23426, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.162734Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:a960e9da70c88dbcf845afdba23380732af5b3b6ab8ef93f6f1e231b833d249a","observation_id":"8c3d0d84-a22a-4091-b3c1-a46bdf9e3f08","resolution":{"observed_at":"2026-08-02T22:04:27.162734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.227314Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.227314Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:13619731cc7e6b3b0cfd709c52209b51bea3cca1efdbc0afe4831c3b31fb7848","observation_id":"a42577d2-d03c-4c23-aa9d-686f5adf05fe","resolution":{"observed_at":"2026-08-02T22:04:27.227314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.304994Z","title":"Learning intractable multimodal policies with repa- rameterization and diversity regularization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.304994Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:2bfec49d17794279110eab0811e375522048f883a206114e36c31cc7c409bc84","observation_id":"22d90049-e7b9-483d-a551-58697a16d129","resolution":{"observed_at":"2026-08-02T22:04:27.304994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.385235Z","title":"Latent diffusion planning for imitation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.385235Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:7e3aeae2a3e148f280da3514c67a5419c41f45dcd7cac438639ab050bbbf04af","observation_id":"75fbc84b-3ef7-40ad-969f-1f355fa74897","resolution":{"observed_at":"2026-08-02T22:04:27.385235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.452565Z","title":"Multi-agent reinforcement learning with communication-constrained priors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.452565Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:75ce0410760ee0016486ec27b37bc29e816a8bf54be2ab63408d32f82b3d8048","observation_id":"a573defa-0370-4ce4-832b-3a1ef0e00e5a","resolution":{"observed_at":"2026-08-02T22:04:27.452565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13122","last_updated":"2023-05-22T15:23:41Z","snapshot_observed_at":"2026-08-14T00:44:20.363356Z","submitted_at":"2023-05-22T15:23:41Z","title":"Policy Representation via Diffusion Probability Model for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13122","snapshot_observed_at":"2026-08-02T22:04:27.521008Z","title":"Policy representation via diffusion probability model for reinforcement learning.arXiv preprint arXiv:2305.13122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.521008Z"},"links":{"cited_paper":"/paper/2305.13122","citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:be3a16865bf9831012dd429080902073ebaf75b42158643f9a01bac5c748078f","observation_id":"f6ae37c0-7199-4409-a2f7-82b83cdbeeb0","resolution":{"observed_at":"2026-08-02T22:04:27.521008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.597916Z","title":"Fine-tuning diffusion policies with backpropagation through diffusion timesteps, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.597916Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:25ac94ac451eb4b352f255e38432e417441e7f7a54be836a935ba3e1a3e97798","observation_id":"7281ef6b-bfc0-4c19-9ccd-d63b7abe0f5c","resolution":{"observed_at":"2026-08-02T22:04:27.597916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.681681Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games.Advances in neural in- formation processing systems, 35:24611–24624, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.681681Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:ce3351f8d8bcbc327cdbb889f9f3e5420d06ba4217bb9a1c1b1375ca64ae0b60","observation_id":"38e11d57-8b9d-4527-b36b-13f48431defa","resolution":{"observed_at":"2026-08-02T22:04:27.681681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.751891Z","title":"Turbodiffusion: Accelerating video diffusion models by 100-200 times","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.751891Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:1a500902ac93915fa1bbb23decde3d4d04e6d73eeacbde22ed4e7d6231b1f3ed","observation_id":"4aa68b3c-890f-4b5c-a5c1-255c4d0e910b","resolution":{"observed_at":"2026-08-02T22:04:27.751891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.830447Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.830447Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:0acf6774bf1feb8f874c4b0f82e2aa438e67b45c904d233817dd82fec2d6854d","observation_id":"2eaa20ea-6bc4-4662-ae07-71531815e0d7","resolution":{"observed_at":"2026-08-02T22:04:27.830447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.889476Z","title":"Scaling in-the-wild training for diffusion- based illumination harmonization and editing by imposing consistent light transport","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.889476Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:ba5bb9bcb0364b7d4d435cab5a1814bf776b33e3498be52e450ee7a277726411","observation_id":"9a75dd48-b868-470a-a3b0-232e0f0eb89b","resolution":{"observed_at":"2026-08-02T22:04:27.889476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:27.965079Z","title":"Revisiting multi-agent world modeling from a diffusion-inspired perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:27.965079Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:171ff266a1ea388934f5a3ae02f31b2a6e6cbe1e87867fb68c8c80ff23aa2539","observation_id":"d35ad57d-25c7-4f7a-a625-0053afb43e14","resolution":{"observed_at":"2026-08-02T22:04:27.965079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:28.039567Z","title":"Heterogeneous-agent reinforcement learning.Journal of Machine Learning Research, 25(32):1– 67, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:28.039567Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:90fb5cf4d4b4712bcf270343ec91dc41b0f538aaa16be16a356b85c926cc483e","observation_id":"2297dc93-9b69-466c-b7a0-ba738651c7c7","resolution":{"observed_at":"2026-08-02T22:04:28.039567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:28.103641Z","title":"Smarts: An open-source scalable multi- agent rl training school for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:28.103641Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:6386dc8fc3500611bd58ae6b811f72445126b4df1ad42a9fee226649bdca71b1","observation_id":"9997169c-da64-4e85-9c82-6abccf050280","resolution":{"observed_at":"2026-08-02T22:04:28.103641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:28.180119Z","title":"Madiff: Offline multi-agent learning with diffusion models.Advances in Neural Information Processing Systems, 37:4177–4206, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:28.180119Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:75c3c369275f4b82eb2e4a776f6e9fa436ef59e1bd74f4122b17e57896d8eb0e","observation_id":"84cb4240-94d2-41e2-b980-4932a2befbdd","resolution":{"observed_at":"2026-08-02T22:04:28.180119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:28.257554Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:28.257554Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:da8616e4b59b0944f26b2b45af7e4c61b1bffc56b71d9860c4352bdfd413636d","observation_id":"3b91f9b1-681f-45dd-9424-37451d130912","resolution":{"observed_at":"2026-08-02T22:04:28.257554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:04:28.337206Z","title":"In spite of policy-centric ap- proaches, DIMA [73] uses diffusion models as environment dynamics to boost data efficiency","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T22:04:28.337206Z"},"links":{"citing_paper":"/paper/2602.18291"},"observation_digest":"sha256:438921859bebd410bf3acc58de7a9d37316ef6ba66b8c3872de1d9b928d1ed84","observation_id":"47fc1995-c07a-403a-a969-22a9f6efe9ee","resolution":{"observed_at":"2026-08-02T22:04:28.337206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.18291","last_updated":"2026-06-10T06:44:26Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T14:33:06.351293Z","submitted_at":"2026-02-20T15:38:02Z","title":"Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2602.18291."}