{"as_of":"2026-08-17T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2749ad65d2a3748f93f6b0e3bd5c9bca1fd2a3ce36ea1338092aa1bb8f2b3c9e","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:59:50.876652Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.05968/citation-record","integrity":"/paper/2505.05968/integrity","json":"/paper/2505.05968/citation-record.json","paper":"/paper/2505.05968"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:49.788752Z","title":"Principal component analysis","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:49.788752Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:1a3167c3450147118dcc5953a81b1834ad3faba83fc90bdf5562310e3d5a0d17","observation_id":"2557e51e-a8d3-413e-9784-23a30e8223bc","resolution":{"observed_at":"2026-08-15T22:59:49.788752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17198","last_updated":"2024-01-18T16:25:38Z","snapshot_observed_at":"2026-08-16T15:29:11.610337Z","submitted_at":"2023-05-26T18:43:16Z","title":"A Model-Based Solution to the Offline Multi-Agent Reinforcement Learning Coordination Problem","version":2},"cited_work":{"arxiv_id":"2305.17198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.17198","snapshot_observed_at":"2026-08-15T22:59:51.462303Z","title":"A Model-Based Solution to the Offline Multi-Agent Reinforcement Learning Coordination Problem","venue":"cs.LG","work_id":"15784689-5c83-40e7-8738-114a2dcda437","year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:49.793128Z"},"links":{"cited_paper":"/paper/2305.17198","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:6f3f48c80d118ce95107907cff2b11063465a4020ce9aa4fa5dd78c7d6e9dc7a","observation_id":"7653a9b4-f54d-4df9-9924-d38b20b46270","resolution":{"observed_at":"2026-08-15T22:59:51.546746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-15T22:59:49.797810Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:49.797810Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:e000f5ade5aca5646d865cb8cdce616499d514bd618d8320a1abd876b4ec06a3","observation_id":"a2f15c44-b325-4109-936d-b3c5440dbf8d","resolution":{"observed_at":"2026-08-15T22:59:49.797810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.652744Z","title":"The complexity of decentralized control of markov decision processes","venue":null,"work_id":"881e97c8-3b8b-4ddf-bb13-840e2e8f4eb0","year":2002},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:49.813816Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:af0a38650066bc91cd6154cc4d8d88b8eaa11dc7b4a1ebd0cbde72fb353ba542","observation_id":"ea42da4e-c88c-42a7-b134-358f45640970","resolution":{"observed_at":"2026-08-15T22:59:52.659625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01954","last_updated":"2024-10-02T18:56:10Z","snapshot_observed_at":"2026-08-16T13:13:12.675765Z","submitted_at":"2024-10-02T18:56:10Z","title":"ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization","version":1},"cited_work":{"arxiv_id":"2410.01954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01954","snapshot_observed_at":"2026-08-15T22:59:51.271517Z","title":"ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization","venue":"cs.LG","work_id":"40af39ee-7d4e-4227-807d-1970ae9b3cb7","year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:49.891890Z"},"links":{"cited_paper":"/paper/2410.01954","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:37feb364ef7813379b888c2fdc4e9833850874d7a18de6f80b9af5b41bb63301","observation_id":"a5a7f5d3-7d74-45f9-b049-6328a4a2c595","resolution":{"observed_at":"2026-08-15T22:59:51.332261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.636132Z","title":"Powernet: Multi-agent deep reinforcement learning for scalable powergrid control","venue":null,"work_id":"91c001a1-72a4-40dc-aa7f-2e6b73e3e7b3","year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.037702Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:96b67803f63004d902dd2cf248888c1c8ed242ebe4a5f9302759cdeb94c8d017","observation_id":"00393317-47cd-4435-957c-500b7422bc3b","resolution":{"observed_at":"2026-08-15T22:59:52.642454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.621313Z","title":"Score regularized policy optimization through diffusion behavior","venue":null,"work_id":"9d276073-cf90-44f2-9b51-9e4b28befa2e","year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.042861Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:c0269b6e38068ebeefab0d2feb2d1fbfe45f62634ce08a318fb33a9568643d82","observation_id":"c03b083a-0ceb-4ed8-abef-b93a7077cd91","resolution":{"observed_at":"2026-08-15T22:59:52.626552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14548","last_updated":"2023-02-28T04:19:48Z","snapshot_observed_at":"2026-08-16T16:28:17.155889Z","submitted_at":"2022-09-29T04:36:23Z","title":"Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14548","snapshot_observed_at":"2026-08-15T22:59:50.050622Z","title":"Offline reinforcement learning via high-fidelity generative behavior modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.050622Z"},"links":{"cited_paper":"/paper/2209.14548","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:95cd81cb5b86be7196d3257a956163fb4c5e82cb75e3e7de028204878313fb0b","observation_id":"2a856e86-3d4e-458e-bb3b-16110f8b7eac","resolution":{"observed_at":"2026-08-15T22:59:50.050622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16984","last_updated":"2024-03-14T19:28:48Z","snapshot_observed_at":"2026-08-16T14:56:38.212380Z","submitted_at":"2023-09-29T05:05:54Z","title":"Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16984","snapshot_observed_at":"2026-08-15T22:59:50.090536Z","title":"Consistency models as a rich and efficient policy class for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.090536Z"},"links":{"cited_paper":"/paper/2309.16984","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:ab3bc0f999acac02d69a90449e0ff09a41171af57599103232044cd2c7409511","observation_id":"fb4cca48-bf70-41fa-8346-88bc0883e05e","resolution":{"observed_at":"2026-08-15T22:59:50.090536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12001","last_updated":"2024-09-18T14:13:24Z","snapshot_observed_at":"2026-08-16T13:17:28.952191Z","submitted_at":"2024-09-18T14:13:24Z","title":"Putting Data at the Centre of Offline Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2409.12001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12001","snapshot_observed_at":"2026-08-15T22:59:51.236639Z","title":"Putting Data at the Centre of Offline Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"7f456866-6af2-4db8-a382-f02a5db2617f","year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.093769Z"},"links":{"cited_paper":"/paper/2409.12001","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:b020f1323d9d24e3cb09c05fd0097aa3415209ee3e118398d05744d3dfb4ee7c","observation_id":"14dfefd4-2b6d-41fb-b68c-debe33a3db79","resolution":{"observed_at":"2026-08-15T22:59:51.240888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.602393Z","title":"Off-the-grid marl: Datasets and baselines for offline multi-agent reinforcement learning","venue":null,"work_id":"baeafadc-d0d9-4915-a139-b4f120501fad","year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.098501Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:65a4f64342002c9080d463aaae5904c374a48d8a5a44fe1f23901d12a3e233e6","observation_id":"f86591a4-e4da-4b67-a624-57c5b97389f2","resolution":{"observed_at":"2026-08-15T22:59:52.608137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.587190Z","title":"Dis- pelling the mirage of progress in offline marl through standardised baselines and evaluation","venue":null,"work_id":"c51014f4-1445-4b5e-ad32-8a54b9c13b5e","year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.101602Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:4066e2b1558250a7b3eee5742e25d1519dd88b88bb1176c379d627eed022574a","observation_id":"573b543a-2e51-4a1a-8a2c-b31233752b23","resolution":{"observed_at":"2026-08-15T22:59:52.592922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.567207Z","title":"Henriques","venue":null,"work_id":"57667806-7f8a-4fae-9c32-2f4371a55d11","year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.105265Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:160e2d30c6c8ff390e6c8fe7f6e9ab7982dcaef044ea8fe188186da7aaa220e2","observation_id":"cb9f4b0b-1b31-471f-a05b-5bc1c5015d0f","resolution":{"observed_at":"2026-08-15T22:59:52.575458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.552460Z","title":"Rein- forcement learning-based consensus reaching in large-scale social networks","venue":null,"work_id":"f10544d5-96dc-45eb-81c7-1081d46f6d4c","year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.110579Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:292ecf5d191b54d990498d18855457a2b052c4deef22d4db91ab0dc197d772b9","observation_id":"a520a7d7-d5da-49c3-ac04-faba70847c67","resolution":{"observed_at":"2026-08-15T22:59:52.557930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.537248Z","title":"Dynamic programming for partially observable stochastic games","venue":null,"work_id":"c1bd3d69-3583-447a-854f-ce45b17bac30","year":2004},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.115432Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:402dd49150e1251db73f6292aa6d169a66b893b55fa96a6ba5c322d9c1fc1d7f","observation_id":"ac1f2933-4fef-426b-aa4c-07f5f4a472fe","resolution":{"observed_at":"2026-08-15T22:59:52.542768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-15T22:59:50.119474Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.arXiv preprint arXiv:2304.10573, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.119474Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:7ed40bde6f6ac21497ff3a1cadba1c7f7ebaaefb7dd7e2cb02348116e7377020","observation_id":"b5693bad-8ae4-4d43-abe8-f2837e5e62f2","resolution":{"observed_at":"2026-08-15T22:59:50.119474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.123465Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.123465Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:cede25e31c315e42531519a8b842ae7c2f0ed2bb0542641b42dcf7e54da28b83","observation_id":"f3ac3c8b-7ac8-473a-88c7-fa6d9eaf7cfb","resolution":{"observed_at":"2026-08-15T22:59:50.123465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.127346Z","title":"Actor-attention-critic for multi-agent reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.127346Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:3de3019cc66ae215149474af925d86a857526b0efa7106db5e635697a960882a","observation_id":"c025c414-851f-41b3-b217-08c388c2aa64","resolution":{"observed_at":"2026-08-15T22:59:50.127346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01832","last_updated":"2023-07-29T05:57:53Z","snapshot_observed_at":"2026-08-17T21:13:17.727257Z","submitted_at":"2021-08-04T03:53:33Z","title":"Offline Decentralized Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01832","snapshot_observed_at":"2026-08-15T22:59:50.131941Z","title":"Offline decentralized multi-agent reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.131941Z"},"links":{"cited_paper":"/paper/2108.01832","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:85bb2fd250c42434eed9aabaf31004d79e007ed703e9757f4e310e793b93311c","observation_id":"96e22250-89ad-46ca-9d6d-3c89db93c8c0","resolution":{"observed_at":"2026-08-15T22:59:50.131941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.136089Z","title":"Efficient diffusion policies for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.136089Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:7dff4d6b560a2616753bdaa31591b0830cac3623fdfeed7a8ab54b2764aca8ab","observation_id":"50f6e36f-f3ae-4b6c-9d0f-4af051ac523a","resolution":{"observed_at":"2026-08-15T22:59:50.136089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-15T22:59:50.140108Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.140108Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:4a3772e5150b99ba1b30b1d056d59dd4ee847576aa9d68fdff1356c86707963c","observation_id":"357029c6-3312-4851-a72d-ffb045cd2a71","resolution":{"observed_at":"2026-08-15T22:59:50.140108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.486899Z","title":"Trust region policy optimisation in multi-agent reinforcement learning","venue":null,"work_id":"346ae3c5-d4e3-438b-8ad1-2829064e1cd3","year":2022},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.143886Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:a99773bc18db7c6b7ca8e49c6cba399015fe9170976111e3ae0c6cae3e72838b","observation_id":"6bcbc435-866e-4fa3-9c06-fa1f94c1ebe3","resolution":{"observed_at":"2026-08-15T22:59:52.492536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T22:59:50.147101Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.147101Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:0338a2ac31c9b64f13c800254499b29f870cb08c22e92f8a919f0333acc67f77","observation_id":"6765777d-6c39-478e-99ad-79bab16f3ea3","resolution":{"observed_at":"2026-08-15T22:59:50.147101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.470590Z","title":"Dof: A diffusion factorization framework for offline multi-agent reinforcement learning","venue":null,"work_id":"3fb55519-a337-43a7-9c29-123a8a73bd0c","year":2025},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.215357Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:6b82d6e94b6c2c2a3650be7be9a55757c349a56fc45a590dc1a7b8035b61971f","observation_id":"da8636cf-aef0-465d-9924-07ff3de1a78e","resolution":{"observed_at":"2026-08-15T22:59:52.476695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01472","last_updated":"2026-06-10T06:01:04Z","snapshot_observed_at":"2026-08-16T15:18:57.626386Z","submitted_at":"2023-07-04T04:40:54Z","title":"Improving Generalization and Data Efficiency with Diffusion in Offline Multi-agent RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01472","snapshot_observed_at":"2026-08-15T22:59:50.264937Z","title":"Beyond conservatism: Diffusion policies in offline multi-agent reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.264937Z"},"links":{"cited_paper":"/paper/2307.01472","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:d62bc546c9132255d34ed7eb07c4bfa7d643d3e783d91eb2214a9d5fda8033a4","observation_id":"5dc0bb25-9d7a-4249-9024-544558c00531","resolution":{"observed_at":"2026-08-15T22:59:50.264937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.444531Z","title":"A kernelized stein discrepancy for goodness-of-fit tests","venue":null,"work_id":"83cc71d1-52f0-4b4f-a7db-ac3751f732ca","year":2016},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.319329Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:9fe7c03671091ea70cd3fc907181823fa63fb715d3e2f6844cf829750f399bf6","observation_id":"9e6c36f2-5d08-452d-a05b-c98dddedf5d5","resolution":{"observed_at":"2026-08-15T22:59:52.456662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.344670Z","title":"Offline multi-agent reinforcement learning via in-sample sequential policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.344670Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:07df07c0e3866ab2c1ad2a24f4092f10a1004efd741cafa9071b001bfe2ee303","observation_id":"b9ada247-d453-46bb-a675-4764fe349322","resolution":{"observed_at":"2026-08-15T22:59:50.344670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.396857Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.396857Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:43514083f158b7ebc6c03bba5decc483ea3870f40ed07a84896b653d1eed5074","observation_id":"37ba1b02-ed87-49c2-a356-318bc6324c64","resolution":{"observed_at":"2026-08-15T22:59:50.396857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.410414Z","title":"Efficient and scalable reinforcement learning for large-scale network control","venue":null,"work_id":"8d09e0bb-00b2-48dd-a24c-52373cae0746","year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.400129Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:f2bc6cd7c3882dc12584d31a29135cc36ea1953dd15658c2dd9780108599b3a7","observation_id":"0615b0d0-235a-48a3-8ca1-0c61ebc4179b","resolution":{"observed_at":"2026-08-15T22:59:52.416670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.402829Z","title":"Learning to coordinate from offline datasets with uncoordinated behavior policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.402829Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:bdf55535f0126bf04f3f1de5effb2d2589ccdcc6d56c0c898fb18bd30c92d893","observation_id":"c03c630a-e96d-48ba-bd9a-5332322fe7d3","resolution":{"observed_at":"2026-08-15T22:59:50.402829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.382350Z","title":"Dynamic economic emissions dispatch optimisation using multi-agent reinforcement learning","venue":null,"work_id":"6f127761-f54d-4fc0-bcd2-eb4144d570c2","year":2016},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.405985Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:a6b887e6607000a915cbd470853a30d832ff9843bf776510c44129d81bb56493","observation_id":"c388c804-e5f4-456b-aaf6-2bd70cb16212","resolution":{"observed_at":"2026-08-15T22:59:52.387774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20109","last_updated":"2024-10-31T06:16:24Z","snapshot_observed_at":"2026-08-16T13:30:10.814353Z","submitted_at":"2024-07-29T15:36:42Z","title":"Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20109","snapshot_observed_at":"2026-08-15T22:59:50.408829Z","title":"Diffusion-dice: In- sample diffusion guidance for offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.408829Z"},"links":{"cited_paper":"/paper/2407.20109","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:dbfc6ba2352a045c9a02d6f214f824e3f06401475b5c8f2c9a65e3a81efd30db","observation_id":"1da9306d-1e1b-4b3f-bee0-44382af1c89d","resolution":{"observed_at":"2026-08-15T22:59:50.408829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02194","last_updated":"2023-11-03T18:56:48Z","snapshot_observed_at":"2026-08-16T14:46:06.625977Z","submitted_at":"2023-11-03T18:56:48Z","title":"AlberDICE: Addressing Out-Of-Distribution Joint Actions in Offline Multi-Agent RL via Alternating Stationary Distribution Correction Estimation","version":1},"cited_work":{"arxiv_id":"2311.02194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.02194","snapshot_observed_at":"2026-08-15T22:59:51.102638Z","title":"AlberDICE: Addressing Out-Of-Distribution Joint Actions in Offline Multi-Agent RL via Alternating Stationary Distribution Correction Estimation","venue":"cs.LG","work_id":"40b8b901-8234-4e49-8c96-0aac2b3d5a67","year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.411820Z"},"links":{"cited_paper":"/paper/2311.02194","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:3eb6479ca4bd88cb452c58b6d155fe3176b77da486344cfb16f52cc3cb7bcb3d","observation_id":"71f12ca2-e6d5-4a04-8ff2-318d5312c190","resolution":{"observed_at":"2026-08-15T22:59:51.107831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.02845","last_updated":"2022-06-10T17:05:55Z","snapshot_observed_at":"2026-08-16T17:36:50.372453Z","submitted_at":"2021-12-06T08:11:05Z","title":"Offline Pre-trained Multi-Agent Decision Transformer: One Big Sequence Model Tackles All SMAC Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.02845","snapshot_observed_at":"2026-08-15T22:59:50.414755Z","title":"Offline pre-trained multi-agent decision transformer: One big sequence model tackles all smac tasks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.414755Z"},"links":{"cited_paper":"/paper/2112.02845","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:26ab64139a239fc07d6d44accfaf4ac5538cb61d980ae5dc07f092e3687280ab","observation_id":"d39dea81-78f9-4b71-bdc1-efafbffcc13c","resolution":{"observed_at":"2026-08-15T22:59:50.414755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-15T22:59:50.418518Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.418518Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:29ed9b70de2a163de47b477fb8419790b95d8be8662f1ca82a30cfd456bc11d7","observation_id":"1d194515-c6e7-4869-8a5d-7791e3210820","resolution":{"observed_at":"2026-08-15T22:59:50.418518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.421683Z","title":"Plan better amid conservatism: Offline multi-agent reinforcement learning with actor rectification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.421683Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:030b5289e38302a60bff294dd149c832db8a709f983f9afd45a9f0928b16eb51","observation_id":"260eb825-7af6-4704-ac99-d38c03e6ac8c","resolution":{"observed_at":"2026-08-15T22:59:50.421683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.354647Z","title":"Facmac: Factored multi-agent centralised policy gradients","venue":null,"work_id":"18e6ca83-f956-41a0-8027-c9778fbca4aa","year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.424577Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:cc71a89b703e2a72074442d8581709f026d65536dcf39dc96beb0d6be3835eb0","observation_id":"a85312c7-bba3-429e-9846-996f0f272feb","resolution":{"observed_at":"2026-08-15T22:59:52.360156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.427565Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.427565Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:9c729a18f1f3696c69577141716fcfd766e1959b693a5fa4776e2b16cd9aeaaa","observation_id":"c6bdc2e9-f4ee-4db5-b32a-9f7db8e1aede","resolution":{"observed_at":"2026-08-15T22:59:50.427565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.431436Z","title":"Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.431436Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:fc65d588a5cd4e826ce2e3f3150bc75845206e22630216163d0254a98b0495a1","observation_id":"5978b74e-ac05-4102-a484-f603438d68fe","resolution":{"observed_at":"2026-08-15T22:59:50.431436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12696","last_updated":"2023-09-22T08:10:25Z","snapshot_observed_at":"2026-08-16T14:58:31.252615Z","submitted_at":"2023-09-22T08:10:25Z","title":"Counterfactual Conservative Q Learning for Offline Multi-agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2309.12696","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.12696","snapshot_observed_at":"2026-08-15T22:59:50.974287Z","title":"Counterfactual Conservative Q Learning for Offline Multi-agent Reinforcement Learning","venue":"cs.AI","work_id":"50577d3b-80af-4b0d-b0b3-d7f0b8789f66","year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.436133Z"},"links":{"cited_paper":"/paper/2309.12696","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:24b33615ddff2d0c8c5942b5f143360cc9019455d7c5d9756a2038c8f06774dd","observation_id":"9180358f-4391-4bbb-a6ce-28c01ca85939","resolution":{"observed_at":"2026-08-15T22:59:51.042106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.439686Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.439686Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:4169130e0a5dad32a562bfa3426d1d262a12c88d88500791a02e2c3446aca71a","observation_id":"440ee5e2-2047-4642-a67b-565297168f08","resolution":{"observed_at":"2026-08-15T22:59:50.439686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.289811Z","title":"Generative modeling by estimating gradients of the data distribution.yang-song.net, May 2021","venue":null,"work_id":"ffa7ce78-ea66-4618-8ffb-68b4c66d8598","year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.443221Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:948883ba84167e4a4aa3b29e23e78432b2bdedd81610a1906d987d32cd02c650","observation_id":"e2bca209-df4e-45d0-9489-0acdc0c0eeeb","resolution":{"observed_at":"2026-08-15T22:59:52.298204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-15T22:59:50.446948Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.446948Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:c50fe38e26c0e8a2fe5b030d60f5412b8759f7442ad6b31b2836ebae668cfef3","observation_id":"424fe638-8309-4658-b87b-c02f3a47c5b9","resolution":{"observed_at":"2026-08-15T22:59:50.446948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.267973Z","title":"Arena: A general evaluation platform and building toolkit for multi-agent intelligence","venue":null,"work_id":"a9ecb5eb-60a1-42a3-a626-9ee0b5d72ca4","year":2020},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.450090Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:43e681d9abb6818207ede65aa40a032b53c21c1dc07072f674d2e9e97b9a0772","observation_id":"aa912955-c13d-494d-bb8a-bfa64493113a","resolution":{"observed_at":"2026-08-15T22:59:52.273929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:52.197218Z","title":"Corl: Research-oriented deep offline reinforcement learning library","venue":null,"work_id":"55380b21-054a-4266-8a72-18c4da827d8c","year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.452899Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:5f61d7a86df48c97aa36c3127a7ce4991ca28c5ae0d69597eace1b9ce78bc34e","observation_id":"2b10dfcf-8119-432a-bcc2-09d1048aa270","resolution":{"observed_at":"2026-08-15T22:59:52.246918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.951254Z","title":"Learning from good trajectories in offline multi-agent reinforcement learning","venue":null,"work_id":"bad34b61-94c4-462f-80a1-0e893963f2c2","year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.456202Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:3c1cfb573498a0cd5e00204309f8b9b1e9e2fa9744a9336e8e4eda3aa9e03b7f","observation_id":"8994c3c3-e1a8-43f0-b9d4-115e116cd291","resolution":{"observed_at":"2026-08-15T22:59:52.035848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01343","last_updated":"2024-07-01T14:51:29Z","snapshot_observed_at":"2026-08-16T13:38:05.329863Z","submitted_at":"2024-07-01T14:51:29Z","title":"Coordination Failure in Cooperative Offline MARL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01343","snapshot_observed_at":"2026-08-15T22:59:50.459632Z","title":"Coordination failure in cooperative offline marl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.459632Z"},"links":{"cited_paper":"/paper/2407.01343","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:3ed7fa53cf10a8857ba73d7c06a68e8c36d078ec3522c08254ff0e4bb881e079","observation_id":"3e5bd0d7-6e9f-4856-98ad-9edccc9b9a6b","resolution":{"observed_at":"2026-08-15T22:59:50.459632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.743218Z","title":"Offline multi- agent reinforcement learning with knowledge distillation","venue":null,"work_id":"1ab0dc41-b23b-492c-8869-362c4bdf2650","year":2022},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.510720Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:c738420938ad0db0cfb27d224129dc5ee70b03f47bca4707241a0e2bb353b5f7","observation_id":"5333fee4-92a2-4ebd-a56e-7aee2cdbc5c1","resolution":{"observed_at":"2026-08-15T22:59:51.822838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.564316Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.564316Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:1a19fe59d61b9aa3b40c09a384afc21d7734844c26fec4f694509726a37eab30","observation_id":"2cbc3ce4-6ade-432a-ad7b-68f8c16a4c44","resolution":{"observed_at":"2026-08-15T22:59:50.564316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.717448Z","title":"Offline multi-agent reinforce- ment learning with implicit global-to-local value regularization","venue":null,"work_id":"980e6900-6811-4988-9850-1fb66d3b2a75","year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.633044Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:c8aa7af092f9bda1a59f7e9ed3553ebb9ddb4a1ac5d6faa2062617a928ef744b","observation_id":"3af2ea25-f153-45ff-976c-f7df1b6591f2","resolution":{"observed_at":"2026-08-15T22:59:51.722059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06205","last_updated":"2023-02-26T17:13:07Z","snapshot_observed_at":"2026-08-16T15:55:49.388871Z","submitted_at":"2023-02-13T09:24:34Z","title":"Order Matters: Agent-by-agent Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06205","snapshot_observed_at":"2026-08-15T22:59:50.682482Z","title":"Order matters: Agent-by-agent policy optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.682482Z"},"links":{"cited_paper":"/paper/2302.06205","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:39ac19f7977da2376c00f79a9a0b4bcda034e90cbec8cfb71ebf024913b2f433","observation_id":"0cf2474d-2b95-47c3-8f6f-317b9b3cd0e1","resolution":{"observed_at":"2026-08-15T22:59:50.682482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.687626Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.687626Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:c593228f0c7ff8ebb13651fd98aa6fe777c90f226a74d209c1ef41404e0d20fa","observation_id":"190a48fe-a9cf-42f3-b51f-360084e11a24","resolution":{"observed_at":"2026-08-15T22:59:50.687626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03644","last_updated":"2026-06-01T16:16:05Z","snapshot_observed_at":"2026-08-16T14:37:04.826374Z","submitted_at":"2023-12-06T17:59:34Z","title":"MACCA: Offline Multi-agent Reinforcement Learning with Causal Credit Assignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03644","snapshot_observed_at":"2026-08-15T22:59:50.692456Z","title":"Macca: Offline multi-agent reinforcement learning with causal credit assignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.692456Z"},"links":{"cited_paper":"/paper/2312.03644","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:c43a13c11827aebf4d70c6eb7466c4f70a16d9d9d7274633a3d91e85c426c893","observation_id":"c48582e8-3d0b-4cba-8152-6d636294c178","resolution":{"observed_at":"2026-08-15T22:59:50.692456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:50.696576Z","title":"Multi-agent reinforcement learning is a sequence modeling problem","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.696576Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:fc53fe495dc72b65327b9502f6a312c5f8786b077930c541a3e3dfbb79bc9838","observation_id":"aa076a28-958a-43c8-93a7-518dbd173854","resolution":{"observed_at":"2026-08-15T22:59:50.696576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-15T22:59:50.700224Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.700224Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:eb828fb24b53b6f391e82c425c5fa4806a62a63cc3ac9574f8e00165e8d6f471","observation_id":"5a95ce8f-2087-49cd-8691-632001322ab2","resolution":{"observed_at":"2026-08-15T22:59:50.700224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.00583","last_updated":"2025-08-13T17:31:43Z","snapshot_observed_at":"2026-08-16T19:08:57.094192Z","submitted_at":"2020-11-01T18:24:40Z","title":"Game-Theoretic Multiagent Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.00583","snapshot_observed_at":"2026-08-15T22:59:50.704955Z","title":"An overview of multi-agent reinforcement learning from game theoretical perspective","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.704955Z"},"links":{"cited_paper":"/paper/2011.00583","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:bd245af8cf2b3c11fbd9b6ef329e3b3fca74240ffaf35ec5c87d1403065fd756","observation_id":"96f34187-5050-49fd-8303-b587aa7aec38","resolution":{"observed_at":"2026-08-15T22:59:50.704955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.689877Z","title":"Believe what you see: Implicit constraint approach for offline multi-agent reinforcement learning","venue":null,"work_id":"86b017be-1f59-406d-a5e0-e5e8c2420426","year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.765669Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:2935d2cc83d19576c7dce0c0d6f80c2e158481ac1ca548b8a300d969b4279d44","observation_id":"12eadc7e-a6bc-4888-af22-58cfc68e34ca","resolution":{"observed_at":"2026-08-15T22:59:51.693472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.653914Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms","venue":null,"work_id":"5a675043-472a-4023-8f0a-442cf08a7a5d","year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.854535Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:5b4613c768bc3c91575729b825123c0f8902534311fac05b4719c303d2939c5d","observation_id":"2d2f3544-5939-4d31-a95a-8cc75e2cd10d","resolution":{"observed_at":"2026-08-15T22:59:51.668106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.623850Z","title":"Fop: Factorizing optimal joint policy of maximum-entropy multi-agent reinforcement learning","venue":null,"work_id":"2796051a-e885-423b-98c5-4a5422f2dddd","year":2021},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.858923Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:ac96f3a0cd903f6eb867dd531365ec3df5ecf3b6ee3db8d7621d5103d6a8168f","observation_id":"e331b35d-80f7-4c13-a4a5-76714090dad9","resolution":{"observed_at":"2026-08-15T22:59:51.628298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13332","last_updated":"2020-04-28T06:57:18Z","snapshot_observed_at":"2026-08-16T02:07:12.627371Z","submitted_at":"2020-04-28T06:57:18Z","title":"The AI Economist: Improving Equality and Productivity with AI-Driven Tax Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13332","snapshot_observed_at":"2026-08-15T22:59:50.862730Z","title":"The ai economist: Improving equality and productivity with ai-driven tax policies","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.862730Z"},"links":{"cited_paper":"/paper/2004.13332","citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:e5e711c42a7dc7f2cfd99fb0c687ec02cd826133229b297e876c842ad967c0f6","observation_id":"e18fa33e-eba4-4f3c-b0e6-c78371fa46ec","resolution":{"observed_at":"2026-08-15T22:59:50.862730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.612214Z","title":"guide-then-select","venue":null,"work_id":"b159455f-821b-4bb3-95e4-4a22608d9675","year":2024},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.867827Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:5ad4b7107002a661864bccb966ac405dde7329d16e10fce08fca270df28ab969","observation_id":"de72b18a-441d-4e2c-bf6b-5805072b165b","resolution":{"observed_at":"2026-08-15T22:59:51.616027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.555786Z","title":null,"venue":null,"work_id":"59234df5-3dd7-44e5-8dbb-c034915b07f4","year":null},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.876652Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:04febbc48b54337a66a41de6f37b3aeeb0820e0386593a97afce41195feb090f","observation_id":"561a1827-18f8-4ce6-a718-760e318fd1d7","resolution":{"observed_at":"2026-08-15T22:59:51.559769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:59:51.568886Z","title":"The key hyperparameters for OMSD are summarized in Table 3","venue":null,"work_id":"afc4d2aa-8ac8-47af-b089-42b2089c7397","year":null},"citing_paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition","version":3},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-15T22:59:50.872841Z"},"links":{"citing_paper":"/paper/2505.05968"},"observation_digest":"sha256:a196652bed89230023d8f324697bd77992c789b7e1928048c51d335a8f5beaf6","observation_id":"e1c3942d-e424-488b-b4fc-a8ba2f9b7fb8","resolution":{"observed_at":"2026-08-15T22:59:51.601447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.05968","last_updated":"2026-05-28T04:19:51Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T05:25:10.745287Z","submitted_at":"2025-05-09T11:42:31Z","title":"Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":5,"verified_fuzzy":25},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2505.05968."}