{"as_of":"2026-08-08T06:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1514036c9902c6f5c88f59d6ca504f952772236f62dfb0e6f7d7efd88fd35fdf","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:13.560082Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00797/citation-record","integrity":"/paper/2506.00797/integrity","json":"/paper/2506.00797/citation-record.json","paper":"/paper/2506.00797"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:21.065310Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms","venue":null,"work_id":"16e9280c-407c-423b-a03a-4b8ecac846f0","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:08.649500Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:d9ff0f4ec3981e5658d9f94d73941b8a149dd767000b64a8fb4c9d60bb1e6cd4","observation_id":"8b6bd020-82aa-42ab-88a0-e05f2d1d3abe","resolution":{"observed_at":"2026-08-07T12:09:21.135416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:08.748019Z","title":"A review of cooperative multi-agent deep reinforce- ment learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:08.748019Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:5969d9af7ccf8c370a746afc170a7631ff9dda2f33e9f97b0d30459dc6f48142","observation_id":"51024266-e33e-4c57-97d6-a3db8b1a2638","resolution":{"observed_at":"2026-08-07T12:09:08.748019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.869582Z","title":"Revisiting some common practices in cooperative multi-agent reinforcement learning","venue":null,"work_id":"557ac164-ac21-4e05-8fb7-3b353d1b53cb","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:08.860682Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:98455deac7dd6ad71799a416dbca458c59ec2a5c80982c5679fd38298cc27aa1","observation_id":"c7f3603e-4208-4639-9314-9223ee5d0c63","resolution":{"observed_at":"2026-08-07T12:09:20.954678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.719369Z","title":"Towards global optimality in cooperative marl with sequential transformation","venue":null,"work_id":"46a49f4a-c5c1-4131-8105-8790b5f9c41a","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.003537Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:0d04769dbe9e4c38a34e0a8e3980f16808ff833606f5814bcf664f8f8f0ba0be","observation_id":"89109b44-7e27-47d0-9b75-268f5356a050","resolution":{"observed_at":"2026-08-07T12:09:20.771005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.488926Z","title":null,"venue":null,"work_id":"b8c3afad-a49e-4039-bb73-93153b0e4758","year":2024},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.155414Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:9274ce354cc81e60054ae552607574e7d4bf0779b484906f44acc83211bc0674","observation_id":"e38ff12b-715f-4e7a-bca9-b8c61d99d06f","resolution":{"observed_at":"2026-08-07T12:09:20.579717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.320240Z","title":"Multiagent reinforcement learning: Rollout and policy iteration","venue":null,"work_id":"4d0faa83-17ff-4eb8-9ee4-7106e89e7bfa","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.249278Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:bb50cc69b12d70095c21a37e7ae8a1dc467b0230d48528d1cc31113e6c82dd5c","observation_id":"f87454b7-397d-457d-91dc-cdd452778d19","resolution":{"observed_at":"2026-08-07T12:09:20.397911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:20.108447Z","title":"Context-aware bayesian network actor-critic methods for cooperative multi-agent reinforcement learning","venue":null,"work_id":"4b5e0bb4-3706-4912-aaf0-937bd2898d30","year":2023},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.341192Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:ce1ed5ffaa1eaedcdc1039ebc4785990864e4444ed9007f1abf10ff84f277331","observation_id":"2e812c2d-9698-4dc1-bf85-6c04095e31bb","resolution":{"observed_at":"2026-08-07T12:09:20.209812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.883935Z","title":"Coordinated reinforcement learning","venue":null,"work_id":"6447f7ab-6bbb-44ef-a246-d8fceb8ae901","year":2002},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.429599Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:b2923dfdaf651911f15f1e6e6f427df6b30e8adb23bc3ab69cb085d1fbc54c38","observation_id":"1c7acf73-a58e-4307-afc1-2ee4bc6c28aa","resolution":{"observed_at":"2026-08-07T12:09:19.999451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12681","last_updated":"2023-02-10T09:29:51Z","snapshot_observed_at":"2026-07-06T13:56:18.922588Z","submitted_at":"2022-09-26T13:29:22Z","title":"More Centralized Training, Still Decentralized Execution: Multi-Agent Conditional Policy Factorization","version":2},"cited_work":{"arxiv_id":"2209.12681","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.12681","snapshot_observed_at":"2026-08-07T12:09:14.223413Z","title":"More Centralized Training, Still Decentralized Execution: Multi-Agent Conditional Policy Factorization","venue":"cs.LG","work_id":"5ae68ca0-b779-40df-b2bf-dfc82fa46c39","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.530585Z"},"links":{"cited_paper":"/paper/2209.12681","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:52fd547a5b7b46638178e4f941a71a3a7dbc8bf542aa1ca5b53d06de092e5a78","observation_id":"5b1cc5d4-84a6-4c0c-9624-aff77fee7ada","resolution":{"observed_at":"2026-08-07T12:09:14.299095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.670475Z","title":"Multi-agent reinforcement learning: Independent vs","venue":null,"work_id":"424bc3f1-cc0f-403f-8e71-eb20cbf0a663","year":1993},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.679161Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:67ba0be6099283dde34b7701e052ce0328ed66fd7876329260a7dfb63b75520c","observation_id":"32ccfa27-6f00-40a1-a13a-276a6a831e68","resolution":{"observed_at":"2026-08-07T12:09:19.760972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:09.757254Z","title":"Value- decomposition networks for cooperative multi-agent learning based on team reward","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.757254Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:89e8b418cafe1f22414b2005dbfb558427cce994f7579c6f29ab6cffc80259ab","observation_id":"5fdb052c-3b61-4b2b-a13e-ed0f424ccbd0","resolution":{"observed_at":"2026-08-07T12:09:09.757254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:09.871952Z","title":"Qmix: Monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:09.871952Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:8fc72a78eb70378bcd60172e7e1bbeabef64ec45e5ddac699e51af384e88aec3","observation_id":"617e1732-bcb8-4416-9fa7-b10ea31c513f","resolution":{"observed_at":"2026-08-07T12:09:09.871952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.470382Z","title":"Qtran: Learning to factorize with transformation for cooperative multi-agent reinforcement learning","venue":null,"work_id":"718ce213-7f40-4462-99dc-58129531396c","year":2019},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.006495Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:c783f27d418cf247c5cc1bff18d46bff4e3f42ad848bdf814cc887e2d59e95b2","observation_id":"9f9d4401-e4c2-4462-ab8f-6f2f0b0c0310","resolution":{"observed_at":"2026-08-07T12:09:19.533967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.296950Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":"2ac99597-71b0-4a23-ad00-dd6113d6dd12","year":2017},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.158960Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:8e771faa730272e8d716948110e3f8602f507cd7b45d86120ab107c173f3e4f3","observation_id":"2d436245-855b-47d1-a796-f8c1f5101110","resolution":{"observed_at":"2026-08-07T12:09:19.388235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:10.294956Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.294956Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:c3d137bd09f83c938a05bc9e89ac6cd6631e06f75c4c1d3c325003d287c116fd","observation_id":"2c22b13d-e5f9-4fc1-980a-0f6363672d32","resolution":{"observed_at":"2026-08-07T12:09:10.294956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:19.027942Z","title":"Actor-attention-critic for multi-agent reinforcement learning","venue":null,"work_id":"97bf16d9-47f1-499e-a862-f127e9e4f020","year":2019},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.443532Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:a5ccaac96c1b0b0d8d7e534a7ad22385cb931f4fca924a9a44582d0c7e53a4d6","observation_id":"7f009bdb-7411-4286-8e57-61636f1a08b4","resolution":{"observed_at":"2026-08-07T12:09:19.168581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.867699Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games","venue":null,"work_id":"52f38f13-e0e4-4045-be6b-29240748a4f9","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.589233Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:a7e30b5e02c812ec9c5ca1e55c7262c3f1524ebcb2c94bbad2b6b48c52a5fdb1","observation_id":"da0dc977-e59a-4176-aeaa-e2452537fbca","resolution":{"observed_at":"2026-08-07T12:09:18.942059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.671898Z","title":"Deep coordination graphs","venue":null,"work_id":"4cbce4fb-18cc-4a8b-ba87-e8aa91b135ff","year":2020},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.709772Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:97546543ef8f2639cedb3039ed3019fae5120911b829d30dacbdb2be035a8424","observation_id":"1b428e06-5328-44be-9ed5-0917852f530a","resolution":{"observed_at":"2026-08-07T12:09:18.754897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.482670Z","title":"Deep implicit coordination graphs for multi-agent reinforcement learning","venue":null,"work_id":"a7b47ce2-7e71-4d30-b231-fd1e0a3c1450","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.773040Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:0227befbf6147b3c3dde7cf4b4c0e71ddcd5ad2fee8cda3c097461a4ede3bcb4","observation_id":"6349482b-11c0-43e9-9a51-0b679ed6eea2","resolution":{"observed_at":"2026-08-07T12:09:18.551846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:10.869588Z","title":"Context-aware sparse deep coordination graphs","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.869588Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:bb209006e2e4a4a6c6d73680c9eb95a36deff5875bbaae053ca2339ce287ed8b","observation_id":"2eecfbe2-19f6-4f33-94bd-62d8861d7bf3","resolution":{"observed_at":"2026-08-07T12:09:10.869588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.315202Z","title":"Analysing factoriza- tions of action-value networks for cooperative multi-agent reinforcement learning","venue":null,"work_id":"6aa6e33c-a041-40ec-bcdd-33950821ebd2","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:10.972434Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:1f8ad4f18bcbb487fdeaeca896a6b2fa0b9d7586df716dac4baec498ab946248","observation_id":"aa0c4210-4186-4ffe-a81b-fc3e9971270e","resolution":{"observed_at":"2026-08-07T12:09:18.377599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:18.171847Z","title":"Biasing coevolutionary search for optimal multiagent behaviors","venue":null,"work_id":"132bbbba-4b19-4d9a-95b3-5d1cbb546492","year":2006},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.048003Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:bf955d717354ce5aa1decffdf2026bd4a7be26236270a43b4b7cc59b1752126b","observation_id":"b2e9d5bf-c29b-4406-83a2-9d2fb17d526e","resolution":{"observed_at":"2026-08-07T12:09:18.216281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.976294Z","title":"Bounded approximate decentralised coordination via the max-sum algorithm","venue":null,"work_id":"3ac4f33c-ab25-46a9-bed1-845607616675","year":2011},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.130000Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:6d8dada1cc7d26982ac74af7b77a3197e74fb66d20d06bcbd2212efe442ff8c7","observation_id":"f88da3a5-629c-41da-935e-3766dd477d76","resolution":{"observed_at":"2026-08-07T12:09:18.090154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.773469Z","title":"Nonserial dynamic programming","venue":null,"work_id":"11824b9d-075d-4fb7-bc5d-54982832497f","year":1972},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.226850Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:6d4f837ed54442f4896fdc036a8cfa34ff0ad2f0e3b0fca606784e3a12980f2b","observation_id":"908f2428-3f57-4636-bf13-0dbf972ef113","resolution":{"observed_at":"2026-08-07T12:09:17.865044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.590748Z","title":"Gcs: Graph-based coordination strategy for multi-agent rein- forcement learning","venue":null,"work_id":"f3eeacdf-c85e-4cfd-ba3b-e32652bbd230","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.302675Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:aba8321b3824606825b3b79fdf2c4940418e60d490f8eb42db62015d1f1e01da","observation_id":"184c00e3-a0d2-49d9-acc3-b51f6c95b328","resolution":{"observed_at":"2026-08-07T12:09:17.665808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.418994Z","title":"Ace: Cooperative multi-agent q-learning with bidirectional action-dependency","venue":null,"work_id":"92a255c3-1654-4388-8e09-a792ad0e2bc1","year":2023},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.375942Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:882698e240a97c24ccb9375031b700b342676bb035805564c4c17e3419fde499","observation_id":"ad4dc34a-6841-4ad4-a88e-b29c27c1e97a","resolution":{"observed_at":"2026-08-07T12:09:17.505016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.251251Z","title":"Backpropagation through agents","venue":null,"work_id":"593b6516-8f75-418e-8adf-b1546e666903","year":2024},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.463197Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:03c2685e20dfa229952234240d69844c1afec289cf496a688629ca5e825d10aa","observation_id":"ad3ff415-1ea2-4460-ad54-4dd744c33bcf","resolution":{"observed_at":"2026-08-07T12:09:17.302075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:17.032915Z","title":"Group-aware coordination graph for multi-agent reinforce- ment learning","venue":null,"work_id":"a4c203a0-46ca-4176-a767-ea88d8170634","year":2024},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.548731Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:77871581f6c0a2882b8977cdeaa3ea188545564b693b105dde7f70d5e761d5c4","observation_id":"0ad99584-ad15-4aad-8479-709a1fd67805","resolution":{"observed_at":"2026-08-07T12:09:17.124913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17352","last_updated":"2025-05-13T10:06:37Z","snapshot_observed_at":"2026-07-06T15:34:13.017210Z","submitted_at":"2023-05-27T03:15:24Z","title":"Is Centralized Training with Decentralized Execution Framework Centralized Enough for MARL?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17352","snapshot_observed_at":"2026-08-07T12:09:11.648515Z","title":"Is centralized training with decentralized execution framework centralized enough for marl? arXiv preprint arXiv:2305.17352, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.648515Z"},"links":{"cited_paper":"/paper/2305.17352","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:22722af74d8d706a92f6fef081509af1485e012de5328cf52ea48b579e577968","observation_id":"d7e21359-9f50-4aa0-a801-56994194dd44","resolution":{"observed_at":"2026-08-07T12:09:11.648515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:16.796798Z","title":"Multi-agent reinforcement learning is a sequence modeling problem","venue":null,"work_id":"e8d1d01c-ff56-45d6-b553-a5fff424803b","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.719251Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:56df84acc2138e9707d845ec4797dd3318b61758e38abe2ed4388e25d8a5cd3f","observation_id":"e55f56e1-7572-4113-8bbd-39aa00d71bb6","resolution":{"observed_at":"2026-08-07T12:09:16.911860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:16.595008Z","title":"Coordinated multi-agent reinforcement learning in net- worked distributed POMDPs","venue":null,"work_id":"0c49174b-43a2-4e5d-a672-f11197232c8f","year":2011},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.819710Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:4f07ff0baabccf112c5bc24138ded180ce45bbb0c48e9ff48f7d573f74174fef","observation_id":"0e09f4b3-627c-4f57-b282-b16fd3ef2fd5","resolution":{"observed_at":"2026-08-07T12:09:16.673642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:16.373353Z","title":"Learning to coordinate with coordination graphs in repeated single-stage multi-agent decision problems","venue":null,"work_id":"7783fad6-5ae0-449f-a782-1cca904ffbdc","year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.885075Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:3a4a6148377aac4b0c3c2326ad2cbf41ff995a60cc9d41d9c4be3820ac277753","observation_id":"809ce0f2-1670-46a6-ab0e-8f3084295b37","resolution":{"observed_at":"2026-08-07T12:09:16.457907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.15175","last_updated":"2021-09-30T14:46:18Z","snapshot_observed_at":"2026-07-06T11:53:07.956272Z","submitted_at":"2021-09-30T14:46:18Z","title":"Coordinated Reinforcement Learning for Optimizing Mobile Networks","version":1},"cited_work":{"arxiv_id":"2109.15175","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.15175","snapshot_observed_at":"2026-08-07T12:09:14.028015Z","title":"Coordinated Reinforcement Learning for Optimizing Mobile Networks","venue":"cs.LG","work_id":"33f84c32-1189-4a48-b982-43ab57f6b7d4","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:11.957490Z"},"links":{"cited_paper":"/paper/2109.15175","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:e7e9bd4677892756afa279d84290ff031ca6ed8789be8897f384608555d90dce","observation_id":"02f366e8-e52a-4426-9378-aa4310f7ef90","resolution":{"observed_at":"2026-08-07T12:09:14.106967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04868","last_updated":"2022-02-16T03:17:57Z","snapshot_observed_at":"2026-08-04T11:16:51.369024Z","submitted_at":"2022-02-10T06:59:08Z","title":"Understanding Value Decomposition Algorithms in Deep Cooperative Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2202.04868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.04868","snapshot_observed_at":"2026-08-07T12:09:13.888405Z","title":"Understanding Value Decomposition Algorithms in Deep Cooperative Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"4c4796fb-fdb2-4b1c-846f-0ab526a7d3e0","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.080207Z"},"links":{"cited_paper":"/paper/2202.04868","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:4da328c88021af4976e6ded8082b0d76a1eaaaa6d25edc1ec63b0a8058dccb27","observation_id":"41654430-94ba-4132-96aa-30a723418a60","resolution":{"observed_at":"2026-08-07T12:09:13.963852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:16.205868Z","title":"On the global convergence rates of decentralized softmax gradient play in markov potential games","venue":null,"work_id":"3c6f27de-e001-4919-9b3d-6daf3aa526b8","year":1923},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.157464Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:ef6e3f0ab4af8e66b347478fb6b5b5bedde3dfe2ddaf8ae0da181679efeb5dc3","observation_id":"1f1f0e6a-b47a-4210-8dba-072c3981eac2","resolution":{"observed_at":"2026-08-07T12:09:16.257303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.978992Z","title":"Trust region policy optimisation in multi-agent reinforcement learning","venue":null,"work_id":"02664afb-760f-43a5-bdd4-a09bdba83723","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.226182Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:b2a3e14eeb0b392068bf427b087ee2aed9fd282140acb4869fb3af2f9e5fa16e","observation_id":"1da1cc19-7669-4d0a-8ca0-1869eb7b544d","resolution":{"observed_at":"2026-08-07T12:09:16.081145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.814515Z","title":"On minmax theorems for multiplayer games","venue":null,"work_id":"40dbe3c3-2e00-40e6-99ec-167f8fa7a089","year":null},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.275355Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:7c8e9fbec73c267aee05f82d8b35637bf52021c3857b1cdac429a61ae77b2a3a","observation_id":"69ee98c4-8091-4c8c-aced-d371d6ed6dfa","resolution":{"observed_at":"2026-08-07T12:09:15.898241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.645187Z","title":"Team theory and person-by-person optimization with binary decisions","venue":null,"work_id":"c11bd6c3-b635-4bcf-b817-fa20b2aaf22d","year":2012},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.360426Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:305f560a9acdc59d43f859a162d3f58cb5bf1877a5cac8dd202d00a1f3f46880","observation_id":"c780cd43-1d7f-4464-98d5-af134bf54847","resolution":{"observed_at":"2026-08-07T12:09:15.732224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.441443Z","title":"Collaborative multiagent reinforcement learning by payoff propagation","venue":null,"work_id":"e44c510e-1ec9-4e2e-ab12-392a0dbcd972","year":2006},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.491947Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:b06e36b25d8e1b9822180de65675913228f228c8185913fb9398909f33209d8e","observation_id":"850a2fe5-a037-4794-a047-ec8be72c6304","resolution":{"observed_at":"2026-08-07T12:09:15.527030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:12.638776Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.638776Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:86730d85791a9ab139d768234bb05de19ed74d1b420253fa089cb47047a5f9ab","observation_id":"1ed0f93c-a933-458c-b352-e2eefac6ca96","resolution":{"observed_at":"2026-08-07T12:09:12.638776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.254038Z","title":"Microscopic traffic simulation using sumo","venue":null,"work_id":"352775b6-f115-482d-b4ca-486c8342702d","year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.701283Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:88e004fca0251ade9e2eb58cc3a3f16e1814752594b312673b74fcf5c8356136","observation_id":"3c90702e-bb78-468b-ae25-b015cb39909e","resolution":{"observed_at":"2026-08-07T12:09:15.312623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:15.081936Z","title":null,"venue":null,"work_id":"4409ea35-ff58-4717-b643-1a9a43205c58","year":2019},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.775891Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:c6b1aa2cdffb35b4c467b18755441a83c7e42a28fa124f6af522bc103fcec24d","observation_id":"84d1ec4b-c5e0-423b-8129-c892d0aa8b05","resolution":{"observed_at":"2026-08-07T12:09:15.146793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-07-06T07:32:24.974529Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-08-07T12:09:12.878586Z","title":null,"venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.878586Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:04c88f8041fbabaa529c446455a52efcb97b57f13e06dc8386e35afca7c89ab6","observation_id":"e963249d-7e11-47ae-b019-9e3359cf0bd2","resolution":{"observed_at":"2026-08-07T12:09:12.878586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:14.914934Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"0676b2b2-3fae-4f71-a43b-5aa26b5852b3","year":2018},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:12.993195Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:24b4e2d3f7d377e0468eae40fe0b9ea8dfa589e7e6d5a41ce3c8bc41edea70f8","observation_id":"ddcf55f2-8984-4bd4-9119-914bb90b057b","resolution":{"observed_at":"2026-08-07T12:09:14.987869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.01339","last_updated":"2020-04-24T01:54:46Z","snapshot_observed_at":"2026-07-06T09:09:35.655226Z","submitted_at":"2020-04-03T02:21:07Z","title":"Multi-agent Reinforcement Learning for Networked System Control","version":2},"cited_work":{"arxiv_id":"2004.01339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.01339","snapshot_observed_at":"2026-08-07T12:09:13.733603Z","title":"Multi-agent Reinforcement Learning for Networked System Control","venue":"cs.LG","work_id":"a2ca9a9b-03ec-42f0-921b-1af44c10b98f","year":2020},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.071784Z"},"links":{"cited_paper":"/paper/2004.01339","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:6bfe0ed021e16ec0c66494c80a5a94136f5014308cefdbf3f17bb559017e07aa","observation_id":"770ba9b0-04db-4ea9-960a-d0f43d179fc6","resolution":{"observed_at":"2026-08-07T12:09:13.790402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:09:13.162796Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.162796Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:85fa3188c1319c609ff8c6d0bcddc21f8a60aa1c73ed6270a77096609fd81175","observation_id":"792e14a1-b117-4f07-97aa-11490eed0c67","resolution":{"observed_at":"2026-08-07T12:09:13.162796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:14.744284Z","title":"Abstract dynamic programming","venue":null,"work_id":"c1c2dd31-685b-4194-950d-fe599ce513f7","year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.215863Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:9cc7980b504d999e6b5506cc5ab5e22e3e0bbd624de2a761f72a68a8c504c737","observation_id":"31c27e78-34fa-4be7-ad14-d95b43c19ca2","resolution":{"observed_at":"2026-08-07T12:09:14.827639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:14.605531Z","title":"Dynamical model of traffic congestion and numerical simulation","venue":null,"work_id":"3cb7e582-5f6e-48ed-addf-05e539eaa733","year":1995},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.294728Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:b1a181024a4986458e28082316487c76d1014935db9f23915e376e0208261a1e","observation_id":"2f839a35-c33c-41fc-b476-2f4ed18c165e","resolution":{"observed_at":"2026-08-07T12:09:14.696229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T12:09:13.360881Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.360881Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:bd4a8eb2a9733890b6f930e61357f0f9ee5f97ca4d5998260f073e0c50e15965","observation_id":"4bc9af4d-727e-4618-85e9-d07eb361547d","resolution":{"observed_at":"2026-08-07T12:09:13.360881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01682","last_updated":"2022-08-02T18:16:42Z","snapshot_observed_at":"2026-07-06T13:38:05.839536Z","submitted_at":"2022-08-02T18:16:42Z","title":"Heterogeneous-Agent Mirror Learning: A Continuum of Solutions to Cooperative MARL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01682","snapshot_observed_at":"2026-08-07T12:09:13.464761Z","title":"Heterogeneous-agent mirror learning: A continuum of solutions to cooperative marl","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.464761Z"},"links":{"cited_paper":"/paper/2208.01682","citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:99b72318b5008f5a42a0b44aa25e14e097bbc084dacd4ff29e4536a9f026d666","observation_id":"6bc46274-8ff6-4695-8499-a18a4dfa8c4f","resolution":{"observed_at":"2026-08-07T12:09:13.464761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:14.429331Z","title":"Albrecht","venue":null,"work_id":"3167c6a7-a170-4b6e-baee-f6cb8880313a","year":2021},"citing_paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:13.560082Z"},"links":{"citing_paper":"/paper/2506.00797"},"observation_digest":"sha256:bb4431800ffb58c498eb47cc13e072f8d3a894b95eca1412d524b8aa9159d020","observation_id":"6276f5eb-db5b-4c6f-8332-e34c28c3607f","resolution":{"observed_at":"2026-08-07T12:09:14.491389Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00797","last_updated":"2025-06-01T02:58:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:55:24.070886Z","submitted_at":"2025-06-01T02:58:20Z","title":"Action Dependency Graphs for Globally Optimal Coordinated Reinforcement Learning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":4,"verified_fuzzy":33},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2506.00797."}