{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6527b588c005206d9d029ab321dda889314c9ffe38a4a3901946a30bc8be0eee","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:47:39.488108Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09989/citation-record","integrity":"/paper/2507.09989/integrity","json":"/paper/2507.09989/citation-record.json","paper":"/paper/2507.09989"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15858","last_updated":"2023-11-27T14:25:40Z","snapshot_observed_at":"2026-07-06T16:53:05.949503Z","submitted_at":"2023-11-27T14:25:40Z","title":"Multi-Agent Reinforcement Learning for Power Control in Wireless Networks via Adaptive Graphs","version":1},"cited_work":{"arxiv_id":"2311.15858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15858","snapshot_observed_at":"2026-08-06T17:47:39.712283Z","title":"Multi-Agent Reinforcement Learning for Power Control in Wireless Networks via Adaptive Graphs","venue":"cs.NI","work_id":"486d4a6f-02b8-45ab-8e16-7503c8667bd5","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:36.874336Z"},"links":{"cited_paper":"/paper/2311.15858","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:140208c477813c2faf9fe63c81cee84a5c35da757d0e13e01ce60a2c208fd218","observation_id":"a1fb07d7-507a-48af-9ee5-513978531797","resolution":{"observed_at":"2026-08-06T17:47:39.820541Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.433557Z","title":"Proceedings of the International Conference on Learning Representations (2022)","venue":null,"work_id":"0453bec4-b0b3-4468-b866-36a09eec6f37","year":2022},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:36.967492Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:9fca5d6a605c9c8f8f36407b6fe60ff7a49189b161b4ffbc7ca009eeecf188bd","observation_id":"8c506b9e-95db-4b15-b18b-0e8c687d69d7","resolution":{"observed_at":"2026-08-06T17:47:40.438220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.416161Z","title":"Pro- ceedings of the 2023 International Conference on Autonomous Agents and Multiagent Sys- tems pp","venue":null,"work_id":"c64ea7ae-8920-4a03-ba5a-7a11d350e5f6","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.010854Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:97f21904cd81a541314e562544e7728902d7fe8d342e842a7d5e3faae1aca701","observation_id":"61012a7c-78bf-4851-98d2-78bf93e6df10","resolution":{"observed_at":"2026-08-06T17:47:40.422021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.395023Z","title":"Joint European Conference on Machine Learning and Knowledge Discovery in Databases pp","venue":null,"work_id":"acbd9fbd-818f-4b76-8c84-3088827ae78e","year":2018},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.093328Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:48ea38d5cff34df95b7a247ea9f1338f9c3b641b2149c4cc2a7e5cda4709d7cd","observation_id":"78901d04-639e-469c-bbb3-88b198cb3e12","resolution":{"observed_at":"2026-08-06T17:47:40.403187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.372914Z","title":"International Joint Conference on Artificial Intelligence (2024)","venue":null,"work_id":"8ce5adc7-25fb-4388-8037-fed8420ee6bf","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.169395Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:578a9b3ebd982be08bec8237eb35809e4cad05656d77ec8e539ae09f89650f98","observation_id":"a28de0a2-a975-4e82-8050-52db1790c0dd","resolution":{"observed_at":"2026-08-06T17:47:40.377888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11251","last_updated":"2022-04-04T06:39:20Z","snapshot_observed_at":"2026-08-06T03:41:51.704789Z","submitted_at":"2021-09-23T09:44:35Z","title":"Trust Region Policy Optimisation in Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11251","snapshot_observed_at":"2026-08-06T17:47:37.242154Z","title":"arXiv preprint arXiv:2109.11251 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.242154Z"},"links":{"cited_paper":"/paper/2109.11251","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:67fa610064ac1bf003b40914f5c58f88938f7b3a052159b4b719913778f968cc","observation_id":"b9f7b077-a641-4f1e-b536-eba274abbe39","resolution":{"observed_at":"2026-08-06T17:47:37.242154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.355437Z","title":"the Thirty-Eighth Annual Conference on Neural Information Pro- cessing Systems (NeurIPS) (2024)","venue":null,"work_id":"cfd8ffe4-b18a-43fe-af08-fa10d875967d","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.375135Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:12f09e21398cad4291945ba584cf079f4488749c954a047d39f1d4926cf145fb","observation_id":"063b6800-0521-46b1-85f8-6a051fef939d","resolution":{"observed_at":"2026-08-06T17:47:40.361427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.337845Z","title":"CoRR (2023)","venue":null,"work_id":"f91e0a31-da30-472f-878e-20aa313f6441","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.470113Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:d28e190517e69335ecd6807c22832d57bd1140daea4e9ed64a4310c650c00361","observation_id":"5d2937e1-04a3-4716-b108-7b0d664281a3","resolution":{"observed_at":"2026-08-06T17:47:40.342816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.318085Z","title":"The Twelfth International Conference on Learning Representations (2024)","venue":null,"work_id":"71654b12-f53a-416d-97c7-58897c27a3f2","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.537944Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:dd6dc18ba63017d2bc63c59fba06c169f9a623bdb9328c98fd2ce6679f312ea2","observation_id":"380c99e2-9524-4959-b545-1389d5e469e7","resolution":{"observed_at":"2026-08-06T17:47:40.323345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.301331Z","title":"The Twelfth International Conference on Learning Representations (2024) Title Suppressed Due to Excessive Length 13","venue":null,"work_id":"4cdd52f7-28a2-4e1d-a8e0-6d290f47d9f9","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.637960Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:5584c5e96a9690d2942a827118f616ec11f5f75253f9d1d30b0bd79bd78aa89f","observation_id":"7c7dd837-0402-40a1-aaeb-442128e50d50","resolution":{"observed_at":"2026-08-06T17:47:40.307050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.283727Z","title":"Neural Information Processing Systems (NIPS) (2017)","venue":null,"work_id":"f6dbf81f-f486-4454-bdd5-0dffe89868b8","year":2017},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.696465Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:a1936a2f03389d7f837d17f0a2818d4eacaeca5d6abdaff5fb495cd98c11fdb3","observation_id":"eb079445-1324-4aa5-9a0a-78e13167b24a","resolution":{"observed_at":"2026-08-06T17:47:40.289219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.263186Z","title":"Advances in Neural Information Processing Systems 32 (2019)","venue":null,"work_id":"867c9c6a-5ebd-49d6-9525-1bc41ec17e01","year":2019},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.781829Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:ad76e8a1d65d006eb7c85b30b9f09d06750f84f5eb0da0b818ae975f16a423ab","observation_id":"fb8c8ab5-4842-438f-a72f-a58e8421c799","resolution":{"observed_at":"2026-08-06T17:47:40.270317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.245458Z","title":"Springer (2016)","venue":null,"work_id":"5b0875f0-f71c-4d33-a926-124f61c2051e","year":2016},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.882998Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:c0cd18347dce1a906256f897fcf5cdc958c2ba049ea4a03b2ab2796a6ec6d1f3","observation_id":"439d077f-ba02-49f9-a46e-99ac3d29cc92","resolution":{"observed_at":"2026-08-06T17:47:40.249864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.230524Z","title":"Applied Intelligence 53(4), 4483–4498 (2023)","venue":null,"work_id":"7c4cca36-3531-453e-9a41-a08a47c2b39f","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:37.976283Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:50bd03a9a211485224bbb8bf41b8aa4c710a210504af963bd9969465cbb2a647","observation_id":"a7c27d62-01f7-4309-92ce-878c65b67101","resolution":{"observed_at":"2026-08-06T17:47:40.235075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.212062Z","title":"The Journal of Machine Learning Research 21(1), 7234–7284 (2020)","venue":null,"work_id":"9ce2466b-14e9-4daa-b66e-d3793eca206c","year":2020},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.043046Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:9e8af81c0adb57e25f3b432110d9da03ddb5af7e57303f3ac7c0474c1a9ea8d3","observation_id":"76057f61-0aa5-49b1-b1de-78c6a887666c","resolution":{"observed_at":"2026-08-06T17:47:40.219283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05800","last_updated":"2024-07-08T10:10:07Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T10:10:07Z","title":"FedMRL: Data Heterogeneity Aware Federated Multi-agent Deep Reinforcement Learning for Medical Imaging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05800","snapshot_observed_at":"2026-08-06T17:47:38.095243Z","title":"arXiv preprint arXiv:2407.05800 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.095243Z"},"links":{"cited_paper":"/paper/2407.05800","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:a7160c21230a9a2f59e443b72ef838eb5015e13e9ebbf9b5eb6d0b6366c6facb","observation_id":"6d3bb8c5-9eb2-482c-96b9-6d21f21b69eb","resolution":{"observed_at":"2026-08-06T17:47:38.095243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.193544Z","title":"Neural Computing and Applications 35(27), 19765–19781 (2023)","venue":null,"work_id":"53826490-18be-4b02-b4be-a4d775d4104b","year":2023},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.208471Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:7a5f36e9dbba401280bc7a7700599bc7d8a500f3f2d61118ab041adb30e25aaf","observation_id":"3b5161f9-e1ee-498d-9936-389d9f3020d7","resolution":{"observed_at":"2026-08-06T17:47:40.199924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.167580Z","title":"Advances in Neural Information Processing Systems 35, 16509–16521 (2022)","venue":null,"work_id":"3143678f-5ba7-4b8a-87c6-2c6fe5944720","year":2022},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.274554Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:f934f97b22273aa6743faa92bc4763aebcf1561f7a603af5e5a415f61d64ed0e","observation_id":"dffaa61c-db81-4f8f-81ab-fe11b132a75b","resolution":{"observed_at":"2026-08-06T17:47:40.173531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.140541Z","title":"Theses and Dissertations","venue":null,"work_id":"46ba28d0-f97c-468d-b592-af58eca21815","year":2022},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.399755Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:5cb36f702aa030969f980a688acd9797c0935432fd50a160250926b3f7236e26","observation_id":"41ef0326-dcc2-416f-bc7c-779c1a4dc774","resolution":{"observed_at":"2026-08-06T17:47:40.148295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.116103Z","title":"The International FLAIRS Conference Proceedings, 35 (2022)","venue":null,"work_id":"3ba460cc-f8d9-4b50-98bd-e73c82d020a1","year":2022},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.542071Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:0a755e3033e0616892e44365534df6235fa4c206a457aa9e3aacbe3c1fac9d53","observation_id":"63631aa8-cc7f-417e-939a-6a96e0d49dfa","resolution":{"observed_at":"2026-08-06T17:47:40.124489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.089845Z","title":"IEEE Transactions on Vehicular Technology69(8), 8243–8256 (2020)","venue":null,"work_id":"9944e926-d08c-487b-8412-067b06ab1347","year":2020},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.596388Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:7581aa2dca50835215666e557873d6f193510553ffd1851568febba4ce791a63","observation_id":"5e89f877-1b8c-44bc-8037-515e86d2fd20","resolution":{"observed_at":"2026-08-06T17:47:40.102216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05799","last_updated":"2024-01-11T10:06:42Z","snapshot_observed_at":"2026-08-02T04:14:18.610286Z","submitted_at":"2024-01-11T10:06:42Z","title":"Designing Heterogeneous LLM Agents for Financial Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05799","snapshot_observed_at":"2026-08-06T17:47:38.762403Z","title":"arXiv preprint arXiv:2401.05799 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.762403Z"},"links":{"cited_paper":"/paper/2401.05799","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:3907a72608a002e7e62c407bf4f315e1c426f7214edb08626db1b7e4d164402a","observation_id":"d5642dde-b820-4321-b5c4-1219b425b296","resolution":{"observed_at":"2026-08-06T17:47:38.762403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.069662Z","title":"2021 IEEE International Confer- ence on Systems, Man, and Cybernetics (SMC) pp","venue":null,"work_id":"59e77aa2-fbd1-448e-a5ff-12814fa1c5cc","year":2021},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.800514Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:a4b170f628d71075d550713369c0f22de02ac6a698cba7a421690738ca0e58b3","observation_id":"65dea1ea-b486-4dfd-8204-73e9e4c6c55a","resolution":{"observed_at":"2026-08-06T17:47:40.076193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.047217Z","title":"AIAA Scitech 2019 Forum p","venue":null,"work_id":"8ac948f7-eeef-4f3c-867c-aebf1a28dcfa","year":2019},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:38.922343Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:fb13077d7a3eab1834a06412b61ee4ef5146200823839cbfae12c237498198dd","observation_id":"c86db028-91ff-41eb-89c9-caf595f0452f","resolution":{"observed_at":"2026-08-06T17:47:40.053893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01955","last_updated":"2022-11-04T06:16:11Z","snapshot_observed_at":"2026-07-06T10:46:11.856932Z","submitted_at":"2021-03-02T18:59:56Z","title":"The Surprising Effectiveness of PPO in Cooperative, Multi-Agent Games","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.01955","snapshot_observed_at":"2026-08-06T17:47:39.086300Z","title":"arXiv preprint arXiv:2103.01955 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.086300Z"},"links":{"cited_paper":"/paper/2103.01955","citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:c69c3121a510f95e59f071801de53a08cd530009bf17145035907c2f9d134943","observation_id":"819dfc1c-9d73-4f90-98ea-28967e163a33","resolution":{"observed_at":"2026-08-06T17:47:39.086300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.025578Z","title":"Applied Sciences 15(5), 2580 (2025)","venue":null,"work_id":"5d3fee4e-98c4-474e-8c8d-c09914c472ef","year":2025},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.148563Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:31de4f25f6b93469cfa1fe9cc9059bb124586f93501032ae5f2fbb0749b02a6a","observation_id":"a20098aa-3adb-4c03-aa7f-5b1476f29c16","resolution":{"observed_at":"2026-08-06T17:47:40.032904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:40.004755Z","title":"Complex & Intelligent Systems pp","venue":null,"work_id":"43e52be8-3700-4d63-806b-88a779ceef86","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.268295Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:af588a93db77fde7a5f305d0518d6c47997efbf63187e06a679a9e32a3988c18","observation_id":"42be7f25-7db7-4388-a20f-ffa157071d99","resolution":{"observed_at":"2026-08-06T17:47:40.010555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.985029Z","title":"Neurocomputing 411, 206–215 (2020)","venue":null,"work_id":"848430cf-fe1d-4cd8-bc90-63000c63911d","year":2020},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.329041Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:0b2a6ba835cf8ddb96daff7829bc7d2e10a04a1addbda6014b047b2d8a2181ce","observation_id":"6a71bfb5-a906-4ae5-9763-2a2ed60b78d7","resolution":{"observed_at":"2026-08-06T17:47:39.991068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:47:39.929137Z","title":"Autonomous Agents and Multi-Agent Systems 38(1), 4 (2024)","venue":null,"work_id":"d13effea-4f09-4e36-a141-0e863a355f89","year":2024},"citing_paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:39.488108Z"},"links":{"citing_paper":"/paper/2507.09989"},"observation_digest":"sha256:5f6ed3d00ab833d424665b807e0e4be728d054fcce74b08d26d7acb85594234d","observation_id":"998a9b7f-804e-4023-804a-b80a1f1d82d4","resolution":{"observed_at":"2026-08-06T17:47:39.969754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09989","last_updated":"2025-07-14T07:16:01Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T17:39:58.670661Z","submitted_at":"2025-07-14T07:16:01Z","title":"Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.09989."}