{"as_of":"2026-08-06T17:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c44a7fcaaea7d094b1f5d19a6454a556227b68ce82ece264f057f3af32666210","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T11:08:51.426575Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07548/citation-record","integrity":"/paper/2506.07548/integrity","json":"/paper/2506.07548/citation-record.json","paper":"/paper/2506.07548"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on multi-agent reinforcement learning and its application","venue":null,"work_id":"f9c70f3f-29c9-4e7c-93a5-dd2c5f7610bd","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:d66b6b9e070dcb596083d7674b9dd464437aecedfd9c88ef176f756db2b17e1e","observation_id":"7fa6a324-0853-4ec1-9ecc-abf1cf55bcfd","resolution":{"observed_at":"2026-05-19T11:12:16.176673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey on multi-agent reinforcement learning for connected and automated vehicles","venue":null,"work_id":"20df1a1a-e4c9-4110-bf25-5f1ba889e748","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:f371e301cd47ea72b83a1dafb16b58da19d87c8875747e04b28098081eadf6a1","observation_id":"a6a66adf-e6fe-4cc6-8731-f95e7d3f33da","resolution":{"observed_at":"2026-05-19T11:12:16.174462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.339258","doi":"10.1109/tvcg.2024.3392587","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Marlens: Understanding multi-agent reinforcement learning for traffic signal control via visual analytics","venue":"IEEE Transactions on Visualization and Computer Graphics","work_id":"ff3163b4-f1c9-43ad-b44d-a4abe388affc","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:b38b6a255872a835cb405d0769a02853da25621d6538d62fd1438049821603bc","observation_id":"4264b629-d50d-49ae-bf20-04ab19aea8ee","resolution":{"observed_at":"2026-05-19T11:12:15.373302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09675","last_updated":"2024-08-19T03:31:20Z","snapshot_observed_at":"2026-07-06T19:02:15.690517Z","submitted_at":"2024-08-19T03:31:20Z","title":"Multi-Agent Reinforcement Learning for Autonomous Driving: A Survey","version":1},"cited_work":{"arxiv_id":"2408.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.09675","snapshot_observed_at":"2026-07-04T11:39:46.363672Z","title":"Multi-Agent Reinforcement Learning for Autonomous Driving: A Survey","venue":null,"work_id":"6adea064-1d4e-4cb3-8d76-aaa36da6bed9","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/2408.09675","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:277a253162c23a0f91a6aaad82a7848bd6bafd9e81107ac7f18326497bf0e4ba","observation_id":"b1ef45a9-d453-4972-8192-06249d9c3230","resolution":{"observed_at":"2026-05-19T11:12:15.552234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10458-023-09633-6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey of multi-agent deep reinforcement learning with communication","venue":"Autonomous Agents and Multi-Agent Systems","work_id":"92e90b48-4113-40ca-a047-f82f18ebe6c2","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:fe614eedc5f22bc874f042f9cea2b5eee2a80d6089757e8a1d854e87ebfa3613","observation_id":"e60134e6-dd69-48da-804b-a7c2cf4701b5","resolution":{"observed_at":"2026-05-19T11:12:15.384062Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-07-11T03:19:07.292559+00:00","source":"paper_reference_links","state":"open"},"event_date":"2024-03-16","event_type":"correction","notice_doi":"10.1007/s10458-024-09644-x","provenance":{"observed_at":"2026-07-11T03:07:50.406185+00:00","source":"crossref","source_record_id":"10.1007/s10458-024-09644-x->10.1007/s10458-023-09633-6:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning: A survey","venue":null,"work_id":"1044e88a-421d-4479-bf98-87c669728443","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:602273b0734f5bad8b45a2acbf78fae99630279c043a4e3fd0f010f22d81c45b","observation_id":"e817814d-60e2-457c-9269-35bdf3f97a70","resolution":{"observed_at":"2026-05-19T11:12:16.159161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weighted qmix: expanding monotonic value function factorisation for deep multi-agent reinforcement learning","venue":null,"work_id":"f9d395ba-f735-4a4b-ac3a-606f27aeb909","year":2020},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:256917d413796ecd655754bc08b4ed551c5dc2badb0589f3940f2c73fd31699a","observation_id":"e875f140-d7b1-4094-b95b-503a2f59ff12","resolution":{"observed_at":"2026-05-19T11:12:16.161429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Episodic multi-agent reinforcement learning with curiosity- driven exploration","venue":null,"work_id":"37b35768-092b-4b4e-8c83-e4f26879b3c1","year":2021},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:eddc8ff64643741a791275ede27702cf759853d4a3f73e3e3a121469f2af0960","observation_id":"a9961338-6965-436c-a4eb-f5df2bba6ca5","resolution":{"observed_at":"2026-05-19T11:12:16.154801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emu: Efficient episodic memory utilization of cooperative multi-agent reinforcement learning","venue":null,"work_id":"1d2c978c-0b6b-41e3-9f9f-f00d62a6aaf0","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:0989032d29a7d47637b584882b01b7c0b594d6f0913b48a699867b6a89d8ca7c","observation_id":"79164b48-ec60-4a69-9a84-e5c8ae8cc421","resolution":{"observed_at":"2026-05-19T11:12:16.152821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3459991","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey of reinforcement learning algorithms for dynamically varying environments","venue":"ACM Computing Surveys","work_id":"ccc2968d-e1de-4168-b9af-611183fdeab4","year":2022},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:d130f2bf67d13ad23b1c8ec610a96f939481f13ac4c39a34c40b4fbd3fabb2bb","observation_id":"1c64f3b7-67a7-4d46-be07-f370a00e785b","resolution":{"observed_at":"2026-05-19T11:12:15.381754Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.09183","last_updated":"2019-03-11T20:17:29Z","snapshot_observed_at":"2026-07-06T05:53:08.086224Z","submitted_at":"2017-07-28T10:49:41Z","title":"A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity","version":2},"cited_work":{"arxiv_id":"1707.09183","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.09183","snapshot_observed_at":"2026-07-05T06:00:43.849924Z","title":"A Survey of Learning in Multiagent Environments: Dealing with Non-Stationarity","venue":"cs.MA","work_id":"b84216cf-59cc-4716-8c58-fcfdd7218613","year":2017},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/1707.09183","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:fb3a331983052d72539174c68cf889317182b6077c2aa14bee94bf6fbd6354a8","observation_id":"ba868521-54a0-4eeb-8d17-1215d06026e8","resolution":{"observed_at":"2026-05-19T11:12:15.533776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-07-06T07:32:24.974529Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":"1902.04043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-07-04T19:30:07.613613Z","title":"S., Farquhar, G., Nardelli, N., Rudner, T","venue":null,"work_id":"2f26b259-cf76-40f3-b027-6946ef7763c8","year":1902},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:d4053908ae65a663a910a6c44cd6d65243143150f0c41696cc8ad93e95995a27","observation_id":"ecc5c207-bda1-405e-96f9-fc50c19aaaeb","resolution":{"observed_at":"2026-05-19T11:12:15.527732Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SMACv2: An improved benchmark for cooperative multi-agent reinforcement learning","venue":null,"work_id":"8b5e3312-6f8c-427d-9e86-b89a64dd4eb1","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:54094c0d9d1668d009bdb360b515fc6c01afcc9f6541ab2238a36b88f23113ce","observation_id":"62209474-2270-4fa6-b4cf-cfd2558de696","resolution":{"observed_at":"2026-05-19T11:12:16.172558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on curriculum learning","venue":null,"work_id":"852a0777-9eeb-4594-b59c-ad49c653ffbf","year":2022},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:85be9e01168d6ea894ae2af2c9b9e0d6ec88e941e66af6a90ea41e4fa10ecd0b","observation_id":"d81b91bc-55f9-4533-af4b-2bb589c21cc7","resolution":{"observed_at":"2026-05-19T11:12:16.144601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:fdcd9a4def954a45fabf380a2b9581f925c9ef6b7d53255ac1905434f90f7f9c","observation_id":"588abd56-c028-45c3-b2a8-cef14516287d","resolution":{"observed_at":"2026-05-19T11:12:15.536641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":"833dc6b6-8185-4a09-8fc3-e56211b89c3d","year":2018},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:479d1e7a2f6b0458c427752c3d3ebdea061b74f41c80886fbf61861ee4afc030","observation_id":"cc91dc0d-3ddb-4cec-b056-da5754061c71","resolution":{"observed_at":"2026-05-19T11:12:16.140405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monotonic value function factorisation for deep multi- agent reinforcement learning","venue":null,"work_id":"bd63f05c-911c-4711-9cbd-6d2025712537","year":2020},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:05b2799ec0fe25f301b217ab2ee039ffc413d62bac1b5940a90d0edbb1cff371","observation_id":"f6b5ba46-8fad-4c5d-a37e-9bc7e13145fa","resolution":{"observed_at":"2026-05-19T11:12:16.150809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discriminative experience replay for efficient multi- agent reinforcement learning","venue":null,"work_id":"c48e347e-ee1b-45db-9f76-de27a162d205","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:27633650b31c7bd6d1fbc5b905003d14df469c15ba26fa0a108ba72df6436e49","observation_id":"8457f65e-2143-4303-9cc2-fa357808a64c","resolution":{"observed_at":"2026-05-19T11:12:16.142626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04737","last_updated":"2019-06-11T09:42:00Z","snapshot_observed_at":"2026-08-01T21:07:35.425706Z","submitted_at":"2019-06-11T09:42:00Z","title":"Dealing with Non-Stationarity in Multi-Agent Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1906.04737","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.04737","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dealing with Non-Stationarity in Multi-Agent Deep Reinforcement Learning","venue":"cs.LG","work_id":"8a635422-e918-4c23-8466-06f330515a49","year":2019},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/1906.04737","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:8bcd8c952e0ae6c514628ea2f754d1684d46839ddeed5a1d8b698e44bbb7bb5e","observation_id":"b941258a-95ae-4172-a86d-9435420f5286","resolution":{"observed_at":"2026-05-19T11:12:15.549194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dealing with non- stationarity in MARL via trust-region decomposition","venue":null,"work_id":"839935b7-4c2c-40c3-8591-4d3d43681276","year":2022},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:442bde22bcc2ad8f0d6d1eb5d3fd73bceeda70e87fb419fb8033557a5d6868ac","observation_id":"4278ca5b-09f7-47d7-bb87-c9db5b38ab1f","resolution":{"observed_at":"2026-05-19T11:12:16.099054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tackling non-stationarity in decentralized multi-agent reinforcement learning with prudent q- learning","venue":null,"work_id":"13a14439-5b36-4c33-8a12-1c3ce583e1ae","year":2022},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:fb1a4398ac2e467355408d4066d074480f71fc6b87622a97643a0564126f7760","observation_id":"1ca85564-b158-442b-b36b-e271b90f0eb0","resolution":{"observed_at":"2026-05-19T11:12:16.106247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dealing with non-stationarity in decentralized cooperative multi-agent deep reinforcement learning via multi-timescale learning","venue":null,"work_id":"29e772f3-0655-42fc-92fd-f6b5ea66b01e","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:f5316e102e2df05a3f241b96f4199d8b2f3355ab10214e0dd565c22de36ed8c5","observation_id":"05aa0ca2-b337-4907-9b98-f1ac5d0df478","resolution":{"observed_at":"2026-05-19T11:12:16.166324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monotonic improvement guarantees under non- stationarity for decentralized PPO","venue":null,"work_id":"c6b8c2e2-3bff-46fe-a130-b6cdfe2d97b9","year":2022},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:205ba145b671ec840ef7755df8a904e7c02e07bfd29f6602cc4a2839a2e733a9","observation_id":"e709aba6-7510-4e62-9d4a-2df09df715b5","resolution":{"observed_at":"2026-05-19T11:12:16.133809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Value-decomposition networks for cooperative multi-agent learning based on team reward","venue":null,"work_id":"4bab775f-b258-4344-a50b-677c610f1ab5","year":2018},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:7fb191f3e94e5b3fe7de16cbdc57fa56778312cad074ee3d640fa2aab30b0737","observation_id":"e644fa80-0a46-4153-8ad2-698557c5c9f3","resolution":{"observed_at":"2026-05-19T11:12:16.122003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05408","last_updated":"2019-05-14T06:29:51Z","snapshot_observed_at":"2026-07-06T07:52:46.414945Z","submitted_at":"2019-05-14T06:29:51Z","title":"QTRAN: Learning to Factorize with Transformation for Cooperative Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1905.05408","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.05408","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QTRAN: Learning to Factorize with Transformation for Cooperative Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"bbf2f053-09ec-4bb6-a9d6-c8ca46a0195c","year":2019},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/1905.05408","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:5e736151d0a710cceb355f2fff08f8f4615de2eb630d28a612ecf55ab7288701","observation_id":"6bd3e3c6-1887-42a3-b997-db2c04901e0e","resolution":{"observed_at":"2026-05-19T11:12:15.515186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10458-024-09665-6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Team-wise effective communication in multi- agent reinforcement learning","venue":"Autonomous Agents and Multi-Agent Systems","work_id":"eac3b2fc-4ae1-4c1b-a5c2-bfbcebf36e37","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:603ae402ad0dcfbfb2ca6915707076dee4003e5aaa99598d66c6bd9e0c483a51","observation_id":"c1829183-134b-4ba1-b4b0-18623b4feb9c","resolution":{"observed_at":"2026-05-19T11:12:15.393439Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable communication for multi- agent reinforcement learning via transformer-based email mechanism","venue":null,"work_id":"d30939db-2896-4c9a-90f6-62b88f3423a4","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:43314d72f4c7248f11d19e19258ca4c90b5591122fdb5a5efb4777c92b7c36ef","observation_id":"2b4ab3f2-fa57-4167-879e-eb26ad787282","resolution":{"observed_at":"2026-05-19T11:12:16.124547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ac2c: Adaptively controlled two-hop communication for multi-agent reinforcement learning","venue":null,"work_id":"7c70db30-71ef-4df9-885c-2e0fb6262aa0","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:f89a87f635da61a3c68d39c20653f8f8ef57f4893bded999cea50f7fd2c0efa2","observation_id":"8f29bd60-ff08-4799-be3c-e5f2ba6cb7c9","resolution":{"observed_at":"2026-05-19T11:12:16.129413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Communication in multi-agent reinforcement learning: Intention sharing","venue":null,"work_id":"a72ac1e7-8b86-49a5-a40a-784dea2b1019","year":2021},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:6aea38c072bf831f95fc6845ba673e60acc4827f332e0781552947460e227e2c","observation_id":"681e70c1-bcf2-40cb-b08d-b11cc9476874","resolution":{"observed_at":"2026-05-19T11:12:16.110986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A sequen- tial multi-agent reinforcement learning framework for different action spaces","venue":null,"work_id":"89882cc5-626c-4090-a814-40721da32e8d","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:20152df80eb8fa35163f415bbd93db286bb5902424cae0abe75004c3e779f1f7","observation_id":"f81c8048-5762-4d14-9818-05604413415f","resolution":{"observed_at":"2026-05-19T11:12:16.113073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing high-dimensional continuous action space via decomposed discrete policy-critic","venue":null,"work_id":"93e3d023-e944-4d3c-a915-f22e283b0640","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:46e0e67301445eb169d9a99ceb2f2ebc12f312ac67e4e783d9cdae8a0b79b910","observation_id":"9ec9337a-6685-4716-803a-84c6e66e4d8f","resolution":{"observed_at":"2026-05-19T11:12:16.119805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D- marl: A dynamic communication-based action space enhancement for multi agent reinforcement learning exploration of large scale unknown environments","venue":null,"work_id":"00491bf8-358a-4bec-b619-120bb9dfa3ed","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:6080c93a59463964f1338d694fb5de05bb5a9a02704bc377887fe05967d1476f","observation_id":"d9b86bab-2a56-4e04-bbce-07778687e15f","resolution":{"observed_at":"2026-05-19T11:12:16.127042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cooperative modular reinforcement learning for large discrete action space problem","venue":null,"work_id":"eb39260f-2c0b-48b2-a0ab-c9282a2814c9","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:93b2754e2fd702f659cd5f58d93a039a7ebc1ec40e05a5298812dd957f64ecf5","observation_id":"c368e025-1df5-4fdf-bf91-ecca7d30651e","resolution":{"observed_at":"2026-05-19T11:12:16.138372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.323636","doi":"10.1109/tnnls.2023.3236361","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration in deep reinforcement learning: From single-agent to multiagent domain","venue":"IEEE Transactions on Neural Networks and Learning Systems","work_id":"53020e4a-b3b4-46b5-a528-1bdae7dddc7d","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:cd5f391b7c48bbaa78d8e3fefd43cd7718cc14cc211381e44f5ceb850a3365cd","observation_id":"f2841c80-b544-401a-80df-7fc89409c91f","resolution":{"observed_at":"2026-05-19T11:12:15.379284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:22:58.926104+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:22:58.926104+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking exploration and experience exploitation in value-based multi-agent reinforcement learn- ing","venue":null,"work_id":"661fe6dd-82c1-42fe-9e74-af2746ee6281","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:b2a31500dd85921bbf6556f265b8dddc7af9b14b59fb0b3685f78821ef590df7","observation_id":"c5014f46-13e1-4b75-a081-c2c7d71e083e","resolution":{"observed_at":"2026-05-19T11:12:16.108434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable evaluation of multi-agent reinforcement learning with melting pot","venue":null,"work_id":"47dd3822-4050-4286-9beb-16f25d2a237e","year":2021},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:b095e7b6e506e961137d804ff4411752123e8f35223a673b1271b77b55e54d66","observation_id":"6df1a2fa-5992-46c3-9fee-e9eb29b17a3e","resolution":{"observed_at":"2026-05-19T11:12:16.117478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample-efficient multiagent reinforcement learning with reset replay","venue":null,"work_id":"2c9bace5-c318-4a6a-98d7-ad2e7226eec6","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:b794263799ab9e729d96cd090b68d95fda21f6d87fdcdc7f5da8fbf93cb38485","observation_id":"34b8e147-dab5-46a9-b494-dacd214514b8","resolution":{"observed_at":"2026-05-19T11:12:16.131494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self- organized group for cooperative multi-agent reinforcement learning","venue":null,"work_id":"d1c09eb4-c585-4829-ae76-55239b902977","year":2022},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:dd779b66880b94b2ae006def8ff8171cd1f019729a697a168603a0828379d9c6","observation_id":"22d7f1f8-5dbf-4f12-ad22-26194c77f6c0","resolution":{"observed_at":"2026-05-19T11:12:16.168640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i04.5878","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Google research football: A novel reinforcement learning environment","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"71c03650-acde-48ea-be10-a68baf39a41b","year":2020},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:fea89fa6b2c17671c84dcd4d39d51c4c90bc45f1433fe13a70bfd2f5744432e3","observation_id":"59a4aafd-66da-44ae-a73e-2bd64e3931bd","resolution":{"observed_at":"2026-05-19T11:12:15.375837Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T23:23:23.154335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T23:23:23.154335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.07124","last_updated":"2022-04-21T13:52:02Z","snapshot_observed_at":"2026-07-06T07:03:04.423446Z","submitted_at":"2018-09-19T11:27:25Z","title":"Pommerman: A Multi-Agent Playground","version":2},"cited_work":{"arxiv_id":"1809.07124","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1809.07124","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pommerman: A multi- agent playground","venue":null,"work_id":"a3d3f509-6547-41a8-93d2-8f5bbad4f43d","year":2018},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/1809.07124","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:be4101aa751eee362284f472e74671407824590ae1e4b23967516892e46e8c15","observation_id":"069fb439-390c-4f54-8954-76a4daa4e3b9","resolution":{"observed_at":"2026-05-19T11:12:15.530792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07594","last_updated":"2021-10-14T17:54:49Z","snapshot_observed_at":"2026-08-04T11:42:07.194004Z","submitted_at":"2021-10-14T17:54:49Z","title":"The Neural MMO Platform for Massively Multiagent Research","version":1},"cited_work":{"arxiv_id":"2110.07594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07594","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The neural mmo platform for massively multiagent research","venue":null,"work_id":"cda4c900-8c20-4c1c-b93d-6fc3bf2e9a79","year":2021},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/2110.07594","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:4ec13b5d16056401f846ed48ecf75d9fa5d92b0a3b9eb8d1fe6b9e526c4e884f","observation_id":"b443bf14-cb00-4f18-9b96-dbd5f29398b6","resolution":{"observed_at":"2026-05-19T11:12:15.518312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking multi-agent deep reinforcement learning algorithms in cooperative tasks","venue":null,"work_id":"b5fed212-9cae-4430-824d-185efc55bce5","year":2021},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:f99ee5c438c9c4968827ba18e2a4d7ec41d2449b5cfd93b163959e3b89e1819c","observation_id":"0c6551ca-620b-4595-be86-ac8754e41ff0","resolution":{"observed_at":"2026-05-19T11:12:16.103922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on multi-agent reinforcement learning and its application","venue":null,"work_id":"b155e648-a245-484d-ad4b-91a1e5ab171e","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:909c6e838668a2a35b21d66de21b2abd12c413c92086af88377367659bbc0c14","observation_id":"51f91da0-7c9b-4f6f-8383-20d752cbdc6e","resolution":{"observed_at":"2026-05-19T11:12:16.101145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13415","last_updated":"2025-03-17T17:45:46Z","snapshot_observed_at":"2026-08-02T16:49:09.689912Z","submitted_at":"2025-03-17T17:45:46Z","title":"A Comprehensive Survey on Multi-Agent Cooperative Decision-Making: Scenarios, Approaches, Challenges and Perspectives","version":1},"cited_work":{"arxiv_id":"2503.13415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13415","snapshot_observed_at":"2026-07-02T11:16:53.377341Z","title":"A com- prehensive survey on multi-agent cooperative decision-making: Scenarios, approaches, challenges and perspectives","venue":null,"work_id":"e594fe66-ecab-46b9-8648-35c4d3a5dfd2","year":2025},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/2503.13415","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:adf9ae1fb792c0892a1508fe2a10c2f275e74cd4c82343e3956735ea0cfdd680","observation_id":"8c38fe42-1ce9-4ed0-ba90-1b18238e6998","resolution":{"observed_at":"2026-05-19T11:12:15.539994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-28929-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A concise introduction to decentralized POMDPs, volume 1","venue":"SpringerBriefs in intelligent systems","work_id":"de4327a3-26af-4d7f-9d7c-545c673f0466","year":2016},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:2f9d134854555ba01215de66ac8e409f56c4409dc7f447c33a1a98b8bb96c7a2","observation_id":"984784e3-839e-4323-bd40-9eabdd7c9020","resolution":{"observed_at":"2026-05-19T11:12:15.386684Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:52:37.706359+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:52:37.706359+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cooperative multi-agent control using deep reinforcement learning","venue":null,"work_id":"b7702efd-a603-4356-99d8-80c66cb01520","year":2017},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:db0a7b06d95cbc89e0596b599a8ca245433754f9cd689f66bed4521d4ef14f0f","observation_id":"07c6ba2a-f762-4824-a383-bebfcc409986","resolution":{"observed_at":"2026-05-19T11:12:16.115326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi agent deep reinforcement learning with deep q-network based energy efficiency and resource allocation in noma wireless systems","venue":null,"work_id":"a9da77b1-fb7b-4201-be1b-545509b28e27","year":2023},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:d828c58c0b54e44b09db52964db00caf21cf4566a149f33bb6c55e3894bdae9d","observation_id":"936e4ac7-f1e3-440c-8576-5e3f103348af","resolution":{"observed_at":"2026-05-19T11:12:16.179189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04109","last_updated":"2020-08-06T15:16:05Z","snapshot_observed_at":"2026-07-06T09:45:54.025058Z","submitted_at":"2020-08-06T15:16:05Z","title":"Deep Q-Network Based Multi-agent Reinforcement Learning with Binary Action Agents","version":1},"cited_work":{"arxiv_id":"2008.04109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.04109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep q-network based multi-agent reinforcement learning with binary action agents","venue":null,"work_id":"d4f5d80a-945d-4f8a-9196-2558db4725d7","year":2020},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/2008.04109","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:8867e2a35a5bc6255237c3a53726216460f4b2c0b6750352ba88a3363a3aa0ee","observation_id":"9c452e70-daf3-4043-bac1-14aa5721165a","resolution":{"observed_at":"2026-05-19T11:12:15.546177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The dynamics of reinforcement learning in cooperative multiagent systems","venue":null,"work_id":"8c3b0c8b-15d2-490d-8b51-f3d350234bee","year":1998},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:6156a6921388f9aa1797520be5329f70377e9c726196e17362090b016cb8f815","observation_id":"115426cf-df8f-4859-b2ac-899cf8841013","resolution":{"observed_at":"2026-05-19T11:12:16.170507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Centralized training with decentralized exe- cution reinforcement learning for cooperative multi-agent systems with communication delay","venue":null,"work_id":"9312b657-59ff-4673-a913-039b9b39b800","year":2022},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:39be69cab7dd2f5462d5c08fd84bff76fe945f98b529096431575409701ddaec","observation_id":"d8cd3f2c-7f03-4ccd-a776-8a524cd3d12e","resolution":{"observed_at":"2026-05-19T11:12:16.181385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03052","last_updated":"2024-09-04T19:54:40Z","snapshot_observed_at":"2026-08-06T12:46:14.487556Z","submitted_at":"2024-09-04T19:54:40Z","title":"An Introduction to Centralized Training for Decentralized Execution in Cooperative Multi-Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2409.03052","doi":"10.48550/arxiv.2409.03052","metadata_source":"pith","pith_arxiv_id":"2409.03052","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An introduction to centralized training for decentralized execution in cooperative multi-agent reinforcement learning","venue":"cs.LG","work_id":"f490d83e-5af5-4df1-a209-43725a3eba07","year":2024},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/2409.03052","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:f51b0fc6f2268b9c1c6e2a9bc3089472a1d8b45947d7ae0526266ad4f4693709","observation_id":"1099799c-3f0b-4b0c-9b86-453c0e31561f","resolution":{"observed_at":"2026-05-19T11:12:15.521735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T11:18:56.949796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T11:18:56.949796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games","venue":null,"work_id":"4873a92f-2bf6-49b9-8082-43fbed759b8c","year":2022},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:1b67b864e6e02665c0f06177d53bf0c19dc701cb7fd9f1009fccf3178e0dc31e","observation_id":"d1c7f064-ba8f-4a56-af65-1fa8ab84a91a","resolution":{"observed_at":"2026-05-19T11:12:16.163669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi- agent actor-critic for mixed cooperative-competitive environments","venue":null,"work_id":"8b567b8e-7f48-4d93-b0e3-7b3cec0b4d56","year":null},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:5019f82ab33ad6a3b106252ffd7fd858ac7cdf7b428526cb2776def2ebeb2aa4","observation_id":"9e219d8f-4b50-4b30-95ec-2dc62869b603","resolution":{"observed_at":"2026-05-19T11:12:16.157090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02275","last_updated":"2020-03-14T20:33:00Z","snapshot_observed_at":"2026-08-04T19:23:21.346128Z","submitted_at":"2017-06-07T17:35:00Z","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","version":4},"cited_work":{"arxiv_id":"1706.02275","doi":"10.48550/arxiv.1706.02275","metadata_source":"arxiv_reference","pith_arxiv_id":"1706.02275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments","venue":"arXiv (Cornell University)","work_id":"2b7ccc21-1bc7-4578-8d2c-81638610733e","year":2020},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/1706.02275","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:68487533153bef66afe00b9c749719ad67e5f722e3080d6b6c1d1f4c9c46a41b","observation_id":"91c5ef38-5182-4a1d-982f-3abd5bb0ba93","resolution":{"observed_at":"2026-05-19T11:12:15.543253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3374.155338","doi":"10.1145/1553374.1553380","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Curriculum learning, in: Proceedings of the 26th Annual International Conference on Machine Learning, Associa- tion for Computing Machinery, New York, NY, USA","venue":null,"work_id":"5d30e737-af53-4f1d-8f90-c8e0159a22ba","year":2009},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:a185914a92eb0393e79bc32494ec95b58c4c99e0bef0cd02b50bf956f0d15190","observation_id":"ae42e91b-1b07-4bc0-b5f3-87bf3624232e","resolution":{"observed_at":"2026-05-19T11:12:15.390481Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T01:20:08.326125+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T01:20:08.326125+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-paced learning for latent variable models","venue":null,"work_id":"ac628844-99cc-4e7f-b52f-8e51246f6522","year":null},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:f5d9dcd50d9fe54d241a03aaa0b51c527aa0040b5ef15538e090819ed405620f","observation_id":"8468a40a-ab0f-4080-921d-7b49b7d06fd8","resolution":{"observed_at":"2026-05-19T11:12:16.146799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Available: https://proceedings.neurips.cc/paper files/ paper/2010/file/e57c6b956a6521b28495f2886ca0977a-Paper.pdf","venue":null,"work_id":"128b3cba-b40d-42ae-9426-2fb02da6e9a7","year":2010},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:fc6ead016f2691ec9d82012a174d3398e3408c6a8141cf13750ef57cb65e5b6b","observation_id":"1fe699bd-a495-4950-9b05-d576c0219a83","resolution":{"observed_at":"2026-05-19T11:12:16.135966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.07193","last_updated":"2018-12-27T09:29:31Z","snapshot_observed_at":"2026-08-02T00:50:13.408785Z","submitted_at":"2018-09-19T13:45:47Z","title":"TStarBots: Defeating the Cheating Level Builtin AI in StarCraft II in the Full Game","version":3},"cited_work":{"arxiv_id":"1809.07193","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.07193","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TStarBots: Defeating the Cheating Level Builtin AI in StarCraft II in the Full Game","venue":"cs.AI","work_id":"eed62813-b359-4a57-a606-25edb3ef2383","year":2018},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"cited_paper":"/paper/1809.07193","citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:2962550d31198ea9c18490f91c4a87ad58a887e730401953df850bc4a5a0cae1","observation_id":"1d11207a-4075-47ee-afdc-12c95bab9dd2","resolution":{"observed_at":"2026-05-19T11:12:15.524547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qplex: Duplex dueling multi-agent q-learning","venue":null,"work_id":"91dcd4ba-726d-4c01-bb66-6fdadded9d12","year":2021},"citing_paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:51.426575Z"},"links":{"citing_paper":"/paper/2506.07548"},"observation_digest":"sha256:30dd9d861efba322feabde8211525374a043f6a3dc26c090323a89cc73ff1b01","observation_id":"91b17226-a61a-4b96-ac66-e242b95fd14f","resolution":{"observed_at":"2026-05-19T11:12:16.148694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07548","last_updated":"2026-05-06T13:16:33Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T08:38:18Z","title":"Overcoming Environmental Meta-Stationarity in MARL via Adaptive Curriculum and Counterfactual Group Advantage"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":38},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2506.07548."}