{"as_of":"2026-08-09T22:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31791ddd97d02553828931c6714b47fafe6bd0ae159aaca2f655ed130da91e4b","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:54:06.573779Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.03125/citation-record","integrity":"/paper/2502.03125/integrity","json":"/paper/2502.03125/citation-record.json","paper":"/paper/2502.03125"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-09T05:54:06.484782Z","title":"Exploration by random net- work distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.484782Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:c60007082665cc4eb36c56e9b66a289a575bd3fa0ab234f766743aaa232b0f1a","observation_id":"48f5fa52-df87-417b-8141-0b7224d97926","resolution":{"observed_at":"2026-08-09T05:54:06.484782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.636737Z","title":"The learning rate for the neural networks is uniformly set to 5 × 10−4","venue":null,"work_id":"57a5fa85-101a-48c0-be60-b31638395d8a","year":2019},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.573779Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:7651dd4d23a490edfe829fbfa86d28350d313245b97a1652827ca1b23a29d5a8","observation_id":"552fff4d-4135-4836-968b-14c081cbb5d4","resolution":{"observed_at":"2026-08-09T05:54:06.641532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.758031Z","title":"Multi-agent reinforcement learning as a rehearsal for decentralized planning","venue":null,"work_id":"cf570d00-8711-46d5-be73-75e519503b66","year":2016},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.512935Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:9aaf339050176339e5b45112896bb9c3e5baca69e09fc37207a89ba105f33a1e","observation_id":"1404e1d8-62a7-4700-9fcd-17ae18856a99","resolution":{"observed_at":"2026-08-09T05:54:06.761427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.518834Z","title":"A review of cooperative multi-agent deep reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.518834Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:8713a28d374e1cbab2d99de852dbb91176ffb53b1ab6669e7ba5765733a9e5e6","observation_id":"e687fb5f-3da2-484f-baf3-f2e3aa1980ba","resolution":{"observed_at":"2026-08-09T05:54:06.518834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-08-09T00:58:24.558416Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-08-09T05:54:06.524627Z","title":"The starcraft multi-agent challenge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.524627Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:ccd6a2aa9750087367e3b4fe0b12ff128b18612166aa2651f6f17980a49e6693","observation_id":"b5b26b8c-dd7d-4921-ac1f-8fa888b00e75","resolution":{"observed_at":"2026-08-09T05:54:06.524627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.735420Z","title":"Leibo, Karl Tuyls, and Thore Grae- pel","venue":null,"work_id":"ea566ae0-dc4e-42cd-b68d-4be098db9a72","year":2018},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.530874Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:67ae9d1833d1db475ea3ebdc7ca23b6cc8d6c8bb2acf9a24c66bc66cccc797b3","observation_id":"2757e937-711f-4bd7-ad69-c80edacf0647","resolution":{"observed_at":"2026-08-09T05:54:06.738488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.726933Z","title":"[Tan and Motani, 2023] Chong Min John Tan and Mehul Motani","venue":null,"work_id":"17489a29-8dae-4bf9-aba3-e83e9638c8f2","year":2023},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.533398Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:21de0263a157b91300a61f900f604436cf039d25ea0c928ae9dc6c4f2303f37e","observation_id":"a5b02059-4af0-4f9a-b961-bd9129a3dd41","resolution":{"observed_at":"2026-08-09T05:54:06.729993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.717964Z","title":"Knowledge distillation and student-teacher learning for visual intelligence: A review and new outlooks","venue":null,"work_id":"1d9145f9-bd42-47a7-84c0-131bdcc0c6d2","year":2021},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.535919Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:b9d6d5bcb9e4fe01124c2d34c42a22e5ecc542787c6fc7ca7488787894a81b0a","observation_id":"50471655-d193-4b81-a699-2f054d02c5c1","resolution":{"observed_at":"2026-08-09T05:54:06.721387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01062","last_updated":"2021-10-04T01:36:59Z","snapshot_observed_at":"2026-07-06T09:44:11.377445Z","submitted_at":"2020-08-03T17:52:09Z","title":"QPLEX: Duplex Dueling Multi-Agent Q-Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.01062","snapshot_observed_at":"2026-08-09T05:54:06.539120Z","title":"Qplex: Duplex dueling multi-agent q-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.539120Z"},"links":{"cited_paper":"/paper/2008.01062","citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:2cf3963f1e95201a5d8100e94671c34b1e7f0f96afe724a451e301f54930389c","observation_id":"a6ed0743-853c-437f-859a-e9b410c48b11","resolution":{"observed_at":"2026-08-09T05:54:06.539120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.708613Z","title":"Regularization-adapted anderson acceleration for multi- agent reinforcement learning","venue":null,"work_id":"8636af4d-539f-49b7-82c6-38d9cccf0aa3","year":2023},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.542186Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:514c89cf4d694b5fc24fcec6c1a724ea73b1cce8abd67ce2be66676341325db4","observation_id":"0b511698-04de-4d4e-9c19-e25362176728","resolution":{"observed_at":"2026-08-09T05:54:06.711783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.544898Z","title":"En- hancing collaboration in multi-agent reinforcement learn- ing with correlated trajectories","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.544898Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:c9bad79fcee3540b023ef087f39adde3fc2e043cefa25ae9bac7469883abfbb7","observation_id":"02f6a21c-6f92-4bea-ace6-b8c716b07a55","resolution":{"observed_at":"2026-08-09T05:54:06.544898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.694793Z","title":"Deep multiagent reinforce- ment learning: Challenges and directions","venue":null,"work_id":"f8f78d9f-483b-41b0-9f29-35b3e81473f9","year":2023},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.547666Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:5e02b696fae48a65fc8f808f3a02f0dd927f882964cafa96ace6331f213f9a3a","observation_id":"efd6b89f-c0be-4762-8fae-508fcdbc5254","resolution":{"observed_at":"2026-08-09T05:54:06.698051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-02T17:17:56.296462Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-09T05:54:06.550915Z","title":"A survey on knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.550915Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:a8faa2e65aab64998fcbb5c422e95f86c5ad1ed3be01a828ff9faa8f0a54bcbc","observation_id":"8ddcc6d2-dcce-43ea-8014-c070bc7a4b80","resolution":{"observed_at":"2026-08-09T05:54:06.550915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.684605Z","title":"A comprehensive survey on multi-agent rein- forcement learning for connected and automated vehicles","venue":null,"work_id":"acacbabc-30a8-4d90-bc11-e88a42a56232","year":2023},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.553941Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:e5936585d642080df523306e326ffeed2514aaeb8ea6edaa3d7d240d86e0a74c","observation_id":"2586a3b6-04be-4ae0-a96f-be108bf7cfaa","resolution":{"observed_at":"2026-08-09T05:54:06.687916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.03939","last_updated":"2020-06-09T05:20:11Z","snapshot_observed_at":"2026-07-06T08:56:13.036996Z","submitted_at":"2020-02-10T16:48:03Z","title":"Qatten: A General Framework for Cooperative Multiagent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.03939","snapshot_observed_at":"2026-08-09T05:54:06.556573Z","title":"Qatten: A general framework for coopera- tive multiagent reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.556573Z"},"links":{"cited_paper":"/paper/2002.03939","citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:0c4e4d8dd8d677c0381a510cd2e40d0961f5563df257bfb11d157d5c6de70c95","observation_id":"6b275445-775f-4696-8925-8a90c405438f","resolution":{"observed_at":"2026-08-09T05:54:06.556573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.560228Z","title":"The surprising effectiveness of ppo in cooperative multi-agent games","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.560228Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:2f80355b057b13ad8eff45d44697675da49737c9b050093173864f29fd952af7","observation_id":"637f0a19-6f55-459a-be36-0952e487841a","resolution":{"observed_at":"2026-08-09T05:54:06.560228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.670940Z","title":"Unmanned aerial vehicle swarm cooperative decision-making for sead mis- sion: A hierarchical multiagent reinforcement learning ap- proach","venue":null,"work_id":"2d09d83c-aa0a-4703-b053-ca9a077fc73e","year":2022},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.562863Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:cde8b272d5b434b5e2feeb20eca02bdcd78ee52921fdc743ac93bb9a6337f370","observation_id":"61ddb500-7886-4255-badd-21fde4199a89","resolution":{"observed_at":"2026-08-09T05:54:06.674054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.662040Z","title":"Ctds: Centralized teacher with decentralized student for mul- tiagent reinforcement learning","venue":null,"work_id":"2a833de4-9477-4d62-a1f8-95d19cf578be","year":2022},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.565564Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:23e8486848f36c3f256f2b1adc2f1865ef7e8762f6e3f5cbcb5c22e02d2875a4","observation_id":"a27919d6-9bef-4f0a-b71d-5001f75d1df3","resolution":{"observed_at":"2026-08-09T05:54:06.665212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.568133Z","title":"Qdap: Downsizing adaptive policy for cooperative multi-agent reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.568133Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:cd7ae21c333288df1ade9ddb839f0e2cf3d778d096c21f037822c88089d51bcf","observation_id":"05ad1047-7ed1-43f9-a2db-1217bd85ded3","resolution":{"observed_at":"2026-08-09T05:54:06.568133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.647924Z","title":"Multirobot collaborative task dynamic scheduling based on multiagent reinforcement learning with heuristic graph convolution considering robot service performance","venue":null,"work_id":"204c7f70-5b39-49f6-8a0c-143fa1b84c41","year":2024},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.571083Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:c1699f67ab82bd4c8e33c771c0ac0fb5960e4ece8d22c31c865bfa088e2fac64","observation_id":"66fafe73-7433-4bff-830e-edc9a625f629","resolution":{"observed_at":"2026-08-09T05:54:06.651425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.784259Z","title":"Rethinking individual global max in cooperative multi- agent reinforcement learning","venue":null,"work_id":"1d41c2cc-3224-49bc-82cf-1ae52663b05d","year":2022},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.503483Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:f090769841ab4d81f54e23cbfad6f3e2152d3bab3b78d26ebada983b1ddd165a","observation_id":"78f83113-7418-44f7-ad00-7baf8001470c","resolution":{"observed_at":"2026-08-09T05:54:06.787355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.516162Z","title":"A concise introduction to decentralized POMDPs, volume","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.516162Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:0afef4c0f15c4932e3ee518a9c67b99fee3e509d7efaba0593ac21bf458c24c7","observation_id":"0f8ea0de-e950-4414-8c5b-33cbe4911f08","resolution":{"observed_at":"2026-08-09T05:54:06.516162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.811615Z","title":"Ptde: Personalized training with dis- tilled execution for multi-agent reinforcement learning","venue":null,"work_id":"eeab5643-ed0b-45d2-a4db-e34006326760","year":2024},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.493454Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:f4418a23e19922c0b5412dc618e4410263c846a02f0cb0ec8ba7fc93da572f1b","observation_id":"565be0e4-968d-4fb5-8edf-5854024a28dc","resolution":{"observed_at":"2026-08-09T05:54:06.815173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.527659Z","title":"Qtran: Learn- ing to factorize with transformation for cooperative multi- agent reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.527659Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:0709e9af01de7fc0d9d0c2c76e06f72364d291005766ba435eff9160f4218f88","observation_id":"14790022-c54d-44db-892d-caad3236684c","resolution":{"observed_at":"2026-08-09T05:54:06.527659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-09T05:54:06.521520Z","title":"Policy distillation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.521520Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:15d626f3fbba2374e26217957e125156220bb6dc916b744b721cc2e980f94946","observation_id":"235ba8c1-eaa0-4f1a-b396-d1547713155e","resolution":{"observed_at":"2026-08-09T05:54:06.521520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.793277Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":"c1d9f052-1728-407b-a1c5-44682f4e68e8","year":2015},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.500552Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:a4ca6d8480d728ecf843a46d0cdd426acf46aa886174b59a883964e24159da5d","observation_id":"702019eb-c527-456e-9f4e-35afaff8472a","resolution":{"observed_at":"2026-08-09T05:54:06.796392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.775718Z","title":"Rethinking the implementation tricks and monotonicity constraint in cooperative multi-agent re- inforcement learning","venue":null,"work_id":"789987c2-c887-4178-b2de-c04f1b28d5eb","year":2023},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.507148Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:d7b8ad7017d0ba9ce3ff1a810200232a76e8fd33ceb67e063b9a40e699a20e6a","observation_id":"5ada8b0b-73c4-4fd4-9799-87597cad877e","resolution":{"observed_at":"2026-08-09T05:54:06.778819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.767007Z","title":"[Huang et al., 2024] Anqi Huang, Yongli Wang, Xiaoliang Zhou, Haochen Zou, Xu Dong, and Xun Che","venue":null,"work_id":"786cf2e1-57b6-46ea-b547-77260d72319c","year":2023},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.510263Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:26bf135062e3779abcfd940e49aa61122e4e0e9558c85025cdc20fb892548ea4","observation_id":"79c5c1e2-f014-41c4-b1eb-e8be8436a3b9","resolution":{"observed_at":"2026-08-09T05:54:06.770076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T05:54:06.802881Z","title":"[Gou et al., 2021] Jianping Gou, Baosheng Yu, Stephen J Maybank, and Dacheng Tao","venue":null,"work_id":"81f82b20-15d1-4276-9149-037d1c9d5319","year":2021},"citing_paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T05:54:06.497073Z"},"links":{"citing_paper":"/paper/2502.03125"},"observation_digest":"sha256:1537fdb56ca8942a788a0a237c5d34add795f5e81b679aba152a282bb583362d","observation_id":"792082a7-e14b-46e9-b124-1d85147ce2ea","resolution":{"observed_at":"2026-08-09T05:54:06.806080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.03125","last_updated":"2025-02-05T12:31:55Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-09T05:47:56.856313Z","submitted_at":"2025-02-05T12:31:55Z","title":"Double Distillation Network for Multi-Agent Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2502.03125."}