{"as_of":"2026-08-06T18:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:640d019a06bc48c8731cb79af963327a12bd3d213bcedaba24b8693c97a80324","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T08:32:51.215581Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T03:17:09.608451Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T03:24:28.854619Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"cited_work":{"arxiv_id":"2606.23995","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.23995","snapshot_observed_at":"2026-07-08T03:24:28.854619Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","venue":"cs.LG","work_id":"b4e97278-b394-413a-bdd1-d058a11b57a0","year":2026},"citing_paper":{"arxiv_id":"2607.06514","last_updated":"2026-07-07T17:18:44Z","snapshot_observed_at":"2026-07-10T23:18:27.878119Z","submitted_at":"2026-07-07T17:18:44Z","title":"FootsiesGym: A Fighting Game Benchmark for Two-Player Zero-Sum Imperfect-Information Games","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-08T03:17:09.608451Z"},"links":{"cited_paper":"/paper/2606.23995","citing_paper":"/paper/2607.06514"},"observation_digest":"sha256:d209876c6b9f0b18559d34ad4508737802f789bf094d229eaf093e288a656f4c","observation_id":"568a338a-ce4f-4bd7-b9da-fb4b4d52ed5d","resolution":{"observed_at":"2026-07-08T03:24:28.855837Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.23995/citation-record","integrity":"/paper/2606.23995/integrity","json":"/paper/2606.23995/citation-record.json","paper":"/paper/2606.23995"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1912.06680","doi":"10.5281/zenodo.17096679","metadata_source":"pith","pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","venue":"cs.LG","work_id":"b047dc18-e9a3-4d11-8ff6-cd59d41a6357","year":2019},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:e767d997c86a3932afa3e749f2844583c970fedde0433310519db6fbd27e58c8","observation_id":"984d085a-1262-499d-a632-3a30937199c4","resolution":{"observed_at":"2026-07-04T10:49:45.627271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":null,"venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:73958de0f5632ec737cfccafc4328a18cc9297b479a9faece332030c55121828","observation_id":"f62fbe3c-7e1d-480e-a2e2-28a8f5d9c5c3","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Superhuman AI for heads-up no-limit poker: Libratus beats top professionals","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:9e4ee19df5b0abffdd56bfba214cf1e3a3c99d0cb003a298df75cad56eacbd63","observation_id":"3ee2af48-9dc9-4e27-8063-3e7d41dbf3b4","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Combining deep reinforce- ment learning and search for imperfect-information games","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:e1416dab0fc1b04d8f403ff046d7d35f92f841a3550ac1180f75072aa43f852d","observation_id":"5598f9b3-fb33-498a-ba01-cffa5466558b","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Enhancing robustness in multi-agent reinforcement learn- ing via temporal consistency regularization: A self-distillation framework","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:ff0ea6d86a2c545b28c4fc42ac489624433c3ef714439e6ad22b0c1e6448aa88","observation_id":"1a539a98-6405-4cb0-b436-c66614d458f8","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"V ortices instead of equilibria in minmax opti- mization: Chaos and butterfly effects of online learning in zero-sum games","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:cf1db2632663ef52d385106a6f2ee79ce02f98110c5e0d959dc978878702fb4c","observation_id":"3b2d4df2-29be-4222-84ef-03cbd18daf6c","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Deep reinforcement learning from self-play in imperfect- information games, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:4bfc9f5e77aa536139669f51e4ff1a7880574f7698ca8aca82bb7faa5521fc9b","observation_id":"20b54c9c-b277-48dd-812e-3c0f54a8c452","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Neural replicator dynamics: Multiagent learning via hedging policy gradients","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:83537d132b86f4970ca3731ea095da2cd599066ab5c90f0210cc7409188de221","observation_id":"ea49ad59-abab-4821-8123-40b377d80bf7","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":"1803.05407","doi":"10.48550/arxiv.1803.05407","metadata_source":"pith","pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","venue":"cs.LG","work_id":"a7c6bded-245c-4243-8969-f16b6ac407ba","year":2018},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:7a042d44b203bcc6cf1ee75bfea0b8d8f441a9ac32abab44b931cdd5a1511093","observation_id":"1ce71ab4-aa94-4e53-b469-062069b599a4","resolution":{"observed_at":"2026-07-04T10:49:45.624333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:38.184761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:38.184761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"A unified game-theoretic approach to multiagent reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:9a3580ddc07d8517b4d59fdc738f590ebd65695d40106e248c204075b7949145","observation_id":"301de6d5-1f19-4935-bd61-2a427ca04bc8","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09453","last_updated":"2020-09-26T11:49:05Z","snapshot_observed_at":"2026-08-04T22:42:57.075441Z","submitted_at":"2019-08-26T03:31:35Z","title":"OpenSpiel: A Framework for Reinforcement Learning in Games","version":6},"cited_work":{"arxiv_id":"1908.09453","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.09453","snapshot_observed_at":"2026-07-10T00:26:39.228894Z","title":"Openspiel: A frame- work for reinforcement learning in games.arXiv preprint arXiv:1908.09453","venue":"cs.LG","work_id":"7e3695db-6fc9-47fc-9203-6c5fa3753bbc","year":2019},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"cited_paper":"/paper/1908.09453","citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:79cbede4ba426504256732582cd1eb2eb87a12f922d0d93c2d83f6f9413e6f11","observation_id":"6d3373b7-8fe3-4760-8118-942df6d1bcf8","resolution":{"observed_at":"2026-07-04T10:49:45.645442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Data-augmented game starts for accelerating self-play exploration in imperfect information games","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:b45f9a4ce8d9c5b04fa7b5b6c96d02537df8985e35c0be1376ff87d40b578f08","observation_id":"ec34513a-70b3-4db5-a6bd-aa510e8f7f44","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02596","last_updated":"2025-02-04T09:13:43Z","snapshot_observed_at":"2026-08-04T16:00:11.504753Z","submitted_at":"2024-06-01T05:55:15Z","title":"Slow and Steady Wins the Race: Maintaining Plasticity with Hare and Tortoise Networks","version":2},"cited_work":{"arxiv_id":"2406.02596","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02596","snapshot_observed_at":"2026-07-04T10:49:45.643005Z","title":"Slow and steady wins the race: Maintaining plasticity with hare and tortoise networks","venue":null,"work_id":"a6c6885d-c984-4a75-a168-5085ba9c1b31","year":2024},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"cited_paper":"/paper/2406.02596","citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:20c868d8684f3c21da0581218224d317d255eb2939a1d9c70e96aaad28d27a90","observation_id":"461870a2-4fd7-48ce-9bed-c2f10d417315","resolution":{"observed_at":"2026-07-04T10:49:45.644943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Continuous control with deep reinforcement learning, September 15 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:1662d60409050ce6f48650c99577e7bdb4da5750d231753c464adee4682f3431","observation_id":"237ec56f-758d-4d71-8213-81ffd9e49069","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"NeuPL: Neural population learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:393c7a16210ba2003483a777cf92610eb6785c96dc9f9e09f7ccdb799ad08fc1","observation_id":"daed2e5f-c9a5-4c4c-bc67-e291dd74f5b6","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Pipeline PSRO: A scalable approach for finding approximate Nash equilibria in large games","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:c4b0dde7f6f36e1f9530b50f02ded3d7cf447abb5226cf765d2add3bd4d6560f","observation_id":"1020c128-b3b9-4a23-a854-e486c4c0d4b9","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Wang, Pierre Baldi, Tuomas Sandholm, and Roy Fox","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:59b1c26b0039d39d33559803490adf48519d3bc8bc53ac9712bfe2d26f4562f2","observation_id":"5327bcdd-9dc5-49a0-91d4-f7256feb7804","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Wang, Pierre Baldi, and Roy Fox","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:67f5b8070b944a0f9fed00dcc67fe09fe83be996fece2db7de0a559bcb566bd0","observation_id":"e105f52a-d209-41dc-a3e2-9e8d386505bc","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Escher: Eschewing importance sampling in games by computing a history value function to estimate regret","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:5f9ecb24603cde0d222c667be502d3382262836ed859f9852ac56f527215e249","observation_id":"e19039d1-30dc-48c4-998b-18e544ecd2ec","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18704","last_updated":"2024-11-27T19:14:27Z","snapshot_observed_at":"2026-08-03T01:11:08.151681Z","submitted_at":"2024-11-27T19:14:27Z","title":"Exponential Moving Average of Weights in Deep Learning: Dynamics and Benefits","version":1},"cited_work":{"arxiv_id":"2411.18704","doi":"10.48550/arxiv.2411.18704","metadata_source":"pith","pith_arxiv_id":"2411.18704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exponential Moving Average of Weights in Deep Learning: Dynamics and Benefits","venue":"cs.LG","work_id":"3067eb9b-990e-48d9-8812-63b68dc8fb8a","year":2024},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"cited_paper":"/paper/2411.18704","citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:09deb537b14323bcca51dbcb34afb5ea11986f4a39c75b1a6af5233512ce4717","observation_id":"ae1f20ff-fce4-4c6b-9adb-6ddb1c058e79","resolution":{"observed_at":"2026-07-04T10:49:45.639309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T20:52:27.579092+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T20:52:27.579092+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Connor, Neil Burch, Thomas Anthony, Stephen McAleer, Romuald Elie, Sarah H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:a2fe0e7fc9005ae20ee8673ee8f98a4f9cfc8e10e583a2d26c8bff82f742c4a3","observation_id":"538b7c0c-8c2c-46c6-80f6-01a288e4c52c","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-07-06T18:36:07.983955Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:dd749e339d5702eed1d6c7fe9d651e41d7d270ef333452ff0785cfc328d4b3dc","observation_id":"35c0e572-c422-4a72-b107-562b57def5ca","resolution":{"observed_at":"2026-07-04T10:49:45.642601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Zico Kolter, Amy Zhang, Gabriele Farina, Eugene Vinitsky, and Samuel Sokota","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:8fcb533355b986489b00538d31f7e125c30d7343594e32cbd9f2a8218cdb83d4","observation_id":"94b7a3e7-37f6-4453-b80a-fbf73b5fba81","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:29df6ddfcb016ba20e8592866687fad11d5f4c6d5c843b33c32e500516015644","observation_id":"a2fcb582-38ac-4c9e-a4e4-4c0d53ff6c7a","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"A unified approach to reinforcement learning, quantal response equilibria, and two-player zero-sum games","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:cf61907aeb73e55a9c3a46837234784b17223ef78485c6a89d39cdd6b332af49","observation_id":"42a77ce0-23c9-450e-b7ac-3ce761cc85a0","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:49:45.633518Z","title":"Superhuman AI for Stratego using self-play reinforcement learning and test-time search","venue":null,"work_id":"e7ff2ed0-8e85-4358-a776-3bf7af471c4c","year":2025},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:876cbbea43eacffa7b281c01339a41f4f53f01f02ac8858e6cbb0237ec355a71","observation_id":"5f3d1628-2832-473a-911c-195487ac3fcf","resolution":{"observed_at":"2026-07-04T10:49:45.634952Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"DREAM: Deep regret minimization with advantage baselines and model-free learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:b49a276bec503cfb58271082db9ab218443deda408f089146867c5cb50a339ba","observation_id":"ad0fd4fe-fb5a-4bec-9fca-66e0b3fa2095","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Czarnecki, et al","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:04109a2a52a0b59612070e8ce53d3f9c5bd0915b36e3577d2710a9a446d8c9f8","observation_id":"ef0cf67c-5846-468a-bd2b-0f068121c1bc","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:bdfbe103b1f7f9624ea98ab4a2763f68833a8622696c08ef60ac3de6d333922a","observation_id":"621f8a96-a157-4332-8427-d555b045817e","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.04417","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:49:45.634629Z","title":"arXiv preprint arXiv:2602.04417 , year=","venue":null,"work_id":"3422d46b-7d04-4a4f-aa6d-fa306d84bf8e","year":2026},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:4a9ee7d9c0b9afbc5a480d8e7f4770750319d4db56ec7fc3cb5f185b90083ccc","observation_id":"d253e9da-bcdc-43d5-b1bb-5f4dbe6b08e9","resolution":{"observed_at":"2026-07-04T10:49:45.636250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:ddf3579ab9fbeb6e5b6f22b8263db9ecf367ab93f617e2060189cf2c1afe7e8c","observation_id":"fb321d39-4358-454c-92c7-8e25ac807575","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T08:32:51.215581Z","title":"model soups","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:eb35bc0e2d4d5e05097709d8239d5344ba37340251084cca65696a411b46c272","observation_id":"8a76422c-4821-41ba-9cdc-58687d905a5a","resolution":{"observed_at":"2026-06-26T08:32:51.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T15:25:24.332459Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":24,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2606.23995."}