{"as_of":"2026-08-10T22:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc5987dff295045682139fc3beea62123adc647f2d7c13ce0a639703e052d9a1","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:58:33.585535Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T05:35:27.427721Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-21T05:39:40.969302Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"cited_work":{"arxiv_id":"2510.18183","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.18183","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","venue":"cs.LG","work_id":"c0e63fff-cc7e-4ac1-872d-e85ae3578221","year":2025},"citing_paper":{"arxiv_id":"2605.20577","last_updated":"2026-05-20T00:33:28Z","snapshot_observed_at":"2026-08-02T18:52:25.402587Z","submitted_at":"2026-05-20T00:33:28Z","title":"Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T05:35:27.427721Z"},"links":{"cited_paper":"/paper/2510.18183","citing_paper":"/paper/2605.20577"},"observation_digest":"sha256:774906c8a09bc10149f54bde4ff09541afd7817114f86a793c8a82925c6a9e7c","observation_id":"69a90323-31b8-4649-a4df-2ea4fed6bc62","resolution":{"observed_at":"2026-05-21T05:39:40.970877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.18183/citation-record","integrity":"/paper/2510.18183/integrity","json":"/paper/2510.18183/citation-record.json","paper":"/paper/2510.18183"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:28.629538Z","title":"Oliehoek","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:28.629538Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:86929ea5c6806485e77d8da17b14abb0a07093ece6483c00cca55bd40bb0dc4d","observation_id":"1088073e-d548-4f06-9931-19bf43e7120b","resolution":{"observed_at":"2026-08-04T08:58:28.629538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:28.767199Z","title":"JAX: composable transfor- mations of Python+NumPy programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:28.767199Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:bd8072b053ac495b7f552ffa2227c4919ff3d73d3026a4eae089d57be93c0a00","observation_id":"5feadff1-0f2c-4d4b-b486-682ca9f3edf2","resolution":{"observed_at":"2026-08-04T08:58:28.767199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:28.896870Z","title":"Iterative solution of games by fictitious play.Act","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:28.896870Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:15be460a052e3e9d46589fb0eb332133110686a99a98ee068747e461cbe702bc","observation_id":"afa7b3a7-1e18-46e9-84b2-db7d8811c84e","resolution":{"observed_at":"2026-08-04T08:58:28.896870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:29.020148Z","title":"Superhuman ai for heads-up no-limit poker: Libratus beats top profession- als.Science, 359(6374):418–424, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:29.020148Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:0991e6ac3ef985658570d1bdfcf9ea869c01e4de2718e738a3b19bfa6e946854","observation_id":"41a573df-1c21-47ed-9bfa-b31e9d07894e","resolution":{"observed_at":"2026-08-04T08:58:29.020148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:29.131292Z","title":"Superhuman ai for multiplayer poker.Science, 365(6456):885–890, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:29.131292Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:deca952eaf0a5c1d6f378940339c21c0d92e8d1482638ae5178b6e0fb82ef0ea","observation_id":"e47adac6-4aeb-4ff0-9528-65e7599374b8","resolution":{"observed_at":"2026-08-04T08:58:29.131292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:29.250877Z","title":"Deep counterfactual regret minimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:29.250877Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:8fa73af150895c2f94ef6944fdc295e1b40ee6d04217712fcd0c1d4d218c4841","observation_id":"53985372-219d-419a-b951-5e50b110b483","resolution":{"observed_at":"2026-08-04T08:58:29.250877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:29.365021Z","title":"A comprehensive survey of multiagent reinforcement learning.IEEE Transactions on Systems, Man, and Cybernetics, Part C (Applications and Reviews), 38(2): 156–172, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:29.365021Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:7227d553ef9be44577f351091543c09ebe113909d134b5a70dc64d24d7d08361","observation_id":"9c660a0f-b007-44a7-8269-8148aac7de85","resolution":{"observed_at":"2026-08-04T08:58:29.365021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:29.496706Z","title":"Fast policy extragradient methods for competitive games with entropy regularization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:29.496706Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:2cd7ac80f1e077706d573cc9129de378e45a242ff9c8499f3004b16a699205de","observation_id":"ce753de8-fec7-4ee7-bc74-7becb206f8b9","resolution":{"observed_at":"2026-08-04T08:58:29.496706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:29.658080Z","title":"Last-iterate convergence: Zero-sum games and constrained min- max optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:29.658080Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:151e4a35089db931a7d64de2ddd3508e6a0f073b0f4d51c62fe9cab0714d152c","observation_id":"d78ab0f0-543d-4421-ae16-e9282366fa44","resolution":{"observed_at":"2026-08-04T08:58:29.658080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:29.815653Z","title":"Training gans with optimism","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:29.815653Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:aeab78d07d5ea2f4e920744290abe7ebe325186265920dc3ce4eb3fd893e8b14","observation_id":"31d7292d-e306-4c18-9ebf-315c6a6270e5","resolution":{"observed_at":"2026-08-04T08:58:29.815653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:29.952558Z","title":"Springer, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:29.952558Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:e964903f3177f8acb226fa66bbfd65314d4c2471055de1f4785dbb22dcc62243","observation_id":"ff6dd9e0-7c05-4dac-b29c-6515361a597d","resolution":{"observed_at":"2026-08-04T08:58:29.952558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:30.076837Z","title":"Solving for best responses in extensive-form games using reinforcement learning methods","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:30.076837Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:d98bbb7081d1bd290131ee3f1ebdd55aad2a91246fb109b89ca69109bef5d4c5","observation_id":"60ef99f7-ca8a-4ed4-b836-bb3902e2d54c","resolution":{"observed_at":"2026-08-04T08:58:30.076837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.01121","last_updated":"2016-06-28T15:28:30Z","snapshot_observed_at":"2026-08-08T22:18:19.349556Z","submitted_at":"2016-03-03T15:01:54Z","title":"Deep Reinforcement Learning from Self-Play in Imperfect-Information Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.01121","snapshot_observed_at":"2026-08-04T08:58:30.196277Z","title":"Deep reinforcement learning from self-play in imperfect-information games.CoRR, abs/1603.01121, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:30.196277Z"},"links":{"cited_paper":"/paper/1603.01121","citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:e177b68543cbda9e5cc19ef11a69977bea0c4e4825bbef39a9aacbc34ad39cca","observation_id":"4975bc87-7f7f-4e1d-a9fe-a659391fe349","resolution":{"observed_at":"2026-08-04T08:58:30.196277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:30.366974Z","title":"Learning in perturbed asymmetric games.Games Econ","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:30.366974Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:b9ce814ac00c4b944d2474d4583fa600160388c472bb3f377d45f437e07cf0a6","observation_id":"859c70e3-709f-462b-bbd5-7b3fc6db3baf","resolution":{"observed_at":"2026-08-04T08:58:30.366974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:30.507732Z","title":"Adaptive learning in continuous games: Optimal regret bounds and convergence to nash equilibrium","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:30.507732Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:c624a1fac633eaa40f7183cb710644173e36bcabf0950a99c11743e4272bd95e","observation_id":"ec4c67cc-b910-4747-878e-d0b27864dccc","resolution":{"observed_at":"2026-08-04T08:58:30.507732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:30.623234Z","title":"Extensive games and the problem of information.Contributions to the Theory of Games, 2(28): 193–216, 1953","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:30.623234Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:1c8db32fc899c85c43ba33d454d25b5dc85e582eec495950a64bfb2a6b247122","observation_id":"4c26b87a-0a5d-4630-959a-c45f8b8e989b","resolution":{"observed_at":"2026-08-04T08:58:30.623234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:30.740485Z","title":"A unified game-theoretic approach to multiagent reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:30.740485Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:30774641ee1b8157842f9d3ead00c635f2805f6331b2f491c12227c9e7a3fc84","observation_id":"0bc8ca25-92d9-4bd8-aa23-5ce5a533b33d","resolution":{"observed_at":"2026-08-04T08:58:30.740485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:31.095675Z","title":"A class of gap functions for variational inequalities.Mathematical Programming, 64(1):53–79, 1994","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:31.095675Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:b2d094c51e99841a0ffd70ba8853d994909099c4e36e5829348b881be57f45b9","observation_id":"11abbae1-60db-444a-9c05-9e5f8785eb4a","resolution":{"observed_at":"2026-08-04T08:58:31.095675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:31.247211Z","title":"Last-iterate convergence in extensive-form games","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:31.247211Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:c53db6e6f253e16d665a376bc869cd9ff645b9cc21b040541972907f9db98af5","observation_id":"df1daf7d-e64e-4663-b3b4-3e275a278838","resolution":{"observed_at":"2026-08-04T08:58:31.247211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:31.407152Z","title":"Sample complexity of asynchronous q-learning: Sharper analysis and variance reduction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:31.407152Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:c23c8e3aa1d607e2f54f10d8e03b93752f583b5047373c4e9b3a465915974cfe","observation_id":"38948cf2-175e-4488-8087-3d45ada886f8","resolution":{"observed_at":"2026-08-04T08:58:31.407152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:31.542497Z","title":"A survey of nash equilibrium strategy solving based on cfr.Archives of Computational Methods in Engineering, 28(4), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:31.542497Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:e9712c40e2d51e878ac8cc5333cb6f4280ab0b1f668a418e941ec4281d99f303","observation_id":"8ed87ff8-aa5a-49a6-b185-c31f55e8f2bf","resolution":{"observed_at":"2026-08-04T08:58:31.542497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:31.642192Z","title":"Ozdaglar, Tiancheng Yu, and Kaiqing Zhang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:31.642192Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:2080ed6babb48f51e883091881b5f3589780db14b40287303953ab9751e0c4d0","observation_id":"c8aff3e5-001b-458d-ae7a-f16c007ace6e","resolution":{"observed_at":"2026-08-04T08:58:31.642192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:31.795089Z","title":"Lanier, Roy Fox, and Pierre Baldi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:31.795089Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:75865a8e079f044f7c316b3a8cc7e04f4e97d36d6cc3ae7537d19802267f6ada","observation_id":"bff831ab-f6e3-44af-9079-190a12f4c9c9","resolution":{"observed_at":"2026-08-04T08:58:31.795089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:31.910301Z","title":"ESCHER: eschewing impor- tance sampling in games by computing a history value function to estimate regret","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:31.910301Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:f66a8f69978bc7fd5f4a15b0f31ce82cc847986d8cbeb1155e74b13e408df585","observation_id":"d6df8c92-e7a7-45c8-a867-62924aee2d43","resolution":{"observed_at":"2026-08-04T08:58:31.910301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:32.047562Z","title":"Wang, Pierre Baldi, Tuomas Sandholm, and Roy Fox","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:32.047562Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:9c9ac79dd359c45c220e74445bc720226c468fa79cd7725007329a33c644975d","observation_id":"aa134598-acf0-4880-9fce-e5827b7c4f5b","resolution":{"observed_at":"2026-08-04T08:58:32.047562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:32.194779Z","title":"McKelvey and Thomas R","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:32.194779Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:bb20bcf6d13d5938d2b8aa7a4c372881131f0d80fb64109c621d6ed0699ab4b6","observation_id":"fbb710e8-16e1-42ab-9edd-21c7129bc98d","resolution":{"observed_at":"2026-08-04T08:58:32.194779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:32.332116Z","title":"Ortega, Neil Burch, Thomas W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:32.332116Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:707d3c46238f79d84492ce67b03fcfcd51ace719683c238822e301dd7f6e6ffa","observation_id":"96b8ebf1-617d-4cd4-8ebe-bfd287d45af3","resolution":{"observed_at":"2026-08-04T08:58:32.332116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08938","last_updated":"2026-05-27T03:17:36Z","snapshot_observed_at":"2026-08-07T23:07:31.003475Z","submitted_at":"2025-02-13T03:38:41Z","title":"Reevaluating Policy Gradient Methods for Imperfect-Information Games","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08938","snapshot_observed_at":"2026-08-04T08:58:32.453363Z","title":"Zico Kolter, Amy Zhang, Gabriele Farina, Eugene Vinitsky, and Samuel Sokota","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:32.453363Z"},"links":{"cited_paper":"/paper/2502.08938","citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:ba11c7ffcd81ad6960c58c5d38b0e79ab6d56db67cc63d80b30e2ffc6934f802","observation_id":"b215b5f6-1445-4ce5-82e8-87c9200e7c63","resolution":{"observed_at":"2026-08-04T08:58:32.453363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T08:58:32.616577Z","title":"Proximal policy optimization algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:32.616577Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:e179639d14ffcb1770698f315f919e6c62a34ca07e61485c4402334ee961b94e","observation_id":"48308ba7-0f88-4847-861b-4ace5d1a8776","resolution":{"observed_at":"2026-08-04T08:58:32.616577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:32.782011Z","title":"If multi-agent learning is the answer, what is the question? Artificial intelligence, 171(7):365–377, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:32.782011Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:57083695cbc45539250301b28b65b233a362096ffd06410e9fc622102379c7d5","observation_id":"2bdaee0d-e23a-4ec4-9d6b-4f6675424cca","resolution":{"observed_at":"2026-08-04T08:58:32.782011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:32.896649Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:32.896649Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:1f469bb9eef059598a407bb71817c157090f8a1f922c47a6efca78c58b64a142","observation_id":"1386e903-1dae-4db7-a854-17a227d72b91","resolution":{"observed_at":"2026-08-04T08:58:32.896649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:33.066122Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play.Science, 362 (6419):1140–1144, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:33.066122Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:d5848f51e5099926fce70731d8d312a469be22223696b5ac623d45f25e615a52","observation_id":"7834897e-f1c0-4fdd-bce2-35353c5d097f","resolution":{"observed_at":"2026-08-04T08:58:33.066122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:33.183853Z","title":"Zico Kolter, Nicolas Loizou, Marc Lanctot, Ioannis Mitliagkas, Noam Brown, and Christian Kroer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:33.183853Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:03b3c2af31b92bb9dd007429ee2a92e63f777649a854e6d348769b071a1376a9","observation_id":"c3a4f671-454f-4744-a567-844d8c41fbf4","resolution":{"observed_at":"2026-08-04T08:58:33.183853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10410","last_updated":"2020-11-29T12:23:34Z","snapshot_observed_at":"2026-08-07T01:32:42.645310Z","submitted_at":"2020-06-18T10:30:27Z","title":"DREAM: Deep Regret minimization with Advantage baselines and Model-free learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10410","snapshot_observed_at":"2026-08-04T08:58:33.334458Z","title":"DREAM: deep regret minimization with advantage baselines and model-free learning.CoRR, abs/2006.10410, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:33.334458Z"},"links":{"cited_paper":"/paper/2006.10410","citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:31d977aa40d9687b9d0bd053b1b06a4365db67b352f0a9956e0dbfd92964ddf8","observation_id":"47174499-4607-4911-b25f-e7df15edd7d8","resolution":{"observed_at":"2026-08-04T08:58:33.334458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:33.510525Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning.nature, 575(7782):350–354, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:33.510525Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:377b4fb44a72baa5035547b62891d6c0a5092532b0fbb8e35f658df9d0940f60","observation_id":"a44373cb-2979-4fab-a3df-2ddd9ad8e83c","resolution":{"observed_at":"2026-08-04T08:58:33.510525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:58:33.585535Z","title":"Bowling, and Carmelo Piccione","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:33.585535Z"},"links":{"citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:9705842152ee22bbfad5a3a9de17cfdbe00574da372d3b6b2289956ffc05e781","observation_id":"7f3c8b1f-34cd-47b2-9efa-4e0937f01be4","resolution":{"observed_at":"2026-08-04T08:58:33.585535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09453","last_updated":"2020-09-26T11:49:05Z","snapshot_observed_at":"2026-08-08T18:52:56.345158Z","submitted_at":"2019-08-26T03:31:35Z","title":"OpenSpiel: A Framework for Reinforcement Learning in Games","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09453","snapshot_observed_at":"2026-08-04T08:58:30.975937Z","title":null,"venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T08:58:30.975937Z"},"links":{"cited_paper":"/paper/1908.09453","citing_paper":"/paper/2510.18183"},"observation_digest":"sha256:2f4de0000a68b516cc2eefa327e4b740085fab7ebd17a019856756b76bb0268c","observation_id":"ff5553eb-4cf0-4138-917c-f9d3bc75472a","resolution":{"observed_at":"2026-08-04T08:58:30.975937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.18183","last_updated":"2026-08-03T05:53:48Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:28:37.160405Z","submitted_at":"2025-10-21T00:14:45Z","title":"NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2510.18183."}