{"as_of":"2026-08-09T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d22877913e8e5370557036ee95fc7b04057780ba971021d537933b26af740dc1","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:27.705945Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T01:17:41.135172Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T01:27:02.760603Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"cited_work":{"arxiv_id":"2505.22781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22781","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite- sample convergence bounds for trust region policy optimization in mean-field games","venue":null,"work_id":"9a2588ba-c2cb-4c3a-9b28-9c78995960eb","year":2025},"citing_paper":{"arxiv_id":"2605.11042","last_updated":"2026-05-11T08:39:30Z","snapshot_observed_at":"2026-08-02T19:41:03.067207Z","submitted_at":"2026-05-11T08:39:30Z","title":"Towards Model-Free Learning in Dynamic Population Games: An Application to Karma Economies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T01:17:41.135172Z"},"links":{"cited_paper":"/paper/2505.22781","citing_paper":"/paper/2605.11042"},"observation_digest":"sha256:9697400e0a6ebbb4e2c5ecab785a8e0dab203a61eae619cc75effe86099d487c","observation_id":"d4fce0ae-be86-4a46-ab5c-2eb9ce8dd9b7","resolution":{"observed_at":"2026-05-13T01:27:02.762569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22781/citation-record","integrity":"/paper/2505.22781/integrity","json":"/paper/2505.22781/citation-record.json","paper":"/paper/2505.22781"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.196564Z","title":"and Capuzzo-Dolcetta, I","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.196564Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:e59781bcc82ad2fe985fdf3e139c30b0a0eae95e06ad28c1d2361907364a0cf4","observation_id":"bf637fce-5932-47bb-a84d-fccde22410ae","resolution":{"observed_at":"2026-08-07T13:10:12.196564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.329482Z","title":"and Porretta, A","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.329482Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:083913b70451116fa183c8b7504ae22c530c0a366a988218b2d4a982dec51a51","observation_id":"4a6670e5-2aa5-40cc-b372-5d783f349faa","resolution":{"observed_at":"2026-08-07T13:10:12.329482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.491661Z","title":"Mean field games: numerical methods for the planning problem","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.491661Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:3e093bb7e1f89ddbacba40a9d0ed20d443756d03f1003a4bc060db7843e4d18f","observation_id":"453d78a0-a8be-4b55-9a06-4050d75d6c03","resolution":{"observed_at":"2026-08-07T13:10:12.491661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.619752Z","title":"Mean field games and applications: Numerical aspects","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.619752Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:51987169be3809e00bd4aaedfd4799b4a108b9be7cb1947eeea6ac9a145fc1a4","observation_id":"ccbebb40-1486-421b-adef-e6689a6eff64","resolution":{"observed_at":"2026-08-07T13:10:12.619752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.806388Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.806388Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:fcc3aaec843741b5046fc58e8cb3309fbb52c2734227119c585eb9ac8a57a923","observation_id":"50fb8c21-04b9-48c5-9ee9-c258f2db1281","resolution":{"observed_at":"2026-08-07T13:10:12.806388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.017801Z","title":"An extended mean field game for storage in smart grids","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.017801Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:44a0899d4700c2931c01db6453d6859970bf425708d1956a335e92be46ca742d","observation_id":"99b8884a-b888-4366-8840-6503594e9d34","resolution":{"observed_at":"2026-08-07T13:10:13.017801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.221565Z","title":"Regularization of the policy updates for stabilizing mean field games","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.221565Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:752891d3aed2e33107a96279d9d1355b7197003f3e7da1a6f570edec7e55b2dc","observation_id":"5c2ea739-69c9-4425-b6bb-f1b752ee86ad","resolution":{"observed_at":"2026-08-07T13:10:13.221565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.373064Z","title":"D., and Saldi, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.373064Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:4c34b60368c4cbf553c9969d77900a47aa84236ecf2e6117ccdd8f0fa0b906d3","observation_id":"68a8815d-4929-4184-b623-1ef5e7930c55","resolution":{"observed_at":"2026-08-07T13:10:13.373064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.491777Z","title":"D., and Saldi, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.491777Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:957b7683ab457c6e6d607a2510a32775a07e4da64e835123cff28dc6273504d6","observation_id":"5f18d09d-74d5-4ad8-aa92-cd8971e47d3c","resolution":{"observed_at":"2026-08-07T13:10:13.491777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.621544Z","title":"Mean-field sampling for cooperative multi-agent reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.621544Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7c37bd849556d7b141dc511c1522b6e35f0e442bb2ab3444504d8c1d216108b1","observation_id":"29ad1f48-6d67-45d6-8117-15ccfb0cfe63","resolution":{"observed_at":"2026-08-07T13:10:13.621544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13912","last_updated":"2021-05-31T17:08:26Z","snapshot_observed_at":"2026-07-06T09:32:26.221291Z","submitted_at":"2020-06-24T17:45:44Z","title":"Unified Reinforcement Q-Learning for Mean Field Game and Control Problems","version":3},"cited_work":{"arxiv_id":"2006.13912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.13912","snapshot_observed_at":"2026-08-07T13:10:28.428600Z","title":"Unified Reinforcement Q-Learning for Mean Field Game and Control Problems","venue":"math.OC","work_id":"5c6c14af-37f6-41c5-8944-89b0fa6ef70f","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.774546Z"},"links":{"cited_paper":"/paper/2006.13912","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:edbcfe0f858a4783fabfcde07b4fd76cbf0763f1e54b424fca15142be18c6b2a","observation_id":"570de5b3-c6e6-4ed4-84d7-b2cd89a7bb11","resolution":{"observed_at":"2026-08-07T13:10:28.517786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06659","last_updated":"2024-05-01T11:23:58Z","snapshot_observed_at":"2026-08-08T05:37:10.238060Z","submitted_at":"2023-12-11T18:59:51Z","title":"Convergence of Multi-Scale Reinforcement Q-Learning Algorithms for Mean Field Game and Control Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06659","snapshot_observed_at":"2026-08-07T13:10:13.932048Z","title":"Convergence of multi-scale reinforcement Q learning algorithms for mean field game and control problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.932048Z"},"links":{"cited_paper":"/paper/2312.06659","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:3dd49144f8e69989d21f90e3fc307223b0c7c9f76fb20e19af38eefc1901e14e","observation_id":"a115e582-f4c1-4f97-874b-d709fb4e066e","resolution":{"observed_at":"2026-08-07T13:10:13.932048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.074540Z","title":"On solutions of mean field games with ergodic cost","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.074540Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7b9330529f3e9c0948f7acae60395b3f5f1409c42411ab97ab3ca898e720bdcc","observation_id":"d9faeb28-e1ab-46f7-9b5b-4d91e7518fbd","resolution":{"observed_at":"2026-08-07T13:10:14.074540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.243790Z","title":"Lipschitz continuity in model-based reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.243790Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:8d91251da7387d26dacb78679062daeba0b9bcaa4d03340e5f85ae3a747608cf","observation_id":"7c38864c-386d-4df4-b653-44aafd25fbe2","resolution":{"observed_at":"2026-08-07T13:10:14.243790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.377895Z","title":"Inapproximability of np-complete variants of nash equilibrium","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.377895Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:07477e1b22e15b121b1125856b936d95a49f4a53af8aa740693025868bfc0d71","observation_id":"d1c12000-e29d-4a60-afc9-9eed044892e0","resolution":{"observed_at":"2026-08-07T13:10:14.377895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.540084Z","title":"M., Munos, R., and Kappen, H","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.540084Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:0d61d9774996956665ebc365558ee5ab2e54ade06327149cd3c18cefda5eb43c","observation_id":"cb65bbb7-a39b-440f-8e8e-874cfdae2ee1","resolution":{"observed_at":"2026-08-07T13:10:14.540084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.688053Z","title":"and Priuli, F","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.688053Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:582b0b971178db658e38ae0cf26e382af23a89d816f555d39412b587c7858cec","observation_id":"d527bfc3-31dc-47f3-9bcb-745d3b78ebf6","resolution":{"observed_at":"2026-08-07T13:10:14.688053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.886881Z","title":"A mean-field game model of electricity market dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.886881Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:e68459a62d0817a61197d7f47e731a96c83e3e02f43a54795a2cb40262fca1de","observation_id":"0bb83870-e706-48a0-8f24-a83d215f526a","resolution":{"observed_at":"2026-08-07T13:10:14.886881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.037956Z","title":"and Hesse, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.037956Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:76e3d1fa4cfd0349c3eb583676f4f797afd95235cec4ad83c2f91ca7b2bc368e","observation_id":"7a13ea33-c593-4ce7-b35b-3ddd47b16e40","resolution":{"observed_at":"2026-08-07T13:10:15.037956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.203972Z","title":"First-order methods in optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.203972Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:30542a93da86bc803a0b07e6e75a91ddd1c6287415bfebde477b9c54c042d34b","observation_id":"7d1e2b1d-41c2-481a-9346-d99ba8da6420","resolution":{"observed_at":"2026-08-07T13:10:15.203972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.404955Z","title":"and Russo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.404955Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c5267005a1dca5209e46d223ec89f2a09f8dd8ae15ac05965d31bd6812820e1a","observation_id":"be756859-2ab8-4cf2-a5ca-494054b2bbe8","resolution":{"observed_at":"2026-08-07T13:10:15.404955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.613780Z","title":"A., Ortega, P","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.613780Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:95f28d5b2434a1d0bc3046f85f328340a4e7de6a6b45e4f56f79350400762ede","observation_id":"48e4c65e-cc51-4081-b65b-5e4d78f9ff8f","resolution":{"observed_at":"2026-08-07T13:10:15.613780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.729213Z","title":"The master equation and the convergence problem in mean field games:(ams-201)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.729213Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:3cfe437dc494c52110d72d7ea30def4dd06e67f42641908f9a200a335e0798ce","observation_id":"6bd91a86-fb64-40ac-8366-1dfc1730f3f9","resolution":{"observed_at":"2026-08-07T13:10:15.729213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.539957Z","title":"and Lauri \\`e re, M","venue":null,"work_id":"03b536e7-dd24-4fca-9ada-2da202627fa9","year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.885470Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:5de2ac789773ecfc4e6ff0bd70ce2802287c452cffbb2359aa5a6d7e6aaf1fbe","observation_id":"7dce5b72-226e-41ef-bbc0-72f17a6825ad","resolution":{"observed_at":"2026-08-07T13:10:45.706097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.2172","last_updated":"2013-08-09T16:27:11Z","snapshot_observed_at":"2026-07-06T03:20:23.030252Z","submitted_at":"2013-08-09T16:27:11Z","title":"Mean Field Games and Systemic Risk","version":1},"cited_work":{"arxiv_id":"1308.2172","doi":null,"metadata_source":"pith","pith_arxiv_id":"1308.2172","snapshot_observed_at":"2026-08-07T13:10:28.078321Z","title":"Mean Field Games and Systemic Risk","venue":"q-fin.PR","work_id":"d8f82bde-8a8c-4f20-845a-2ab37d7df8a1","year":2013},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.063803Z"},"links":{"cited_paper":"/paper/1308.2172","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:3aa72f740c852eeeaa4de1d7d929a09ba13c583fd0b1a8589fa10d6a3762ed7e","observation_id":"9096057d-4782-48ed-a291-3e6a5577120b","resolution":{"observed_at":"2026-08-07T13:10:28.223000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.277952Z","title":"Probabilistic theory of mean field games with applications I-II","venue":null,"work_id":"20b04884-3afe-4736-8fd2-b6f40f47d550","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.251055Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c31cc839f20a35c8aa28975a47c734e45aec54bc4f2acb1a24d7178147d41a1f","observation_id":"db6ebada-1185-4011-b4e7-f9bebad60ca4","resolution":{"observed_at":"2026-08-07T13:10:45.413359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.027072Z","title":"Numerical method for fbsdes of mckean--vlasov type","venue":null,"work_id":"502539a9-d471-4448-b945-b08de479a7b7","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.373548Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:a5386d6422859317dbf04f2d9020d7918e88e2726ca2a6d52cc7f8c2309db224","observation_id":"25424109-0fc2-4849-905e-af23cd3e2c59","resolution":{"observed_at":"2026-08-07T13:10:45.138057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:16.529488Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.529488Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f2b0792fd0c53504efadf6c5c359bf0920ab818ee07d5be114752191ec1b2ed1","observation_id":"6b9d0135-894c-417e-83a5-c4d104926724","resolution":{"observed_at":"2026-08-07T13:10:16.529488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.770365Z","title":"and Koeppl, H","venue":null,"work_id":"16f8b2c5-1252-44e9-a4aa-90a7be7ff76c","year":1909},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.744269Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:dd848efa484add40e120575769493cd2c9d311a8baf87cd46b29b540fd53398c","observation_id":"2e93f1e8-f4a9-473f-a040-9bb9bc1dec24","resolution":{"observed_at":"2026-08-07T13:10:44.865814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.432509Z","title":"and Koeppl, H","venue":null,"work_id":"78508d06-7da9-4ed3-9008-ef76198ad77e","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.855232Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:624401ecaa8680a607fb77a4384a6334e126db0857790604a53f35aeb4fe6902","observation_id":"27bbb1b0-3aba-4b92-9e01-73ad00a0db6d","resolution":{"observed_at":"2026-08-07T13:10:44.565375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.097564Z","title":"A mean field game analysis of sir dynamics with vaccination","venue":null,"work_id":"d09d6a75-f12c-4c8e-8bec-c8059f49d0f1","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.038129Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:08dc786dc3cccc24d7cd8c1be6b9d844b48ae0107c7e244916165478512a8afd","observation_id":"dec370c1-d457-45b3-bb97-7d9744f31cb0","resolution":{"observed_at":"2026-08-07T13:10:44.298047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.765689Z","title":"and Touzi, N","venue":null,"work_id":"e2a1930e-e0ba-47c6-8936-70706b8c52f0","year":2015},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.232176Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:921e0c163d0611f8d29fc6dc2b3576c7246ac326c2bb9d4684ad3bf20fd1935d","observation_id":"dd77e7cb-60ec-45b4-9aab-1a478328e33f","resolution":{"observed_at":"2026-08-07T13:10:43.918293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.522497Z","title":"and Silva, F","venue":null,"work_id":"c45d2563-a389-44ac-a4c7-d4542abb3844","year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.431580Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:175b09206342ae6d1ac18bb79e2cb61f2df9a8df68819babfeddf211b478a03b","observation_id":"f47c2e38-69af-4291-97e3-dfd0e973e66b","resolution":{"observed_at":"2026-08-07T13:10:43.646217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.248192Z","title":"N-player games and mean field games of moderate interactions","venue":null,"work_id":"1ef4c4d4-1047-4eeb-aa27-39f50a232fce","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.587562Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c5af6ced197aee716a154b90e7363d0f4dee786cb70d2d5c813b5295111b9edb","observation_id":"97469166-6922-49d8-8dd6-e7e430524278","resolution":{"observed_at":"2026-08-07T13:10:43.356158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.931441Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":"5b25f34d-632d-4039-a8a9-d43c8a642e11","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.719823Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:2094cc2fd617c456a3bfd1db1cb520dcf87092c851103f3b21f8e63c9a4160eb","observation_id":"023d22f7-2603-4386-8fbe-f1dde2ae9152","resolution":{"observed_at":"2026-08-07T13:10:43.097433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.663288Z","title":"Convergence of adaptive and interacting markov chain monte carlo algorithms","venue":null,"work_id":"46c3de71-c0a4-4119-b907-6b2e7cff3e6f","year":2011},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.855496Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:3ed3db8edf704a4902cfe21d0d6395706c57a83f8af6d05f54ddb378170c1b25","observation_id":"79bbc963-3836-4e96-9a35-0f8520672c3c","resolution":{"observed_at":"2026-08-07T13:10:42.793131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.377653Z","title":"Taming the noise in reinforcement learning via soft updates","venue":null,"work_id":"58a7f176-4e18-4de4-9386-ce7bda675779","year":2016},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.009623Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:23dc480e9b880227aa347e49d2729b837c43d2b54cf126e61f2057a41ee3a769","observation_id":"03d71b27-7be9-4f46-a629-b5e3f2106beb","resolution":{"observed_at":"2026-08-07T13:10:42.494859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:18.193450Z","title":"A theory of regularized markov decision processes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.193450Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:9f1e682f6ea819c6172d08fcbc7420de8d8bd09f168ed3773bf599184046d5b3","observation_id":"b1b27f0a-1f7f-4f2d-9c0f-95401d9ff0e1","resolution":{"observed_at":"2026-08-07T13:10:18.193450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03787","last_updated":"2022-02-16T10:01:00Z","snapshot_observed_at":"2026-07-06T11:16:49.764856Z","submitted_at":"2021-06-07T16:51:07Z","title":"Concave Utility Reinforcement Learning: the Mean-Field Game Viewpoint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03787","snapshot_observed_at":"2026-08-07T13:10:18.346868Z","title":"Concave utility reinforcement learning: the mean-field game viewpoint, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.346868Z"},"links":{"cited_paper":"/paper/2106.03787","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:d4c02233a169632bec02a0d0b7f15ed33584135418d645d552268e13cdbfff9d","observation_id":"78fb16c5-db85-4513-951f-93cf8e0bbccb","resolution":{"observed_at":"2026-08-07T13:10:18.346868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.162612Z","title":"Numerical resolution of mckean-vlasov fbsdes using neural networks","venue":null,"work_id":"e3822db4-3eb9-4cd1-8d67-6d6d18c52364","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.546112Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:350ea05d8d96f24727b37985a9302d40358c7fa9621fe51b86a2d353dd21161d","observation_id":"d69e59ea-a95b-4796-8bf2-d7fbc8088ae4","resolution":{"observed_at":"2026-08-07T13:10:42.256776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:18.689464Z","title":"and Diepold, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.689464Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:295de81571772d7d22f46fe2f5ddacfa89cea65558f2e326d18cb08fa810272a","observation_id":"3a1a6c36-559e-48d7-94c7-a7e450b1a6bf","resolution":{"observed_at":"2026-08-07T13:10:18.689464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:41.845690Z","title":"Learning mean-field games","venue":null,"work_id":"75a4bd87-4397-4c8a-86b6-2940482435a9","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.864106Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:917258df71a5ed8ee095a0315e61a4335c7c8ceac556a3d28358c74648bc7d00","observation_id":"5bfd2c8a-fd34-4a50-ae8f-e06c4b1236c4","resolution":{"observed_at":"2026-08-07T13:10:41.972833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:41.509560Z","title":"A general framework for learning mean-field games","venue":null,"work_id":"2b3c560a-686b-4503-9eba-363166b4398a","year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.028275Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c50900420dd527b40a4fa36f104d67428725ab1db8122e3c4743e49b697676f9","observation_id":"ccd5ec80-907a-4e95-8d0e-98e07be6c675","resolution":{"observed_at":"2026-08-07T13:10:41.639343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:41.141974Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"50d842a0-1ff3-4615-b362-bf630c7d7b69","year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.165381Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:08656126cafb9c76379ff9e5382158b7bdbaaa44b63c88b0c3a1360ed7481c66","observation_id":"e65f3309-8d85-4952-bc78-5a6fae295914","resolution":{"observed_at":"2026-08-07T13:10:41.336299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:40.866478Z","title":"J., Liaw, C., Plan, Y., and Randhawa, S","venue":null,"work_id":"d1d37360-0485-40d0-ab32-df9abecf435c","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.339607Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:6fc2bd27af7dd13c98dde3ba70539814dfc1ee158c4e182c65d9644c276cab99","observation_id":"5b074396-72b5-4276-ba77-c170a92c8aa2","resolution":{"observed_at":"2026-08-07T13:10:40.989906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.489673Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.489673Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:277e5aebd1adddf198eabdebcb222afa19f6b1bcc2c85b49a9710f903f8b0280","observation_id":"94f56b99-100a-4721-8c09-56180e6a5ef6","resolution":{"observed_at":"2026-08-07T13:10:19.489673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:40.619823Z","title":null,"venue":null,"work_id":"24469160-ff06-4659-b0f3-10c2d3b40416","year":1972},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.640667Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:2666a0b628a0513f4aa854b5c98cdb362100ae10d3c783d4b08fbaf943babfde","observation_id":"f8a7b82f-be21-40f2-bce0-cb5781e8892a","resolution":{"observed_at":"2026-08-07T13:10:40.725380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:40.367915Z","title":"E., and Malham \\'e , R","venue":null,"work_id":"2e240b8a-3755-4b38-b943-261248fe5d14","year":2003},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.736199Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:1d4994f75c3eaa5de2e1f5b4197842207f565b6cbf7cd4b132aa2bbb1cb690fc","observation_id":"0a887376-c623-4d30-a983-83a98eab0cb3","resolution":{"observed_at":"2026-08-07T13:10:40.511051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:40.011666Z","title":"P., and Caines, P","venue":null,"work_id":"fd72539a-3965-4750-a527-5913e8d320f3","year":2005},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.880740Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:81b53101126c90dfe07b28291ea2e34f563308973eb7437886c06e76922cc0ea","observation_id":"18f08f07-8014-474d-ad13-e41ec9bc9bf9","resolution":{"observed_at":"2026-08-07T13:10:40.194629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:39.723743Z","title":"P., and Caines, P","venue":null,"work_id":"28b326e3-e196-485f-a8cf-fda80495a600","year":2006},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.085274Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:833416450b5b1344bde5dcdb49e4d91f57172c3021344c89288ddcb32c09a401","observation_id":"39a6dc44-f5cd-4cd2-a412-8b19c3e48907","resolution":{"observed_at":"2026-08-07T13:10:39.850916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:39.367003Z","title":"P., and Caines, P","venue":null,"work_id":"81efdb3f-b928-471e-8be8-202091b05539","year":2006},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.238426Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f913653a3e6f02c98cf0e3d627cf463b6c7c8436914d434d64cb067ba1684223","observation_id":"db69e7c9-770d-46b8-9d34-f9b69d01db74","resolution":{"observed_at":"2026-08-07T13:10:39.591521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:39.101209Z","title":"and Sha, F","venue":null,"work_id":"01def460-7c1c-4b09-87e8-5f0600bd9d8f","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.405360Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:cf6d8e4c967c88f331b10e18066e8841e115f63df175dbf5a498d189ce4bcae9","observation_id":"0868478e-fd85-46bb-9d00-5a1b1ab40a13","resolution":{"observed_at":"2026-08-07T13:10:39.225351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:38.821830Z","title":"and Langford, J","venue":null,"work_id":"0360180d-b1ef-4892-86ba-59e14fd58593","year":2002},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.536988Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c904d31a1fd78b0d2977a5da37c11f7737a56eb76f2e0bc298dc1ad0e4884063","observation_id":"9f637947-4b9e-4903-a1cf-004bc8ed7e5d","resolution":{"observed_at":"2026-08-07T13:10:38.952013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:38.508450Z","title":null,"venue":null,"work_id":"a3cc2e98-31df-4a8c-83b0-ddf7232c9ef7","year":2003},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.673691Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:ce5ea85177ac5d6a0b88683d8a48721c906983149a0a1e06b63c3ef07c06a11c","observation_id":"d2cf9ab8-375c-4972-aa89-067c533187b7","resolution":{"observed_at":"2026-08-07T13:10:38.682202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:38.167709Z","title":"and Singh, S","venue":null,"work_id":"4c762813-f40e-4838-855c-6522929eef80","year":1998},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.845556Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:cc0d866fe38a413417f3d0bfd32f039c142b3e93722350f8ba380afbedad7616","observation_id":"cbab3140-898f-4cc1-af1f-5adf410ed2c3","resolution":{"observed_at":"2026-08-07T13:10:38.365483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.019331Z","title":"A., and Peters, J","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.019331Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7b10a9c22e3635eb518ea1954b158b6baa67a1bc8f2999a6958c143644089a40","observation_id":"a733ded7-9ecf-4b7d-a69f-896fc7515207","resolution":{"observed_at":"2026-08-07T13:10:21.019331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:37.871182Z","title":"and Zariphopoulou, T","venue":null,"work_id":"1921dbab-abcd-449c-a322-ba4966c0151b","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.140695Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f29986b8f83418d862f0b60ab7aef3093e1a3c2ba9dea237747992fa00c0d467","observation_id":"b216d78f-32db-4a42-9f27-166e20c2548e","resolution":{"observed_at":"2026-08-07T13:10:38.039128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:37.551313Z","title":"and Lions, P.-L","venue":null,"work_id":"5507f896-8246-4207-847a-fca11f385006","year":2006},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.319382Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:01b7d7864a2968eab36c1d4476d57d34ff1bcde4789cf75bf7fec1f1924eb7d4","observation_id":"6137cd43-9af3-45e5-b098-e70a40ca2750","resolution":{"observed_at":"2026-08-07T13:10:37.682067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:37.223065Z","title":"and Lions, P.-L","venue":null,"work_id":"ab9e6917-b048-483e-ab8d-d57cac0cd1cf","year":2006},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.475442Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:9c035ad6566325f0c0d2f0789b768795d131855e11f70206c9d1004f97bf3516","observation_id":"00e46286-6eca-46ee-98e3-ab074020cf14","resolution":{"observed_at":"2026-08-07T13:10:37.358005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:36.993784Z","title":"and Lions, P.-L","venue":null,"work_id":"76e40b00-9369-4255-9208-646bd54e45f0","year":2007},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.678545Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:baae2bf130492618f12d39da825959df30500b2582d0a1f6287c295fb7a6d75b","observation_id":"dc7ff6ff-efdf-4703-ab72-e57f9deb2496","resolution":{"observed_at":"2026-08-07T13:10:37.110259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12944","last_updated":"2024-07-26T18:20:46Z","snapshot_observed_at":"2026-08-08T09:40:53.697167Z","submitted_at":"2022-05-25T17:49:37Z","title":"Learning in Mean Field Games: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12944","snapshot_observed_at":"2026-08-07T13:10:21.805809Z","title":"Learning mean field games: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.805809Z"},"links":{"cited_paper":"/paper/2205.12944","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:274be21aa4717101ecc158ccf1d0957d5fc3202077f313960104be8e34b4bc2b","observation_id":"df7cf107-2d2d-46dd-ad91-acc63b4c49c2","resolution":{"observed_at":"2026-08-07T13:10:21.805809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.939715Z","title":"and Tankov, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.939715Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:428ba328b1dd0ad001351e52ec213db53338250fa999d16e5f03ff5512013ccf","observation_id":"caa7464b-ca39-4d2a-b1a3-52c81f97e0b2","resolution":{"observed_at":"2026-08-07T13:10:21.939715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:36.638116Z","title":"G., and Castro, P","venue":null,"work_id":"4ce83f62-fd7c-40c4-a389-dd14cfcaa56b","year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.118395Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:4bff03790492a9c36779e2d3864d3b787e8b96078653b5e77426da0fd6d4b107","observation_id":"b4ef1a75-91d8-4d15-95cf-65c2afa50d05","resolution":{"observed_at":"2026-08-07T13:10:36.778709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:36.389648Z","title":"A mean-field game approach to cloud resource management with function approximation","venue":null,"work_id":"200ce5df-9814-4909-98b6-a2a6793df166","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.294882Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:aca0c45f16da5c79db81794a9abc54684800a3eea2a83d95d1ff0c716a891128","observation_id":"061924ee-e8d9-42d4-a570-edba6260118a","resolution":{"observed_at":"2026-08-07T13:10:36.518742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:36.082477Z","title":"I., Fern \\'a ndez-Gaucherand, E., Hern \\'a ndez-Hernandez, D., Coraluppi, S., and Fard, P","venue":null,"work_id":"46ea1e4d-5207-4cfa-9d36-ba14513527da","year":1997},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.422162Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:5652f86ca8237e13d2c60775ae2804c422bb20afbc5b04edfb354c9bd7fb71e8","observation_id":"e4d9343c-f81b-4127-ac4e-b3612d920a9b","resolution":{"observed_at":"2026-08-07T13:10:36.242074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:35.807947Z","title":"J., and Le Fort-Piat, N","venue":null,"work_id":"e11505d0-e594-4661-8bf0-0013041b1a05","year":2007},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.542113Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c27c1267b0e389b36823065be10a03a7289a9a9c7dfa1d30f832bc07933e840a","observation_id":"62b0348e-6afa-4d28-a1a0-b1e1d296efc5","resolution":{"observed_at":"2026-08-07T13:10:35.938947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:35.542726Z","title":"On the global convergence rates of softmax policy gradient methods","venue":null,"work_id":"62395432-3bd2-4ba8-ac9d-4a57a7a24af0","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.629063Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:13420fcb2231f9c91ba25b0748a84d3f5d762b8e3bbb70bc8e5c23d2362c0fc0","observation_id":"c2192078-c026-4f09-9341-aeb0ddfb1cd0","resolution":{"observed_at":"2026-08-07T13:10:35.674906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:35.213275Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"962c360c-0ce0-4279-8bf4-387ab5992f9c","year":1928},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.697117Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:34530003329358a1dfb3d8dbf5caa291011951332fec15c2dcaf21fa77e30d6e","observation_id":"179377ee-779a-40c0-adfe-684e4f89a49c","resolution":{"observed_at":"2026-08-07T13:10:35.407930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:34.796694Z","title":"Equilibrium points in n-person games","venue":null,"work_id":"aad04bde-6e38-4e2c-8ae6-5e658e038941","year":1950},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.825724Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f4e59246e6c235968824e866389932a63de9e8b8d438c5c6d979207288decca1","observation_id":"deee8e41-6131-4519-83d0-0d81307edf98","resolution":{"observed_at":"2026-08-07T13:10:35.017098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:34.478062Z","title":"Non-cooperative games","venue":null,"work_id":"bf051be7-e944-43bf-a97d-a3f37e9f34d6","year":1951},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.945284Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:9a3f06d37de40bcd0cdd82e1c647d78c61cd63d4697c2b21e4035e3b2bd0ffc7","observation_id":"9459171a-5cd1-4b5f-a64c-ace63906c4e2","resolution":{"observed_at":"2026-08-07T13:10:34.652398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-07T13:10:23.087809Z","title":"A unified view of entropy-regularized markov decision processes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.087809Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:acaa07234090bd3bb6438ef995418dd9bd6b64e7cfd827c73232046191c87db7","observation_id":"8797b717-c186-4857-a0cb-d49e42ae35a9","resolution":{"observed_at":"2026-08-07T13:10:23.087809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:34.097888Z","title":"Combining policy gradient and q-learning","venue":null,"work_id":"68ce6767-9aed-4baf-9c90-a070ab114ac9","year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.258768Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:d4b2b5ec245657bdebc59d4381022648f9f5d279046ada483e31d23b8b39ae76","observation_id":"d45e711e-b08b-4bf2-b8aa-78fad369ea65","resolution":{"observed_at":"2026-08-07T13:10:34.305505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.834643Z","title":"Scaling mean field games by online mirror descent","venue":null,"work_id":"75a45bc7-fd56-4e72-b69f-b1a9de876376","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.407117Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:ba2749e9981f0a370c92b62c12dda5edd645c53c8822b5014f70a8187eba91d5","observation_id":"6a6656f1-46f9-4cf2-a0f6-3db7528d17c0","resolution":{"observed_at":"2026-08-07T13:10:33.964017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.536360Z","title":"Fictitious play for mean field games: C ontinuous time analysis and applications","venue":null,"work_id":"55d40987-b47d-4725-bb09-220ce743fe7c","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.669181Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:4abd8c7771aa935c8cecaaf884eb482aa2c174c47b394dbaeb4dc928b99f48ee","observation_id":"d341e81a-6d43-4e45-9261-cf9318c72e8f","resolution":{"observed_at":"2026-08-07T13:10:33.667286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.07933","last_updated":"2021-05-17T15:17:36Z","snapshot_observed_at":"2026-07-06T11:10:07.425725Z","submitted_at":"2021-05-17T15:17:36Z","title":"Mean Field Games Flock! The Reinforcement Learning Way","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.07933","snapshot_observed_at":"2026-08-07T13:10:23.894935Z","title":"Mean field games flock! the reinforcement learning way","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.894935Z"},"links":{"cited_paper":"/paper/2105.07933","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7b32d7f7c65406baa5032f7216eb46dc3170a3a2540610aa735965e2a443619e","observation_id":"9804e0d7-ba49-4ec8-b59b-1efd1be482c1","resolution":{"observed_at":"2026-08-07T13:10:23.894935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.282444Z","title":"Generalization in mean field games by learning master policies","venue":null,"work_id":"7033d0ed-9477-4360-9881-f6f3cb09ad27","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.088295Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:4dbaa57109f33c6e2cee82343a62d25f58d8e8433476f6de5f140e13093e609a","observation_id":"ed45f950-7f0f-4a09-9c65-7cf997065bfc","resolution":{"observed_at":"2026-08-07T13:10:33.421759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.080308Z","title":"Relative entropy policy search","venue":null,"work_id":"0fc41264-d54f-41b3-ad06-18d364ed6492","year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.280777Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:a9e8f7a0e15d57958fa2d36acd06765f24e9a819561a5bb52ef0a84caaed8dcf","observation_id":"6f072f44-c0b5-4a69-907c-fc5f15848068","resolution":{"observed_at":"2026-08-07T13:10:33.137548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.861828Z","title":null,"venue":null,"work_id":"8a1816a7-1160-4549-83aa-53ff751cfb00","year":1978},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.415989Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:88ad7eabf538a18304113a8f6ace47cb51710d3a1e091f7847ad0d3d51cbbd9c","observation_id":"a6d8c63e-2826-4cb1-8ef4-c27bdf46da08","resolution":{"observed_at":"2026-08-07T13:10:32.954863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.715470Z","title":"Risk-averse dynamic programming for markov decision processes","venue":null,"work_id":"3e9eb590-37f3-4a43-9032-edb6600f2059","year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.501979Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:eb2acf95241cb1a1cdcbba9b99a521593376f9126a2377ee72d307f3f213a996","observation_id":"b27f4cb1-4c6d-4247-9f29-14222d27e36e","resolution":{"observed_at":"2026-08-07T13:10:32.785228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.435150Z","title":"Discrete-time average-cost mean-field games on polish spaces","venue":null,"work_id":"afd93a53-a98e-4994-b6f5-efae8b2f2e4e","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.662129Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:976220980f039ec4344c6cb8771da5da2ec1d2819a5e021709e42cd8f9379ffd","observation_id":"78eb7089-8b69-4d91-8dea-1905199a3f2a","resolution":{"observed_at":"2026-08-07T13:10:32.563548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-08-09T00:58:24.558416Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-08-07T13:10:24.777756Z","title":"S., Farquhar, G., Nardelli, N., Rudner, T","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.777756Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:62eaf5811b7bf3cec76845e29132deb66d6683cd6a6e74bcbe96eef1e3bd1dbb","observation_id":"a06817dc-94c0-40e9-b3b1-aced4a8a7c3e","resolution":{"observed_at":"2026-08-07T13:10:24.777756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.172367Z","title":"and Geist, M","venue":null,"work_id":"343aa147-7793-46f7-afb7-86b2a283bc8d","year":2014},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.904569Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:d872b63e64e8e965a7d04909085d6baf18116cb553b7eed5533b1881bec93ba3","observation_id":"27eef3f0-dde0-4a7e-9fbb-adfc6193a832","resolution":{"observed_at":"2026-08-07T13:10:32.297226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.937616Z","title":"Trust region policy optimization","venue":null,"work_id":"fbbf79ca-19d0-4821-8dc6-dfdc457c3875","year":2015},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.085428Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:db612cf3b4e9ba46525ed9a48668462a0ba7fc548e117b38c8100114cd780fd0","observation_id":"17cde2f0-fc39-4990-83b9-63c2af12ed7f","resolution":{"observed_at":"2026-08-07T13:10:32.042431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-03T05:49:14.071341Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-08-07T13:10:25.197393Z","title":"Safe, multi-agent, reinforcement learning for autonomous driving","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.197393Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:2b41953b006c78a8c8eed53b923e8e205d86117925f77048cb4fd070fa8efb8f","observation_id":"e163f9de-fd01-4a78-be95-55c051baff8d","resolution":{"observed_at":"2026-08-07T13:10:25.197393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.692343Z","title":"Adaptive trust region policy optimization: Global convergence and faster rates for regularized mdps","venue":null,"work_id":"94f98816-89a2-44d3-abdd-7ec2afef1061","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.356684Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:01a0e60bc403efae3ba9f6726a2eb29dca18dbcc3c7b822a3c5aefce05d5f27f","observation_id":"62a70fbc-ee7d-4dfb-82e9-fedcc03f6342","resolution":{"observed_at":"2026-08-07T13:10:31.863235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.429244Z","title":"Near-optimal time and sample complexities for solving markov decision processes with a generative model","venue":null,"work_id":"1632576e-a62e-4778-a0f0-9a87fd907d7b","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.492393Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:009a254bb3f74c4be8bbebfd6297c18af616830630e20566e933e861fc3aaced","observation_id":"c61aa626-fc8a-479d-9489-b171f6d3fac2","resolution":{"observed_at":"2026-08-07T13:10:31.502983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.239621Z","title":"and Barto, A","venue":null,"work_id":"4a50f7c2-8d02-43df-8f15-98d020adaaaa","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.663184Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:fd8e19b26fd13beda74d6e4045c30b6aa316afe0053ff9f1da8ba6f52798040f","observation_id":"c285cf1f-31d3-422b-9690-aae4aa618c9a","resolution":{"observed_at":"2026-08-07T13:10:31.332007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.027052Z","title":null,"venue":null,"work_id":"77b2806d-c4a3-406d-b7b7-ad05fac7c5b4","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.789076Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:4cdec394a21ee2118adc6fae0bca583ceddb8a9c77321cc152b5c69decab6d3d","observation_id":"bd5dc256-aa0c-4404-8f4f-3f0e0ae72acd","resolution":{"observed_at":"2026-08-07T13:10:31.146473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.733199Z","title":"Algorithms for reinforcement learning","venue":null,"work_id":"fdd74397-edb1-499c-bf5e-3a36d08847d0","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.976783Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7ac750ca41badebcb46a7a163f92eed968a432c1fdceb6f0d1985479091a1f1f","observation_id":"8f602fc9-608c-4b01-8d32-15962ae3e3ba","resolution":{"observed_at":"2026-08-07T13:10:30.866770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.514628Z","title":"and Zhou, X","venue":null,"work_id":"2842e59a-cda6-4b3f-8777-e3c23af16c96","year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.108732Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f80b3d6ab0354952af8c2343a6a15333ff27637e4b003b0796b4bfff0b61cc8d","observation_id":"d97a3575-cbc2-4494-a256-039da6b3be71","resolution":{"observed_at":"2026-08-07T13:10:30.584759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.169898Z","title":"Deep learning-based numerical methods for high-dimensional parabolic partial differential equations and backward stochastic differential equations","venue":null,"work_id":"f46af003-4058-45e0-aace-7c145b3a398b","year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.241320Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:16bc1fa776868aaa937fe297f3bfd0735b9d609c455a4e13c528fcb22b25bf47","observation_id":"d23c640d-f2cb-4332-a07e-46bc412993b2","resolution":{"observed_at":"2026-08-07T13:10:30.349052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.881151Z","title":null,"venue":null,"work_id":"c9c1ce03-5270-4070-ac3b-7c34b08b0c99","year":2000},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.416453Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:ddbd34901d11a8efccf56cddf22b0d33bb772d79af2d20f7ac35774317050873","observation_id":"14ce55e6-3de5-4025-be1d-644c4611101b","resolution":{"observed_at":"2026-08-07T13:10:29.996593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.540877Z","title":null,"venue":null,"work_id":"c3fbaf7a-602f-4308-b909-9bbc7d8d9cab","year":1991},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.554078Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:86300998b0b17de794564de5c82613672e85193f34596d84a8532ff270fe5a91","observation_id":"c4948045-4cdc-45ec-9ad2-856d0e229c0e","resolution":{"observed_at":"2026-08-07T13:10:29.720378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.260065Z","title":"Policy mirror ascent for efficient and independent learning in mean field games","venue":null,"work_id":"35e89a22-0686-4561-9033-3e7965f7117b","year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.764903Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f2091b45143a3e36c084ef53c78f454e6b82b300d8d7b178d4f30828950abf5c","observation_id":"97283845-d13d-4399-bf3c-36ce0d4ffa19","resolution":{"observed_at":"2026-08-07T13:10:29.386478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.128253Z","title":null,"venue":null,"work_id":"5e771a5d-3fc2-4e8f-908f-f3edb8bafe00","year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.017211Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:32debcb230084a7bb9573cd72dc2b252ae320ebaa92932f40e27a2bf697f1943","observation_id":"e4890fa3-9eba-4808-83e8-edca356f2b54","resolution":{"observed_at":"2026-08-07T13:10:29.189716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.893949Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms","venue":null,"work_id":"ceda253c-c6da-4aad-adf8-3c198f8fecc2","year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.275330Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:0191cf0088f5ba03a20ec0ad1a28810e7ab60e1f4c389382defc50a2da7008f1","observation_id":"83382493-16e4-41c4-bcf8-b5ca657e6f61","resolution":{"observed_at":"2026-08-07T13:10:29.016638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.440566Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.440566Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:426433d89ff8e73f8b9be4bed71b8d7afd4435baa51a1f6a5ca9dcfc2875261a","observation_id":"a2658e27-0b40-4d5f-b58c-a51f579f4b39","resolution":{"observed_at":"2026-08-07T13:10:27.440566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.759003Z","title":"D., Bagnell, J","venue":null,"work_id":"092c3550-8225-46cc-8738-2dff81773637","year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.525688Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:d28b81ba78395d56da038e31d69d3178c22095c47e01c461c869207002840d79","observation_id":"010bacfd-047a-4a62-9ea7-646781f58239","resolution":{"observed_at":"2026-08-07T13:10:28.811262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.705945Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.705945Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:d4ea16d413dfe56943482c46c46217191e0832cd842ba15ddfb89f402ec61bbb","observation_id":"26a31921-354f-45b5-b123-62d2532794ca","resolution":{"observed_at":"2026-08-07T13:10:27.705945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-08T05:00:44.050132Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":54},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 1 inbound Pith citation observation for arXiv:2505.22781."}