{"as_of":"2026-08-16T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:774dcb43f78865cfe576b3e8c93fea0e3d835640e99e356757313a8f29933d7d","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:59:48.980316Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.02016/citation-record","integrity":"/paper/2412.02016/integrity","json":"/paper/2412.02016/citation-record.json","paper":"/paper/2412.02016"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:50.166985Z","title":"Game Theory: Analysis of Conflict","venue":null,"work_id":"bdcf0f75-5cdf-403e-9e3c-7cf88f84ef4e","year":1991},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.547329Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:ffe357bfcb0490dc607203b77afad6604990df8cb44c79c97272a89c13776451","observation_id":"c4847d24-0244-46fa-b7b9-5f18e4885b1c","resolution":{"observed_at":"2026-08-11T23:59:50.175594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:50.123481Z","title":"Three-player games are hard","venue":null,"work_id":"6d12f087-cddf-431d-a7a0-50bb0434bf96","year":2005},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.577695Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:47a8e7a5cf5b22cb5e506e933264b4fb975c4eeb4c32810a9e9fd595b06d3595","observation_id":"ca1e0a86-466d-4555-a3e9-4319b3998854","resolution":{"observed_at":"2026-08-11T23:59:50.130353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:48.585577Z","title":"MIT press, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.585577Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:84f40aeec00a27bcf6c460dec1691a25cd83a31026eb029110847924f491e825","observation_id":"09042e0d-ea45-407c-8610-300d7272c35f","resolution":{"observed_at":"2026-08-11T23:59:48.585577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:50.067037Z","title":"Recent developments of game theory and reinforcement learning approaches: A systematic review.IEEE Access, 12:9999–10011, 2024","venue":null,"work_id":"ea87e1a3-3237-4886-aba8-cf68465e68a8","year":2024},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.597358Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:f1fb14a2561913e8c514623bc0b411304c83886cb1d4777f5396c9c32c394cd5","observation_id":"848b09e5-6c31-4789-be38-56417bcb46ce","resolution":{"observed_at":"2026-08-11T23:59:50.078787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:48.618480Z","title":"Schapire","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.618480Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:4cb804ddc2e725257b98a3daffd7aa175e698b355a4269fa5fa3a93120267aa5","observation_id":"4a0d0cf7-4197-439d-9d26-979a1da01723","resolution":{"observed_at":"2026-08-11T23:59:48.618480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:50.000873Z","title":"Explore no more: Improved high-probability regret bounds for non-stochastic bandits","venue":null,"work_id":"f12aee25-8842-43ba-bb9d-aed1cb5e73dd","year":2015},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.654966Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:1331e689fcccacbe83a84a9c487bf14c92b3385a4bfc546146a1034404fa5f59","observation_id":"bf46e130-0353-4eba-b79b-48a650236886","resolution":{"observed_at":"2026-08-11T23:59:50.017368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.904742Z","title":"Eqilibrium approximation quality of current no-limit poker bots","venue":null,"work_id":"8350b95a-0930-4d1d-a858-233a2c52c577","year":2017},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.662108Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:9ff76672384267bbadb04e34c74b1b4d734d423544cba8ac8e896c19a777cc32","observation_id":"49094ab9-30a2-4735-be4b-54b906123b20","resolution":{"observed_at":"2026-08-11T23:59:49.958199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.846985Z","title":"Cambridge University Press, 2007","venue":null,"work_id":"765f30fc-9567-4796-af97-46f2b609abbb","year":2007},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.697187Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:8fba94510bea0d3d08de63b50f910824df7fdc8f3f107d87359c6f877ae7789b","observation_id":"42ee4dc4-3d5e-4755-b10c-d4fd256a72c4","resolution":{"observed_at":"2026-08-11T23:59:49.855954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.767120Z","title":"The complexity of approximate (coarse) correlated equilibrium for incomplete information games","venue":null,"work_id":"e9ac9bfa-1393-4b01-b81b-ba46580d0c52","year":2024},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.706982Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:1e6ac47be729c1e40787861032d0473e54dec8727556deae92de32d1c290d4d4","observation_id":"31f8c99c-8389-4bcc-ae1f-26d5f3691baf","resolution":{"observed_at":"2026-08-11T23:59:49.796293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.708498Z","title":"Coarse correlation in extensive- form games","venue":null,"work_id":"b7e15f4e-72bd-4dce-bc98-6e5d9b5a7612","year":2020},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.712810Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:3d7d15bdd3ff80fb492f1f9305cbe43e51d15524cc9469d0228c930be637d0c4","observation_id":"fa5fe846-6aab-4c44-9f63-e93a9c76b7ce","resolution":{"observed_at":"2026-08-11T23:59:49.718662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.664961Z","title":"Cambridge University Press, 2006","venue":null,"work_id":"7f4089ec-c605-4841-96ce-19057f6a99b1","year":2006},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.730237Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:ce9c7c3b74f9b1be8eebdc1627f8dc585211c8cac55e0bd4ed0afaae13fff7da","observation_id":"95ae39fb-bf7d-4462-980e-3b830e5e1525","resolution":{"observed_at":"2026-08-11T23:59:49.671647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.623611Z","title":"Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems","venue":null,"work_id":"0fd0d981-922e-4d98-8cc6-608db08a02dd","year":2012},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.737342Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:c2335e0db92c59d359ac19ccbbd5095a87f3744d6233ce6a9127a567209e9436","observation_id":"ff2195f1-d24d-4549-bbb9-9d81a997c093","resolution":{"observed_at":"2026-08-11T23:59:49.630806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:48.745863Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529–533, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.745863Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:9ee15172bfbe2d92fcd7295b96aea3c8b4dbb583b6e5a0d479caeaaaafe81d6c","observation_id":"2743a2ac-1fd2-4aec-9347-3624f55bf5f2","resolution":{"observed_at":"2026-08-11T23:59:48.745863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:48.762187Z","title":"Policy gradient methods for reinforcement learning with function approximation.Advances in neural information processing systems, 12, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.762187Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:9b2b2cd7fbc9e26054436fe692e272b628e8862d5a295a99b4a198d2721fd92a","observation_id":"0527151a-094a-4d79-891c-7b34810a5773","resolution":{"observed_at":"2026-08-11T23:59:48.762187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-11T23:59:48.794755Z","title":"Trust region policy optimization.arXiv preprint arXiv:1502.05477, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.794755Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:ceb49adc62466f0fda673e54ef70fc8961334b0bfb2999bc4265352ef1c1af2a","observation_id":"dece90e3-ea94-45d2-b68d-ac18fc6fa985","resolution":{"observed_at":"2026-08-11T23:59:48.794755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T23:59:48.824823Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.824823Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:50863b4c7d2f407336b067f9ff10ffd554cdee01dcfd44b717ec2166fbd14ac1","observation_id":"dc7ccef7-f6e1-4dce-a76b-e1ed706ce376","resolution":{"observed_at":"2026-08-11T23:59:48.824823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:48.859418Z","title":"Multi-agent actor-critic for mixed cooperative-competitive environments.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.859418Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:ae257ad4f1f60c53c4e7be1bddf73431486bf5b47142616b469ee0ff82ca6972","observation_id":"8685981c-d5ec-4895-bc7f-d122561f7578","resolution":{"observed_at":"2026-08-11T23:59:48.859418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.491925Z","title":"Convergence Proof for Actor-Critic Methods Applied to PPO and RUDDER, pages 105–130","venue":null,"work_id":"f61bce35-74bb-45dd-b18f-48e864ccae96","year":2021},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.865394Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:7908f7ed2c8e494412a73ef58dd4f4a3772ae55222d0305c6ccf863a21de623d","observation_id":"708c3d88-6fc1-4112-85fd-80f9dd7296bc","resolution":{"observed_at":"2026-08-11T23:59:49.519980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.09118","last_updated":"2021-08-20T11:32:23Z","snapshot_observed_at":"2026-08-13T18:44:41.873396Z","submitted_at":"2021-08-20T11:32:23Z","title":"CybORG: A Gym for the Development of Autonomous Cyber Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.09118","snapshot_observed_at":"2026-08-11T23:59:48.889248Z","title":"Richer, Junae Kim, and Damian A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.889248Z"},"links":{"cited_paper":"/paper/2108.09118","citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:a56ad008759935c35b8bc41f5c42bab88d767df860e4009aa382196a8efc8608","observation_id":"8bb01468-c5d0-4725-8992-a4b353f46fcc","resolution":{"observed_at":"2026-08-11T23:59:48.889248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07388","last_updated":"2023-09-14T02:09:36Z","snapshot_observed_at":"2026-08-13T10:14:02.898498Z","submitted_at":"2023-09-14T02:09:36Z","title":"On Autonomous Agents in a Cyber Defence Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07388","snapshot_observed_at":"2026-08-11T23:59:48.907642Z","title":"On autonomous agents in a cyber defence environment.ArXiv, abs/2309.07388, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.907642Z"},"links":{"cited_paper":"/paper/2309.07388","citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:1c1cbef0852a72ac074ddd2d4e8b655608f298436a25e127d8c425640361cf54","observation_id":"2e132313-3a13-4f00-8e49-ecfac322a7d9","resolution":{"observed_at":"2026-08-11T23:59:48.907642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.462115Z","title":"A Bradford Book, 2018","venue":null,"work_id":"d46aea10-73f7-4936-8409-9f6987cd4c88","year":2018},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.944754Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:d8aea431f61d6067c7eaadcf69c937a866be7f93d1d253bd45432bf255a56cdf","observation_id":"1c6cfd61-7065-4898-8a75-cbb9ecb15e04","resolution":{"observed_at":"2026-08-11T23:59:49.468476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:48.963482Z","title":"Using confidence bounds for exploitation-exploration trade-offs.Journal of Machine Learning Research, 3(Nov):397–422, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.963482Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:10f2b5f43e547380cdec03bb38295925aad52643dd301be9792eab2bc11cc134","observation_id":"2d58370f-bfcb-4b07-b021-a76659ab6e08","resolution":{"observed_at":"2026-08-11T23:59:48.963482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:59:49.401289Z","title":"Flaxman, Adam Tauman Kalai, and H","venue":null,"work_id":"f7e3c08b-d2cd-4513-bf53-03f50784762f","year":2005},"citing_paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:59:48.980316Z"},"links":{"citing_paper":"/paper/2412.02016"},"observation_digest":"sha256:a97516a41fbe6439c55e9aba600e6d2b8372a75712142f15d847d4667f79564b","observation_id":"14cb441b-4c9d-414a-a3b9-3180250947f3","resolution":{"observed_at":"2026-08-11T23:59:49.410289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.02016","last_updated":"2024-12-02T22:37:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:47:28.933842Z","submitted_at":"2024-12-02T22:37:59Z","title":"Explore Reinforced: Equilibrium Approximation with Reinforcement Learning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2412.02016."}