{"as_of":"2026-08-09T11:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9ba0358b7ba7a6f02128bef745355d201cd8cdc1c176f96769bf585051a2458","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:22:20.728645Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19928/citation-record","integrity":"/paper/2607.19928/integrity","json":"/paper/2607.19928/citation-record.json","paper":"/paper/2607.19928"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.565114Z","title":"Başar and G.J","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.565114Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:ef457ff54c4489be6b2eb7c6f7174022aab7911bf7345615f48b2f0948fc1557","observation_id":"d06da8c5-3bad-4d2f-825d-5c77a6105fc0","resolution":{"observed_at":"2026-08-01T11:22:20.565114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.570220Z","title":"Bouchard and N","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.570220Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:6f8be2fe7c70cf972c4921ace65caf161a779ada319f9f33b8f1eb34998c65bd","observation_id":"7aafdae3-4a94-40f8-a31b-b0fb9ff89a67","resolution":{"observed_at":"2026-08-01T11:22:20.570220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.574696Z","title":"Buckdahn, P","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.574696Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:1c5a3c476ba1048b10fd1de82958601be43e0fce737b83d0dc7edb409c58bd4e","observation_id":"7b31b335-27b2-43b6-ba67-000bd3af2580","resolution":{"observed_at":"2026-08-01T11:22:20.574696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.579306Z","title":"Buşoniu, R","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.579306Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:ae594e2d3df4dac7074f3c46196af0d1cc57bdefc2376e30ac435bf92adc2e7c","observation_id":"5d10ffc7-8672-4e90-8abe-68e0012e73d7","resolution":{"observed_at":"2026-08-01T11:22:20.579306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.583484Z","title":"Carmona and F","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.583484Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:de56031b2290914ff09c377e785f2dce0d3ba35ac39e46160674bf71bb8f53f3","observation_id":"87893005-eae9-471a-9676-6fb86519d5bb","resolution":{"observed_at":"2026-08-01T11:22:20.583484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.587571Z","title":"Dockner, S","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.587571Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:f72e99dde125c8adc763542bf9dbdb28891801f6877e9acb7affc8500b5bd09c","observation_id":"3b2649f5-97c9-4d13-b215-a83db45c365d","resolution":{"observed_at":"2026-08-01T11:22:20.587571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.592027Z","title":"Fleming and H.M","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.592027Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:62b2a1332df6ed037fdb8d5c55ad6276a16933e06373345cd0d13ea19b94e9ff","observation_id":"08040e2d-72c3-4f18-ba10-2695434055f3","resolution":{"observed_at":"2026-08-01T11:22:20.592027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.595905Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.595905Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:5766f5aeef9acb906d31dba2affcd21dfbf5c14576c8a345bbb2262465c4f293","observation_id":"68e41935-8c6d-4748-86ee-6e460ff9db31","resolution":{"observed_at":"2026-08-01T11:22:20.595905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.600048Z","title":"Springer, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.600048Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:93ff44722be8d8bb0040a4a211b6adf823b629d9915e23ae1540b237bc541341","observation_id":"f149baea-b9c0-43bc-a52d-81f1d526e381","resolution":{"observed_at":"2026-08-01T11:22:20.600048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.603807Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.603807Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:085c98814f37faec8c15e2c6b46979c05d47f07e598ad264fd8e5254970fd6fc","observation_id":"45546477-f6d9-44ec-9b83-a1dee15030a8","resolution":{"observed_at":"2026-08-01T11:22:20.603807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.607761Z","title":"Anα-potential game framework forn-player dynamic games.SIAM Journal on Control and Optimization, 63(4):2964–3005, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.607761Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:24d46823573cbda5cf273ef0e70f86cd5622d981b3df16dce910d876da99763c","observation_id":"7330bed7-adf5-4f46-a209-96a5dae68633","resolution":{"observed_at":"2026-08-01T11:22:20.607761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28669","last_updated":"2026-06-27T01:03:53Z","snapshot_observed_at":"2026-08-07T06:27:01.587182Z","submitted_at":"2026-06-27T01:03:53Z","title":"Entropy Regularized Reinforcement Learning for Zero-Sum Stochastic Differential Games in a Regime-Switching Jump-Diffusion Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.28669","snapshot_observed_at":"2026-08-01T11:22:20.611862Z","title":"Entropy regularized reinforce- ment learning for zero-sum stochastic differential games in a regime-switching jump- diffusion process.arXiv:2606.28669, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.611862Z"},"links":{"cited_paper":"/paper/2606.28669","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:ef14be0cde42cf9dd1e1363cda73c96bb13977d7bcdb4b13ba231a22e1b1f877","observation_id":"944c4818-b030-4d57-804c-5689ca96aa46","resolution":{"observed_at":"2026-08-01T11:22:20.611862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28671","last_updated":"2026-06-27T01:17:22Z","snapshot_observed_at":"2026-08-08T22:57:39.907648Z","submitted_at":"2026-06-27T01:17:22Z","title":"Entropy-Regularized Reinforcement Learning for Linear-Quadratic Stackelberg Differential Games in Regime-Switching Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.28671","snapshot_observed_at":"2026-08-01T11:22:20.616066Z","title":"Entropy-regularized reinforce- ment learning for linear-quadratic stackelberg differential games in regime-switching diffusion models.arXiv:2606.28671, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.616066Z"},"links":{"cited_paper":"/paper/2606.28671","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:9170810f1781bdc29078c52e2ceb8177ba928e5c1d7534b9721f9166c602749e","observation_id":"717eb36c-0c83-489d-b9b4-c6cf628148f9","resolution":{"observed_at":"2026-08-01T11:22:20.616066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.620044Z","title":"Recent developments in machine learning meth- ods for stochastic control and games.Numerical Algebra, Control and Optimization, 14(3):435–525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.620044Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:315a422231d19ec013dd280159fd68e4cc801524522dce343a68ac67ac1650ee","observation_id":"842a9b81-0c06-4678-9a1b-da69c8cd85bd","resolution":{"observed_at":"2026-08-01T11:22:20.620044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.623927Z","title":"Huang, P.E","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.623927Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:2ba9e595d00bae2efffbf89609faae238fd48b80d897a6f820ad3f9a6eaa5701","observation_id":"1eceffb0-0050-45fb-9408-7358beba4edc","resolution":{"observed_at":"2026-08-01T11:22:20.623927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-08T07:29:46.503525Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-08-01T11:22:20.627811Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.arXiv:2512.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.627811Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:70af40efd9eb43667fa54ec6ea2251215e78d6af3769c1f7f17f04150871d2c5","observation_id":"e4888772-7b01-4209-aa7b-cd21a5fdc2f2","resolution":{"observed_at":"2026-08-01T11:22:20.627811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.631946Z","title":"Sublinear regret for a class of continuous- time linear-quadratic reinforcement learning problems.SIAM Journal on Control and Optimization, 63(5):3452–3474, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.631946Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:2de19a9e9f3da46aea3547d74c53f9f2a1d89488357e4e2c116adfe210179a9f","observation_id":"0bba2d55-4741-4b6d-a2d9-b02a49d9c8ad","resolution":{"observed_at":"2026-08-01T11:22:20.631946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-08-01T11:22:20.635669Z","title":"Data-driven exploration for a class of continuous-time indefinite linear-quadratic reinforcement learning problems.arXiv:2507.00358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.635669Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:9a7ae04b51483e77e1d1d3d0fe6439f89759f08b21dcb8033f8bfe414d4ab5cc","observation_id":"2a8504d5-6aa5-4220-9480-8210bd94ac96","resolution":{"observed_at":"2026-08-01T11:22:20.635669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.639819Z","title":"Jia and X.Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.639819Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:0d1c5c7d3a5fdbd1161c12cb731afe7794f32353cc86b4f219dfb95d865cbfa8","observation_id":"517acc6d-724f-4675-aca9-d448b4f2a479","resolution":{"observed_at":"2026-08-01T11:22:20.639819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.643824Z","title":"Jia and X.Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.643824Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:f4e7ae87ec7260851895647ff948fa0adcb1fdcc3ed486907af4a52bb3ed63f5","observation_id":"62e0d2ed-5d8d-4da5-9163-1ce0b9d106a3","resolution":{"observed_at":"2026-08-01T11:22:20.643824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.647639Z","title":"Jia and X.Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.647639Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:a9fbd21ffb988377c3b13cafbad368f30510d47e7d9b01286f607e72b773de82","observation_id":"c322874c-fb4d-4158-a533-e533105f53d0","resolution":{"observed_at":"2026-08-01T11:22:20.647639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.651537Z","title":"Karatzas and S.E","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.651537Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:f4ea8a720e7ad84072244c903173d4dbddc866d12051ee01ac6e81d7b629eb2d","observation_id":"1daf5aba-d84e-46d7-bde3-c5a56bcf4254","resolution":{"observed_at":"2026-08-01T11:22:20.651537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.655449Z","title":"Krylov.Nonlinear Elliptic and Parabolic Equations of the Second Order","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.655449Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:68845151c3a4322d7e7f27e59bcdd837ff62f501d2b48139515ca76b624d4fe5","observation_id":"f941b0b6-b5eb-4916-bf0e-6bb32294040f","resolution":{"observed_at":"2026-08-01T11:22:20.655449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.659370Z","title":"Ladyzhenskaya, V.A","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.659370Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:677a3e941c528ec29782bec40e93ae8e50d1665defe2ecec8f7cdbdeaf3ff9ae","observation_id":"3fa5b3e9-a62c-4746-8aff-9f0693063227","resolution":{"observed_at":"2026-08-01T11:22:20.659370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.663451Z","title":"Lasry and P.-L","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.663451Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:d366b9ac77778e7cb25fa894e0b17d818fa4d8d2c9e25b9edcdc3e4da4be9b24","observation_id":"4092ac45-138c-46ca-89b6-82329c8fd0bd","resolution":{"observed_at":"2026-08-01T11:22:20.663451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.667751Z","title":"Actor-critic reinforcement learning al- gorithms for mean field games in continuous time, state and action spaces.Applied Mathematics & Optimization, 89(3):73, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.667751Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:1a0c38c2d9a293556136296e093382ca5469ce5452ce0aad2894ba1102ca55fb","observation_id":"ea73c6d1-45b6-4829-8fae-809b1166cf53","resolution":{"observed_at":"2026-08-01T11:22:20.667751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.672034Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.672034Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:8a9ae42202751b642c97234af3f0e9be09da1348d63cb8aa8bdaa176468cf8f7","observation_id":"c660c46a-1bee-4ba7-9cad-0bb6e4f720b8","resolution":{"observed_at":"2026-08-01T11:22:20.672034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.676452Z","title":"Mnih et al","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.676452Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:9fc5d4c7befaab92f4c918e9e0c9f3ea2a1c64c7fa966439fbc68c80bb091f87","observation_id":"4d2ba461-18db-48a1-87da-365ca2336570","resolution":{"observed_at":"2026-08-01T11:22:20.676452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.680518Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.680518Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:19138eda72b1cf7d68ad297f70daa114e2781f3442e65165004a8a53a7f81103","observation_id":"a4d7c324-fc34-4202-a87c-90b113d4bbf9","resolution":{"observed_at":"2026-08-01T11:22:20.680518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.684619Z","title":null,"venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.684619Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:da664fe5003232c04717ef79dfb6ee7a41713401eff8019272dc6b4b85c83792","observation_id":"6b5bd82f-5a43-43f3-ba20-0c9ff50cd4be","resolution":{"observed_at":"2026-08-01T11:22:20.684619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.688624Z","title":"Learning distributed equilibria in linear-quadratic stochastic differential games: Anα-potential approach.arXiv:2602.16555, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.688624Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:031455ca0173125a053f82b5b64792ba0a0466c97197f29b19a02a8341cecf3e","observation_id":"d7109b10-09f6-4381-af13-db03688f3ba7","resolution":{"observed_at":"2026-08-01T11:22:20.688624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27372","last_updated":"2026-04-30T03:37:55Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T03:37:55Z","title":"Continuous-time q-learning for mean-field control with common noise, part-I: Theoretical foundations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27372","snapshot_observed_at":"2026-08-01T11:22:20.692590Z","title":"Continuous-time q- learning for mean-field control with common noise, part I: Theoretical foundations","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.692590Z"},"links":{"cited_paper":"/paper/2604.27372","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:7e0869fb814a840ccbd65f48f41528716a6b28cc5d9b7a4e2fdcc6552ca0aa60","observation_id":"da386cc4-6a4a-4eb1-b4eb-0910641b873c","resolution":{"observed_at":"2026-08-01T11:22:20.692590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.696871Z","title":"Reinforcement learning for exploratory linear- quadratic two-person zero-sum stochastic differential games.Applied Mathematics and Computation, 442:127763, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.696871Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:c0f4d7daa88035a1f678771251d4a47ff3d03dd97c29374e8b7eb6807e73545e","observation_id":"24211381-ebd3-4cb3-ab6b-2c4b3f964e1f","resolution":{"observed_at":"2026-08-01T11:22:20.696871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.700770Z","title":"Sutton and A.G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.700770Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:2c26534906e0ca62ca7a480d68bcab6b802f84b4b01e9a27aa508ff28b095cc1","observation_id":"ea6fbfea-33a6-4975-bd56-ce3ab6ecf508","resolution":{"observed_at":"2026-08-01T11:22:20.700770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-01T11:22:20.704553Z","title":"Regret of exploratory policy improvement and q- learning.arXiv:2411.01302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.704553Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:d92aa798b137dec79944024213991ba5aa8aedd837ddca70d95dc41826b56837","observation_id":"4c764ff7-65ef-41ed-ac5a-2d826cecf34a","resolution":{"observed_at":"2026-08-01T11:22:20.704553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.709348Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.709348Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:0c98bae7eb704bd6d8e2eee705eb98266179f50507691c976731f8fbb02cb901","observation_id":"18d40f3f-e0c1-4120-a2be-fe64d20e4678","resolution":{"observed_at":"2026-08-01T11:22:20.709348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.713281Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.713281Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:2ec9d6565770f264356981f15cdc6a1546d4f6d79f6b48b14b6e305f90e79852","observation_id":"e576da72-ae9e-4f0b-a119-3bdd74ebd4e8","resolution":{"observed_at":"2026-08-01T11:22:20.713281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.717121Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.717121Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:ff51b0f3c62ebb89f7d4030eea01c8ce550ac6a4f393e1b3e59dc63f30e98d92","observation_id":"b61a4e65-e746-4664-ae2a-7035de25d74d","resolution":{"observed_at":"2026-08-01T11:22:20.717121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.720868Z","title":"Continuoustimeq-learningformean-fieldcontrolproblems.Applied Mathematics & Optimization, 91(1):10, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.720868Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:3d144ddebc8f13b4ef928a56e7152ebb29d00db7972b2efc4d7820ac81e486ee","observation_id":"39132cc4-3f89-4c08-9e10-d14b113930d9","resolution":{"observed_at":"2026-08-01T11:22:20.720868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04521","last_updated":"2026-07-31T08:57:04Z","snapshot_observed_at":"2026-08-06T03:14:08.152047Z","submitted_at":"2024-07-05T14:06:59Z","title":"Unified continuous-time q-learning for mean-field game and mean-field control problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04521","snapshot_observed_at":"2026-08-01T11:22:20.724649Z","title":"Unified continuous-time q-learning for mean- field game and mean-field control problems.arXiv:2407.04521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.724649Z"},"links":{"cited_paper":"/paper/2407.04521","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:e2b849cafc865e85058988bc9f3a2aa809828beebc09503422586c0c66dca0d7","observation_id":"63e59b80-236e-4bb3-bdd5-36974a329498","resolution":{"observed_at":"2026-08-01T11:22:20.724649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:22:20.728645Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.728645Z"},"links":{"citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:314f7824de035fb65bda8bff944a4fc0e819acd77d329bafda8bbdb5b2e2a9b2","observation_id":"0f5886ff-a829-4fe8-a48e-340def7ae7cd","resolution":{"observed_at":"2026-08-01T11:22:20.728645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2607.19928."}