{"as_of":"2026-08-19T12:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afa630189ea738d233ae4b2eabff1fe675c4a2e2ab304789491a380d78eecea5","coverage":[{"denominator":142,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T04:17:12.534820Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11626/citation-record","integrity":"/paper/2607.11626/integrity","json":"/paper/2607.11626/citation-record.json","paper":"/paper/2607.11626"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Nature , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:e370699df7497d277445d6a071f57180d64befebdecbd87b9689929e7d8973d3","observation_id":"3b13e07c-8818-4835-acdc-1a5bc91c8e77","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Mastering the game of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:7103129ca87dcec5fc08a4df06a35e3d6c04e19ebbb41d4ad166674d43a84947","observation_id":"bd28bf77-378b-44cd-b4e5-650ded9bd911","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2019 , journal=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:5cef0d2ddce6fec3c8dad66842d8a3c1e8d62237e19a3450bcda55f135c8c046","observation_id":"9870bdbc-c5e3-4fa1-b43d-12c7135169d1","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03372","last_updated":"2024-04-11T02:59:07Z","snapshot_observed_at":"2026-08-19T07:13:45.149219Z","submitted_at":"2024-04-04T11:16:16Z","title":"Elementary Analysis of Policy Gradient Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03372","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arxiv:2404.03372 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2404.03372","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:aeace8713479991af4673fb93a5b940a82b4d07c335fbbde4518e64fd86ad796","observation_id":"6193d972-ea4e-4cff-b657-5a0c79578cce","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Starcraft","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:a0a89a229e600ceb3270ec8c22b3dcf6c8119453e342168ba4caa5738db6381f","observation_id":"d0dfd9fc-8476-45be-94a5-c784bf1c7a54","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Science Robotics , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:f065944348b9d8eb016c3ec7d40307a085436024f673fcb2679ef8fd53d6068b","observation_id":"4e9f8405-2753-46a4-9e5c-bd1895dbda7f","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Science Robotics , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:7bee7859645736b85e0caf30ce16d208fd42983481c61075cdb63d587bf58b45","observation_id":"09d04b13-9c04-40e1-a774-5085018c676f","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:6d6ba4df04418476f2ad971d54387767520e19cda780987bfefdb78e2ebf5813","observation_id":"d63c5b9f-acdc-4cfc-ae35-343b22f9f3dc","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03966","last_updated":"2017-05-09T14:41:15Z","snapshot_observed_at":"2026-08-17T19:25:40.889662Z","submitted_at":"2016-06-13T14:17:00Z","title":"Making Contextual Decisions with Low Technical Debt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03966","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv:1606.03966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/1606.03966","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:6dadc48115aace04b4b9da160d99ce84648e29032a76fe42b57c4e7ade6d1647","observation_id":"90cbff71-a513-4551-9c28-a964e005e6ca","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":", booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:582be8d100313c5d86801f687bb72fb0b1866071935c070f2918b843641ed9e6","observation_id":"45d7be47-d62a-42af-895a-f02ae0c7fd91","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Nature , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:589c84b301c35a12165475ec2a4cfbe9bfe7a082c2360d9fb0f262b6d596ac54","observation_id":"afcc29dd-c109-444d-9af3-6fcb2ab98e78","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:660846eee79b78d2d7f69c0b10c05cf3dab5466501b8baeb3dae83e0f810cd01","observation_id":"6963f7b2-8e41-4757-887c-98f08f9bdcdf","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2019 , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:5818b3501048295f9720aae0ab1bdf91a8b28fbb88ff0a15ba306fa4838aa5aa","observation_id":"4ed4838d-fba6-4376-be91-2fe1a0b00981","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Adaptive Trust Region Policy Optimization:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:23c11da55313a9f16bb9017378a4c0689829e6aea27f45db2c490cc98ed4d0b0","observation_id":"c3fa16a0-8415-48f2-ac13-e8d422c37d8c","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"On the Convergence Rates of Policy Gradient Methods , journal=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:631af4cb84215542958eb8eb8360a2bd0eefaa1f48136186fe3634311eae17db","observation_id":"945439db-d11d-4d1c-8466-d9dcd2d8e959","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Mathematical Programming , author=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:d71c1aec67f5b060788f8cade915cbc2d403ef1c8b9e0bc4388318f1d49c3247","observation_id":"1d87765c-ac94-4cd7-b66e-b2c2e52b1107","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Escaping the Gravitational Pull of Softmax , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:94d8e971dd2ab198e206ada188c0487bfa06281e1e99d36f11d795f59458fe6e","observation_id":"b99c6e00-d5f2-4f9c-8b1f-ea6c49544848","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2023 , booktitle=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:f7fb9e72673cafe423687825c3af53d0b5922eceabdf64ff0e3233cba39b104b","observation_id":"135be19a-a105-4e10-9c84-35d3ea8d5be9","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Fast Global Convergence of Natural Policy Gradient Methods with Entropy Regularization , journal=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:d09af0976b6dd63fc2e43bf90861d58a77bacfd918f34a1026cfe32b18d6dacf","observation_id":"18640ec0-9e5b-4089-85ea-26b0eea23c2b","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Mathematical Programming , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:e73740c49322cd1999124b11342aafbdee52592888a6eba4440cbde3b790d1ab","observation_id":"03b727e5-c8db-40cf-8866-3b17ae090699","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"SIAM Journal on Optimization , author=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:32740d0b362c80e46fa56df9d888879d90dec6b11924cdd677d710038fa84e29","observation_id":"e102a90f-255c-47a6-84d6-e22f705e15a3","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Journal of Machine Learning Research , author=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:438a67a6cfcee664def2278786a7c4e2559fba08fe8ce918ef00ca82ad3156dd","observation_id":"a6335e65-410a-4856-808a-d3beda8c08a5","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"On the Global Convergence Rates of Softmax Policy Gradient Methods , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:a753e041329a23c4dc802035446eec8814fc963543c4641eedb80a3adbeeb46d","observation_id":"8347442e-f35f-4fe1-8958-87d9a20f1fe0","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2023 , booktitle=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:8cd14a0fcaa508b560c3e2c8bb7d2686dd292ca3683d97e5ec7588cc82958b91","observation_id":"164c734b-210d-4e4c-bf80-074326ac9032","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2022 , journal=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:bd10137a6460551f412ba7b2ff54afad1896827ce79252ebf5f539a891e1e53a","observation_id":"4ca8a9bc-7716-4b8b-8cef-63f82e6ff550","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"On the Linear Convergence of Natural Policy Gradient Algorithm , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:bcf148b8df6d517dbd4350976e604f51f2ce8f008c184b6efa6109cd62d6cae1","observation_id":"a8f6de46-d4dd-4ea9-a1fa-a61d129806bc","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2020 , pages =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:7f8b2217354243595f9623ce24bb353d5b0563ac796136fe22cc68e4ca1e7f41","observation_id":"0cf8e632-6f80-4343-9bb7-ddb9b27a3fc5","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Artificial Intelligence and Statistics , author=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:2a02b72fe016f152abf638d292a8556939c73e0286c068b70968a0accf6e46b9","observation_id":"33799fd1-79e0-49a1-912e-538909989665","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":", year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:6e3c626ed6c94ff6453106513137477bad2f3a02f948cb40782c045944d2a6ac","observation_id":"18e5f31f-092b-4cc6-bebc-9aad12d58520","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:833e5445fe7855f59a54695ca29ebbc755874e1fc584bc56d0e40c778fcc2b6a","observation_id":"034bdb0b-dc20-424a-9b88-ff9bee76fa8c","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"On the Linear Convergence of Policy Gradient under","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:76c449664958875294d72fb1fddf64950247fe457159a84bbe8efc4aca248113","observation_id":"62401023-607c-4265-8e37-ad4065ec6f3f","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":", title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:72d82c6d07abee29880ed02646c2fb82f9a7f05369f6e6162661d1632a13a5a8","observation_id":"4c54d006-81b5-4b42-84c9-871e9ddecb7b","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Improved and Generalized Upper Bounds on the Complexity of Policy Iteration , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:a80d7860365a9f777f9db9903318dae87f7910401904e7899fc88300aab076e1","observation_id":"f31d2e45-5f33-4d19-a2b2-47cce4bc1abe","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Journal of Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:7ea1486f6f53207d201f0dff6cdcc45c6d8191e3f23c4d916f301725bbbd9e7f","observation_id":"472c6665-bf13-4ba5-8bdb-52f2566c3bc4","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1206.2459","last_updated":"2014-04-24T09:15:51Z","snapshot_observed_at":"2026-08-15T00:57:11.013471Z","submitted_at":"2012-06-12T08:34:47Z","title":"R\\'enyi Divergence and Kullback-Leibler Divergence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1206.2459","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv:1206.2459 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/1206.2459","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:b196009742d3da3cbb97d4b21a975bb577ada9ddb0dadc6b89268e236cc2bd97","observation_id":"70eb4c51-c10e-4e17-8f60-d8c49edc4223","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Machine Learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:084d9be526603338f6b7823ea8c164275a05632ddbf022d4dd3e66952e925f5d","observation_id":"5a0fa521-6daa-4166-aaef-dc8bf32902df","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Machine Learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:773a3f69aed3178311239b6aac4d46a3bf71155fee6744a6d866cf111e588aa0","observation_id":"b46525f3-b451-4c6e-a227-3e11396e9428","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:526ac186151ae6a00b897b1b53d996e7a76461643260bafbac54c13b0b5013a9","observation_id":"eb97c3f5-cd8b-43e1-8aee-3f59eec44e9d","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"A natural policy gradient , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:3a9262693c6ab2ad42e11942778cde5717279e273c09b7ebaea904e3ac7d9e93","observation_id":"28cb6e32-828b-47d6-8163-24b0e92b2fb8","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:4f09e7a17494af93cd3f73def070dd7780a1b5f886d2543bdb7dc5e799a52676","observation_id":"7f894097-4641-435b-9a7c-8b0d412c70f9","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:1bc9f8fde71e03631dce6b225e1c56868c4650e30b4c5318590109866354c64e","observation_id":"4f44e2db-cee0-438b-bc35-88821db6cfb4","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Operations Research , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:7cbd4efdd1333a7caecc3aaaf77a6ba1074844eb069a4e390ec25a183f9b5783","observation_id":"46e7b2e8-efeb-4bd2-af3e-3e9f7736b45b","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"AAAI Conference on Artifical Intelligence , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:6995a50b624889f041cb7b6d6d6b243bf511ac8375f1cfe4005ad7781d1a9083","observation_id":"2bdd53b0-c576-4375-ba53-208f77cb3836","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:c0a37a1883c6535dabd2d10d7c2eb85eeac52fdcfa6c6485f4b5c615b3edd24c","observation_id":"0b6af84a-3327-4e74-b3ef-a3c0e14c75a8","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Mathematical Programming , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:d01632f33abb53c28f7b293dcec519f4fd1e9873017358f0bc699c528399d9ab","observation_id":"ed707d0c-562a-4181-9a4c-77f159d7cbd9","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Puterman and Shelby L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:d78813425fc5e1bd453082c62bc63c3e2028dc4b141f76db6276c069a5813d1b","observation_id":"19c708c3-cc84-416c-8a77-e492e231c0ad","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:74b665ff0a01fb696eb8caf9339310ec924d274cf554def27c509d32a74d421f","observation_id":"aaae1373-0d08-451b-b0a2-ba1f26909209","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Nature , author=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:0988973c103d63bea35c0e9150cf849631dfb1d29432e2286b408f1ecf6de080","observation_id":"e2203802-5d8c-4ad9-a83e-efa35c348cb7","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Nature , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:9923452f706cb31be82f79494ef92762447f9b6b9c72cf4a41a38026512322d3","observation_id":"5d306a4b-267b-40f1-89be-8d1589d0eb5b","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Nature , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:a2b28902286b35e01657ac03345ef46039a707180559e0e34d0a01d37d55b307","observation_id":"f9cc4840-8223-4c2c-bdc9-0f588d216654","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:6800f0db147683c86e7846f6f251d63b08aaabf4f634d2fa9ba8d01d2542d290","observation_id":"33c29a33-25c2-4ecc-a08e-fa74a89b9b73","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:a7dff15d92fb096748b3db471c7335f0d50bf002882373456c453a14c1b58025","observation_id":"2b6985ed-aed0-4aa4-a835-b7dbeb7e6aff","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Operations Research Letters , volume=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:fef92f04f579932ca16f257ef8ede9c5ea895de55f4318545b9f7898bad56359","observation_id":"01b460f7-f249-47a6-94f7-e0d48acbf6b2","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv:1509.02971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:ef8aaebe1e129b695ad0d8ca966f9000bb3e4b5b224344cfc668adaf122ed02e","observation_id":"ef7792f8-5f95-4745-be5b-15bfda397f15","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in neural information processing systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:e79f19af6bd87642ba34567952d4d8f2b56827f67b6d03af70610b0d75bd3c6c","observation_id":"7578b6b1-1ba4-4ccc-91fc-a378b30a19ce","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-19T07:13:43.624540Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arxiv:2005.09814 , year =","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:614d8aa114ded39eb87677b876a54b2f8852d66cea7db7b3c2ec2afee5b65ed8","observation_id":"d3c3ed6e-a074-449b-92bc-82328076a10b","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arxiv:1506.02438 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:71acad37c0e5d7a321f2c8e244432cc5eff57157c8f1af1bf1ecd24fc9e5e190","observation_id":"2d990d7e-bac3-41b0-b33f-164373c63ec6","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:7013a848b32038aadd6c28d72a8ed61029e53e79322ba6fd3247fe17f89c492b","observation_id":"8a6cb66e-52a6-4468-a52d-72cb33f12bfb","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13136","last_updated":"2024-09-30T07:03:48Z","snapshot_observed_at":"2026-08-19T07:13:44.170635Z","submitted_at":"2024-05-21T18:12:39Z","title":"Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13136","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv preprint arXiv:2405.13136 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2405.13136","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:2fe06d01bfef718f93457e106e1ddf2d95fb00d5b56121c4a42128454b0fc769","observation_id":"3f3757d3-44f2-4fe6-8838-e40089b87ad8","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2019 IEEE 58th Conference on Decision and Control (CDC) , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:42498ab6b5cb9d943ac2cf3bc342921192186be1a96f0ef2a41f3ee2ca2c3dc8","observation_id":"49e71c0e-1362-4504-abb5-95187d5d08f6","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:c635a1af76e280b0c45c029805fcb4da6a27405f6088d962942eceb56f5545ea","observation_id":"521377fe-2649-4037-ac7e-af8926112511","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04913","last_updated":"2024-11-07T17:51:55Z","snapshot_observed_at":"2026-08-19T07:13:43.121135Z","submitted_at":"2024-11-07T17:51:55Z","title":"Structure Matters: Dynamic Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04913","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv preprint arXiv:2411.04913 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2411.04913","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:fdc530446f2dd41182d3f93a0257c683bd7d174db6bb6f9bc6587eba3bfdb482","observation_id":"342a263b-952b-469c-8926-c28e0ab8838a","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:14a6989cfb013ab10375d5e2bc84fabd310d75b36f2f470129dd4963d610111f","observation_id":"7d9eaf87-8d9a-486e-897c-c9ce372d42b0","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2003 , publisher=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:bab25977c5160f4e1effb34515a20adf6616cc1b9a1ffd922fc52d215e05c4e2","observation_id":"f830d578-4a73-4ad0-bca5-4e894cad8f3f","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"SIAM Journal on Optimization , volume=","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:9d17a326bd698c7b0c5664c87e23ab7601d1d245da1273e3b2bdb37db69a7b4a","observation_id":"f395aff0-9ea2-464c-aced-9610672671d3","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:777eb8d648a488b409edba21f902f1395b4f8d1eafa33a95b7f9498706c23616","observation_id":"0f8ef427-73ed-4001-9118-11f252a778cb","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:366759a71bcfaa1f5bb5ea6dd043e3d12ad8a3d6db73aa3130260594516d0a25","observation_id":"512003c4-5fc3-484f-807c-0428c3b5dbe9","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05828","last_updated":"2023-10-31T00:56:56Z","snapshot_observed_at":"2026-08-19T07:13:42.803237Z","submitted_at":"2021-08-12T16:19:19Z","title":"A general class of surrogate functions for stable and efficient reinforcement learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05828","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv preprint arXiv:2108.05828 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2108.05828","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:b8dad175c6ee22fa21fcba587f5c1e7ec3b73af0fdef0086ad2fc96db18c3843","observation_id":"652097ef-63fc-4676-9b7f-82e914a7b81a","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:2a5dd712b81c414b97a58b6aed0d31640d741c25b6dd04c6efe11b123e1200a5","observation_id":"ffbd5812-beb4-4135-861d-d07ddfa2cbe8","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:a0a428019513d9bdab467f6451766b38d8bf2ff8145cdf51c7d2c0b09b54d843","observation_id":"e086921c-112e-419c-bddf-fac9531fbfa2","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:4ce06e7cae9bbd6795ba9be6374dc3f83450b2a8aca9597d2b28c60deb070a16","observation_id":"3cc7e455-32f6-4856-95db-640e86a392a6","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:25a13d7a29f5e57c9c14246b3db8cf210f49edebf202f08a4cc7a20111cdcd97","observation_id":"02e600da-1f06-43ed-8239-849df5a9fcba","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16602","last_updated":"2025-03-25T17:30:54Z","snapshot_observed_at":"2026-08-19T07:13:39.974313Z","submitted_at":"2024-07-23T16:04:55Z","title":"Functional Acceleration for Policy Mirror Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16602","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv preprint arXiv:2407.16602 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2407.16602","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:76acd7ff96f4f18d45d50388f3ae78017b192b60fa37ab5072e00f4dc22921c6","observation_id":"33863655-828d-40da-b7dc-1f73ec9125d7","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"1998 , publisher=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:293c6522fe40d749027d34d25c06c12a2073ce80438a4aa1fef7849d9dd69200","observation_id":"feb4ff35-db7e-4997-8b25-7541486b7036","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:b45ab51b9a2165748f74196735e400db7386462815ef8ae6bea81113859140a2","observation_id":"6c98bb8d-ad7b-48d3-a23a-ef0c059e9f9b","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:b22c8b844e3e67a763ffa4bc521d98f8fc730cfd23ead0d67c4e4e98ae041d6c","observation_id":"b462ec1f-2d39-4283-bb03-b81a208fd488","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Journal of Scientific Computing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:d44bd0ba16bd78220b4048efd0304fcf7119505a2ae900b443b2eef417484fdd","observation_id":"e8be1368-e58d-45fb-b4b8-0ce5bffdbfbd","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:8757074726acdfee49cf4f0669159b15b30a4b3d4ae82f719616754926de7095","observation_id":"68d38a77-f8ef-4b9a-9c11-74da427bae41","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Mathematics of Operations Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:b790e8e47c606d9f68aeb7cdb9c3d3799481302ccebf5365765a4e377c510e87","observation_id":"ef87b3a3-b0da-4125-b4ea-8d34e8fdc074","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:78228a93698ef5c905001674d9a8e45993af532421be047a09ba4f2318b9c44d","observation_id":"aea7405f-b149-4395-8d27-432d03cc3129","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:2b2c6dcfab815b7a9022e65e119e529d71a3e9c3106fd846a0d6a2e6a89fce26","observation_id":"5b6b2522-4984-4d28-a942-a3ae84565144","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:c52a6302e80470353b99e18ebfcd13ae065dd72526683051840f34cd2ec748b4","observation_id":"0a5d14ad-1d4b-4f08-8e00-15fdb3b7963b","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:e7cb42fb16edd430383aa015df2bd6c4bb2789d297367bcf7af17d545eadef0a","observation_id":"a32aafb6-2923-4a16-b100-2938738c4185","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:7cbd4be0d24c2bf4508e7e31cf36b2854e6394b945968e3a5677de6782ec9a60","observation_id":"bafe69ab-b98e-476c-b10e-6e970efe7bab","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2025 , booktitle=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:82a2006f25601c92c3983da107eccb821a7fe22a210b71dc7a6367e6cbc2a5eb","observation_id":"8b04eb64-53cf-4b12-81ba-ec1800dcb771","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"IEEE Transactions on Automatic Control , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:efa5cfc63769c1d43d94042b4803ff1798e2a2de6d1689b87b0ea76bdf6fe28f","observation_id":"4eccd9a3-7b03-4589-9d17-12ca0fecf2b2","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:75d58e634a37e888b16fe6a87ec1acb7f84d0f4c090a045e31cec1f3e1157536","observation_id":"a1cf2639-2dfc-4647-b8b8-e0fda75feb45","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:2f78e17ec2876e995b0396d8649cfea531763551a5dc458c4de4fc62eade087a","observation_id":"e7f02beb-4ebe-429b-8808-f4dd854d7106","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:898f1af5fe8ecd872fdb9228f82f2986b6c14d01bbacf9ee56cd7ba66ffccf0a","observation_id":"7b168b0a-d3fe-4286-acb4-8801f14da9b3","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"SIAM Journal on Optimization , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:b6fe33909945757ee1a84ba3d3867c9a396cc73ea14576a847052811976057c1","observation_id":"470aba16-58b9-416b-8cbe-ac56273bec8d","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:62f74cff595aa772060d2aeaae04afc4e6b4b60b98ef8bddcbd9f45ec71b869e","observation_id":"33fd2a0c-302f-47be-955e-13268ecbd8d6","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:a928b95789d2c8b07fc4094c99cff9abbbdd9b89df77302950e8aa9c963f73e4","observation_id":"f4ca55f0-41a9-48fa-b4b4-36ee7f30c021","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03557","last_updated":"2020-05-08T02:06:12Z","snapshot_observed_at":"2026-08-16T13:48:41.926654Z","submitted_at":"2020-05-07T15:42:31Z","title":"Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03557","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arXiv preprint arXiv:2005.03557 , year=","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2005.03557","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:64af2cd2b9d732d95f891b3f9a74d942dfd87c8fb17d13a4c32c22ded68096dc","observation_id":"f95e448a-d11d-43dd-852d-e375044c556e","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:2d398f8a8b6f2a78efd26c67817df9f9a92b7adfe6cf5f34d1a532988acd83f9","observation_id":"867cac06-44df-4423-9ebe-c6aff6e4d351","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Neurocomputing , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:72d59604a49d5769e0451170957cba3fedbf574390b95e518cabb8f7c05b5dcf","observation_id":"a78ac04f-5113-46ae-a60b-c08b2d947af8","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Transactions on Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:b2042175c1d362460df1efd9ca92455fdf5b6b8bcb12bb2a05a8e790af119a82","observation_id":"50288f46-9d08-4bfc-b8ff-907c79171fce","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Finite-sample analysis for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:1a1cd9bee68eda5d5f6fd84ec6733c44f45bddc1d80845e28c47f241482d96b0","observation_id":"4dd62a56-6969-42fd-8f10-7c9486b19b07","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"2021 , journal=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:c94ae9a398f504d76a9e3f65acda25ed96ef153968a5298846af824fdee62f06","observation_id":"69f3772f-5ee6-40cd-8adb-5b6f2330c69f","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Bernstein-type inequalities for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:4c8b0a1d2f818bf8cbfb3b98843a3979b223e5cad55cc72bcdaad302a68b7227","observation_id":"adcf5910-d8bb-41e0-900b-cada2093544c","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"Conference on Learning Theory , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:db446db0cbbc249cea4e48c924f9c00d437b9de839d17c9e229467aa257fcae7","observation_id":"533d3da6-0b4d-4914-97ea-d3ba052ba6d4","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-15T03:05:44.120652Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":142},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 142 outbound references and 0 inbound Pith citation observations for arXiv:2607.11626."}