{"as_of":"2026-08-10T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6760916e54e7ba66ba666a04fc3127fdf83f14e2be228738ed2f9268866853c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:28:42.268615Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":24,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2402.08106","last_updated":"2026-05-07T16:54:55Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:52:32Z","title":"Mirror Descent-Ascent for mean-field min-max problems","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-24T03:47:22.184621Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2402.08106"},"observation_digest":"sha256:74876797f5d0bd8098cd58ae89766ab2ec4ee0ef0d892f1b0148933a8ca40ffb","observation_id":"0d75a5a4-6ea1-4e92-b80d-73e6ea25e561","resolution":{"observed_at":"2026-05-24T03:48:53.043539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-09T19:28:42.268615Z","title":"Mirror descent policy optimization, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00361","last_updated":"2025-06-30T03:48:44Z","snapshot_observed_at":"2026-08-10T07:59:12.895663Z","submitted_at":"2025-02-01T07:55:06Z","title":"Efficient Online Reinforcement Learning for Diffusion Policy","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T19:28:42.268615Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2502.00361"},"observation_digest":"sha256:59f18e22ac3cfa9d4ecee177b41c3bff8efecea6a75215385a1c0363d76ca10c","observation_id":"86f8400b-94fb-4e00-9968-a0de2b76725d","resolution":{"observed_at":"2026-08-09T19:28:42.268615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:0b15585edb10f52165f699c6df2602a0219006b1852ce8fcf1b478810773ecf4","observation_id":"ce92ea2b-0577-448c-bb91-92038e927280","resolution":{"observed_at":"2026-05-11T23:02:52.240735Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:c8266ea861e6f2bf7388946666251e7915ae23caf23c75f78167e9e0ee078d2f","observation_id":"cd57ddcc-8515-48d4-9d6f-ba5a74779574","resolution":{"observed_at":"2026-05-14T01:29:56.916211Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-07T00:34:02.274823Z","title":"Mirror descent policy optimization","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.13862","last_updated":"2025-06-16T18:00:01Z","snapshot_observed_at":"2026-08-10T01:40:45.849259Z","submitted_at":"2025-06-16T18:00:01Z","title":"StaQ it! Growing neural networks for Policy Mirror Descent","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:02.274823Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2506.13862"},"observation_digest":"sha256:ba8cfff335117fd1fac0f6d18d9f43a7c89fada871f824bf8c7b443471765b7b","observation_id":"89fea3c6-8f12-4a8f-99a4-1d118f9ff6c4","resolution":{"observed_at":"2026-08-07T00:34:02.274823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-06T19:56:46.000303Z","title":"Tomar, L","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.04406","last_updated":"2025-07-06T14:40:05Z","snapshot_observed_at":"2026-08-08T04:26:00.655558Z","submitted_at":"2025-07-06T14:40:05Z","title":"Convergence and Sample Complexity of First-Order Methods for Agnostic Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:56:46.000303Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2507.04406"},"observation_digest":"sha256:a929996bf712f533b55cb2353909965d1145a90335d4d68a8810bcd82e687d5c","observation_id":"ae7111e3-ab19-47b2-b7ab-59905970265b","resolution":{"observed_at":"2026-08-06T19:56:46.000303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-06T18:18:47.685612Z","title":"Mirror descent policy optimization","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.08718","last_updated":"2025-07-11T16:19:45Z","snapshot_observed_at":"2026-08-08T04:07:41.428130Z","submitted_at":"2025-07-11T16:19:45Z","title":"On the Effect of Regularization in Policy Mirror Descent","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:18:47.685612Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2507.08718"},"observation_digest":"sha256:178714c53a77ad91fe9be2c54fada8d44c2deeb52b623a59a46d8cfb5851f3a3","observation_id":"c6a8c166-7e67-471a-8e93-8ad3cc798fc8","resolution":{"observed_at":"2026-08-06T18:18:47.685612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2509.09838","last_updated":"2026-05-11T21:29:26Z","snapshot_observed_at":"2026-07-06T22:29:01.585836Z","submitted_at":"2025-09-11T20:34:08Z","title":"Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T17:05:36.100114Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2509.09838"},"observation_digest":"sha256:b34b06c7977f2c80abba4871c94cdb40e407002c4783befa10b05352db133768","observation_id":"4273129e-9f29-4c6b-a718-a5c46792249a","resolution":{"observed_at":"2026-05-18T17:06:39.772528Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2509.22963","last_updated":"2026-05-19T22:38:20Z","snapshot_observed_at":"2026-08-02T17:56:37.590404Z","submitted_at":"2025-09-26T21:53:36Z","title":"Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-21T21:14:54.053177Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2509.22963"},"observation_digest":"sha256:947272b50c999f452f009d7e23a06f4b7d95f59480615c765b6b792b9253013d","observation_id":"dbc5e0e8-c761-4c7a-8982-1905e36b648b","resolution":{"observed_at":"2026-05-21T21:15:38.709665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2605.03921","last_updated":"2026-05-05T16:16:57Z","snapshot_observed_at":"2026-07-06T23:16:44.876986Z","submitted_at":"2026-05-05T16:16:57Z","title":"Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-07T16:22:51.320973Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2605.03921"},"observation_digest":"sha256:3978ffa27674f4c8273184b4c7184f343906762785631b2c8e106e30fc1fb273","observation_id":"dfbff5c1-c899-4947-b8b8-8983e3201c42","resolution":{"observed_at":"2026-05-11T23:46:14.256716Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2605.06139","last_updated":"2026-05-20T08:43:26Z","snapshot_observed_at":"2026-08-03T23:49:55.614451Z","submitted_at":"2026-05-07T12:38:17Z","title":"Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T13:55:22.422923Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2605.06139"},"observation_digest":"sha256:e24ed6beb36cffb88ad74d2148d68c037c26928b444a18a62650c93c97345e84","observation_id":"3e1c3ff1-7248-44ab-b112-1701486e0a21","resolution":{"observed_at":"2026-05-11T18:46:10.338147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2605.06139","last_updated":"2026-05-20T08:43:26Z","snapshot_observed_at":"2026-08-03T23:49:55.614451Z","submitted_at":"2026-05-07T12:38:17Z","title":"Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-21T09:02:28.407064Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2605.06139"},"observation_digest":"sha256:63b7a8d3b42c62b45922d123f4b662c870e55ac327717a20cb532769dd24bdc2","observation_id":"4a514623-c37f-4dcd-b26d-f8abf87dcf3d","resolution":{"observed_at":"2026-05-21T09:04:04.439050Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:6e37f70736a4cf0e22d70987b521b338da93ee033da858d863a932f2f9e7b3a8","observation_id":"b3dce0b0-8a55-46f1-ba00-1873240e3db5","resolution":{"observed_at":"2026-05-11T20:06:09.271610Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2605.18591","last_updated":"2026-08-03T00:43:51Z","snapshot_observed_at":"2026-08-06T23:24:40.850221Z","submitted_at":"2026-05-18T16:05:36Z","title":"Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-05-20T12:44:29.147095Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2605.18591"},"observation_digest":"sha256:125bcd9fa88fcee4cbb30802a136c9ca3d5239abf6088b4fe7522731fd28fcc7","observation_id":"ea2350a4-db8b-4bcd-9470-3335b03c3166","resolution":{"observed_at":"2026-05-20T12:48:17.524423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2605.25507","last_updated":"2026-05-26T17:23:26Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T07:11:50Z","title":"Credit Assignment with Resets in Language Model Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T21:50:18.827822Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2605.25507"},"observation_digest":"sha256:51efb6e9269792e0c1626b3e5e9e3e744e5ff88614454fdf6e7479f2a4943bc9","observation_id":"3c4c513e-24fe-45ad-a19f-547b0d8f27aa","resolution":{"observed_at":"2026-06-29T21:53:59.238296Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2606.29092","last_updated":"2026-06-27T21:20:26Z","snapshot_observed_at":"2026-07-07T00:03:07.870153Z","submitted_at":"2026-06-27T21:20:26Z","title":"Priced Motion Through Optimal Faces: A Normal-Fan Geometry for Non-Stationary Adversarial MDPs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T09:24:21.047027Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2606.29092"},"observation_digest":"sha256:89aad4c11fa22ff92acc39fd7f0f1b87b57d10d81ee066021e851cb7748f065b","observation_id":"6e3b7b17-14c5-4708-ae37-b7cc90c6b381","resolution":{"observed_at":"2026-06-30T09:24:32.086752Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2606.29092","last_updated":"2026-06-27T21:20:26Z","snapshot_observed_at":"2026-07-07T00:03:07.870153Z","submitted_at":"2026-06-27T21:20:26Z","title":"Priced Motion Through Optimal Faces: A Normal-Fan Geometry for Non-Stationary Adversarial MDPs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T09:24:21.047027Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2606.29092"},"observation_digest":"sha256:4af00ad6f55ad19fd324e76493cd8835b6cca6c07b02e3f120f76ff6618bc453","observation_id":"3ec84ec4-10c1-42ad-b944-123aa27f30a6","resolution":{"observed_at":"2026-06-30T09:24:31.615265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-07-14T08:30:10.584105Z","title":"Mirror descent policy optimization,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.10892","last_updated":"2026-07-12T19:48:46Z","snapshot_observed_at":"2026-08-08T14:33:47.467368Z","submitted_at":"2026-07-12T19:48:46Z","title":"A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T08:30:10.584105Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2607.10892"},"observation_digest":"sha256:235ca0658fd97ba44648044409c52c18a251661180761dacec8e7d368dcd70a2","observation_id":"e73e4d5e-b46e-4335-bc00-b2ca1e70d098","resolution":{"observed_at":"2026-07-14T08:30:10.584105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-07-14T04:17:12.534820Z","title":"arxiv:2005.09814 , year =","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.11626","last_updated":"2026-07-13T14:45:07Z","snapshot_observed_at":"2026-07-16T23:19:55.768663Z","submitted_at":"2026-07-13T14:45:07Z","title":"On the Policy Convergence of Policy Mirror Descent Methods","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-14T04:17:12.534820Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2607.11626"},"observation_digest":"sha256:578baf31fa4384c4915d1f0f3eb73570af6cd211bc796f797b732c4aa4402105","observation_id":"d3c3ed6e-a074-449b-92bc-82328076a10b","resolution":{"observed_at":"2026-07-14T04:17:12.534820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2005.09814/citation-record","integrity":"/paper/2005.09814/integrity","json":"/paper/2005.09814/citation-record.json","paper":"/paper/2005.09814"},"outbound":[],"paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T10:37:00.663177Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2005.09814."}