{"as_of":"2026-08-06T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3c070a06762d0e8c4849654167c0cd19f83456e0dcda461a7851294065a4974","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T19:44:02.317303Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26784/citation-record","integrity":"/paper/2605.26784/integrity","json":"/paper/2605.26784/citation-record.json","paper":"/paper/2605.26784"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:652e74609ae1b189d8da417cbf2d6f87a36f973f1b7d96f034f33c9ab8b31bcf","observation_id":"25e016ad-833b-4ba4-bb27-138a7328cc14","resolution":{"observed_at":"2026-06-29T19:53:55.956092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22375","last_updated":"2025-05-29T01:59:00Z","snapshot_observed_at":"2026-08-02T18:20:00.749960Z","submitted_at":"2025-05-28T14:03:02Z","title":"Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition","version":2},"cited_work":{"arxiv_id":"2505.22375","doi":"10.48550/arxiv.2505.22375","metadata_source":"pith","pith_arxiv_id":"2505.22375","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pangu embedded: An efficient dual-system llm reasoner with metacognition","venue":"cs.CL","work_id":"48eb26ab-dce4-4bb6-9a0c-2376e9449315","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2505.22375","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:43a1cc46fdf7b1f3506fc3726ef5ef4fbc63bdf4b74ea49b535b7b0d9484b3e5","observation_id":"cf08b0b9-2f6f-4d24-a527-dda933894760","resolution":{"observed_at":"2026-06-29T19:53:55.959578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-07-06T09:23:23.891393Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":"2005.12729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-07-04T12:09:48.784830Z","title":"arXiv preprint arXiv:2005.12729 , year=","venue":null,"work_id":"a0c5b73d-c242-4cb2-b4d4-fbffb504fe33","year":2005},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:e83c2079e273e15ada30eae5b48f6b87f5a630d8d54d3b76f7f8a220b2be2439","observation_id":"34485d47-4743-4400-a09d-9c895fef8c0d","resolution":{"observed_at":"2026-06-29T19:53:55.985787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.02286","last_updated":"2017-07-10T18:52:12Z","snapshot_observed_at":"2026-07-06T05:50:13.428362Z","submitted_at":"2017-07-07T17:56:57Z","title":"Emergence of Locomotion Behaviours in Rich Environments","version":2},"cited_work":{"arxiv_id":"1707.02286","doi":"10.48550/arxiv.1707.02286","metadata_source":"pith","pith_arxiv_id":"1707.02286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergence of Locomotion Behaviours in Rich Environments","venue":"cs.AI","work_id":"f1b3506d-9900-4626-a881-67b9890ce5bd","year":2017},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/1707.02286","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:7b7a7054b499c14e86dd31d786087ebe7c4e8557cd779ad7793e693ca469e889","observation_id":"0a50c1d7-d55d-4e07-b5e7-742036fe99c8","resolution":{"observed_at":"2026-06-29T19:53:55.971665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23770","last_updated":"2026-05-08T07:00:31Z","snapshot_observed_at":"2026-07-06T22:40:17.725041Z","submitted_at":"2025-12-29T07:15:07Z","title":"SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints","version":3},"cited_work":{"arxiv_id":"2512.23770","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23770","snapshot_observed_at":"2026-06-29T19:53:55.975931Z","title":"SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints","venue":"cs.LG","work_id":"4c21f66d-aef9-4828-996f-84de5c3cade5","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2512.23770","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:2562b3efa9f9ee197e0f57eceae204a65195f97ff19fccc753a4ee9d75ac8b3d","observation_id":"fe5c8c06-98f3-45dc-b182-0eb65282cfb3","resolution":{"observed_at":"2026-06-29T19:53:55.977140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:50:12.348883Z","title":"What can rl bring to vla generalization? an empirical study.arXiv preprint arXiv:2505.19789","venue":null,"work_id":"c43a0a70-9b6b-42e1-9712-b9b19f7c90a7","year":2026},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:a8de6ab4ce49cc6723d00f22b4994bd1773387cd3b30aeb4b109dbbd276619b0","observation_id":"80e2cbf4-dd6f-4560-b3c0-e0898b2de06e","resolution":{"observed_at":"2026-06-29T19:53:55.971507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:3f42aca62fb23a5c1953e66f04c3f83098ea221b6a14c4fb64c6e3c78a3fd078","observation_id":"df1dc87e-2b68-453a-aad5-bb4965f5b013","resolution":{"observed_at":"2026-06-29T19:53:55.988110Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09207","last_updated":"2021-03-09T08:44:43Z","snapshot_observed_at":"2026-07-06T10:34:43.153428Z","submitted_at":"2021-01-22T16:52:06Z","title":"Differentiable Trust Region Layers for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2101.09207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.09207","snapshot_observed_at":"2026-07-04T08:59:43.297294Z","title":"Differentiable trust region layers for deep reinforcement learning.arXiv preprint arXiv:2101.09207, 2021","venue":null,"work_id":"713a3af1-a46b-4538-91c9-e1614f7328cb","year":2021},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2101.09207","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:535b9161de81d20882d269adf39c18989e29e5a0de668a9a4bb25c7ebf0df428","observation_id":"d4d5ce8c-2441-4c57-ac10-1e8ddc904bb4","resolution":{"observed_at":"2026-06-29T19:53:55.990855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-07-06T21:17:38.654920Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.00663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00663","snapshot_observed_at":"2026-07-02T06:56:44.503712Z","title":"arXiv preprint arXiv:2505.00663v1 , year=","venue":null,"work_id":"7341d663-31ef-4297-bce9-869ffb398d6f","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2505.00663","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:a1e8e42a7a4b75493a5e9b6cb23f40c065b95afe964844f9786b371dd0b06999","observation_id":"42fb7b7b-e288-4bc2-a5d4-6af7262093e9","resolution":{"observed_at":"2026-06-29T19:53:55.983387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-06T02:17:39.954909Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":"2503.14286","doi":"10.48550/arxiv.2503.14286","metadata_source":"pith","pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tapered off-policy REINFORCE: Stable and efficient reinforcement learning for LLMs","venue":"cs.LG","work_id":"885b5bf5-7859-4e5a-af07-52a7da4f25c1","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:0d0bec547bfb075721837837470b733135d9d5539a6c67cc921bbd3d03845ff5","observation_id":"afaaa5d0-713c-4d07-891a-575637848102","resolution":{"observed_at":"2026-06-29T19:53:55.944800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:375e3e0c477214066f60cf306c5f805b8e171236146f8294dbda167b295ab9fb","observation_id":"9a287af2-64b6-43f1-8687-db7b7326d15c","resolution":{"observed_at":"2026-06-29T19:53:55.939103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:c38ff23577598295d8a552684710e91b93816cc13dbc19c2d018c8fe83a3d3eb","observation_id":"b7b3b1a9-39e8-4a27-8d9a-6691c4cc940a","resolution":{"observed_at":"2026-06-29T19:53:55.949640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:3a1e5bd42789403e590996193b4069b77c8d572b80ff7c426147e04ac97f4c3b","observation_id":"f108616f-79d7-43ac-adf5-b3c5c05d03dc","resolution":{"observed_at":"2026-06-29T19:53:55.936626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14133","last_updated":"2023-06-25T05:41:38Z","snapshot_observed_at":"2026-07-06T15:46:21.260261Z","submitted_at":"2023-06-25T05:41:38Z","title":"Provably Convergent Policy Optimization via Metric-aware Trust Region Methods","version":1},"cited_work":{"arxiv_id":"2306.14133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14133","snapshot_observed_at":"2026-06-29T19:53:55.941965Z","title":"Provably conver- gent policy optimization via metric-aware trust region methods.arXiv preprint arXiv:2306.14133,","venue":null,"work_id":"e0cc2f9b-6db6-45b1-9867-c537dbedf4ad","year":null},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2306.14133","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:bef6b642b5e25448b2f940b7f492e57da5d880cf700e75cd84db36ae9f7be353","observation_id":"7d7a8cf5-ff55-4844-9fda-020b42df42bb","resolution":{"observed_at":"2026-06-29T19:53:55.943707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07629","doi":"10.48550/arxiv.2508.07629","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Klear-reasoner: Advancing reasoning capability via gradient-preserving clipping policy optimization.arXiv preprint arXiv:2508.07629","venue":"ArXiv.org","work_id":"2d3fe64a-7a53-4e46-b832-c2a7bb443af1","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:7811d9edb3f055d4f1cdbb252141db756ca40666863f268f6383c540ec4c2d7c","observation_id":"b294cf96-df86-4e2e-be66-3d63b81b54c9","resolution":{"observed_at":"2026-06-29T19:53:55.953529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21380","last_updated":"2026-04-12T10:37:12Z","snapshot_observed_at":"2026-08-02T16:04:50.458535Z","submitted_at":"2025-03-27T11:20:17Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":"2503.21380","doi":"10.48550/arxiv.2503.21380","metadata_source":"pith","pith_arxiv_id":"2503.21380","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","venue":"cs.CL","work_id":"3dcb0e77-7b4c-4b36-9c04-1e76b8bdb08d","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2503.21380","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:f1c90a55aefda26d37a42d268d92b9af208f1081b0b6066716ab08e7a8569a0c","observation_id":"453e5ccb-c092-45a6-8f8d-1bdab7c52581","resolution":{"observed_at":"2026-06-29T19:53:55.921721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:5a531836db49b3499c1f306e88bb5b8541355a22fba229506521665e66668864","observation_id":"1dede566-7515-4ec2-825d-a010d3d250db","resolution":{"observed_at":"2026-06-29T19:53:55.952076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16025","last_updated":"2025-07-26T13:04:47Z","snapshot_observed_at":"2026-07-06T17:21:46.980522Z","submitted_at":"2024-01-29T10:17:54Z","title":"Simple Policy Optimization","version":9},"cited_work":{"arxiv_id":"2401.16025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.16025","snapshot_observed_at":"2026-07-03T00:27:29.398667Z","title":"Simple policy optimization","venue":null,"work_id":"5f4d0124-c547-44b7-bf95-0e14936ca0bf","year":2024},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2401.16025","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:71a49ffe9fb8b2ad4cb2e5510454f732a10c6f02b2a066d80c95ea3ea7e5d8aa","observation_id":"8635219d-654b-4759-8ec3-c548d38a8919","resolution":{"observed_at":"2026-06-29T19:53:55.985392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:a546c22da667e729d68f83dddcbff3ea2ce13743cb02d420346b33f504a1aaa1","observation_id":"59e794fb-451c-4f4a-9e8a-f300173a5c84","resolution":{"observed_at":"2026-06-29T19:53:55.974209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:e8a79684600879c1c612276380eebd4887e0ee0556b0d198cf0000db2af07c07","observation_id":"6f95295a-bbf0-4acb-80a1-458f6d9178eb","resolution":{"observed_at":"2026-06-29T19:53:55.976909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05405","last_updated":"2023-12-08T23:29:57Z","snapshot_observed_at":"2026-08-02T22:15:32.958936Z","submitted_at":"2023-12-08T23:29:57Z","title":"Guaranteed Trust Region Optimization via Two-Phase KL Penalization","version":1},"cited_work":{"arxiv_id":"2312.05405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.05405","snapshot_observed_at":"2026-06-29T19:53:55.960894Z","title":null,"venue":null,"work_id":"26af4f3e-ba26-4059-b6ad-e2fc2d45bc2c","year":null},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2312.05405","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:b41db584ee9ab9714292034dd59b29d37570d836fffd814ebd79cd0030a8770b","observation_id":"48afe975-e9c1-4f7a-822a-ab10846bf9df","resolution":{"observed_at":"2026-06-29T19:53:55.962399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11640","last_updated":"2019-11-26T15:27:13Z","snapshot_observed_at":"2026-08-05T11:09:16.697445Z","submitted_at":"2019-11-26T15:27:13Z","title":"A Stochastic Trust-Region Framework for Policy Optimization","version":1},"cited_work":{"arxiv_id":"1911.11640","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.11640","snapshot_observed_at":"2026-06-29T19:53:55.978131Z","title":"A stochastic trust-region framework for policy optimization.arXiv preprint arXiv:1911.11640,","venue":null,"work_id":"d47fb9d4-9b72-4ef2-82ba-79a0ccd4df7b","year":1911},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/1911.11640","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:8911e940d3d79f9d0d3f6b4ed2b31cbc0038e5a86f2666a91dce71cb82602ec0","observation_id":"e88cb61b-9b0b-444b-90b8-b4ca75de5e4c","resolution":{"observed_at":"2026-06-29T19:53:55.979899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:44:02.317303Z","title":"R2VPO utilizes adaptive dual updates for LLMs and fixed dual factors for robotics tasks","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:ce7e0f46bdf6c2c9dc2780f6c16ac64b05d5850c6044500dc8f65212624073d5","observation_id":"e0dd0bc3-4c10-4463-9dab-39c0008eda06","resolution":{"observed_at":"2026-06-29T19:44:02.317303Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5835.4277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:53:55.981051Z","title":null,"venue":null,"work_id":"dd572b36-1cb1-46ca-8bc7-e8bb97959b3c","year":null},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:32aaf2c374570f9f2de85b52670c31ccabf33f55d679fe308d0c521be37dfde8","observation_id":"3a3b7f2f-6888-4db5-81bb-9759af692699","resolution":{"observed_at":"2026-06-29T19:53:55.982603Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:44:02.317303Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:a99526560e4fc5fe6aaeae0eb93c196cbde2b309adc39b3235b8e534888fa043","observation_id":"d416ea4d-258f-41ba-9805-266904275ad5","resolution":{"observed_at":"2026-06-29T19:44:02.317303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:44:02.317303Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:81295759e05ab8b5b35e4639af95bd04c8ca9bb51d0653cc855590630ad4b17e","observation_id":"9edf4df3-956f-4861-9c1f-508211cae22a","resolution":{"observed_at":"2026-06-29T19:44:02.317303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T17:10:54.260826Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":2,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2605.26784."}