{"as_of":"2026-08-05T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd4f63771fae989ee8586e4ba42b3c26113b7df372fa1083ad6f504983e14a6a","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T08:01:05.911650Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:23:30.215870Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22156","snapshot_observed_at":"2026-08-02T07:23:30.215870Z","title":"arXiv preprint arXiv:2605.22156 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-02T07:23:22.525561Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:30.215870Z"},"links":{"cited_paper":"/paper/2605.22156","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:4ff8b299fefd96f258105874e74576bcf5d917b59542d1ca58ad5b3e1d5f327c","observation_id":"9b5031bc-8e80-4294-bedd-c73a5983a727","resolution":{"observed_at":"2026-08-02T07:23:30.215870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.22156/citation-record","integrity":"/paper/2605.22156/integrity","json":"/paper/2605.22156/citation-record.json","paper":"/paper/2605.22156"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:04716317b0e861129525970c38d7ee7dfcd1b0f18997e6ac57e2bd033ce83d7b","observation_id":"44906f4b-b4bc-4132-b2a4-7acccd1d3ac0","resolution":{"observed_at":"2026-05-22T08:01:15.588609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:3aa8c498de8b3c468c1f05c58eb51b8e3ebb0ba642ee81525e1b2985f4ddf832","observation_id":"d9315f31-6061-459b-b04f-c92e4489b73b","resolution":{"observed_at":"2026-05-22T08:01:15.504835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":"2308.08998","doi":"10.1126/sciadv.abg6611","metadata_source":"pith","pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforced Self-Training (ReST) for Language Modeling","venue":"cs.CL","work_id":"db054f5c-62a3-405b-aae8-43e02c39f672","year":2023},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:b8d4b8a42a1e3ff670323dd4abee4a5a9d1b73332bfc1a4c9dca2caf08e478d3","observation_id":"d3ec8921-d40b-4556-8241-8312b01460a5","resolution":{"observed_at":"2026-05-22T08:01:15.500354Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:43cb5ea9b289938ad837e2e4ea2f43f87052c59170f6bceba2c073672ae04cdb","observation_id":"d87eb0ca-b935-41bc-b11c-5effbd7a2150","resolution":{"observed_at":"2026-05-22T08:01:15.532477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.346092Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to repro- ducibility.arXiv preprint arXiv:2504.07086","venue":null,"work_id":"293ecb4d-96d1-4ced-a46c-a3aa4e23d934","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:f94f4beda0f05037527881b7ba1eda2d78e43bc91287fa55b17e537493742e2c","observation_id":"838b9c2f-661a-4e92-b41e-787ffd25f5aa","resolution":{"observed_at":"2026-05-22T08:01:15.496215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22117","doi":"10.48550/arxiv.2603.22117","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the direction of rlvr updates for llm reasoning: Identification and exploitation","venue":"arXiv (Cornell University)","work_id":"f4bbdde2-afd9-44a8-822a-145757254bc0","year":2026},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:5e6537b5e3ab6dad8878b0169bfb9fa30285114f64f2caf5e2a64983ec82f257","observation_id":"a1765dc9-b917-4675-bccc-74c6cc5f96e3","resolution":{"observed_at":"2026-05-22T08:01:15.487068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":"2409.12186","doi":"10.48550/arxiv.2409.12186","metadata_source":"pith","pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Coder Technical Report","venue":"cs.CL","work_id":"09ba463d-6377-4017-9801-444ffb94b056","year":2024},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:61ae2c1f7c529aea35d06efc5de26600cc6821efad1d8d1c78c5884ab91f7848","observation_id":"86465566-b956-45ce-89f9-5f4a0b3e4965","resolution":{"observed_at":"2026-05-22T08:01:15.559609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:18:55.772185+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:18:55.772185+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:cfce95f1989c7a0ab8205d912cc8b1cdf466faf0b81625ce1fadac65efb3e88a","observation_id":"b755f437-3838-4efd-b328-b6a832c6c774","resolution":{"observed_at":"2026-05-22T08:01:15.491515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64434/tml.20251026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:24.393084Z","title":"On-policy distillation.Thinking Machines Lab: Con- nectionism","venue":null,"work_id":"bb76b11f-d59b-421e-88c6-fa0920ed09c3","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:c0efc1efe77735bf1d3dd728717264b362b64fe629055ad459888910389cfc2e","observation_id":"e7c4a0ce-b494-4da4-b36a-755779ab3bd0","resolution":{"observed_at":"2026-05-22T08:01:15.044250Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.19835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:30.724740Z","title":"Fipo: Eliciting deep reasoning with future-kl influenced policy optimization","venue":null,"work_id":"5f612bbe-1204-4f05-b54d-9a02bc9d66ea","year":2026},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:a830b29f3ef4d4f31cd550934882854191faae29180cff5a8f644efad318fd85","observation_id":"9554dc8e-6f30-4035-a952-7b05cd74a3ba","resolution":{"observed_at":"2026-05-22T08:01:15.541515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.140816Z","title":"Sparse but critical: A token-level analysis of distributional shifts in rlvr fine-tuning of llms","venue":null,"work_id":"fb448c11-a1b6-4d2c-a2cb-51dac670c22e","year":2026},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:5925b786a9b46c0cbf6d92dfc5c917c282728bea9f073dd2c47c4df878d97a17","observation_id":"d09a2380-f0d0-4713-ae77-44f835805bdd","resolution":{"observed_at":"2026-05-22T08:01:15.519492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:94f84a31b841b3e56d2acb89b6470919fdab39616964807f372fc0d18ca5a7d3","observation_id":"6f27696a-61bc-4463-8705-cf33591c635b","resolution":{"observed_at":"2026-05-22T08:01:15.554340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:d71d594166f1c371dc45376fbb9e2e7f2ff75a0e31e98ceab2b910c9b02df57f","observation_id":"5f32f5c9-9b31-4470-8148-6501ad6412ca","resolution":{"observed_at":"2026-05-22T08:01:15.523399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:d0a634ac23f513c359ffb4877aec437605e2e7f764ab1d1272fdf789931f438a","observation_id":"07623a88-bd20-4eef-8c06-94a642055627","resolution":{"observed_at":"2026-05-22T08:01:15.545821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:551dba8198450bbe6d40c5bca7a2dd54d41dd0694621fa29a7edac8d858fbc3b","observation_id":"657bde64-5f1e-40e0-be6b-cb2fb25d9541","resolution":{"observed_at":"2026-05-22T08:01:15.513978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-07-06T21:35:22.208213Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:1f74da4d64f4807f8ec2bbff50328b5f51c88d7f7de156f8f389c16c9c613787","observation_id":"b3a484d2-b832-4b9e-baa0-f76a8cebdf82","resolution":{"observed_at":"2026-05-22T08:01:15.509689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:2cb1a2f1e04c4add458dbb2a0184f43a2c6fb2234ab2fe3e2daae65fcc6b6e68","observation_id":"a5e60214-0376-4e5e-a286-0c3200dd1fce","resolution":{"observed_at":"2026-05-22T08:01:15.536711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:f3b08dd17afd4ee46f755390e04025a71c51150a3de62975ab74d821af54559d","observation_id":"3d9a9f6e-4919-4b1c-8675-77baf533b850","resolution":{"observed_at":"2026-05-22T08:01:15.582276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:d5e10381040b8cf83a2099d688a98bce1a6717f9ba76db0a32946fe29221cbd8","observation_id":"e4eb10b9-7510-470a-8ac1-d280943eb846","resolution":{"observed_at":"2026-05-22T08:01:15.527668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:ef5c5bfa7ec75e42d0fd2149cf4cfbc21ee595bae239557e1fa635f640a440e1","observation_id":"e90d2e06-902c-4836-b0ff-8ea552de5d1c","resolution":{"observed_at":"2026-05-22T08:01:15.592991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8689.5940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For the training dataset, we utilize dapo-math-17kacross all main experiments","venue":null,"work_id":"0e71e85d-c96c-4bfa-ba7e-86dc6439cf24","year":2072},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:370d808c7ba1496fcd7e7c984511b5cd82d7a841df26ffd04e11249744e18cf7","observation_id":"9fa3fdf8-75ef-443a-a160-cd62699f2212","resolution":{"observed_at":"2026-05-22T08:01:15.549942Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":19,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2605.22156."}