{"as_of":"2026-08-07T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef743548676142e6e68653666e720c1404d5c7f0a7735039eca8bb3cb95f3670","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T01:15:49.658412Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:34:06.659805Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T22:27:26.448121Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-08-04T09:34:06.659805Z","title":"Rl-plus: Countering capability boundary collapse of llms in reinforcement learning with hybrid-policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-06T05:26:40.214370Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T09:34:06.659805Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2510.14807"},"observation_digest":"sha256:40425ce7e0faae56b7a8596ff8d7c1d7e1aa066b832c41c56f591cc27b36960e","observation_id":"f544093f-ec86-4b34-af8a-850645821afe","resolution":{"observed_at":"2026-08-04T09:34:06.659805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-08-03T05:28:11.383416Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02244","last_updated":"2026-07-14T10:18:39Z","snapshot_observed_at":"2026-08-07T11:20:54.293788Z","submitted_at":"2026-02-02T15:53:55Z","title":"Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T05:28:11.383416Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2602.02244"},"observation_digest":"sha256:5f7fa2232eb24b51bfc69a0183d0289ee467a538d9097315452abc81f25eaab6","observation_id":"da083899-7760-4574-bf2b-59638c3afc2a","resolution":{"observed_at":"2026-08-03T05:28:11.383416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":"2508.00222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-07-02T22:27:26.448121Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","venue":"cs.AI","work_id":"ba0130b0-a8d2-4183-80e3-bd9b6b0c347a","year":2025},"citing_paper":{"arxiv_id":"2604.02709","last_updated":"2026-04-15T09:12:39Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T04:06:39Z","title":"Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T19:51:08.304741Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2604.02709"},"observation_digest":"sha256:0c7a0843aa9ce2685320736646619d9689fe5a59d0d52fc9c51b62547e7658f6","observation_id":"7f852c4b-d9b7-4d86-b2d2-d3e785e29c46","resolution":{"observed_at":"2026-05-13T19:53:11.743641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":"2508.00222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-07-02T22:27:26.448121Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","venue":"cs.AI","work_id":"ba0130b0-a8d2-4183-80e3-bd9b6b0c347a","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:39fc1ee233e7ce2ab657f2a651191901848809afefdc3fc7ae88fb128ee0d47a","observation_id":"895f2d4e-3db9-4fed-a88e-6bfe5a51724f","resolution":{"observed_at":"2026-05-12T10:21:30.040182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":"2508.00222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-07-02T22:27:26.448121Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","venue":"cs.AI","work_id":"ba0130b0-a8d2-4183-80e3-bd9b6b0c347a","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:ffc30d247ba280e5f8c7bacb2dc03c3e29c7d07758279fcef5ed16386790b4fb","observation_id":"9b2c95e0-46d3-4174-9cd4-f5bdfe9d76c1","resolution":{"observed_at":"2026-05-11T22:11:16.745580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":"2508.00222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-07-02T22:27:26.448121Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","venue":"cs.AI","work_id":"ba0130b0-a8d2-4183-80e3-bd9b6b0c347a","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:576c97013477b215238943e4cadf816aa4fac63b31941516d45719e27454925c","observation_id":"54793fe2-ed12-4d07-9310-e806fa66d86f","resolution":{"observed_at":"2026-05-19T17:02:40.643093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":"2508.00222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-07-02T22:27:26.448121Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","venue":"cs.AI","work_id":"ba0130b0-a8d2-4183-80e3-bd9b6b0c347a","year":2025},"citing_paper":{"arxiv_id":"2605.05965","last_updated":"2026-05-07T10:11:51Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T10:11:51Z","title":"Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:54.001327Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2605.05965"},"observation_digest":"sha256:705dab493eb6f945f0c57a1d7c8dd422540a3fe1c349f77f0ff7ec29fa501ea7","observation_id":"988a5c69-d1bf-4da7-a7e1-f9ce65807ce5","resolution":{"observed_at":"2026-05-11T16:36:10.539031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":"2508.00222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-07-02T22:27:26.448121Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","venue":"cs.AI","work_id":"ba0130b0-a8d2-4183-80e3-bd9b6b0c347a","year":2025},"citing_paper":{"arxiv_id":"2606.04560","last_updated":"2026-06-04T06:53:10Z","snapshot_observed_at":"2026-08-03T03:32:03.287107Z","submitted_at":"2026-06-03T07:47:47Z","title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T07:43:21.284574Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2606.04560"},"observation_digest":"sha256:3d2be40876b23decd48730f42be0f1811160f33ce1f07ed48d88021888e7dce2","observation_id":"026b34fc-4a97-43da-bb62-a9a4b3d59496","resolution":{"observed_at":"2026-07-02T06:06:41.027689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":"2508.00222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-07-02T22:27:26.448121Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","venue":"cs.AI","work_id":"ba0130b0-a8d2-4183-80e3-bd9b6b0c347a","year":2025},"citing_paper":{"arxiv_id":"2606.09932","last_updated":"2026-06-07T17:58:58Z","snapshot_observed_at":"2026-07-06T23:49:12.754871Z","submitted_at":"2026-06-07T17:58:58Z","title":"When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T18:49:47.876179Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2606.09932"},"observation_digest":"sha256:bfd637ffe3ffee5958f61a387d5114f996f4ca9d9ff3f804ded198db4ffa40b6","observation_id":"4ee16055-4ec2-4e07-a709-aaf498fc08b5","resolution":{"observed_at":"2026-07-02T22:27:26.449420Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00222","snapshot_observed_at":"2026-08-02T14:23:19.627366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20438","last_updated":"2026-05-12T01:46:10Z","snapshot_observed_at":"2026-08-04T23:37:21.539547Z","submitted_at":"2026-05-12T01:46:10Z","title":"Preference Tuning as Spectral Update Reorganization","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T14:23:19.627366Z"},"links":{"cited_paper":"/paper/2508.00222","citing_paper":"/paper/2607.20438"},"observation_digest":"sha256:23940a49a389f76d9027187f7da5a6de46ca7537c8bb93ca9cce990dd23ec831","observation_id":"637b06e1-7920-48cd-8901-029268f58fa7","resolution":{"observed_at":"2026-08-02T14:23:19.627366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.00222/citation-record","integrity":"/paper/2508.00222/integrity","json":"/paper/2508.00222/citation-record.json","paper":"/paper/2508.00222"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24273","last_updated":"2025-05-30T06:49:00Z","snapshot_observed_at":"2026-08-07T12:24:35.137897Z","submitted_at":"2025-05-30T06:49:00Z","title":"How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2505.24273","doi":"10.48550/arxiv.2505.24273","metadata_source":"pith","pith_arxiv_id":"2505.24273","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How much backtracking is enough? exploring the interplay of sft and rl in enhancing llm reasoning","venue":"cs.AI","work_id":"531d83c6-0670-45ed-a1d9-69830d44a94e","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2505.24273","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:0e5d016e769742fb13b84c084415cbcf06f6f0af4d7e1fd60a22d99d5251e1a8","observation_id":"7b22eef4-03c0-4df3-93c4-657d5cecb0a0","resolution":{"observed_at":"2026-05-19T01:16:56.985752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.249697+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.249697+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13026","last_updated":"2025-08-04T07:29:42Z","snapshot_observed_at":"2026-08-07T15:43:16.550178Z","submitted_at":"2025-05-19T12:10:17Z","title":"Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs","version":3},"cited_work":{"arxiv_id":"2505.13026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13026","snapshot_observed_at":"2026-07-02T22:27:26.462219Z","title":"Step-wise adaptive integration of supervised fine-tuning and reinforcement learning for task-specific llms","venue":null,"work_id":"5a881ed1-1ca7-44b2-a715-c4cd73ce7f35","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2505.13026","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:ff332cf659d3e264b3f628fcd78bc2ef78369087b15c3c1662eefd83ac4dd5e9","observation_id":"6ae68cf3-9cc2-46be-b62b-fa959f8e26cb","resolution":{"observed_at":"2026-05-19T01:16:56.993587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:883f35d72f952556a4b477716746beddd6c69b84ab8d0eb1b24f99b97a8a5b41","observation_id":"b96672c0-0bed-4193-9ae3-4c8ab85aac4f","resolution":{"observed_at":"2026-05-19T01:16:57.060549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:35ac202ad399fbb3f10abd4e17747fc2b4dda4a722894209013e9e1660e118cb","observation_id":"1f0cd3ad-c5a0-4f7f-b891-ee41de0ec916","resolution":{"observed_at":"2026-05-19T01:16:56.979210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:2f6d33b2de7ab3458cfa9372329dcc055a86bba0e7896b53bfb3012ee359bca1","observation_id":"c02c08fd-8d9a-4359-bab6-f00a2eeacb8f","resolution":{"observed_at":"2026-05-19T01:16:56.999752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:58347ff4c9e7028ac85c0680a5eeeb26b5d13f2529d3a8d500ab4c6ad3350b02","observation_id":"d341d843-23ac-4668-85cc-2a4cd35da58b","resolution":{"observed_at":"2026-05-19T01:16:57.015996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:0b45f9c1ac01fd1cf2b80218ecf4f0eba72935e4bf933eac898f23958107bbb3","observation_id":"d9588cdb-293f-4ccf-bcee-e4773f677bf4","resolution":{"observed_at":"2026-05-19T01:16:57.007208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:380755bc33a094e213ebc51c01a11ca5c5af0b8d5d4d1a707a75b7cf6d8d3b14","observation_id":"4cccdf65-b86f-4eaa-8584-d24c5534aadb","resolution":{"observed_at":"2026-05-19T01:16:57.097300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:00d32be630329d7b6c94096bea614c68ccf18457318cf5695c5b62a4dcb23bd3","observation_id":"a05552eb-1069-4963-ae17-3dd4728d2867","resolution":{"observed_at":"2026-05-19T01:16:57.023034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:a5f4174674a95c76102c212bfa04c0ad7533fead27c737fb59e72ef0e9562365","observation_id":"d23aded9-6e25-426d-8887-42be8eb3e84e","resolution":{"observed_at":"2026-05-19T01:16:57.066799Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:6e5835614e08b106bd0bdf20acf0837418ac9e352e99ced1c8bbe9e451db1816","observation_id":"e437c7e8-593e-4319-abf4-4ed102200f61","resolution":{"observed_at":"2026-05-19T01:16:57.045584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-07-04T10:09:44.995719Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning.arXiv preprint arXiv:2506.01096, 2025a","venue":null,"work_id":"610cb02e-4ce1-409c-8693-5312275e2e86","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:54f2c582bb4704fc08a67f1087c94e4779e1c47c5ef2b43097bed59239bcabd8","observation_id":"90be6e53-f651-415a-b8a1-e2b32ae7e8e1","resolution":{"observed_at":"2026-05-19T01:16:56.964027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"John Wiley & Sons","venue":null,"work_id":"671e0fac-c617-4908-8a40-19b37adef293","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:601421e14736e8ae596919e0fe4c0db5ebe8e96c9152e70a94c591206232c26e","observation_id":"22272cb6-e500-487e-8f2a-9bfa08c6b452","resolution":{"observed_at":"2026-05-19T01:16:57.416280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:854b0ff95f3b13037632993fc3aedab2bae1463ebe62e099444167a3c19b29ff","observation_id":"fab2b4f4-8975-4504-98b3-c6df7177afda","resolution":{"observed_at":"2026-05-19T01:16:57.039204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:554654669932bc5a5027bdeec7f4a8170afd96bdee100ad0912a479ebe85c8e6","observation_id":"3614caa9-715a-41bb-9e26-b7ea0abf370f","resolution":{"observed_at":"2026-05-19T01:16:57.032605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:7401eba8240b477f8ec8eb85eb709f025dbf7c057b4f1f0611e7b534ea7907d0","observation_id":"c62b401a-4ddc-4b1c-8099-2e529cba08b3","resolution":{"observed_at":"2026-05-19T01:16:57.078802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":"2504.20571","doi":"10.18653/v1/2024.acl-long.643","metadata_source":"pith","pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","venue":"cs.LG","work_id":"75a5258b-4143-4f2f-99f3-6d950a496305","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:8b53ee4813ee4411e96f827aebec0206de1f013391738631da714506342a0b19","observation_id":"25803ded-892f-4eb0-8dfd-08c9acb5dbfa","resolution":{"observed_at":"2026-05-19T01:16:57.104689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21438","last_updated":"2026-05-07T19:45:35Z","snapshot_observed_at":"2026-07-06T19:41:06.495019Z","submitted_at":"2024-10-28T18:34:25Z","title":"UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function","version":3},"cited_work":{"arxiv_id":"2410.21438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21438","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function","venue":"cs.CL","work_id":"74923039-4a54-4a44-8232-d7000e8d9503","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2410.21438","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:d6ac7b056e936d0a2bb9e2d4c87f8bb1553361aabea5c05378cfbceae2ef55f3","observation_id":"7e1e3c82-2fa3-4b9b-8617-47f0d56dc2e1","resolution":{"observed_at":"2026-05-19T01:16:57.084581Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:5fe7ecf7cebe044cdbd4c075c8070e817ffc32453cff45fc4bd20061c5eea908","observation_id":"7132f0ea-f4be-46f5-b269-58b3540dbda3","resolution":{"observed_at":"2026-05-19T01:16:57.090142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:dcca7d50352fe1fef94f7d396ec94fe8683c7a15cafcf630cd1d6c5f61d3d300","observation_id":"022e8f73-c2b8-4372-957f-d47abeb89bf0","resolution":{"observed_at":"2026-05-19T01:16:57.073079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:2c74abbe37b507d2385ac4ecf93fea47a43b7c53f0b584058196f5fcb5bff739","observation_id":"179d49d9-5143-4989-a9c2-f99e8d816395","resolution":{"observed_at":"2026-05-19T01:16:57.054416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:1ea0e634983a8efb7f0ff99a57701b569e950c2563ebbea73876ba0b99bbb535","observation_id":"1690ad0a-2a23-4c81-9284-9c8fccd9f666","resolution":{"observed_at":"2026-05-19T01:16:56.971782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First, we dissect the bias and variance issues inherent to standard Importance Sampling (IS) when using data from a single behavior policy","venue":null,"work_id":"88e58e0c-1bf6-4fe9-ab29-98ed67a18e59","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:7bc7800cd674f8e74566b617f13faef436709d638ad7c153a2bb6bf5df5cb5be","observation_id":"724ed7d1-bae9-44e3-b0da-9ea529315ae7","resolution":{"observed_at":"2026-05-19T01:16:57.405776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Both theχ 2-divergence and the more commonly known KL-divergence (DKL(πθ∥πω)) are measures of dissimilarity between distributions (both are instances of f-divergences)","venue":null,"work_id":"971a9b99-8a6d-42ab-af84-200261115905","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:87aaae9ab26088bbf3055388a1bbba647d6f76a0303a48a11eb2f0b9774343a6","observation_id":"b3195e19-88f0-4e10-a4bc-89576fb6853d","resolution":{"observed_at":"2026-05-19T01:16:57.419753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"safety net","venue":null,"work_id":"425f30a9-afbe-4cef-a3e6-22b8b0788cf1","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:aa99c3a4cd3474e7f52b00e928545221172ac2a98b2034718bd7920b9a3076cf","observation_id":"e7d5442c-d63d-492c-86aa-29264ba58b21","resolution":{"observed_at":"2026-05-19T01:16:57.402310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b889ae09-fe75-4ea7-abad-dce1e7189e9b","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:dca2330360c6b85f3e568c3e44483de8454677a73d3c28ae7573c18f86c113f6","observation_id":"1de1f09c-09e0-4355-983e-fcdd4ee855d9","resolution":{"observed_at":"2026-05-19T01:16:57.399065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For our approach, one of the model-generated rollouts is replaced with a correct reasoning trajectory from the training dataset","venue":null,"work_id":"6e1788da-b197-44ba-bd20-bcb9350fc49a","year":2021},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:d882295f6053b3af8f134cb271e07a9866a1f2f56ece8240ef255227169683c7","observation_id":"b5dc6cc1-442a-4442-89f9-ab6ee5d81ee2","resolution":{"observed_at":"2026-05-19T01:16:57.392025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"53cbf881-b622-489f-8cdb-1fe507bdf036","year":2023},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:f194108a0f68157adc258b3d2655802dbacb4b1c1a3848c4cdac8be8ff41ca9d","observation_id":"44f5a834-1b23-4e05-842f-ab92b39fa250","resolution":{"observed_at":"2026-05-19T01:16:57.413093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"During evaluation, we set the sampling temperature to 0.6 and report the average pass@1 score over 5 runs by default","venue":null,"work_id":"a117da13-f242-46f8-a0b2-96b490a99729","year":2021},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:c6e2bea4155535a9aa0231a0cb5ca1cc4b06dbf633961d4e42ae636b7df13d52","observation_id":"732bfdc5-a802-4494-8539-6bbe1f4e0228","resolution":{"observed_at":"2026-05-19T01:16:57.409654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The second category consists of four straightforward baselines: 1)SFT, supervised fine-tuning using external reasoning trajectory data","venue":null,"work_id":"d22ed2a2-8022-495d-89da-b49e08d118d1","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:4cbd84b1c8dda804bec2e0db4e8486e8d840e0ebfd06ddad47a16b84aaa9146b","observation_id":"609a9226-2fbf-49ab-a86f-b939df71e029","resolution":{"observed_at":"2026-05-19T01:16:57.395871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","latest_version":5,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":2,"verified_exact":19,"verified_fuzzy":7},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 10 inbound Pith citation observations for arXiv:2508.00222."}