{"as_of":"2026-08-15T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9604090352ee068c00c44d9c4906c33d8ce3884a2bb2c20ce1861f814a988ae5","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:03:50.900234Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03068/citation-record","integrity":"/paper/2608.03068/integrity","json":"/paper/2608.03068/citation-record.json","paper":"/paper/2608.03068"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-08T01:03:50.820158Z","title":"Dan Hendrycks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song, and Jacob Steinhardt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.820158Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:5ffda668351ae4c302fe4e1059a5a591a0ac4e3f267d6366e8a0d1b673e32db2","observation_id":"198e8273-1157-42ea-87a4-f1de19bf9c72","resolution":{"observed_at":"2026-08-08T01:03:50.820158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-08T01:03:50.835692Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.835692Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:6b07015e0d48f4415fafbebe7259fe160a9252882bd5296ece484b1926aa388c","observation_id":"f49a1024-cbde-4c97-a3d1-15074d109f82","resolution":{"observed_at":"2026-08-08T01:03:50.835692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:03:50.840766Z","title":"Mihir Prabhudesai, Lili Chen, Alex Ippoliti, Katerina Fragkiadaki, Hao Liu, and Deepak Pathak","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.840766Z"},"links":{"citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:875511be47708e3d5583954598325629093527ce58c0f8878ea905cd1f68465f","observation_id":"c6307409-bfff-417d-96c1-a50c2b545310","resolution":{"observed_at":"2026-08-08T01:03:50.840766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-13T20:01:21.267324Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-08T01:03:50.846084Z","title":"Yun Qu, Qi Cheems Wang, Yixiu Mao, Vincent Tao Hu, and Xiangyang Ji","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.846084Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:fc5f67f47ea2e195e46121b55773ae5c9cb8a68c3792d0d38cd67180b5503ff7","observation_id":"d7e09ead-8a90-4a9e-95fc-49075a756c03","resolution":{"observed_at":"2026-08-08T01:03:50.846084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:03:50.851038Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.851038Z"},"links":{"citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:23735a36db5c4742c6d5e903c3cf3da57201d14277dab75419ded9932fbae9e1","observation_id":"4bb7b8b2-740b-4747-ab40-041cd0009fed","resolution":{"observed_at":"2026-08-08T01:03:50.851038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19107","last_updated":"2024-05-29T14:11:29Z","snapshot_observed_at":"2026-08-14T18:50:49.537528Z","submitted_at":"2024-05-29T14:11:29Z","title":"Offline Regularised Reinforcement Learning for Large Language Models Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19107","snapshot_observed_at":"2026-08-08T01:03:50.856286Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.856286Z"},"links":{"cited_paper":"/paper/2405.19107","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:7248778e425d6620873ec28ac6f570a5042d511bfe5715373e71ae652993a458","observation_id":"c48d44f1-d719-44e6-8d60-4d963273726d","resolution":{"observed_at":"2026-08-08T01:03:50.856286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-08T01:03:50.867049Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Mingchuan Zhang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.867049Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:b79edd6ea33843ae9c456278ccc47c7b8aab47c6eff269e6871894cf29e5fbcf","observation_id":"d7ab1b69-45a5-4627-893c-40d3a1179c0b","resolution":{"observed_at":"2026-08-08T01:03:50.867049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T01:03:50.872022Z","title":"CoRR, abs/2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.872022Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:a01ec3cbee4e0266f17c733b0f9e132c0fdbd732b0b9f8c7260fd63f1ac14cb7","observation_id":"06828e25-d770-4794-91aa-04f2467a6c68","resolution":{"observed_at":"2026-08-08T01:03:50.872022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-07T16:07:46.182926Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-08T01:03:50.877512Z","title":"Xuerui Su, Liya Guo, Yue Wang, Yi Zhu, Zhiming Ma, Zun Wang, and Yuting Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.877512Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:a28ddba364b0b16b1804d35fb32ef4f510804dc5f898e4098701b330dd055064","observation_id":"bb9eb6a6-0b0a-470f-be7b-34ee3c3bd211","resolution":{"observed_at":"2026-08-08T01:03:50.877512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12951","last_updated":"2025-05-19T10:44:49Z","snapshot_observed_at":"2026-08-07T15:43:18.974872Z","submitted_at":"2025-05-19T10:44:49Z","title":"DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management","version":1},"cited_work":{"arxiv_id":"2505.12951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12951","snapshot_observed_at":"2026-08-08T01:03:50.997788Z","title":"DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management","venue":"cs.LG","work_id":"ae8944ad-23dd-41b5-9496-5d1415a6cfd7","year":2025},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.882610Z"},"links":{"cited_paper":"/paper/2505.12951","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:86e362b582d8afb7263271ad2116c554ce59c61896b731214aeed190f9cbb35f","observation_id":"656f73ed-543a-4fa8-9343-6d6f4884cfd9","resolution":{"observed_at":"2026-08-08T01:03:51.005031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-08T01:03:50.887036Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.887036Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:50880d0ddf4205629e9ad0760dfb0c9dc9ce308bd1d0db2db28d70999661343a","observation_id":"04e254a3-3d8f-4309-b802-dd0885ef1db6","resolution":{"observed_at":"2026-08-08T01:03:50.887036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-08T01:03:50.891503Z","title":"Yufeng Yuan, Yu Yue, Ruofei Zhu, Tiantian Fan, and Lin Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.891503Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:3bb00aa7f9d6ae6b877a1a37c1e2cba65927b656aca44d5f4aed7f70cc47a5c2","observation_id":"234fcb07-92af-4807-996e-7e34e791be50","resolution":{"observed_at":"2026-08-08T01:03:50.891503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-14T13:45:32.469908Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-08T01:03:50.895805Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.895805Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:eb0e87a5c4ff2c496230439678c5ce51ae945bd6c96ed7f61589c5278a874cd7","observation_id":"47b2cca1-ef7f-429d-a4b9-b4f81fd44a93","resolution":{"observed_at":"2026-08-08T01:03:50.895805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-08T01:03:50.900234Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.900234Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:0f76c61aad218131242dc28c4a00e134b18a8da0316b61ffd45affc5643bef2c","observation_id":"f64dcd2a-c888-4b80-90f1-c759daa5af2f","resolution":{"observed_at":"2026-08-08T01:03:50.900234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T01:03:50.862158Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.862158Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:a250314d682890c582c6f4b597dd6874342827d0dfe7109087cf37c84c1b7f15","observation_id":"53510328-38fc-4371-ab95-f428ae84eb73","resolution":{"observed_at":"2026-08-08T01:03:50.862158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:03:51.342824Z","title":"InProceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks 1, NeurIPS Datasets and Benchmarks 2021, December 2021, virtual","venue":null,"work_id":"90a2a686-d190-44d4-a23b-112eaef59505","year":2021},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.825233Z"},"links":{"citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:e3ac8073aec407423774f453d6338999a360b8604bf18f00bfa8e815a19c2144","observation_id":"f05c8805-548d-48d0-8a4b-158208d944e1","resolution":{"observed_at":"2026-08-08T01:03:51.347930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-08T01:03:50.814168Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.814168Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:bb12820d115f5bfda3db527a8c60f5719cc7f34ddcb47c718e6e56124afbea6f","observation_id":"471fe5c0-bde5-4e7e-a082-1e7ca1a9f9f6","resolution":{"observed_at":"2026-08-08T01:03:50.814168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-08T01:03:50.829866Z","title":"Jingcheng Hu, Yinmin Zhang, Qi Han, Daxin Jiang, Xiangyu Zhang, and Heung-Yeung Shum","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.829866Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:ebe80182d3c64b880bb1c2295d67e21c730549989ac31c4a95030b2e6b2d48eb","observation_id":"da67af90-fa16-46a0-a5c0-349c22f72ca6","resolution":{"observed_at":"2026-08-08T01:03:50.829866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T00:57:52.279448Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2608.03068."}