Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-03T05:14:22.701235Z
Paper Citation Record · LEDGER
As of 6 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2602.02979.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-03T05:14:22.701235Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
49 of 49 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 87d0fa1f-0626-4e36-a24f-8cb1dae340ff · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning write newline
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1a45c0f4-7875-4ed4-8853-ee4539f65de5 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning gpt-oss-120b & gpt-oss-20b Model Card
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bdfcc90d-8e92-4083-a330-075d0d36cdc7 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 69de20ef-bf47-4540-aaa3-41cb06dc5a84 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e32f2d2d-3250-43b9-bbf7-511323954271 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-Questioning Language Models
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 25610b30-6f73-42cf-be21-e10395ced2c0 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Evaluating Large Language Models Trained on Code
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e4e45190-6ff2-466b-961e-4204a8676826 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 737037a8-e47b-44d4-a264-54666cf8bb22 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d617b099-8cf9-4b7b-9dc2-bb66070de29e · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3d6a929b-8e45-4dd7-83e8-5f52b1200b4f · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Process Reinforcement through Implicit Rewards
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 09b938cb-cfa9-409d-9fde-7fd96d8601ba · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Reinforcement Pre-Training
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6d6214f2-eaf5-46ca-b93c-e6fec8f28563 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning The Llama 3 Herd of Models
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f86ca8b5-11b4-4ac4-b1b0-76bbca2e5fc4 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1d40c09b-d99b-468c-9ba5-51506692e497 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8daffe21-dfc4-4bd5-878a-b4ee0fd211ea · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Measuring Mathematical Problem Solving With the MATH Dataset
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7a846845-f5a8-43b3-b42f-54e359f75bee · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5fb056ad-3db9-455a-9ba4-619a857ff0e8 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning R-Zero: Self-Evolving Reasoning LLM from Zero Data
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fb33b96c-a663-42ee-8cf6-7604f252f535 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning OpenAI o1 System Card
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bc67d132-ce79-4bb1-b1b7-d2e82aa7e73c · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 04c1710f-cb6e-4b6a-8800-1b409e358e42 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Tulu 3: Pushing Frontiers in Open Language Model Post-Training
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c7a19091-6e30-466f-9050-cb40ebc128d1 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Solving Quantitative Reasoning Problems with Language Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 80755571-d9f4-4a77-9222-4be56575688e · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 27b9735b-8a94-4cb8-bfd3-6a74ed075534 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f5c69e64-3f56-4297-8e6e-5f40264c8371 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fc97f02f-9939-460d-b733-43ff7bb1570b · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Gpt-5 system card
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a99a263-3129-4a56-b36a-407951cbbd24 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Openai o3 and o4-mini system card
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 12838577-31e1-47f6-b1f9-5296e72813f5 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Training language models to follow instructions with human feedback
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3601a53e-9544-4920-b9c7-75b34b5a2b09 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Maximizing Confidence Alone Improves Reasoning
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 60aafde8-049e-4852-82cd-062df4e42f3c · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning ChatDev: Communicative Agents for Software Development
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b81d792d-609f-42ee-99b0-75671d10419e · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Proximal Policy Optimization Algorithms
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b8acca25-d9e8-4c0c-82c8-b61e1cb98086 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Unresolved cited work
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0fabeef2-9cce-4689-85ea-d4369ba374ef · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0d8a5bc1-fea8-416d-9c88-6fb3901f2fa3 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Hybridflow: A flexible and efficient rlhf framework
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 32557d67-3451-44be-8156-77395016f9c0 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7f367450-1201-4965-a556-2b4be6eab8a3 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Kimi K2: Open Agentic Intelligence
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3383bd60-e72a-4dbf-ac1b-00724e58fe4d · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b4f89082-9116-4c21-a8dc-0b28d253485b · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Zephyr: Direct Distillation of LM Alignment
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 135e414e-7f4a-4229-876c-70cf501e6e31 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning V., Chi, E
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5877dcad-ab33-452d-90da-745304b5d0a3 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a0df4921-1f7b-4bd2-be47-c0941eb40e2a · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning V., Zhou, D., et al
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b896a909-8106-4d06-ac64-1436ef0624b9 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-rewarding correction for mathematical reasoning
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cdf5c098-156d-4097-a352-632d13f6c65b · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Qwen2 Technical Report
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 23a6939e-eb50-4155-bcc8-347fa703c964 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-Rewarding Language Models
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dfd36174-b9ca-47bb-a361-d09a6b57de2d · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning S., and Katabi, D
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c101a8eb-45cf-44a7-a4e0-633897d475cb · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9fcaacfb-fa23-4a17-aee4-351c5a09750b · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 09c111ba-ea9e-4141-9985-0fb9fa94f850 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Absolute Zero: Reinforced Self-play Reasoning with Zero Data
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dc6b080e-c3c7-4fd8-8e92-ba8f2fb6dec4 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning TTRL: Test-Time Reinforcement Learning
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e33cb627-a715-4a13-bd31-0c3f31276d91 · outbound
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-adapting language models
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
No inbound Pith citation observations are available.