Pith. sign in

Paper Citation Record · LEDGER

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning

As of 6 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2602.02979.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2602.02979 v3

Coverage vector

measured 49 of 49 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T05:14:22.701235Z

measured 49 of 49 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

49 of 49 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 87d0fa1f-0626-4e36-a24f-8cb1dae340ff · outbound

This paper cites write newline.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.163147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.163147Z digest=sha256:909085a30fa3561b0910f3ca0398445406b8421fb11a07b6f9aade2e20ec77c1

Observation 1a45c0f4-7875-4ed4-8853-ee4539f65de5 · outbound

This paper cites gpt-oss-120b & gpt-oss-20b Model Card.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning gpt-oss-120b & gpt-oss-20b Model Card

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.225076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.225076Z digest=sha256:eb3a8177ac6d39f1f992bddc38ed7b2bf043c0e740f1d9dc575523fc77247e1c

Observation bdfcc90d-8e92-4083-a330-075d0d36cdc7 · outbound

This paper cites The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.279744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.279744Z digest=sha256:7798c96cd5c3f7695b594fd87f573d00864264167eeadd8c0055622f86c5d321

Observation 69de20ef-bf47-4540-aaa3-41cb06dc5a84 · outbound

This paper cites Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.390378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.390378Z digest=sha256:4495a519e2a01fec41d509ae12a636e90608cb1d35351908a621606741848362

Observation e32f2d2d-3250-43b9-bbf7-511323954271 · outbound

This paper cites Self-Questioning Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-Questioning Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.543228Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.543228Z digest=sha256:f1f9bc4f145d58d4dcbb31a4e12afde316198089e5a0dad9e2ab1d84e0089d2d

Observation 25610b30-6f73-42cf-be21-e10395ced2c0 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Evaluating Large Language Models Trained on Code

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.644273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.644273Z digest=sha256:92046380bedbec81ef46a0554c818c5fab9994b9f4d16c08f930c43702aed1a0

Observation e4e45190-6ff2-466b-961e-4204a8676826 · outbound

This paper cites Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.752684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.752684Z digest=sha256:fa9d5fd6824c963ad5595ea827f618a02eb132d25738d1adcf86a09d6a0acc4b

Observation 737037a8-e47b-44d4-a264-54666cf8bb22 · outbound

This paper cites F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.824281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.824281Z digest=sha256:aaa7472cd79502e70c07ab68c4866dd51aa7b1b5fe9a62c393d5c223fc988223

Observation d617b099-8cf9-4b7b-9dc2-bb66070de29e · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.899029Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.899029Z digest=sha256:c152c8ef76562f754e61d8690421d4428463af9587e8a5d899b0a7112b79cfed

Observation 3d6a929b-8e45-4dd7-83e8-5f52b1200b4f · outbound

This paper cites Process Reinforcement through Implicit Rewards.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Process Reinforcement through Implicit Rewards

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.976904Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.976904Z digest=sha256:423327e1fe6c1979e1bb1ee5971b2ef3dba702ab7943e1725bb0eabddbc815c4

Observation 09b938cb-cfa9-409d-9fde-7fd96d8601ba · outbound

This paper cites Reinforcement Pre-Training.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Reinforcement Pre-Training

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.061552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.061552Z digest=sha256:d519f6fd796f93289a6e0d43856da5c3e44ecc6f308a171c0ec485f5b0c4495b

Observation 6d6214f2-eaf5-46ca-b93c-e6fec8f28563 · outbound

This paper cites The Llama 3 Herd of Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning The Llama 3 Herd of Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.148904Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.148904Z digest=sha256:862fb0beca71a07a379ce344051cba7c1f7569416b15b88e4deeaf8659c0a166

Observation f86ca8b5-11b4-4ac4-b1b0-76bbca2e5fc4 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.324841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.324841Z digest=sha256:375d547b9746d7d676faa1cb27ddbafdf5397c578b7a50703d3079668328a7ea

Observation 1d40c09b-d99b-468c-9ba5-51506692e497 · outbound

This paper cites O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.431225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.431225Z digest=sha256:884ed1a686a522831a32510128c0ad9d46178d9cb11c794ed8c5a1f94ad0f441

Observation 8daffe21-dfc4-4bd5-878a-b4ee0fd211ea · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Measuring Mathematical Problem Solving With the MATH Dataset

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.514942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.514942Z digest=sha256:b848fbe6f24e25e65f613fb7d3e864ac2ce2a3a7c424ca50d69a4276172c1812

Observation 7a846845-f5a8-43b3-b42f-54e359f75bee · outbound

This paper cites Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.632040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.632040Z digest=sha256:8472777603c7a1732e24d12b281e21531b374fb153468ea47afd7a98a5ab58f2

Observation 5fb056ad-3db9-455a-9ba4-619a857ff0e8 · outbound

This paper cites R-Zero: Self-Evolving Reasoning LLM from Zero Data.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning R-Zero: Self-Evolving Reasoning LLM from Zero Data

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.752065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.752065Z digest=sha256:95f79ca796762ad5f66159ed671de52c01d1f99ac189ecfe4c867255992c0c37

Observation fb33b96c-a663-42ee-8cf6-7604f252f535 · outbound

This paper cites OpenAI o1 System Card.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning OpenAI o1 System Card

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.860703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.860703Z digest=sha256:83bb91535709ad7dad97e806c650a68e967c1cc18825c98f4f7cac23c70d323f

Observation bc67d132-ce79-4bb1-b1b7-d2e82aa7e73c · outbound

This paper cites PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.928775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.928775Z digest=sha256:6e38417597bb77cb500dbbc314d1bb549ef435ea99a7e51d9435e90c34e80573

Observation 04c1710f-cb6e-4b6a-8800-1b409e358e42 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.051690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.051690Z digest=sha256:2f95e0e49acf21745e565e66002d7306cfe7e11e472bde12c663261fe65ada26

Observation c7a19091-6e30-466f-9050-cb40ebc128d1 · outbound

This paper cites Solving Quantitative Reasoning Problems with Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Solving Quantitative Reasoning Problems with Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.142903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.142903Z digest=sha256:9332c84e2dfe43b5437a2b7f694d1bf3e4206677404fa4aee2d7f9ddbd1abd73

Observation 80755571-d9f4-4a77-9222-4be56575688e · outbound

This paper cites Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.263434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.263434Z digest=sha256:c141f708a49c5529df8fbb25dc25c49fae0534302b7f9b9754553fb4773e8ec5

Observation 27b9735b-8a94-4cb8-bfd3-6a74ed075534 · outbound

This paper cites URPO: A Unified Reward & Policy Optimization Framework for Large Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning URPO: A Unified Reward & Policy Optimization Framework for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.399777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.399777Z digest=sha256:bd136d98b19fea9eb270d7527d2acde58fa915964afaef889d80ed7db17169fe

Observation f5c69e64-3f56-4297-8e6e-5f40264c8371 · outbound

This paper cites AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.549625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.549625Z digest=sha256:2902eadc9df8f679912f0d45b90932e88eb7c8513b3b9656844f7ef7042c1678

Observation fc97f02f-9939-460d-b733-43ff7bb1570b · outbound

This paper cites Gpt-5 system card.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Gpt-5 system card

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.689456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.689456Z digest=sha256:6754d297d83e01b9787f8dbf78a056bdc1b8a7b5f83f00672126803ebf06c781

Observation 4a99a263-3129-4a56-b36a-407951cbbd24 · outbound

This paper cites Openai o3 and o4-mini system card.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Openai o3 and o4-mini system card

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.817165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.817165Z digest=sha256:ca8058ddd2ef27b03986819c32eab7aa3eb9c665bec06d7f0949e1212de245a6

Observation 12838577-31e1-47f6-b1f9-5296e72813f5 · outbound

This paper cites Training language models to follow instructions with human feedback.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Training language models to follow instructions with human feedback

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.947935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.947935Z digest=sha256:a26600c6948d964d442283d006cdac055f006db10f6769009fd8c3d82069c122

Observation 3601a53e-9544-4920-b9c7-75b34b5a2b09 · outbound

This paper cites Maximizing Confidence Alone Improves Reasoning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Maximizing Confidence Alone Improves Reasoning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.083519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.083519Z digest=sha256:a5119467484e9d2ad84c4227d5757cc396ec43669f7e2feb70540154c7495f64

Observation 60aafde8-049e-4852-82cd-062df4e42f3c · outbound

This paper cites ChatDev: Communicative Agents for Software Development.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning ChatDev: Communicative Agents for Software Development

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.203270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.203270Z digest=sha256:9a9cb4841275e1b19e411099914a1a000b98756110c63ed1fb450374081c624c

Observation b81d792d-609f-42ee-99b0-75671d10419e · outbound

This paper cites Proximal Policy Optimization Algorithms.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.320392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.320392Z digest=sha256:d7aaba0e47bdc3175fa74f170e277fd3b9388ca5cceb194f0d0b60a3a9fafdc8

Observation b8acca25-d9e8-4c0c-82c8-b61e1cb98086 · outbound

This paper cites an unresolved cited work.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.441984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.441984Z digest=sha256:c944eca125e9c443e27d9fa2e5a65431c33c181b0b5a848e310977b7f9b57123

Observation 0fabeef2-9cce-4689-85ea-d4369ba374ef · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.525676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.525676Z digest=sha256:3c1e0453e3838a77fee4517f14b3d6af2e033c8bc6415d69749e4d456c6febfa

Observation 0d8a5bc1-fea8-416d-9c88-6fb3901f2fa3 · outbound

This paper cites Hybridflow: A flexible and efficient rlhf framework.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Hybridflow: A flexible and efficient rlhf framework

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.635923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.635923Z digest=sha256:fc3486e1925de3238e4cbc224e8de2500d83db8fe685d2219c7b0538ebd6ff00

Observation 32557d67-3451-44be-8156-77395016f9c0 · outbound

This paper cites Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.763891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.763891Z digest=sha256:75730fbaeeada1f9271e99db334ed5e5ffe857f57b5053b644637a14af26b53c

Observation 7f367450-1201-4965-a556-2b4be6eab8a3 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Kimi K2: Open Agentic Intelligence

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.881653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.881653Z digest=sha256:367a2cfb26beafae0dc98c24eeeda1feb553c88e1b55c1257c5eaca00d375cb9

Observation 3383bd60-e72a-4dbf-ac1b-00724e58fe4d · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.975564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.975564Z digest=sha256:8b9fc459a5be00b06ffbc073a066d021ef4194c55f366df49494876342851d2b

Observation b4f89082-9116-4c21-a8dc-0b28d253485b · outbound

This paper cites Zephyr: Direct Distillation of LM Alignment.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Zephyr: Direct Distillation of LM Alignment

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.149242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.149242Z digest=sha256:f4bfc12482c725670dafa2281c58c91928a4ef60ed6af8d9238b4c318e791e90

Observation 135e414e-7f4a-4229-876c-70cf501e6e31 · outbound

This paper cites V., Chi, E.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning V., Chi, E

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.286257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.286257Z digest=sha256:50c16bb1495140635e29c57c0cc49e1caee7d6e050ea118f2a5ecece2ae56514

Observation 5877dcad-ab33-452d-90da-745304b5d0a3 · outbound

This paper cites OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.405084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.405084Z digest=sha256:0386a328534c4fdaf7afc3799fd194c4e3df9663eba847e5250f3637065802a2

Observation a0df4921-1f7b-4bd2-be47-c0941eb40e2a · outbound

This paper cites V., Zhou, D., et al.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning V., Zhou, D., et al

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.461937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.461937Z digest=sha256:3158449c37b9155b27d28e9295305d7ba18cc96885e8f9aa2ac111e6e73dda5c

Observation b896a909-8106-4d06-ac64-1436ef0624b9 · outbound

This paper cites Self-rewarding correction for mathematical reasoning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-rewarding correction for mathematical reasoning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.533431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.533431Z digest=sha256:70e1327458fd98072751e3f6b8437c033f36c27aaa64e9b044e1abb83e06b0ad

Observation cdf5c098-156d-4097-a352-632d13f6c65b · outbound

This paper cites Qwen2 Technical Report.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Qwen2 Technical Report

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.778638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.778638Z digest=sha256:3909409b0a64bb995222219d0e1462dc6ae1212aa66727787c2df819697a0baa

Observation 23a6939e-eb50-4155-bcc8-347fa703c964 · outbound

This paper cites Self-Rewarding Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-Rewarding Language Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.845716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.845716Z digest=sha256:37eacb87a5d9c689293c671c3dec134b6483636dd623c3ce551b5e568671e207

Observation dfd36174-b9ca-47bb-a361-d09a6b57de2d · outbound

This paper cites S., and Katabi, D.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning S., and Katabi, D

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.969612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.969612Z digest=sha256:0a8058c099fcba025a1c5e2f08ddaac8e6b04f28fd6ffefa162eca1b2be0752d

Observation c101a8eb-45cf-44a7-a4e0-633897d475cb · outbound

This paper cites Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.069080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.069080Z digest=sha256:c6e4c6a5915535c54a065611601dc820c833f7b9e4c96cb2e2819e25be50794a

Observation 9fcaacfb-fa23-4a17-aee4-351c5a09750b · outbound

This paper cites Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.180784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.180784Z digest=sha256:5a09353161a6b80b59e793fe1f18bf957e564c1c3c78b924b7c210fbba16ac6a

Observation 09c111ba-ea9e-4141-9985-0fb9fa94f850 · outbound

This paper cites Absolute Zero: Reinforced Self-play Reasoning with Zero Data.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Absolute Zero: Reinforced Self-play Reasoning with Zero Data

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.304814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.304814Z digest=sha256:0f79382d8a7c03b6d26e622182e25a69c7fca2f56dbdf35f45eba13b99c7647a

Observation dc6b080e-c3c7-4fd8-8e92-ba8f2fb6dec4 · outbound

This paper cites TTRL: Test-Time Reinforcement Learning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning TTRL: Test-Time Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.507382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.507382Z digest=sha256:caab654e49b1e4d66e2b4c4cb98d079794ade0424e6cfddf25cd2779b20ee64f

Observation e33cb627-a715-4a13-bd31-0c3f31276d91 · outbound

This paper cites Self-adapting language models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-adapting language models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.701235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.701235Z digest=sha256:73afe6f76af8e68b6b287d024925d6e91c1d9d0976b0bfe783a8b1ccc9a61f33

Pith citing papers

No inbound Pith citation observations are available.