Pith. sign in

Paper Citation Record · LEDGER

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning

As of 23 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2602.02979.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2602.02979 v3

Coverage vector

measured 49 of 49 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T05:14:22.701235Z

measured 49 of 49 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

49 of 49 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 87d0fa1f-0626-4e36-a24f-8cb1dae340ff · outbound

This paper cites write newline.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.163147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.163147Z digest=sha256:d84a507c02cd0d0a63247c232af505dde59fedd09feb385440cb78f2d93dd361

Observation 1a45c0f4-7875-4ed4-8853-ee4539f65de5 · outbound

This paper cites gpt-oss-120b & gpt-oss-20b Model Card.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning gpt-oss-120b & gpt-oss-20b Model Card

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.225076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.225076Z digest=sha256:3320725cd65b537613a61b36c01e09df6fe247de759090f0da4dd87edd716638

Observation bdfcc90d-8e92-4083-a330-075d0d36cdc7 · outbound

This paper cites The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.279744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.279744Z digest=sha256:c667754829d20f6d7e0d914c34552dc81da2a54786458b96dd4cae01c74433ad

Observation 69de20ef-bf47-4540-aaa3-41cb06dc5a84 · outbound

This paper cites Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.390378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.390378Z digest=sha256:2f23363175795bc80db1a398b8cec09bf2bd2a38d88b496c3d52c8c9e75a6a17

Observation e32f2d2d-3250-43b9-bbf7-511323954271 · outbound

This paper cites Self-Questioning Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-Questioning Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.543228Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.543228Z digest=sha256:6653a4517b18953c9c744a12c1ba4b7179950bbd4f54cadf9607edbf213f0b4c

Observation 25610b30-6f73-42cf-be21-e10395ced2c0 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Evaluating Large Language Models Trained on Code

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.644273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.644273Z digest=sha256:ef7cf3d2465617b4c0a515a395491a2eae7d538d36eea67ce9c71ca023e71405

Observation e4e45190-6ff2-466b-961e-4204a8676826 · outbound

This paper cites Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.752684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.752684Z digest=sha256:672807b31340aa0876272cd610e1f78e6f22e5478c94d6d1428a43b1ed3f0dea

Observation 737037a8-e47b-44d4-a264-54666cf8bb22 · outbound

This paper cites F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.824281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.824281Z digest=sha256:cdc59a61995f8623c1430e10a042d9c4be0eda502d52e3b577fd7e0dc914c2c2

Observation d617b099-8cf9-4b7b-9dc2-bb66070de29e · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.899029Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.899029Z digest=sha256:3a71c407518c09930110766f409f0f67d10ef378c25d2182b33074717830564e

Observation 3d6a929b-8e45-4dd7-83e8-5f52b1200b4f · outbound

This paper cites Process Reinforcement through Implicit Rewards.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Process Reinforcement through Implicit Rewards

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:17.976904Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:17.976904Z digest=sha256:4f309af45d4ec4f69f579179e63f476db31d1de2db9044ef4d2599fa0c832b32

Observation 09b938cb-cfa9-409d-9fde-7fd96d8601ba · outbound

This paper cites Reinforcement Pre-Training.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Reinforcement Pre-Training

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.061552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.061552Z digest=sha256:5ec5be64da0a8eff88d4450445b0842c177e731f0dbc4915822555834f3b3d5f

Observation 6d6214f2-eaf5-46ca-b93c-e6fec8f28563 · outbound

This paper cites The Llama 3 Herd of Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning The Llama 3 Herd of Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.148904Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.148904Z digest=sha256:0f1336d6ff5ebf919bd6b1cd6a33dbcad8cb2936f210a4d787bb594b4b7654a8

Observation f86ca8b5-11b4-4ac4-b1b0-76bbca2e5fc4 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.324841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.324841Z digest=sha256:b7332e7454add9a8ca842a9470072c348b3f363274dfb7ddc9ce2113454ec33f

Observation 1d40c09b-d99b-468c-9ba5-51506692e497 · outbound

This paper cites O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.431225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.431225Z digest=sha256:403486a7810264211e403a011d781ea6e686aaca1ab7959be2df17af1c1267ae

Observation 8daffe21-dfc4-4bd5-878a-b4ee0fd211ea · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Measuring Mathematical Problem Solving With the MATH Dataset

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.514942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.514942Z digest=sha256:fb2d1f99fe8f2856df2c9dbc4339dcc01e3024fc3c9d73e059b9fc74fa474e50

Observation 7a846845-f5a8-43b3-b42f-54e359f75bee · outbound

This paper cites Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.632040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.632040Z digest=sha256:4c943e706155c586769901cee11fb6b388d6f209c5e5b51dead9211cb9e022ad

Observation 5fb056ad-3db9-455a-9ba4-619a857ff0e8 · outbound

This paper cites R-Zero: Self-Evolving Reasoning LLM from Zero Data.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning R-Zero: Self-Evolving Reasoning LLM from Zero Data

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.752065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.752065Z digest=sha256:d06e033cd77e7a98d3ae9454a530047727bf68cd0bbd2ab71373cdba597177b5

Observation fb33b96c-a663-42ee-8cf6-7604f252f535 · outbound

This paper cites OpenAI o1 System Card.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning OpenAI o1 System Card

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.860703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.860703Z digest=sha256:1571c8e5fc74582cf4f6a0400a3fbc0d86a340ead7c16fe28d07c225448c4a49

Observation bc67d132-ce79-4bb1-b1b7-d2e82aa7e73c · outbound

This paper cites PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:18.928775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:18.928775Z digest=sha256:3217b8fdab2b84b6761751c714f7ea5d240061c7ffe514fa5b9932ecdfe4e702

Observation 04c1710f-cb6e-4b6a-8800-1b409e358e42 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.051690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.051690Z digest=sha256:a952f1b29c9a956385eacaa11240b58e2087439bb155593a49ff116652cb22f1

Observation c7a19091-6e30-466f-9050-cb40ebc128d1 · outbound

This paper cites Solving Quantitative Reasoning Problems with Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Solving Quantitative Reasoning Problems with Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.142903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.142903Z digest=sha256:6b629a8343c48a0b791c476708734f1e3858759d223d4ad04750705634afb076

Observation 80755571-d9f4-4a77-9222-4be56575688e · outbound

This paper cites Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.263434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.263434Z digest=sha256:e039e7cc51ee9e59ece0744911e985a87ea22ae3b205fc9ae0ed32216ef99566

Observation 27b9735b-8a94-4cb8-bfd3-6a74ed075534 · outbound

This paper cites URPO: A Unified Reward & Policy Optimization Framework for Large Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning URPO: A Unified Reward & Policy Optimization Framework for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.399777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.399777Z digest=sha256:33b819b0d9463ff94e90b204e5a3ea09fad5277ac609300374f8363e7e03efb5

Observation f5c69e64-3f56-4297-8e6e-5f40264c8371 · outbound

This paper cites AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.549625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.549625Z digest=sha256:6bfb3e957a0b6147f38a956d13c59b37d48de4ee3da9226a722f0c2258e25536

Observation fc97f02f-9939-460d-b733-43ff7bb1570b · outbound

This paper cites Gpt-5 system card.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Gpt-5 system card

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.689456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.689456Z digest=sha256:17f989b80cdb2398156cac1a5752d07511cd3b0134e745a1eac7c34ff1490d70

Observation 4a99a263-3129-4a56-b36a-407951cbbd24 · outbound

This paper cites Openai o3 and o4-mini system card.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Openai o3 and o4-mini system card

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.817165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.817165Z digest=sha256:a2958d3a2ee33c9c4ec16f436da75daa7c4c623ef79ca9ff43cb2a6c17714587

Observation 12838577-31e1-47f6-b1f9-5296e72813f5 · outbound

This paper cites Training language models to follow instructions with human feedback.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Training language models to follow instructions with human feedback

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:19.947935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:19.947935Z digest=sha256:d4cf6de2977138427ab1e6b1472b01588454106b2c65accff6d6eddeb21399eb

Observation 3601a53e-9544-4920-b9c7-75b34b5a2b09 · outbound

This paper cites Maximizing Confidence Alone Improves Reasoning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Maximizing Confidence Alone Improves Reasoning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.083519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.083519Z digest=sha256:019defc033d3ad872f7d5f6564e047c91e05535a278ac03755adc045ba0618d0

Observation 60aafde8-049e-4852-82cd-062df4e42f3c · outbound

This paper cites ChatDev: Communicative Agents for Software Development.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning ChatDev: Communicative Agents for Software Development

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.203270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.203270Z digest=sha256:e9f46282c0ef6137061653efcdf9090e1ecfe2d9167140c7ae72f19b2d6eff20

Observation b81d792d-609f-42ee-99b0-75671d10419e · outbound

This paper cites Proximal Policy Optimization Algorithms.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.320392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.320392Z digest=sha256:c3a8be7c55d2987c285f13f0ea418a3de7dc028cc17edeaf9750673e6414e729

Observation b8acca25-d9e8-4c0c-82c8-b61e1cb98086 · outbound

This paper cites an unresolved cited work.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.441984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.441984Z digest=sha256:824ea6198d4c9019cf1791ab1cf32a08637e91e19e69dea6ca01e70a986c7542

Observation 0fabeef2-9cce-4689-85ea-d4369ba374ef · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.525676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.525676Z digest=sha256:ea2f6e1b46f3f6ad3a224c70221fa65404f63ccadac36ae19bdf0a610819b268

Observation 0d8a5bc1-fea8-416d-9c88-6fb3901f2fa3 · outbound

This paper cites Hybridflow: A flexible and efficient rlhf framework.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Hybridflow: A flexible and efficient rlhf framework

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.635923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.635923Z digest=sha256:e57f941f040375ec7e80dcfc16db17cb14638246c8989e5d1529a97ecf9023c9

Observation 32557d67-3451-44be-8156-77395016f9c0 · outbound

This paper cites Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.763891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.763891Z digest=sha256:1472f0bffc2e984959c218a0920b68f7ab8d7161612e941c556e4ba54b4833ea

Observation 7f367450-1201-4965-a556-2b4be6eab8a3 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Kimi K2: Open Agentic Intelligence

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.881653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.881653Z digest=sha256:67f6463191baa86ced684fe25b4b8346c94ea7eefa08bfc0610b46ffb9ed50c3

Observation 3383bd60-e72a-4dbf-ac1b-00724e58fe4d · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:20.975564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:20.975564Z digest=sha256:1dc9ffad3340d4e0e3b134d5f8fc4236cc981a6cf0bb4c1ee6ccfcf9856f309e

Observation b4f89082-9116-4c21-a8dc-0b28d253485b · outbound

This paper cites Zephyr: Direct Distillation of LM Alignment.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Zephyr: Direct Distillation of LM Alignment

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.149242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.149242Z digest=sha256:d0969bf1f06b41929cbaff87e57365e20e9f2412c9c8f1bd9221f8e679483401

Observation 135e414e-7f4a-4229-876c-70cf501e6e31 · outbound

This paper cites V., Chi, E.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning V., Chi, E

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.286257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.286257Z digest=sha256:36627ce33112d6d68f54a9c4cbc411d87fd2a545560934305c729c94649b672c

Observation 5877dcad-ab33-452d-90da-745304b5d0a3 · outbound

This paper cites OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.405084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.405084Z digest=sha256:a1a5ebb6647f0942bd84d3bebbdd8b63c61d60b4205fdad93221be7038953325

Observation a0df4921-1f7b-4bd2-be47-c0941eb40e2a · outbound

This paper cites V., Zhou, D., et al.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning V., Zhou, D., et al

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.461937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.461937Z digest=sha256:f4c83b286b01bd07a14ab3cdd07ddcdb3d31b59705d6da7ce6742ce30babe81d

Observation b896a909-8106-4d06-ac64-1436ef0624b9 · outbound

This paper cites Self-rewarding correction for mathematical reasoning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-rewarding correction for mathematical reasoning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.533431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.533431Z digest=sha256:954566f20203be9089dc32527db514f40b8f5cd11a04a07e0bd8b0dde5729b2b

Observation cdf5c098-156d-4097-a352-632d13f6c65b · outbound

This paper cites Qwen2 Technical Report.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Qwen2 Technical Report

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.778638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.778638Z digest=sha256:ab7e5ff843141acacbe9c9b141fec22c9037bbace2882ebd47ecb1b8e3e70328

Observation 23a6939e-eb50-4155-bcc8-347fa703c964 · outbound

This paper cites Self-Rewarding Language Models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-Rewarding Language Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.845716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.845716Z digest=sha256:72331060a75d79ef3fcf4f9c04e5e157aab4c669f7018fb4a36be2812f61bde0

Observation dfd36174-b9ca-47bb-a361-d09a6b57de2d · outbound

This paper cites S., and Katabi, D.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning S., and Katabi, D

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:21.969612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:21.969612Z digest=sha256:3ef5e4b18c8b29ccbbe8a6e99d639dfea7a2871faf4a34c5e476af8c6fa1553c

Observation c101a8eb-45cf-44a7-a4e0-633897d475cb · outbound

This paper cites Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.069080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.069080Z digest=sha256:21ec57642421bac625ecde22b06b2dcc6eb9b7208862141d44ca02dd1631da27

Observation 9fcaacfb-fa23-4a17-aee4-351c5a09750b · outbound

This paper cites Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.180784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.180784Z digest=sha256:e4026570102e10f171d6497d8b916ea3e62ae73b956b4272bd14f935ab018272

Observation 09c111ba-ea9e-4141-9985-0fb9fa94f850 · outbound

This paper cites Absolute Zero: Reinforced Self-play Reasoning with Zero Data.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Absolute Zero: Reinforced Self-play Reasoning with Zero Data

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.304814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.304814Z digest=sha256:6068b739138c38fa2095802410d2cd66131dad937f25445fa587d177f524489e

Observation dc6b080e-c3c7-4fd8-8e92-ba8f2fb6dec4 · outbound

This paper cites TTRL: Test-Time Reinforcement Learning.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning TTRL: Test-Time Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.507382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.507382Z digest=sha256:4f33cb0be07ef8c8fb74c5a25fda4a740e23f3147899054ff1d5c02472ff05b3

Observation e33cb627-a715-4a13-bd31-0c3f31276d91 · outbound

This paper cites Self-adapting language models.

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning Self-adapting language models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-03T05:14:22.701235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T05:14:22.701235Z digest=sha256:0bca0159184f0f55c32c8abbe0227993c715169967dc2dacfe4e1363fd8e1878

Pith citing papers

No inbound Pith citation observations are available.