{"as_of":"2026-08-06T20:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9f030615825e86b70af36c3ec1b8e2a6c785f6092233b3c5c43264842d2ad9a","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:14:22.701235Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.02979/citation-record","integrity":"/paper/2602.02979/integrity","json":"/paper/2602.02979/citation-record.json","paper":"/paper/2602.02979"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:17.163147Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.163147Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:909085a30fa3561b0910f3ca0398445406b8421fb11a07b6f9aade2e20ec77c1","observation_id":"87d0fa1f-0626-4e36-a24f-8cb1dae340ff","resolution":{"observed_at":"2026-08-03T05:14:17.163147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-03T05:14:17.225076Z","title":"K., Bai, Y., Baker, B., Bao, H., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.225076Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:eb3a8177ac6d39f1f992bddc38ed7b2bf043c0e740f1d9dc575523fc77247e1c","observation_id":"1a45c0f4-7875-4ed4-8853-ee4539f65de5","resolution":{"observed_at":"2026-08-03T05:14:17.225076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-03T05:14:17.279744Z","title":"The unreasonable effectiveness of entropy minimization in llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.279744Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:7798c96cd5c3f7695b594fd87f573d00864264167eeadd8c0055622f86c5d321","observation_id":"bdfcc90d-8e92-4083-a330-075d0d36cdc7","resolution":{"observed_at":"2026-08-03T05:14:17.279744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-07-06T17:02:09.539730Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-03T05:14:17.390378Z","title":"H., Baker, B., Gao, L., Aschenbrenner, L., Chen, Y., Ecoffet, A., Joglekar, M., Leike, J., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.390378Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:4495a519e2a01fec41d509ae12a636e90608cb1d35351908a621606741848362","observation_id":"69de20ef-bf47-4540-aaa3-41cb06dc5a84","resolution":{"observed_at":"2026-08-03T05:14:17.390378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03682","last_updated":"2025-09-09T21:50:16Z","snapshot_observed_at":"2026-08-06T04:14:31.812506Z","submitted_at":"2025-08-05T17:51:33Z","title":"Self-Questioning Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03682","snapshot_observed_at":"2026-08-03T05:14:17.543228Z","title":"Self-questioning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.543228Z"},"links":{"cited_paper":"/paper/2508.03682","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:f1f9bc4f145d58d4dcbb31a4e12afde316198089e5a0dad9e2ab1d84e0089d2d","observation_id":"e32f2d2d-3250-43b9-bbf7-511323954271","resolution":{"observed_at":"2026-08-03T05:14:17.543228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-03T05:14:17.644273Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.644273Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:92046380bedbec81ef46a0554c818c5fab9994b9f4d16c08f930c43702aed1a0","observation_id":"25610b30-6f73-42cf-be21-e10395ced2c0","resolution":{"observed_at":"2026-08-03T05:14:17.644273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07061","last_updated":"2024-07-10T15:57:21Z","snapshot_observed_at":"2026-08-04T14:51:52.505052Z","submitted_at":"2024-07-09T17:33:24Z","title":"Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07061","snapshot_observed_at":"2026-08-03T05:14:17.752684Z","title":"Internet of agents: Weaving a web of heterogeneous agents for collaborative intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.752684Z"},"links":{"cited_paper":"/paper/2407.07061","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:fa9d5fd6824c963ad5595ea827f618a02eb132d25738d1adcf86a09d6a0acc4b","observation_id":"e4e45190-6ff2-466b-961e-4204a8676826","resolution":{"observed_at":"2026-08-03T05:14:17.752684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:17.824281Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.824281Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:aaa7472cd79502e70c07ab68c4866dd51aa7b1b5fe9a62c393d5c223fc988223","observation_id":"737037a8-e47b-44d4-a264-54666cf8bb22","resolution":{"observed_at":"2026-08-03T05:14:17.824281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T05:14:17.899029Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.899029Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:c152c8ef76562f754e61d8690421d4428463af9587e8a5d899b0a7112b79cfed","observation_id":"d617b099-8cf9-4b7b-9dc2-bb66070de29e","resolution":{"observed_at":"2026-08-03T05:14:17.899029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-03T05:14:17.976904Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:17.976904Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:423327e1fe6c1979e1bb1ee5971b2ef3dba702ab7943e1725bb0eabddbc815c4","observation_id":"3d6a929b-8e45-4dd7-83e8-5f52b1200b4f","resolution":{"observed_at":"2026-08-03T05:14:17.976904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-08-03T05:14:18.061552Z","title":"Reinforcement pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.061552Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:d519f6fd796f93289a6e0d43856da5c3e44ecc6f308a171c0ec485f5b0c4495b","observation_id":"09b938cb-cfa9-409d-9fde-7fd96d8601ba","resolution":{"observed_at":"2026-08-03T05:14:18.061552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T05:14:18.148904Z","title":"M., Radenovic , F., Guzm \\'a n , F., Zhang , F., Synnaeve , G., Lee , G., Anderson , G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.148904Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:862fb0beca71a07a379ce344051cba7c1f7569416b15b88e4deeaf8659c0a166","observation_id":"6d6214f2-eaf5-46ca-b93c-e6fec8f28563","resolution":{"observed_at":"2026-08-03T05:14:18.148904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T05:14:18.324841Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.324841Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:375d547b9746d7d676faa1cb27ddbafdf5397c578b7a50703d3079668328a7ea","observation_id":"f86ca8b5-11b4-4ac4-b1b0-76bbca2e5fc4","resolution":{"observed_at":"2026-08-03T05:14:18.324841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:18.431225Z","title":"O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.431225Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:884ed1a686a522831a32510128c0ad9d46178d9cb11c794ed8c5a1f94ad0f441","observation_id":"1d40c09b-d99b-468c-9ba5-51506692e497","resolution":{"observed_at":"2026-08-03T05:14:18.431225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-03T05:14:18.514942Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.514942Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:b848fbe6f24e25e65f613fb7d3e864ac2ce2a3a7c424ca50d69a4276172c1812","observation_id":"8daffe21-dfc4-4bd5-878a-b4ee0fd211ea","resolution":{"observed_at":"2026-08-03T05:14:18.514942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05613","last_updated":"2025-08-07T17:53:56Z","snapshot_observed_at":"2026-08-05T23:13:56.904431Z","submitted_at":"2025-08-07T17:53:56Z","title":"Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05613","snapshot_observed_at":"2026-08-03T05:14:18.632040Z","title":"Cooper: Co-optimizing policy and reward models in reinforcement learning for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.632040Z"},"links":{"cited_paper":"/paper/2508.05613","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:8472777603c7a1732e24d12b281e21531b374fb153468ea47afd7a98a5ab58f2","observation_id":"7a846845-f5a8-43b3-b42f-54e359f75bee","resolution":{"observed_at":"2026-08-03T05:14:18.632040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-03T05:14:18.752065Z","title":"R-zero: Self-evolving reasoning llm from zero data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.752065Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:95f79ca796762ad5f66159ed671de52c01d1f99ac189ecfe4c867255992c0c37","observation_id":"5fb056ad-3db9-455a-9ba4-619a857ff0e8","resolution":{"observed_at":"2026-08-03T05:14:18.752065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-03T05:14:18.860703Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.860703Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:83bb91535709ad7dad97e806c650a68e967c1cc18825c98f4f7cac23c70d323f","observation_id":"fb33b96c-a663-42ee-8cf6-7604f252f535","resolution":{"observed_at":"2026-08-03T05:14:18.860703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10406","last_updated":"2025-06-12T06:59:35Z","snapshot_observed_at":"2026-08-03T23:35:43.336278Z","submitted_at":"2025-06-12T06:59:35Z","title":"PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10406","snapshot_observed_at":"2026-08-03T05:14:18.928775Z","title":"Pag: Multi-turn reinforced llm self-correction with policy as generative verifier","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:18.928775Z"},"links":{"cited_paper":"/paper/2506.10406","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:6e38417597bb77cb500dbbc314d1bb549ef435ea99a7e51d9435e90c34e80573","observation_id":"bc67d132-ce79-4bb1-b1b7-d2e82aa7e73c","resolution":{"observed_at":"2026-08-03T05:14:18.928775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-03T05:14:19.051690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.051690Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:2f95e0e49acf21745e565e66002d7306cfe7e11e472bde12c663261fe65ada26","observation_id":"04c1710f-cb6e-4b6a-8800-1b409e358e42","resolution":{"observed_at":"2026-08-03T05:14:19.051690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-03T05:14:19.142903Z","title":"V., Slone, A., Anil, C., Schlag, I., Gutman-Solo, T., Wu, Y., Neyshabur, B., Gur-Ari, G., and Misra, V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.142903Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:9332c84e2dfe43b5437a2b7f694d1bf3e4206677404fa4aee2d7f9ddbd1abd73","observation_id":"c7a19091-6e30-466f-9050-cb40ebc128d1","resolution":{"observed_at":"2026-08-03T05:14:19.142903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-07-06T21:38:10.885548Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-03T05:14:19.263434Z","title":"Confidence is all you need: Few-shot rl fine-tuning of language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.263434Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:c141f708a49c5529df8fbb25dc25c49fae0534302b7f9b9754553fb4773e8ec5","observation_id":"80755571-d9f4-4a77-9222-4be56575688e","resolution":{"observed_at":"2026-08-03T05:14:19.263434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-06T14:44:18.901773Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17515","snapshot_observed_at":"2026-08-03T05:14:19.399777Z","title":"Urpo: A unified reward & policy optimization framework for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.399777Z"},"links":{"cited_paper":"/paper/2507.17515","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:bd136d98b19fea9eb270d7527d2acde58fa915964afaef889d80ed7db17169fe","observation_id":"27b9735b-8a94-4cb8-bfd3-6a74ed075534","resolution":{"observed_at":"2026-08-03T05:14:19.399777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-07-06T21:13:45.700548Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-08-03T05:14:19.549625Z","title":"Aimo-2 winning solution: Building state-of-the-art mathematical reasoning models with openmathreasoning dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.549625Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:2902eadc9df8f679912f0d45b90932e88eb7c8513b3b9656844f7ef7042c1678","observation_id":"f5c69e64-3f56-4297-8e6e-5f40264c8371","resolution":{"observed_at":"2026-08-03T05:14:19.549625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:19.689456Z","title":"Gpt-5 system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.689456Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:6754d297d83e01b9787f8dbf78a056bdc1b8a7b5f83f00672126803ebf06c781","observation_id":"fc97f02f-9939-460d-b733-43ff7bb1570b","resolution":{"observed_at":"2026-08-03T05:14:19.689456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:19.817165Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.817165Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:ca8058ddd2ef27b03986819c32eab7aa3eb9c665bec06d7f0949e1212de245a6","observation_id":"4a99a263-3129-4a56-b36a-407951cbbd24","resolution":{"observed_at":"2026-08-03T05:14:19.817165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:19.947935Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.947935Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:a26600c6948d964d442283d006cdac055f006db10f6769009fd8c3d82069c122","observation_id":"12838577-31e1-47f6-b1f9-5296e72813f5","resolution":{"observed_at":"2026-08-03T05:14:19.947935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-03T05:14:20.083519Z","title":"Maximizing confidence alone improves reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.083519Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:a5119467484e9d2ad84c4227d5757cc396ec43669f7e2feb70540154c7495f64","observation_id":"3601a53e-9544-4920-b9c7-75b34b5a2b09","resolution":{"observed_at":"2026-08-03T05:14:20.083519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07924","last_updated":"2024-06-05T13:23:49Z","snapshot_observed_at":"2026-07-06T15:54:28.831510Z","submitted_at":"2023-07-16T02:11:34Z","title":"ChatDev: Communicative Agents for Software Development","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07924","snapshot_observed_at":"2026-08-03T05:14:20.203270Z","title":"and Cong, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.203270Z"},"links":{"cited_paper":"/paper/2307.07924","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:9a9cb4841275e1b19e411099914a1a000b98756110c63ed1fb450374081c624c","observation_id":"60aafde8-049e-4852-82cd-062df4e42f3c","resolution":{"observed_at":"2026-08-03T05:14:20.203270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T05:14:20.320392Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.320392Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:d7aaba0e47bdc3175fa74f170e277fd3b9388ca5cceb194f0d0b60a3a9fafdc8","observation_id":"b81d792d-609f-42ee-99b0-75671d10419e","resolution":{"observed_at":"2026-08-03T05:14:20.320392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:20.441984Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.441984Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:c944eca125e9c443e27d9fa2e5a65431c33c181b0b5a848e310977b7f9b57123","observation_id":"b8acca25-d9e8-4c0c-82c8-b61e1cb98086","resolution":{"observed_at":"2026-08-03T05:14:20.441984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T05:14:20.525676Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.525676Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:3c1e0453e3838a77fee4517f14b3d6af2e033c8bc6415d69749e4d456c6febfa","observation_id":"0fabeef2-9cce-4689-85ea-d4369ba374ef","resolution":{"observed_at":"2026-08-03T05:14:20.525676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:20.635923Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.635923Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:fc3486e1925de3238e4cbc224e8de2500d83db8fe685d2219c7b0538ebd6ff00","observation_id":"0d8a5bc1-fea8-416d-9c88-6fb3901f2fa3","resolution":{"observed_at":"2026-08-03T05:14:20.635923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-03T05:14:20.763891Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.763891Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:75730fbaeeada1f9271e99db334ed5e5ffe857f57b5053b644637a14af26b53c","observation_id":"32557d67-3451-44be-8156-77395016f9c0","resolution":{"observed_at":"2026-08-03T05:14:20.763891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-03T05:14:20.881653Z","title":"Kimi k2: Open agentic intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.881653Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:367a2cfb26beafae0dc98c24eeeda1feb553c88e1b55c1257c5eaca00d375cb9","observation_id":"7f367450-1201-4965-a556-2b4be6eab8a3","resolution":{"observed_at":"2026-08-03T05:14:20.881653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T05:14:20.975564Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:20.975564Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:8b9fc459a5be00b06ffbc073a066d021ef4194c55f366df49494876342851d2b","observation_id":"3383bd60-e72a-4dbf-ac1b-00724e58fe4d","resolution":{"observed_at":"2026-08-03T05:14:20.975564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-03T05:14:21.149242Z","title":"Zephyr: Direct distillation of lm alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.149242Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:f4bfc12482c725670dafa2281c58c91928a4ef60ed6af8d9238b4c318e791e90","observation_id":"b4f89082-9116-4c21-a8dc-0b28d253485b","resolution":{"observed_at":"2026-08-03T05:14:21.149242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:21.286257Z","title":"V., Chi, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.286257Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:50c16bb1495140635e29c57c0cc49e1caee7d6e050ea118f2a5ecece2ae56514","observation_id":"135e414e-7f4a-4229-876c-70cf501e6e31","resolution":{"observed_at":"2026-08-03T05:14:21.286257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-03T17:06:56.934769Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-03T05:14:21.405084Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.405084Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:0386a328534c4fdaf7afc3799fd194c4e3df9663eba847e5250f3637065802a2","observation_id":"5877dcad-ab33-452d-90da-745304b5d0a3","resolution":{"observed_at":"2026-08-03T05:14:21.405084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:21.461937Z","title":"V., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.461937Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:3158449c37b9155b27d28e9295305d7ba18cc96885e8f9aa2ac111e6e73dda5c","observation_id":"a0df4921-1f7b-4bd2-be47-c0941eb40e2a","resolution":{"observed_at":"2026-08-03T05:14:21.461937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19613","last_updated":"2025-02-26T23:01:16Z","snapshot_observed_at":"2026-07-06T20:43:22.572496Z","submitted_at":"2025-02-26T23:01:16Z","title":"Self-rewarding correction for mathematical reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19613","snapshot_observed_at":"2026-08-03T05:14:21.533431Z","title":"Self-rewarding correction for mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.533431Z"},"links":{"cited_paper":"/paper/2502.19613","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:70e1327458fd98072751e3f6b8437c033f36c27aaa64e9b044e1abb83e06b0ad","observation_id":"b896a909-8106-4d06-ac64-1436ef0624b9","resolution":{"observed_at":"2026-08-03T05:14:21.533431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-03T05:14:21.778638Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.778638Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:3909409b0a64bb995222219d0e1462dc6ae1212aa66727787c2df819697a0baa","observation_id":"cdf5c098-156d-4097-a352-632d13f6c65b","resolution":{"observed_at":"2026-08-03T05:14:21.778638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-03T05:14:21.845716Z","title":"Y., Cho, K., Sukhbaatar, S., Xu, J., and Weston, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.845716Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:37eacb87a5d9c689293c671c3dec134b6483636dd623c3ce551b5e568671e207","observation_id":"23a6939e-eb50-4155-bcc8-347fa703c964","resolution":{"observed_at":"2026-08-03T05:14:21.845716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:21.969612Z","title":"S., and Katabi, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.969612Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:0a8058c099fcba025a1c5e2f08ddaac8e6b04f28fd6ffefa162eca1b2be0752d","observation_id":"dfd36174-b9ca-47bb-a361-d09a6b57de2d","resolution":{"observed_at":"2026-08-03T05:14:21.969612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-07-06T21:05:59.227458Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-03T05:14:22.069080Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:22.069080Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:c6e4c6a5915535c54a065611601dc820c833f7b9e4c96cb2e2819e25be50794a","observation_id":"c101a8eb-45cf-44a7-a4e0-633897d475cb","resolution":{"observed_at":"2026-08-03T05:14:22.069080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-07-06T21:35:56.582332Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-03T05:14:22.180784Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:22.180784Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:5a09353161a6b80b59e793fe1f18bf957e564c1c3c78b924b7c210fbba16ac6a","observation_id":"9fcaacfb-fa23-4a17-aee4-351c5a09750b","resolution":{"observed_at":"2026-08-03T05:14:22.180784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-03T05:14:22.304814Z","title":"Absolute zero: Reinforced self-play reasoning with zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:22.304814Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:0f79382d8a7c03b6d26e622182e25a69c7fca2f56dbdf35f45eba13b99c7647a","observation_id":"09c111ba-ea9e-4141-9985-0fb9fa94f850","resolution":{"observed_at":"2026-08-03T05:14:22.304814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-03T05:14:22.507382Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:22.507382Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:caab654e49b1e4d66e2b4c4cb98d079794ade0424e6cfddf25cd2779b20ee64f","observation_id":"dc6b080e-c3c7-4fd8-8e92-ba8f2fb6dec4","resolution":{"observed_at":"2026-08-03T05:14:22.507382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T05:14:22.701235Z","title":"Self-adapting language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:22.701235Z"},"links":{"citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:73afe6f76af8e68b6b287d024925d6e91c1d9d0976b0bfe783a8b1ccc9a61f33","observation_id":"e33cb627-a715-4a13-bd31-0c3f31276d91","resolution":{"observed_at":"2026-08-03T05:14:22.701235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2602.02979."}