{"as_of":"2026-08-07T13:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:524e0d07651025bc0b74b0982fbd36f2807aae13434c71367aebff3ad65b7a89","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:55:42.622845Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:56:39.504430Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.510220Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.14683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14683","snapshot_observed_at":"2026-07-01T20:56:13.510220Z","title":"Miromind-m1: An open-source advancement in mathematical reasoning via context-aware multi-stage policy optimization","venue":null,"work_id":"04977ecb-1e13-4380-aebc-fc71cfbb3aa4","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":287,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2507.14683","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:581702cd575fcdb797e880b691204e9f83992d41e48aa9c8496950a14019b7a4","observation_id":"5cb70732-447f-4e2c-aab2-faa64c78da79","resolution":{"observed_at":"2026-05-18T00:02:24.767561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.14683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14683","snapshot_observed_at":"2026-07-01T20:56:13.510220Z","title":"Miromind-m1: An open-source advancement in mathematical reasoning via context-aware multi-stage policy optimization","venue":null,"work_id":"04977ecb-1e13-4380-aebc-fc71cfbb3aa4","year":2025},"citing_paper":{"arxiv_id":"2604.10480","last_updated":"2026-04-12T06:24:07Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T06:24:07Z","title":"Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:14:38.371700Z"},"links":{"cited_paper":"/paper/2507.14683","citing_paper":"/paper/2604.10480"},"observation_digest":"sha256:b5589b0017eef31f9e8a68163c06139ce776f3059e34c9e9ef8551cb51abb6db","observation_id":"9285862f-99e2-4b13-bd67-3bfdfc80eda2","resolution":{"observed_at":"2026-05-11T09:06:00.557948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.14683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14683","snapshot_observed_at":"2026-07-01T20:56:13.510220Z","title":"Miromind-m1: An open-source advancement in mathematical reasoning via context-aware multi-stage policy optimization","venue":null,"work_id":"04977ecb-1e13-4380-aebc-fc71cfbb3aa4","year":2025},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2507.14683","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:c610cdddc255f3c8cc85416d0c681fcdd2a374e58a0414e214abb76512b0a06d","observation_id":"c00b2957-89d4-47bb-b0ee-42962a5b5236","resolution":{"observed_at":"2026-06-30T00:14:04.540542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.14683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14683","snapshot_observed_at":"2026-07-01T20:56:13.510220Z","title":"Miromind-m1: An open-source advancement in mathematical reasoning via context-aware multi-stage policy optimization","venue":null,"work_id":"04977ecb-1e13-4380-aebc-fc71cfbb3aa4","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":288,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.14683","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:07a208a052d075ea11e16cf25f68839d298c85ab38b24653edcbe313e7a2a7ea","observation_id":"05ef2408-2264-4ead-839b-6940bffe0e8f","resolution":{"observed_at":"2026-07-01T20:56:13.511537Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.14683/citation-record","integrity":"/paper/2507.14683/integrity","json":"/paper/2507.14683/citation-record.json","paper":"/paper/2507.14683"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-03T16:01:59.567237Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-08-06T15:55:42.505183Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.505183Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:493f2b66a81bbe3ae3a69996881aadba0ef25b88220debb7f445ef5cfea058c6","observation_id":"f41dd2f5-c890-404e-8a61-91943603b5a6","resolution":{"observed_at":"2026-08-06T15:55:42.505183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-03T02:41:13.331563Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-06T15:55:42.523415Z","title":"Merrill, Tatsunori Hashimoto, Yejin Choi, Jenia Jitsev, Reinhard Heckel, Maheswaran Sathiamoorthy, Alexandros G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.523415Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:41a958649aaae20d6d635a48928ba4421484c851e8f193bd1f71ae54e8560880","observation_id":"bf4c0288-0f85-4589-9c67-3dd807430791","resolution":{"observed_at":"2026-08-06T15:55:42.523415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:55:42.528683Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.528683Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:7cf341cc5ad530de944e1f2c36f8ef20919a5edba6c3c6774d0ba16b99c497c2","observation_id":"e3323e53-83b4-4e52-a678-a60a1bac7677","resolution":{"observed_at":"2026-08-06T15:55:42.528683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-06T15:55:42.534276Z","title":"Skywork open reaonser series","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.534276Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:94aa009e6115cb63e61d4506140862ae407fc7cc184e5a30643d0cb88c80978d","observation_id":"def4558f-e3ab-4f03-9a65-2dc11a981de7","resolution":{"observed_at":"2026-08-06T15:55:42.534276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08311","last_updated":"2025-05-25T07:57:14Z","snapshot_observed_at":"2026-08-07T02:57:31.179488Z","submitted_at":"2025-05-13T07:41:15Z","title":"AM-Thinking-v1: Advancing the Frontier of Reasoning at 32B Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08311","snapshot_observed_at":"2026-08-06T15:55:42.539416Z","title":"Am-thinking-v1: Advancing the frontier of reasoning at 32b scale","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.539416Z"},"links":{"cited_paper":"/paper/2505.08311","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:7a57652b004042d47bf964cea3ed4de51153683897bb6c4db148225b75149e25","observation_id":"851a1dcd-ee08-4c1c-bd10-434df931e55c","resolution":{"observed_at":"2026-08-06T15:55:42.539416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T15:55:42.546685Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.546685Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:6c26265e776166b6b700a0bfe8d527ede66aab0fe0e417e98100a4e839d8f59e","observation_id":"95b5c68a-747b-40cc-a7fe-7e7cbf65108b","resolution":{"observed_at":"2026-08-06T15:55:42.546685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T15:55:42.551665Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.551665Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:9d0eae7c1dea979a0044d73ef9707b22958ce5e2bab1a1a882369394442e48c0","observation_id":"fe408ce1-a139-472b-86a2-cd9a40d73c78","resolution":{"observed_at":"2026-08-06T15:55:42.551665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T15:55:42.556087Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.556087Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:05f523a8693a5a15d7341d70ec6d66e980e5667f9c19f26c55f64f409253fa39","observation_id":"9b541b4f-9a42-489e-8a94-581485138278","resolution":{"observed_at":"2026-08-06T15:55:42.556087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-07T04:11:42.457515Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-06T15:55:42.560228Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.560228Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:63ad1c6f6942c3422f8ce536bef30895af051b6825cbb72444a7293acc020173","observation_id":"55adf272-4e07-4ef0-975f-904dc0245558","resolution":{"observed_at":"2026-08-06T15:55:42.560228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-06T15:55:42.564588Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.564588Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:c46dc898f601159f02aa678857c359e54befacc8d06beeb55135433d2c102f33","observation_id":"26475905-cb27-4011-9119-0f0a525756e2","resolution":{"observed_at":"2026-08-06T15:55:42.564588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:55:42.572359Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.572359Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:cd448e40f4a0d3a5abd42578fe5baea5ea131b8e082de07eaf6ec35317b76a0d","observation_id":"bed715db-3950-435a-ba11-91f47d4e0237","resolution":{"observed_at":"2026-08-06T15:55:42.572359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T15:55:42.577131Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.577131Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:f00ca356fe9c0865ae30efe48233635bedce2507a39340b70db3291f70749dcb","observation_id":"41314aea-683b-4c79-9ca2-95e98c39808c","resolution":{"observed_at":"2026-08-06T15:55:42.577131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17565","last_updated":"2025-05-13T07:43:57Z","snapshot_observed_at":"2026-07-06T21:14:14.909399Z","submitted_at":"2025-04-24T13:57:53Z","title":"DeepDistill: Enhancing LLM Reasoning Capabilities via Large-Scale Difficulty-Graded Data Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17565","snapshot_observed_at":"2026-08-06T15:55:42.580195Z","title":"Open Thoughts, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.580195Z"},"links":{"cited_paper":"/paper/2504.17565","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:725c4fbfdb5d862e64fdfc653c5d742b596945d724877be61e5b6b61ef9d297a","observation_id":"b00e935a-2c58-46b2-ab08-e8702f93d437","resolution":{"observed_at":"2026-08-06T15:55:42.580195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T15:55:42.587682Z","title":"Dai, and Quoc V Le","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.587682Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:05d5bb72b38630075ff31d0cd7633619ea204780ac764345aea3fe7ccc9e9bc5","observation_id":"aea26196-b430-4ef0-bc43-bcd375bec63c","resolution":{"observed_at":"2026-08-06T15:55:42.587682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T15:55:42.592502Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.592502Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:f9277858f6958e6a06e6bdb24d3aa52042ac7f40776434f26f99fc77a9b33481","observation_id":"45047020-db86-4237-9b92-81b3f553d448","resolution":{"observed_at":"2026-08-06T15:55:42.592502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-06T15:55:42.595925Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.595925Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:90e1560faadff3e907bd2f7f9cc84ad54922a1f793f93381e6238fcd179a7ea0","observation_id":"0ef95cc2-b12f-4a6b-8a84-7b3cb7a23793","resolution":{"observed_at":"2026-08-06T15:55:42.595925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T02:56:21.377033Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-06T15:55:42.604562Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.604562Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:18475871a564e4b9e0d5369fbb2900a465225388c2e87901042cc121dc9689a1","observation_id":"d3e2fe4e-2353-4b39-b05f-cf96aee9919c","resolution":{"observed_at":"2026-08-06T15:55:42.604562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08819","last_updated":"2024-12-11T23:31:06Z","snapshot_observed_at":"2026-08-06T01:09:31.956094Z","submitted_at":"2024-12-11T23:31:06Z","title":"HARP: A challenging human-annotated math reasoning benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08819","snapshot_observed_at":"2026-08-06T15:55:42.608109Z","title":"Harp: A challenging human-annotated math reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.608109Z"},"links":{"cited_paper":"/paper/2412.08819","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:2b17a7da5b8d09b7d812838b601092a01030d9035f77ae384711134c90b4a6b6","observation_id":"7917bd7d-861b-4f80-9ded-b4b348468bba","resolution":{"observed_at":"2026-08-06T15:55:42.608109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T15:55:42.611272Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.611272Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:b29e26cf1cba7377f0c142c01bc05799596d08401b1d787646a09e51077d2373","observation_id":"0815638b-df74-481c-8fa8-bdd6e337cb8d","resolution":{"observed_at":"2026-08-06T15:55:42.611272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T15:55:42.614460Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.614460Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:53f981a328a452459e7a8cfb0503c47e05ea4c891f59195e5ad33ba170765256","observation_id":"ea541bba-8763-401e-8d46-369a528fb236","resolution":{"observed_at":"2026-08-06T15:55:42.614460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-07-06T21:17:33.687092Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-06T15:55:42.618381Z","title":"100 days after deepseek-r1: A survey on replication studies and more directions for reasoning language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.618381Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:0fe608362125ceb72c705ac4a712e2152c7a74072c3ef5cf163b11f272650abe","observation_id":"959f1a18-0010-458e-a947-05e298a39acd","resolution":{"observed_at":"2026-08-06T15:55:42.618381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19633","last_updated":"2025-03-25T13:19:46Z","snapshot_observed_at":"2026-08-04T15:51:22.842215Z","submitted_at":"2025-03-25T13:19:46Z","title":"1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19633","snapshot_observed_at":"2026-08-06T15:55:42.622845Z","title":"1.4 million open-source distilled reasoning dataset to empower large language model training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.622845Z"},"links":{"cited_paper":"/paper/2503.19633","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:99669201657c219cd031b7a723f8e89cdba5acd4301e5758ab16817687970c16","observation_id":"a1a3ce8a-cfa6-48b5-8796-7fc38837fe9e","resolution":{"observed_at":"2026-08-06T15:55:42.622845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11221","last_updated":"2025-06-23T05:32:12Z","snapshot_observed_at":"2026-07-06T20:37:23.683063Z","submitted_at":"2025-02-16T17:54:57Z","title":"PlanGenLLMs: A Modern Survey of LLM Planning Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11221","snapshot_observed_at":"2026-08-06T15:55:42.583833Z","title":"Plangenllms: A modern survey of llm planning capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.583833Z"},"links":{"cited_paper":"/paper/2502.11221","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:b46ccc12d6ed2d2bbb1ceaf539599ce208039e506c272df96fa76bb7d6e8f281","observation_id":"b0e8d495-3b3e-4664-b5a9-ae421033963b","resolution":{"observed_at":"2026-08-06T15:55:42.583833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T15:55:42.568123Z","title":"Proximal policy optimiza- tion algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.568123Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:24cb8a22da4c536ef6e3ddca4bdf7889723ea0971ad92acb9aa24a58287180fe","observation_id":"0c79cd03-d79e-4acf-a928-ee92ef571748","resolution":{"observed_at":"2026-08-06T15:55:42.568123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T15:55:42.600378Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.600378Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:7b79521cba9d128daa7f51e94c4c4f2b5dafe05e3ab5dde2ac1cb81db5430fc6","observation_id":"5fe026e6-8a8d-4273-9404-f310a2f38811","resolution":{"observed_at":"2026-08-06T15:55:42.600378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:55:42.512830Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.512830Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:d283206772cc893f44ff529a40fdb01ca245a51c5e82493bb5daa20a34c7402e","observation_id":"95c82986-bede-402c-81e8-de0a59f8ff2d","resolution":{"observed_at":"2026-08-06T15:55:42.512830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16940","last_updated":"2025-07-22T02:01:16Z","snapshot_observed_at":"2026-07-06T20:41:28.562637Z","submitted_at":"2025-02-24T08:08:41Z","title":"Reasoning Does Not Necessarily Improve Role-Playing Ability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16940","snapshot_observed_at":"2026-08-06T15:55:42.518689Z","title":"Reasoning does not necessarily improve role-playing ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.518689Z"},"links":{"cited_paper":"/paper/2502.16940","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:7e29cc580d92fd7837438a0de2ad8389dfe6ae2740bab3682f95fa795aa75fa0","observation_id":"b5ca1b6c-54fa-4e40-a847-b45d0f7aee59","resolution":{"observed_at":"2026-08-06T15:55:42.518689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:49:19.794260Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 4 inbound Pith citation observations for arXiv:2507.14683."}