{"as_of":"2026-08-09T11:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2bc4401e67aff384afaf83e3765bc9763e60c2fd57d2dab397cda3f5889695c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:57:39.510592Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:40:25.785903Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:68700972c717f9744bc23f43ec56a5a821fcf758d22ac337c088763f1c53378e","observation_id":"46961b85-16bb-4847-91a5-50b12008bd73","resolution":{"observed_at":"2026-05-18T19:21:48.445880Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-04T06:40:25.785903Z","title":"rstar2-agent: Agentic reasoning technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10739","last_updated":"2026-08-03T08:17:50Z","snapshot_observed_at":"2026-08-07T08:51:03.458621Z","submitted_at":"2025-12-11T15:26:28Z","title":"Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T06:40:25.785903Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2512.10739"},"observation_digest":"sha256:d8abe40000be9161907c601243fe33ee1e3c197df23c66ca01a5c32073959ee0","observation_id":"03de0ad8-bd7c-4deb-9eb4-a8e79f32dea3","resolution":{"observed_at":"2026-08-04T06:40:25.785903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-03T16:30:41.340195Z","title":"rstar2-agent: Agentic reasoning technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13278","last_updated":"2026-06-05T03:56:56Z","snapshot_observed_at":"2026-08-06T12:37:47.631212Z","submitted_at":"2025-12-15T12:38:04Z","title":"AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T16:30:41.340195Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2512.13278"},"observation_digest":"sha256:1dc333f8294b095bbe822891ca0364843c466a8e8c2e9f10bf18f7b8db31b797","observation_id":"6ba424a7-071a-451d-853e-4bd2233f05a6","resolution":{"observed_at":"2026-08-03T16:30:41.340195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-03T09:01:49.933722Z","title":"rstar2-agent: Agentic reasoning technical report.arXiv preprint arXiv:2508.20722,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-05T17:30:11.339669Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:49.933722Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:555bd57199198c02a7fa8f4d9a85b89bcb47a4cbf944fe25a8e20967c441d041","observation_id":"d2bb13be-c000-42e5-a325-75a7376d07c8","resolution":{"observed_at":"2026-08-03T09:01:49.933722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-02T18:14:54.599326Z","title":"rstar2-agent: Agentic reasoning technical report.arXivpreprintarXiv:2508.20722, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14473","last_updated":"2026-07-15T10:22:14Z","snapshot_observed_at":"2026-08-09T02:48:12.251795Z","submitted_at":"2026-03-15T16:31:51Z","title":"AI Can Learn Scientific Taste","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T18:14:54.599326Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2603.14473"},"observation_digest":"sha256:5287e825611cf9ff971ecd50151620a5e5910118f6d11b4620448c5d908b6d18","observation_id":"f44f5df8-ac25-45ac-9c26-8ba6bfa81712","resolution":{"observed_at":"2026-08-02T18:14:54.599326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2604.06636","last_updated":"2026-04-08T03:22:26Z","snapshot_observed_at":"2026-07-06T22:55:06.424752Z","submitted_at":"2026-04-08T03:22:26Z","title":"SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:14:10.609406Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2604.06636"},"observation_digest":"sha256:37dc43882c816f648cc2ca63b6b9ef5ad4705767e72d74c54eda74314c8c1d69","observation_id":"7d6c79d8-0511-48b1-a72b-e05d4ffab47b","resolution":{"observed_at":"2026-05-10T23:20:50.855350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2604.18936","last_updated":"2026-04-21T00:21:05Z","snapshot_observed_at":"2026-07-06T23:05:39.724237Z","submitted_at":"2026-04-21T00:21:05Z","title":"Fine-Tuning Small Reasoning Models for Quantum Field Theory","version":1},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-05-10T03:23:18.770963Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2604.18936"},"observation_digest":"sha256:cfdb83455266886c7d4b4b923b12c1de9354d4bd95595df822c799964b8442e1","observation_id":"52ae9bc8-3b34-4067-8e51-a32db106e2ed","resolution":{"observed_at":"2026-05-11T12:31:05.839585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2604.23838","last_updated":"2026-04-26T18:45:31Z","snapshot_observed_at":"2026-08-02T18:30:10.398959Z","submitted_at":"2026-04-26T18:45:31Z","title":"JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T06:36:33.914193Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2604.23838"},"observation_digest":"sha256:1385a548b1f690bdedc7175e9331ef5b54595473e6180e1669ee4dee9f1cbd48","observation_id":"6c362dbf-4887-4fc2-bfe5-842379e3e598","resolution":{"observed_at":"2026-05-11T21:11:11.260353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2605.02178","last_updated":"2026-05-04T03:15:56Z","snapshot_observed_at":"2026-08-02T07:53:28.208356Z","submitted_at":"2026-05-04T03:15:56Z","title":"T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T19:36:00.359351Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2605.02178"},"observation_digest":"sha256:16765e3cea40a1f5c760824ea73c6d040636e21d172aaf4bf9548f76bd6adaf7","observation_id":"fdc7fda0-30ad-431e-8f56-c5fc5287af24","resolution":{"observed_at":"2026-05-09T05:45:22.161743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2605.04719","last_updated":"2026-05-07T02:33:36Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T10:10:31Z","title":"Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T16:23:13.535140Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2605.04719"},"observation_digest":"sha256:4f3a403c8983005889c3ed9bb0ea9edc430bf359aaa870952e301b456bd2e1d8","observation_id":"e1aaefe0-d289-4c88-954d-bcf99c6a9463","resolution":{"observed_at":"2026-05-11T18:16:10.568637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2605.06326","last_updated":"2026-05-07T14:23:21Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:23:21Z","title":"Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T10:30:36.330305Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2605.06326"},"observation_digest":"sha256:27b7bf454f46da6b3a5f4347d9397b4354413e9b81ef51cd92d64bcbd60b5953","observation_id":"a3e970f5-5a02-484a-a52b-31115fe346fe","resolution":{"observed_at":"2026-05-11T20:01:10.556776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2605.07237","last_updated":"2026-05-11T02:57:28Z","snapshot_observed_at":"2026-08-08T23:42:46.127810Z","submitted_at":"2026-05-08T04:42:05Z","title":"Teaching Language Models to Think in Code","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T02:33:02.995360Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2605.07237"},"observation_digest":"sha256:7cda82253defc1b6c373f824f56a68c4e356deffa5b1ad378b76f5cfb704438e","observation_id":"9e213d58-4445-4618-9bf7-ef103d03f21a","resolution":{"observed_at":"2026-05-11T03:15:56.569722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2605.07237","last_updated":"2026-05-11T02:57:28Z","snapshot_observed_at":"2026-08-08T23:42:46.127810Z","submitted_at":"2026-05-08T04:42:05Z","title":"Teaching Language Models to Think in Code","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:26:11.265781Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2605.07237"},"observation_digest":"sha256:e8c1a93319b617bd9d909d0c6ac4f3459e156a6a760c75ea9a82a431e2a67387","observation_id":"ba510941-67cf-4756-b7fb-9bfc7df61b78","resolution":{"observed_at":"2026-05-12T06:16:28.333349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2605.18500","last_updated":"2026-05-18T14:54:49Z","snapshot_observed_at":"2026-08-07T22:03:46.168938Z","submitted_at":"2026-05-18T14:54:49Z","title":"Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T11:21:39.492072Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2605.18500"},"observation_digest":"sha256:cd94583e1fdecf1696e67d859febc09ba898dbe4b62c8d652ab1360117847a25","observation_id":"c1a0a899-ee28-4c80-a2d1-6adafbc0b040","resolution":{"observed_at":"2026-05-20T11:23:14.031521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2605.24693","last_updated":"2026-05-23T18:13:41Z","snapshot_observed_at":"2026-08-03T16:34:39.940462Z","submitted_at":"2026-05-23T18:13:41Z","title":"CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T13:19:22.541146Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2605.24693"},"observation_digest":"sha256:41570ecd2953cac6b4a7eff95920f5861573bd13af1845a848b6f027943845a3","observation_id":"c6f55ad0-8721-44ef-ae29-20152abc4df5","resolution":{"observed_at":"2026-06-30T13:24:40.161949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2605.28774","last_updated":"2026-05-27T17:36:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:36:39Z","title":"Agent Explorative Policy Optimization for Multimodal Agentic Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T12:22:39.655615Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2605.28774"},"observation_digest":"sha256:72e734cf0597c6f2444edfc4e4a88d4653db334ba6fc6b6023e40d41c49ed024","observation_id":"20f9e4b4-7ab9-482f-b412-fd80cc2ac8c7","resolution":{"observed_at":"2026-06-29T12:23:23.734275Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2606.03762","last_updated":"2026-06-02T15:16:12Z","snapshot_observed_at":"2026-08-02T17:38:14.832178Z","submitted_at":"2026-06-02T15:16:12Z","title":"Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T11:19:31.702516Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2606.03762"},"observation_digest":"sha256:44bbcf04875b344549c12ed5d803e8d94127a307e738fe225023aeb83df24de2","observation_id":"cc52f01b-67d1-467f-b515-c6bb9a6670df","resolution":{"observed_at":"2026-07-02T02:06:26.248154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":"2508.20722","doi":"10.48550/arxiv.2508.20722","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, and 1 others","venue":"ArXiv.org","work_id":"c32843ff-ee26-40a1-a436-198c5480f68f","year":2025},"citing_paper":{"arxiv_id":"2606.26620","last_updated":"2026-06-25T05:33:03Z","snapshot_observed_at":"2026-08-07T13:16:24.780198Z","submitted_at":"2026-06-25T05:33:03Z","title":"Discovering Millions of Interpretable Features with Sparse Autoencoders","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T05:34:00.754172Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2606.26620"},"observation_digest":"sha256:4c7037478d909130434f6c9c81d2378386552d6bb3181af61033506281c955ba","observation_id":"36d350a3-81e4-46fa-91dc-29c9616c577d","resolution":{"observed_at":"2026-07-04T12:59:53.059796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20722","snapshot_observed_at":"2026-08-02T14:04:49.632692Z","title":"doi:10.48550/arXiv.2508.20722 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18256","last_updated":"2026-05-14T06:47:20Z","snapshot_observed_at":"2026-08-05T02:13:07.767245Z","submitted_at":"2026-05-14T06:47:20Z","title":"PEARL: Solver-in-the-Loop Interactive Optimization Modeling from Natural Language","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T14:04:49.632692Z"},"links":{"cited_paper":"/paper/2508.20722","citing_paper":"/paper/2607.18256"},"observation_digest":"sha256:af8c6c01e20c7710e4cee09c3c0af68efac2befdc9cb436cdd3e881a6add5b35","observation_id":"0b32f477-f016-4790-b9ca-9fb3fd6adcbc","resolution":{"observed_at":"2026-08-02T14:04:49.632692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20722/citation-record","integrity":"/paper/2508.20722/integrity","json":"/paper/2508.20722/citation-record.json","paper":"/paper/2508.20722"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-08-08T08:43:53.657438Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-05T14:57:39.369654Z","title":"Phi-4-reasoning technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.369654Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:52cda81871d7fde83c16adcca4ee047196c21f78d62a446fe64b7ba31165e4b1","observation_id":"674f8691-2994-450f-8f27-a408c9d60ff7","resolution":{"observed_at":"2026-08-05T14:57:39.369654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:39.380300Z","title":"Llama-nemotron: Efficient reasoning models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.380300Z"},"links":{"citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:94d550e293c94ddfefea7dbd9e521d2f824ba45c2a8f44339058beb6dd48180e","observation_id":"d0f6480d-d4f6-491a-84e2-ce22941b5d90","resolution":{"observed_at":"2026-08-05T14:57:39.380300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T14:57:39.384805Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.384805Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:1c56fbb92e0b57294cd35eaf7fb5a6a58a3dd098302092097d6df53f640f4165","observation_id":"d392f9cb-a736-4c3f-8590-5aa401935edc","resolution":{"observed_at":"2026-08-05T14:57:39.384805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T14:57:39.390460Z","title":"Reasoning with exploration: An entropy perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.390460Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:93ada2238371be78431cb13e5ea200ba7f49c206b04fedf558dfab41f67f8b4d","observation_id":"b14bd8d2-9c3c-40da-a071-5805ad758f21","resolution":{"observed_at":"2026-08-05T14:57:39.390460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T14:57:39.395422Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.arXiv preprint arXiv:2505.22617,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.395422Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:806df03d3637c3d3d021aa97c4e90adc53421eb285cfaa444d01b97363902564","observation_id":"e89626b0-8d1c-4c8a-beda-243ec2370369","resolution":{"observed_at":"2026-08-05T14:57:39.395422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-05T14:57:39.400085Z","title":"Retool: Reinforcement learning for strategic tool use in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.400085Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:fd24d01cc7a14c7afeff9123f74415c2e903945d05731a578be7ee1f95c465e9","observation_id":"8531d737-cf7d-4b16-ac7b-e5e06958c981","resolution":{"observed_at":"2026-08-05T14:57:39.400085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-05T14:57:39.405467Z","title":"Glaive function calling v2 dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.405467Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:ed9e5194bc3ec6a6561f0370bd4e365f5da115af52e2636683c0891f1471be5d","observation_id":"1e6a9ace-d75a-451e-b5c1-cc2d3f741e21","resolution":{"observed_at":"2026-08-05T14:57:39.405467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T14:57:39.409953Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.409953Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:183c93838052150e4d6aa405584b895c70d82aaba344767509ffb5dc3780bf7f","observation_id":"3d64c1c3-e5e3-4ed5-903a-1f9d68fb3be2","resolution":{"observed_at":"2026-08-05T14:57:39.409953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-07T16:09:26.563632Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21067","snapshot_observed_at":"2026-08-05T14:57:39.414554Z","title":"Why distillation can outperform zero-rl: The role of flexible reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.414554Z"},"links":{"cited_paper":"/paper/2505.21067","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:f832cdd72d38176ede70e0b6e92fa00971b9097520a699c8cdcb04caad2f28ef","observation_id":"6bdb1f8e-e9e3-4861-bf3e-f7ee7c8a74e5","resolution":{"observed_at":"2026-08-05T14:57:39.414554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T14:57:39.419049Z","title":"Project euler","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.419049Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:621625d54873639dce8b994e0b2ed9f49d98be05df8406d69b655f1e2183f551","observation_id":"eff25afd-da3a-4465-8fcc-eeff55d22108","resolution":{"observed_at":"2026-08-05T14:57:39.419049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T14:57:39.427791Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.427791Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:209c751cf2ed57b939037c0c16b5ce2ac41d7e0252b77bdf8c2824baee70c6e0","observation_id":"0b4a37c3-6a47-4f09-a775-3a90ffedb885","resolution":{"observed_at":"2026-08-05T14:57:39.427791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00920","last_updated":"2025-07-25T08:26:54Z","snapshot_observed_at":"2026-08-07T03:58:38.931628Z","submitted_at":"2024-09-02T03:19:56Z","title":"ToolACE: Winning the Points of LLM Function Calling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00920","snapshot_observed_at":"2026-08-05T14:57:39.437030Z","title":"Zihan Liu, Zhuolin Yang, Yang Chen, Chankyu Lee, Mohammad Shoeybi, Bryan Catanzaro, and Wei Ping","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.437030Z"},"links":{"cited_paper":"/paper/2409.00920","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:ff90970fa26359cf4f77e4709e50c1fb1d4ca345ec8acfa4b8e85435299b6e4b","observation_id":"5e308ebe-28d5-4453-8387-8d91a8dea797","resolution":{"observed_at":"2026-08-05T14:57:39.437030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07773","last_updated":"2025-08-20T12:20:55Z","snapshot_observed_at":"2026-08-07T15:47:47.764911Z","submitted_at":"2025-05-12T17:23:34Z","title":"Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07773","snapshot_observed_at":"2026-08-05T14:57:39.441530Z","title":"Xinji Mai, Haotian Xu, Weinong Wang, Yingying Zhang, Wenqiang Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.441530Z"},"links":{"cited_paper":"/paper/2505.07773","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:0a260fde309d332a3abf02d43c1546a83c4007e184c0af9f6c789849553fbf4b","observation_id":"4e85ad13-c4e7-40ce-8ed5-8bdbda4a1f96","resolution":{"observed_at":"2026-08-05T14:57:39.441530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-08-07T15:59:48.302908Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-08-05T14:57:39.446005Z","title":"Aimo-2 winning solution: Building state-of-the-art mathematical reasoning models with open- mathreasoning dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.446005Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:6bc743ba71e33501c0eb302eedd9cc3d037caa5618ac96c929766acdc5a3ceac","observation_id":"9c7f279d-c669-4fc1-8ffb-568518d163cc","resolution":{"observed_at":"2026-08-05T14:57:39.446005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03601","last_updated":"2025-07-19T17:39:17Z","snapshot_observed_at":"2026-08-07T20:27:54.118684Z","submitted_at":"2025-04-04T17:13:57Z","title":"APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03601","snapshot_observed_at":"2026-08-05T14:57:39.450498Z","title":"Apigen-mt: Agentic pipeline for multi-turn data generation via simulated agent-human interplay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.450498Z"},"links":{"cited_paper":"/paper/2504.03601","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:23e44537d51fa893359a0339925b384d026cb84b18060068e60d9e08c06e0623","observation_id":"435b59c5-8e68-488e-b7eb-e59cf0e6f3c0","resolution":{"observed_at":"2026-08-05T14:57:39.450498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T14:57:39.455290Z","title":"Toolrl: Reward is all tool learning needs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.455290Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:36d5838869f55d228efc60d8e1a9449673ee7ac22ac5d7841d02592ef9763de1","observation_id":"2d14ae9a-cb97-421e-b964-938ca4cdd7fe","resolution":{"observed_at":"2026-08-05T14:57:39.455290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-05T14:57:39.459947Z","title":"Magistral.arXiv preprint arXiv:2506.10910,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.459947Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:ff06ff48c5e750fa39a97859ae90940124d121ce946e123d4020b86d71796c64","observation_id":"a6555b84-43a2-475f-b906-cd989fed6db3","resolution":{"observed_at":"2026-08-05T14:57:39.459947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:39.464672Z","title":"ByteDance Seed, Jiaze Chen, Tiantian Fan, Xin Liu, Lingjun Liu, Zhiqi Lin, Mingxuan Wang, Chengyi Wang, Xiangpeng Wei, Wenyuan Xu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.464672Z"},"links":{"citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:ca11b2206d4d5144e4aab3a2fea22c9b916a1745483f6f889948e34f1da4acdb","observation_id":"7ea5839c-db55-4e8f-b609-015076d6cb7d","resolution":{"observed_at":"2026-08-05T14:57:39.464672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T14:57:39.469144Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.469144Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:d1e26853ba8657217ff9a955eaa98a85b4c5f8fa6a5161180139919b35e74e37","observation_id":"e0f49d86-4f6b-4113-b811-406ebd9d8947","resolution":{"observed_at":"2026-08-05T14:57:39.469144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T14:57:39.473799Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.473799Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:0264f3fcdeee745fa0b37b1a51f0414d973d34282501cb1f9d6f132e7a34edd5","observation_id":"89a5a147-9639-4331-819a-90690405db0f","resolution":{"observed_at":"2026-08-05T14:57:39.473799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-05T14:57:39.478441Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.478441Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:440a168b73669363a41d5ce1bedaab4c0717a1d8738891f69b2e9f6b909d13f8","observation_id":"d4bf7628-c16d-40fe-8b29-34cbe67c9916","resolution":{"observed_at":"2026-08-05T14:57:39.478441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T14:57:39.482938Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.482938Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:ed7109a5dd3d0cd24e53e072b6b6b4c775c8327046227d8103003dbf4b03b89b","observation_id":"0527649f-084d-44be-b31d-b22c6d068207","resolution":{"observed_at":"2026-08-05T14:57:39.482938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T14:57:39.487519Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.487519Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:12f938cf52e90ce098cc93b38499a9acdb050fa70b95ae7abc684b9e8c76079b","observation_id":"a7a0bdfc-3922-4041-8048-6598a871fdd0","resolution":{"observed_at":"2026-08-05T14:57:39.487519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02120","last_updated":"2024-06-07T02:50:56Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:50:35Z","title":"Magicoder: Empowering Code Generation with OSS-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02120","snapshot_observed_at":"2026-08-05T14:57:39.492222Z","title":"Magicoder: Empowering code generation with oss-instruct","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.492222Z"},"links":{"cited_paper":"/paper/2312.02120","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:2d93da48c69075516cfd7f1df6bcb01ba298e8f3347440d73077f25d91b4c118","observation_id":"ca34421e-6542-49e5-9a8e-4644f7166bc4","resolution":{"observed_at":"2026-08-05T14:57:39.492222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07608","last_updated":"2025-06-05T11:49:09Z","snapshot_observed_at":"2026-08-07T15:47:50.795694Z","submitted_at":"2025-05-12T14:30:11Z","title":"MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07608","snapshot_observed_at":"2026-08-05T14:57:39.496906Z","title":"Mimo: Unlocking the reasoning potential of language model–from pretraining to posttraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.496906Z"},"links":{"cited_paper":"/paper/2505.07608","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:97f057202f566a95fd15db457faff64b5e86bd8017033a7b11a2e4ea72da609a","observation_id":"f901aec4-ac7c-4ad1-bfab-7917b16802c7","resolution":{"observed_at":"2026-08-05T14:57:39.496906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T14:57:39.501283Z","title":"Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue, Tiantian Fan, Gaohong Liu, Lingjun Liu, Xin Liu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.501283Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:73d78e849c1f50e97238fe16ea13a10cbbebbd55a56083f2bbb1729b70f1c09c","observation_id":"923c90b6-2151-45b6-9b45-298703dfc78c","resolution":{"observed_at":"2026-08-05T14:57:39.501283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10293","last_updated":"2025-08-16T13:14:36Z","snapshot_observed_at":"2026-08-05T20:35:00.904619Z","submitted_at":"2025-08-14T02:43:53Z","title":"Promoting Efficient Reasoning with Verifiable Stepwise Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10293","snapshot_observed_at":"2026-08-05T14:57:39.505938Z","title":"Promoting efficient reasoning with verifiable stepwise reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.505938Z"},"links":{"cited_paper":"/paper/2508.10293","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:15a5e16614d47f32eaab4ff88c4e1f1bed868f705365c0f1a8fc0391542d98c2","observation_id":"5c478112-4f81-4129-80cc-85d947720eb5","resolution":{"observed_at":"2026-08-05T14:57:39.505938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T14:57:39.510592Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.510592Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:d716927c48105782804514bbe855d32d08f179c5cee3095e3fafeddd9f4a93f0","observation_id":"19ad39bf-ede6-4d10-b885-327da8382ff2","resolution":{"observed_at":"2026-08-05T14:57:39.510592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T14:57:39.432202Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.432202Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:143ce6e6b3da17bfc1c75d1ba4d944bd56851ffa224556e85acea122208ec73f","observation_id":"aa9b1cef-8270-4200-9f95-350fa9bf2956","resolution":{"observed_at":"2026-08-05T14:57:39.432202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T14:57:39.423424Z","title":"Kimi-researcher","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.423424Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:0bcca7dca14185bd171b31d5f5a05d7b189767c7e39a7ef9554b26474fcb1e37","observation_id":"ee948300-1b9d-4fc3-912c-928028a5fbf9","resolution":{"observed_at":"2026-08-05T14:57:39.423424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-08-05T14:57:39.374889Z","title":"Aime problems and solutions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.374889Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:2a84d57d1cc0941c5a4272a7d3b0a89c037f63b8f69953748ee006f2380c35de","observation_id":"d4edf230-9a3f-4cbd-8ca3-7c9b740426ab","resolution":{"observed_at":"2026-08-05T14:57:39.374889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 19 inbound Pith citation observations for arXiv:2508.20722."}