{"as_of":"2026-08-07T01:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c32b5fb18c300a4cf9537e32e836ccb1113ffaa76a68759e27c4746f39250523","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:23.492554Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:07:39.150321Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14731","snapshot_observed_at":"2026-08-06T15:07:39.150321Z","title":"Ring-lite: Scalable reasoning via c3po-stabilized reinforcement learning for llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16802","last_updated":"2025-07-27T13:53:23Z","snapshot_observed_at":"2026-08-06T14:59:05.706744Z","submitted_at":"2025-07-22T17:52:16Z","title":"Agentar-Fin-R1: Enhancing Financial Intelligence through Domain Expertise, Training Efficiency, and Advanced Reasoning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:39.150321Z"},"links":{"cited_paper":"/paper/2506.14731","citing_paper":"/paper/2507.16802"},"observation_digest":"sha256:ea1bc4b8d7ba36d0550237b19e3643af6766d1def2a7eeac169f585ddd06816a","observation_id":"a9fd62bf-9c62-42d2-950a-509aa958bef2","resolution":{"observed_at":"2026-08-06T15:07:39.150321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"cited_work":{"arxiv_id":"2506.14731","doi":"10.48550/arxiv.2506.14731","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ArXiv.org","work_id":"98bb8d82-c67b-4972-99c6-336abb96de39","year":2025},"citing_paper":{"arxiv_id":"2512.05591","last_updated":"2026-04-23T12:00:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-05T10:26:32Z","title":"Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T00:53:51.251900Z"},"links":{"cited_paper":"/paper/2506.14731","citing_paper":"/paper/2512.05591"},"observation_digest":"sha256:b1ae27d0dad7da3a4e39d31ccd621fd77c6f40c8eb9e29dbd3b14498fe60b071","observation_id":"2d15c3b6-b9a6-4533-b4ce-7948d24c60b2","resolution":{"observed_at":"2026-05-17T00:58:46.293783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14731","snapshot_observed_at":"2026-08-02T19:53:08.502936Z","title":"Ring-lite: Scalable reasoning via c3po-stabilized reinforcement learning for llms.arXiv preprint arXiv:2506.14731,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.502936Z"},"links":{"cited_paper":"/paper/2506.14731","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:f7056a2b1ad3e8adb2594b453dedde652604a8d89173970e623977ec0819a083","observation_id":"c822d43c-a000-4fea-8898-e4eba2f046e8","resolution":{"observed_at":"2026-08-02T19:53:08.502936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14731/citation-record","integrity":"/paper/2506.14731/integrity","json":"/paper/2506.14731/citation-record.json","paper":"/paper/2506.14731"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-03T16:01:59.567237Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-08-07T00:14:22.426243Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models, 2025.https://arxiv.org/abs/2502.17387","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.426243Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:f87da0aa90d9bd7d89a82320fc4e686fd60c602cf8ac95b181fe68b5941c9171","observation_id":"791f41b8-8b5a-4841-9f32-c105a5483f26","resolution":{"observed_at":"2026-08-07T00:14:22.426243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-07-06T21:28:24.644692Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-07T00:14:22.519933Z","title":"DeepSeek-AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.519933Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:74a60a3935572bcbb014d4ab7e416753d666572f22ba6a96d7348b61cab0a439","observation_id":"2a0e87ad-35f9-427c-8aae-3ec1f1dfbbb9","resolution":{"observed_at":"2026-08-07T00:14:22.519933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:14:22.609418Z","title":"org/abs/2501.12948","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.609418Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:411747532bb29c9954b980ad90a9407cf2fa45e7cda87a4ba48404ec47237083","observation_id":"5a24296e-cae0-4a09-88b7-873cf6066d1d","resolution":{"observed_at":"2026-08-07T00:14:22.609418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:24.149476Z","title":null,"venue":null,"work_id":"28374b4b-ae2b-4208-b3bd-f80715a92106","year":2025},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.791494Z"},"links":{"citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:f88bec8b79ecc15e8643207d079e5d74f66be1423e4127cff692ba14883311fc","observation_id":"0be78314-a998-474a-996f-16531294b857","resolution":{"observed_at":"2026-08-07T00:14:24.243668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:23.962277Z","title":"Aitor Lewkowycz, Anders Andreassen, David Dohan, Ethan Dyer, Henryk Michalewski, Vinay V","venue":null,"work_id":"a6b7a4e7-3feb-4576-90c6-3163959b61dd","year":2025},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.858003Z"},"links":{"citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:d28f11ad044ce524104cd8592e650adbcffe11d5e7340836ae739af3282c8b1b","observation_id":"dc87b8bc-e519-4efd-a889-a6939d8f7889","resolution":{"observed_at":"2026-08-07T00:14:24.075438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05139","last_updated":"2025-03-10T14:21:21Z","snapshot_observed_at":"2026-07-06T20:48:22.689787Z","submitted_at":"2025-03-07T04:43:39Z","title":"Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05139","snapshot_observed_at":"2026-08-07T00:14:22.999127Z","title":"Ling-Team","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.999127Z"},"links":{"cited_paper":"/paper/2503.05139","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:ffc681cad0f80f26f13300bd6e68c16aecd4265c8a3e1f0bd148b1fad2b7dcf5","observation_id":"dcd56729-79a2-468d-8c68-3dd13c2d5a48","resolution":{"observed_at":"2026-08-07T00:14:22.999127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13147","last_updated":"2025-08-08T15:28:01Z","snapshot_observed_at":"2026-08-04T08:26:16.909949Z","submitted_at":"2024-12-17T18:12:47Z","title":"Are Your LLMs Capable of Stable Reasoning?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13147","snapshot_observed_at":"2026-08-07T00:14:23.045879Z","title":"https://doi.org/10.48550/arXiv.2412.13147","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.045879Z"},"links":{"cited_paper":"/paper/2412.13147","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:d993475f638177d8c264f0c7144be774975cc73f5663db8b742f03973f2df365","observation_id":"0ce9eb9b-0084-4264-ae49-e22ba1e4d821","resolution":{"observed_at":"2026-08-07T00:14:23.045879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T00:14:23.120263Z","title":"Decoupled weight decay regularization, 2019.https://arxiv.org/abs/1711.05101","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.120263Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:d640339c50d294b7e1ce55d2c3e4733a00dda3746d62d558c294dc5f7806cac2","observation_id":"3ad01978-3460-4b95-bf1d-3383f778d694","resolution":{"observed_at":"2026-08-07T00:14:23.120263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:14:23.190529Z","title":"David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, and Samuel R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.190529Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:4100d84f10bce792cc232557766901cf8525e2929b808004957510058dd7b2cb","observation_id":"4d4dc78d-d00c-4968-94e7-79b7d3d07e1f","resolution":{"observed_at":"2026-08-07T00:14:23.190529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:23.365603Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.365603Z"},"links":{"citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:beab12dd4590efd0c2cf77dbd47d4a572e73f3f7cee9b68e0b2cc7e3fb22616d","observation_id":"fd343ea1-b0af-4958-ac07-206f0ff553d3","resolution":{"observed_at":"2026-08-07T00:14:23.365603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-07-06T21:11:54.143996Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-07T00:14:23.492554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.492554Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:6579eff65cbb92c118a22aea81b31a930fd9901fad0ea78bc6ef551a92c62f2f","observation_id":"cfda8c5e-4bc2-4b25-bbef-9a520947345d","resolution":{"observed_at":"2026-08-07T00:14:23.492554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-07T00:14:22.930873Z","title":"Rongao Li, Jie Fu, Bo-Wen Zhang, Tao Huang, Zhihong Sun, Chen Lyu, Guang Liu, Zhi Jin, and Ge Li","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.930873Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:e1ccf288b553757bc3e2c83646684374b4921d8bd28d1a7fa46ee1a8ba579941","observation_id":"7369c7f0-44e4-4cd5-96dd-5f2271220783","resolution":{"observed_at":"2026-08-07T00:14:22.930873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T00:14:23.277165Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.277165Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:bcd4af3f4899edee6d98490296876cfd5239a07c295ff13ad6228934bf3e7655","observation_id":"a844fb5d-128d-452a-bc81-47e67470c87b","resolution":{"observed_at":"2026-08-07T00:14:23.277165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-07T00:14:22.710839Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.710839Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:91210aeb95198ca00f3c8f03a2de3b1793b1c897001da9209e620b43a5cd0135","observation_id":"d3cd57e7-3742-41e8-bc7a-9d202c092f4b","resolution":{"observed_at":"2026-08-07T00:14:22.710839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:22.327769Z","title":"Nemotron-crossthink: Scaling self-learning beyond math reasoning.arXiv preprint arXiv: 2504.13941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.327769Z"},"links":{"citing_paper":"/paper/2506.14731"},"observation_digest":"sha256:1df49e3a502ca36d401e15dd6da05d2b2dd268a0578918f36486923bde199062","observation_id":"83135e4b-12e8-4cb8-a729-be7995bc8e86","resolution":{"observed_at":"2026-08-07T00:14:22.327769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 3 inbound Pith citation observations for arXiv:2506.14731."}