{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e42afc4b07b8d39bd9cbd1db8d4ba51861a8136c58541d577a346df39a19ab7","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:37:39.581071Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.12395/citation-record","integrity":"/paper/2607.12395/integrity","json":"/paper/2607.12395/citation-record.json","paper":"/paper/2607.12395"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.490840Z","title":"Chi and Quoc V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.490840Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:536a86ed09ce838037838ebe7c6fa34452397966541d47318f1001490c6809cb","observation_id":"b4892cd6-bcd0-41c9-b7bf-b89c2a0f977c","resolution":{"observed_at":"2026-08-02T06:37:31.490840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.549024Z","title":"NeurIPS , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.549024Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:749b799de88a44498f4e856f14b15d4dcab79bd81370a6ed8ba3ffeb545f7e6e","observation_id":"a4e24d96-67ce-4f1f-9aac-27feb04a4c77","resolution":{"observed_at":"2026-08-02T06:37:31.549024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.613955Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.613955Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:54fcd66b2da9b936f4a5125b4eb9499fc71e8761d4e935bb2bb21ef9f7456cd9","observation_id":"1f2380d4-da70-45fc-9d72-f94c0a629de0","resolution":{"observed_at":"2026-08-02T06:37:31.613955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.664253Z","title":"A Survey of Large Language Models , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.664253Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d94da8005f3343f833e22256f80e95023ea65384177a546315529fbff55d4077","observation_id":"6f0201df-c5dc-46b5-9d6e-c06d617955d1","resolution":{"observed_at":"2026-08-02T06:37:31.664253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.702494Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.702494Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:8721ecb3259e822af2c71891aa27e098081764b43b48a5ee5d909ff854e6e729","observation_id":"f5df07dc-49ff-476b-8da1-0d15cb2a1a0c","resolution":{"observed_at":"2026-08-02T06:37:31.702494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.771311Z","title":"Brown and Benjamin Chess and Rewon Child and Scott Gray and Alec Radford and Jeffrey Wu and Dario Amodei , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.771311Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:8ebd22f832eef1a751be653947376d70348a4fb8a111e6675202039fb9882803","observation_id":"cb2f9126-0440-45ed-a995-eb577de33969","resolution":{"observed_at":"2026-08-02T06:37:31.771311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.856413Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.856413Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d9403530d917298f68a0754d073fd4dddd6c0a2fbc3538b6d3d3041554dcc503","observation_id":"b938b8ac-3f89-4619-9c63-476ce6eb28d4","resolution":{"observed_at":"2026-08-02T06:37:31.856413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.915828Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.915828Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:3a924b999d57f3429f04270824da6782f7928cd85ac4fc197fbb9cf5ecbea943","observation_id":"974faa6f-e29a-4983-ba67-0c4860cab164","resolution":{"observed_at":"2026-08-02T06:37:31.915828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:31.977680Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:31.977680Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:6fda2e866ef1158ecb56b66a44380e433c3e50ee79fc4d26aa9bd49430109a8d","observation_id":"1666de82-fbe4-4083-b920-b2efb188572d","resolution":{"observed_at":"2026-08-02T06:37:31.977680Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.029207Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.029207Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:3b8bae2979ed9ce7f32e87809eddacb7d420b6d0dd09e06685d1f5a39897c4df","observation_id":"eb374259-c6cc-4360-8c58-342456af6d5f","resolution":{"observed_at":"2026-08-02T06:37:32.029207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.134939Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.134939Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:6cf1d44261781ff9a9c0a4277f3ac6c3bea0c9f5307bb60ca40d97045b04a7c3","observation_id":"98f0c652-bfa1-453e-a605-51dac705dfb2","resolution":{"observed_at":"2026-08-02T06:37:32.134939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.260873Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.260873Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:480bdfcfed31d84da208b43584fae7e20e32012e7dca4c6c12f932293052915f","observation_id":"7e730bee-8e6b-419f-af41-5ed387d6feec","resolution":{"observed_at":"2026-08-02T06:37:32.260873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.347280Z","title":"Group Sequence Policy Optimization , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.347280Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d135188af95620be50f1dd630b934dc82c5c39a823bcb23691d5e0aa9700952f","observation_id":"982c0c32-31d2-4019-aab5-de4fceab575b","resolution":{"observed_at":"2026-08-02T06:37:32.347280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.424742Z","title":"Your Efficient RL Framework Secretly Brings You Off-Policy RL Training , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.424742Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:c680ae0c617aa3999b84bbad24a5ac0ab6d6dcc7082d792e4b05c11df1b5f940","observation_id":"9ede01e0-340a-4c77-8216-14281c204463","resolution":{"observed_at":"2026-08-02T06:37:32.424742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.551250Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.551250Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:f4fac2e9a2aafe60cd904041a7b07c59254871525cba9f93fee86ae6f966e8ec","observation_id":"d9764aae-a6db-4d64-be89-58c31d4a0cbf","resolution":{"observed_at":"2026-08-02T06:37:32.551250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.655674Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.655674Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:e05c9d49f5d606c6553d2471999c5094ef839f30ea381799b12529efee1bb360","observation_id":"92b03b7e-59e8-4349-a170-47feb22ff494","resolution":{"observed_at":"2026-08-02T06:37:32.655674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.774327Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.774327Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:20308ebe6406b1d68ef823c7d38acce8ddd2fc762be1f6818e1806fe964373f4","observation_id":"ae06ab61-7e78-4da1-887b-f220b3468780","resolution":{"observed_at":"2026-08-02T06:37:32.774327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.879873Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.879873Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d00ef730ab9128b53bbc9421b89be1759e6670e18b1f2251937134246dce63b0","observation_id":"35c9a828-4e7a-406a-b1ed-8141c7edcf89","resolution":{"observed_at":"2026-08-02T06:37:32.879873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:32.947030Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:32.947030Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:fa4d9d978f53760bef68a26125f98efe5ee0d7ed4a2d05b9de0fa05a510ff560","observation_id":"a4e4af3e-307e-4815-80a7-e7a92634e9b9","resolution":{"observed_at":"2026-08-02T06:37:32.947030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:33.062554Z","title":"EuroSys , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:33.062554Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:1cafe955caf0824d0863d9fae2fc3b63b0483ba4fd862bbcafe855833df4d05a","observation_id":"b6bcb339-11a2-43a3-85d2-878732f1f591","resolution":{"observed_at":"2026-08-02T06:37:33.062554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:33.141103Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:33.141103Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:1d6437ebba243eea36a30bbb745d6eb5607b2527c61bbdb987176fbe9b48ec2f","observation_id":"c315021e-549c-48dc-9686-d163a2752042","resolution":{"observed_at":"2026-08-02T06:37:33.141103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:33.257338Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:33.257338Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:577559eb08fd2720e910f49b3059a80f150c0f6bed1203a61514fb8d5a9ae1a1","observation_id":"328c0a76-421f-4a3a-ac12-984283b0fedc","resolution":{"observed_at":"2026-08-02T06:37:33.257338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:33.365730Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:33.365730Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:4108f80b7a11633c5b7ec72e0f303864676c5f99ce3331c5b32c214c23f19167","observation_id":"7079ce51-7ff8-403d-96c2-8c9faae15793","resolution":{"observed_at":"2026-08-02T06:37:33.365730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:33.430458Z","title":"Qwen3.5: Accelerating Productivity with Native Multimodal Agents , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:33.430458Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:193ce2eedc6ddced226e6171ef7be52ae343aa95ac3fa7d65846e5eca58f038d","observation_id":"9cd235d4-dec8-4cf8-b502-3e63f23a6a29","resolution":{"observed_at":"2026-08-02T06:37:33.430458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:33.567911Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:33.567911Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:23458bab4ef489f4c01018ad91510a726d0c56e2f1a8c60fe562701ad0f8c8d5","observation_id":"e8331b09-9c92-4030-9199-64752a878ead","resolution":{"observed_at":"2026-08-02T06:37:33.567911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:33.691034Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:33.691034Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:ff22ae1d18abb07b4c97e92fbcb1373974faab85d5acdd4a4edb17895586a32d","observation_id":"d41b0a38-74d5-4997-a932-5d52cd026846","resolution":{"observed_at":"2026-08-02T06:37:33.691034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:33.903064Z","title":"DeepSeek-V2:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:33.903064Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:61f161dd4b7510e50bb82570f019aadcd0cfcdd5418574a87a765a8458d2ce69","observation_id":"7cdc105a-1842-4a98-943e-bda1507541ba","resolution":{"observed_at":"2026-08-02T06:37:33.903064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:34.033607Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:34.033607Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:44e3705097ddf6d00e79c7c3df0dc81048e85548822d201cb14c7e9a1ee66ad8","observation_id":"6e4c74bc-48d3-4b38-b068-fe57d291bd06","resolution":{"observed_at":"2026-08-02T06:37:34.033607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:34.167466Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:34.167466Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:1b6cf25ff1b9c5ebfcf4bbc2b9cc62ff986ffbb0c2f59ca7b536d3568280b111","observation_id":"484e7acc-f0f8-4d93-9ab8-556c647f74fe","resolution":{"observed_at":"2026-08-02T06:37:34.167466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:34.303287Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:34.303287Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:09bd404011757a0210aa9ea4fc171c6f1025289b22b201347fa1bd0b4c3ad3d9","observation_id":"117a3773-156b-4c43-b70c-01590c8b7f7a","resolution":{"observed_at":"2026-08-02T06:37:34.303287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:34.489886Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:34.489886Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:01306e962a3a00cfc97839de2b0b434b1a2a68acb74b7cc37db252aee1017feb","observation_id":"92a23e84-0c5b-44e2-9136-fec9c0abc710","resolution":{"observed_at":"2026-08-02T06:37:34.489886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:34.625640Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:34.625640Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:576ba0f58364c844b092a9b64d01bb9702407314a4b8410b6f6a003bc7dd7738","observation_id":"540deabc-e1a3-4233-85d6-27092fef9ebb","resolution":{"observed_at":"2026-08-02T06:37:34.625640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:34.748211Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:34.748211Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:0bfc09d8b078485d0cec10969a5a78f7560bfacc5b2150407542a26ba012307d","observation_id":"feacad75-dac5-4c77-a5b2-8843121a64d2","resolution":{"observed_at":"2026-08-02T06:37:34.748211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:34.891918Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:34.891918Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d13a5de23f9336dda762b9177c0abfe8de83f468f3f5b7e7eae38f9f114d86ba","observation_id":"4d21c6c5-a218-4515-9798-27c191b34715","resolution":{"observed_at":"2026-08-02T06:37:34.891918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:34.939822Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:34.939822Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:66dd894d4933c91c8d59ce08d9cbe06ade21c3f3b97cd7073be1af8ae103dd9f","observation_id":"662954a7-e69e-4a3e-b9ec-0b33654cf858","resolution":{"observed_at":"2026-08-02T06:37:34.939822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:35.035663Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:35.035663Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:f57efa796a9544ac49d6074cf51c159aa0627ccd31a5fec7d91cc2b26556d393","observation_id":"b14ef062-d4c9-4b2f-91c8-ab03289e0f4f","resolution":{"observed_at":"2026-08-02T06:37:35.035663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:35.222683Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:35.222683Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:f0b26d5e6e71923f1ff81779284d17b3eb63d4cf6570f4eb7b7eac5fd596ed97","observation_id":"05957687-daa8-485f-89f3-a01215b88759","resolution":{"observed_at":"2026-08-02T06:37:35.222683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:35.281525Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:35.281525Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:f04665e8b8005411b5dff32a6d4c876506e5b6fea88d9ed5f67bf89276b03d3f","observation_id":"5d0cf703-a7f1-495c-8a74-00c4e880b056","resolution":{"observed_at":"2026-08-02T06:37:35.281525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:35.412226Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:35.412226Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:ba7901593ee03c7dbbc09fb3d4d2be1ec1affb926ed14dd8fb79469e78820c3d","observation_id":"9b1139a5-e6ad-4805-a397-0b24b3ac8ffe","resolution":{"observed_at":"2026-08-02T06:37:35.412226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:35.504768Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:35.504768Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:61ece74d4b2021791a6812b172932828d2ec17d1070d1b576dd96549c7627fa4","observation_id":"3fe383e8-43c1-4d51-832d-1366f3d6f22e","resolution":{"observed_at":"2026-08-02T06:37:35.504768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:35.678338Z","title":"Gonzalez and Clark W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:35.678338Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:e09eb758b968b0470591d6fe68d122e95f1ded0bed7b437de66dec0b08a008ed","observation_id":"1f75b614-e1d3-4aa4-bd58-e0bb4a6c489a","resolution":{"observed_at":"2026-08-02T06:37:35.678338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:35.880707Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:35.880707Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:9e938f429b072806d65e2627c09a93da3fa7bc4ab5e8174cc2c44ae762b465b8","observation_id":"90965d7a-25e8-47ef-91e8-3143a562216f","resolution":{"observed_at":"2026-08-02T06:37:35.880707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:36.096418Z","title":"NeurIPS , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.096418Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:fc7a8d2897beffdaac81d69d6a52acd4bdae8b8a52212ca0d1beb66c3ebb3a6b","observation_id":"9fd6f238-6cbd-49c1-8fd1-530674627308","resolution":{"observed_at":"2026-08-02T06:37:36.096418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:36.252366Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.252366Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:316fb77513ab8e10ffc01fc5788f33adbdb59b48a297d990b026262a942268a2","observation_id":"e2af5349-50c5-4e53-bf2e-cc17066961b4","resolution":{"observed_at":"2026-08-02T06:37:36.252366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-07T14:59:29.958322Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-02T06:37:36.445162Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.445162Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:c7c96467a3a1c82c66a8ac689ca328598f54f3001640a4a87b313598a2259ecd","observation_id":"70ba9640-73f3-4a19-bd19-009a3d40a001","resolution":{"observed_at":"2026-08-02T06:37:36.445162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-02T06:37:36.599379Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.599379Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:e72b8e003c356c6536bad546f0c35ef1c534f42d01b0353d6fd78293676df6f9","observation_id":"11a1f182-415f-45d8-a3ec-9b9c8e7a7bd0","resolution":{"observed_at":"2026-08-02T06:37:36.599379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:36.735367Z","title":"Incentivizing dual process thinking for efficient large language model reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.735367Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:b56d22ee9cad980032fcf7274185afdf63cb650d98d6433d052354f7afda7e3c","observation_id":"0d0880a4-7f26-4abf-8759-c9ef375e1cb7","resolution":{"observed_at":"2026-08-02T06:37:36.735367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-02T06:37:36.887939Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.887939Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:19e66bfc157092b2a304f2d894cb4e7176c478f30b9116095728cc6e4d99f0d3","observation_id":"c8a8f204-ee29-4261-8b0d-1a7b09935cb3","resolution":{"observed_at":"2026-08-02T06:37:36.887939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:37.025556Z","title":"macereason-math: A dataset of high-quality multilingual math problems ready for RLVR","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.025556Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:cc298ddc332ede9414f2ce05bf582d9395fed6dd0965d92fc8013e4ffc24f161","observation_id":"18feaa55-a541-47c4-bc5a-d1aa09168ef3","resolution":{"observed_at":"2026-08-02T06:37:37.025556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T06:37:37.177652Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.177652Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:a19628c3e2bf406625c5c1c1a12e138841627f2e6a9587ec2c2f4ce0a30d98c6","observation_id":"f0bd608c-2077-4856-a6e6-5c3f70d9e353","resolution":{"observed_at":"2026-08-02T06:37:37.177652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-02T06:37:37.260760Z","title":"GLM-5: from vibe coding to agentic engineering","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.260760Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:0b8ec318a298b14b2ae8b40a9602cb935801f396b54d39f22d2044f012fb0a8e","observation_id":"d1e76a2c-40f9-4dc6-92d4-94a00d44c7c4","resolution":{"observed_at":"2026-08-02T06:37:37.260760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:37.361077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.361077Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:7ceae7aed7558ab2c27ce11c862d10df1a05becfde344945e4c837fa7e4f5826","observation_id":"2d7b4523-7cdc-49bb-97d1-e3e7844032ff","resolution":{"observed_at":"2026-08-02T06:37:37.361077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-02T06:37:37.465240Z","title":"Openrlhf: An easy-to-use, scalable and high-performance RLHF framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.465240Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:9c75c59b40c722d0dbc67de816960513f1b7d4d64f6e760f8738b1b16dd7737c","observation_id":"e334939b-ebd3-4787-a54d-2af494d7c320","resolution":{"observed_at":"2026-08-02T06:37:37.465240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:37.535450Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.535450Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:258875701fdc9194873bff2f47cdedeefc047739c6b8195b99eb5521257e8f01","observation_id":"ff8c01df-8406-442a-b203-98ee18302674","resolution":{"observed_at":"2026-08-02T06:37:37.535450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26971","last_updated":"2026-05-26T12:57:12Z","snapshot_observed_at":"2026-08-07T18:23:52.993798Z","submitted_at":"2026-05-26T12:57:12Z","title":"RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26971","snapshot_observed_at":"2026-08-02T06:37:37.582083Z","title":"RLVR datasets and where to find them: Tracing data lineage for better training data","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.582083Z"},"links":{"cited_paper":"/paper/2605.26971","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:f7fb253a78c9385bae6a30a5f6b31f3e48ffa9b4d50143dc390ecc10927095c5","observation_id":"9ad04e95-8e2d-4ead-9895-0dbd5ea30dd3","resolution":{"observed_at":"2026-08-02T06:37:37.582083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:37.632153Z","title":"Megascale: Scaling large language model training to more than 10, 000 gpus","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.632153Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:2deb1c13cfec3f3c8426183b2e759006d0852abafd6c0b1b83a2ac5ecb5c618f","observation_id":"166d065a-a0c4-4777-9b80-1c33e73d107f","resolution":{"observed_at":"2026-08-02T06:37:37.632153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T06:37:37.683762Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.683762Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:3d080e9ec68cafebda79768aaa7b1beb4c4b1664fd667b1048a12cabd3602eb8","observation_id":"b7b8cdab-155c-4caa-8965-1ec63fe6c1c3","resolution":{"observed_at":"2026-08-02T06:37:37.683762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-02T06:37:37.761908Z","title":"Kimi K2.5: visual agentic intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.761908Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:276d1d0063b85b7785b4d5c542ef68060366125d0d259316d9edf2a7f662968e","observation_id":"af0c0b54-4af7-4491-847e-df3044e514ed","resolution":{"observed_at":"2026-08-02T06:37:37.761908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:37.838226Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.838226Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:62a3029c60f6e463d47bb544bf4aec599ce2826fbf817cad83eb0ed31feebb2b","observation_id":"ebb2de66-fb56-4608-ad20-72147bcb2351","resolution":{"observed_at":"2026-08-02T06:37:37.838226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:37.949384Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.949384Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:110dfff0f2dc1edd5f0071ff2f433ab6abfef6851ef03ba9385f3f7794fb5e78","observation_id":"4e08a390-5410-4967-941e-0bf09dad2ddc","resolution":{"observed_at":"2026-08-02T06:37:37.949384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-02T06:37:38.064496Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.064496Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:ede84ac8078197fb9b916dcd384b83a46037d4d39ef571ff65d691c887166c37","observation_id":"87d50b34-b66f-4c2b-9bdb-ff158c6571bb","resolution":{"observed_at":"2026-08-02T06:37:38.064496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-02T06:37:38.160357Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.160357Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:bcc80c089d0447e1134b6ff561f690fe8e9a2a4b681c9ab2a4f7cfbe8dea1a83","observation_id":"99c812be-c174-4e18-a448-0094ca043f57","resolution":{"observed_at":"2026-08-02T06:37:38.160357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-02T06:37:38.233149Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.233149Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:ae13ad35a73e9b7e6f7a526bde66a6dd5a204033b3eb86a2200bdae77b1c3d45","observation_id":"34bf8699-b6e2-4200-a761-ca1bd7a85ae0","resolution":{"observed_at":"2026-08-02T06:37:38.233149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-02T06:37:38.290188Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.290188Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:30baabb51aa57f365054fbacd07f76c620125edceeb766a8e76a4d1e9ffad765","observation_id":"eff9b1bb-79c6-428b-86bb-ba04d01d1efd","resolution":{"observed_at":"2026-08-02T06:37:38.290188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:38.296337Z","title":"Efficient large-scale language model training on GPU clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.296337Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:78fd11befd5816305f30fac9e08e475081d3257a77325515ca08a7a766cbefc1","observation_id":"55a42e38-a151-44a7-988d-59c5d60052d8","resolution":{"observed_at":"2026-08-02T06:37:38.296337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04658","last_updated":"2024-01-15T14:57:29Z","snapshot_observed_at":"2026-08-03T19:06:46.657140Z","submitted_at":"2024-01-09T16:27:28Z","title":"Lightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04658","snapshot_observed_at":"2026-08-02T06:37:38.357406Z","title":"Lightning attention-2: A free lunch for handling unlimited sequence lengths in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.357406Z"},"links":{"cited_paper":"/paper/2401.04658","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d373cc6c5c7c4ba0d37a82fd3796e00c85b3136b93ed6013dbcdc4406119a30b","observation_id":"36ba925c-029b-4b53-afd1-c6e80ab1e360","resolution":{"observed_at":"2026-08-02T06:37:38.357406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:38.431799Z","title":"Zero: memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.431799Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:e9d28595cc0e46213be78967c296af95915be4d1f6b8e42cb6e4bc755ba20f4c","observation_id":"1de690bf-9584-40f1-b6af-ef0d9ac41291","resolution":{"observed_at":"2026-08-02T06:37:38.431799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T06:37:38.475345Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.475345Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:ce1c125adb8659167f23bc9b1db4672926908c27c440de9c3c7e3228b94c912d","observation_id":"68c23ab6-9060-489a-8090-23168e798d19","resolution":{"observed_at":"2026-08-02T06:37:38.475345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:38.557172Z","title":"Hybridflow: A flexible and efficient RLHF framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.557172Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:e576ef4c0ed2ce70494d3ca8b22582175f68de75655c3222c2e7fbf3c921b40a","observation_id":"8dbbfaac-f73b-4a31-bb03-50db4791cac6","resolution":{"observed_at":"2026-08-02T06:37:38.557172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-02T06:37:38.634701Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.634701Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d61fba53185b0db43042af26e6e41f6962823ab59bf36fecb578779264f0bf5a","observation_id":"fdf48ca9-d639-46db-80e3-2411d7e9e3f4","resolution":{"observed_at":"2026-08-02T06:37:38.634701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:38.731951Z","title":"Rethinking sample polarity in reinforcement learning with verifiable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.731951Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:db15eae8514b046184dff386c85a9815c7b415943ef8e1e5bd4d1b699fc854ba","observation_id":"75731417-20c7-44a9-bffc-eff3f824f2e9","resolution":{"observed_at":"2026-08-02T06:37:38.731951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:38.854751Z","title":"Every step evolves: Scaling reinforcement learning for trillion-scale thinking model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.854751Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:4bed94bf056f925424029fc0269e079a47687d6b659f61ff5b6ea08d11b38e15","observation_id":"4bfb6b8a-90fd-4867-bd40-d2ab0c7b5bc3","resolution":{"observed_at":"2026-08-02T06:37:38.854751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:38.923125Z","title":"A survey on parallel reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.923125Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d0fd07cefa479247de89e92a41166cdfba0ace82e6067e337d922bce9791ba30","observation_id":"c8a2c0c9-c587-426c-b133-05e0f1fc484c","resolution":{"observed_at":"2026-08-02T06:37:38.923125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:38.978930Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:38.978930Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:b6b4e8ccac0e7b813eaff4d3c9daeec56249f901076ca5cf35ed2ff98160ea4d","observation_id":"6c184937-d24d-4ebb-9e1f-65a96be8db18","resolution":{"observed_at":"2026-08-02T06:37:38.978930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:39.049337Z","title":"Your efficient rl framework secretly brings you off-policy rl training, August 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.049337Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:9a8228bf96051283a2974f3a1d74e885dca97cadcb955fc3d61918dce94f2b41","observation_id":"a11c1bc5-f966-4004-b141-1c6c584e3ac5","resolution":{"observed_at":"2026-08-02T06:37:39.049337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T06:37:39.109905Z","title":"DAPO: an open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.109905Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:a1ec73c36822ad5ea1477f653671aded77daee0c39590c5de50dc4bdc6f4712e","observation_id":"794d7ead-9bca-434d-8e6b-8bd20fcb2b5c","resolution":{"observed_at":"2026-08-02T06:37:39.109905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-02T06:37:39.169135Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? CoRR, abs/2504.13837, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.169135Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:c4c4c18606538be227e9f9d861b5686b5d1acba0fc072129cba8963e2588ee09","observation_id":"21794d45-9556-4282-914d-9c4b48097b07","resolution":{"observed_at":"2026-08-02T06:37:39.169135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-02T06:37:39.232262Z","title":"VAPO: efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.232262Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:1abce5fe6d793f27dd91c248d1f561e580a2cd3d047d22436e72f3e5e5e97372","observation_id":"47e697d8-4a65-4332-acb8-c38c7128699f","resolution":{"observed_at":"2026-08-02T06:37:39.232262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-02T06:37:39.345872Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.345872Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d6588e74e36caef2ddb2999b7f7d345120ec4e3231324bcedbbc02fd22ff08c7","observation_id":"8026aa05-9dc7-4e34-ba2c-cb04d2eab06f","resolution":{"observed_at":"2026-08-02T06:37:39.345872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:39.399475Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.399475Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:d863dfce910b6cf0abc3ebadebcb0e1e74a76a6abbcefc01dae6f1784b9cb3e3","observation_id":"ae15005e-3986-412a-9fb9-afa01d71d31b","resolution":{"observed_at":"2026-08-02T06:37:39.399475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-02T06:37:39.461508Z","title":"Group sequence policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.461508Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:a4c010cc46cb496c3f34c5ed202826dd9c00f267b4e7887119975715cd76b6e8","observation_id":"effb4bfc-0281-44a4-b21c-4446baed5c88","resolution":{"observed_at":"2026-08-02T06:37:39.461508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-08-02T06:37:39.525266Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.525266Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:7ed07616b729fa64a0ab9cfffa0b68c76e08f1723aea2f10151a331ad3b6c68d","observation_id":"a49cfe8a-2894-4485-ab0b-ea0df3835026","resolution":{"observed_at":"2026-08-02T06:37:39.525266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:37:39.581071Z","title":"slime: An llm post-training framework for rl scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.581071Z"},"links":{"citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:996f76730c9c9d9953cb886930838dabf213bf1eb60cdbd734a1f15ba79d1467","observation_id":"d05f42b4-ad2a-45ad-ac66-76730c05f020","resolution":{"observed_at":"2026-08-02T06:37:39.581071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":82,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2607.12395."}