{"as_of":"2026-08-07T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69044c662066b24c46cb4c95067ac009b339e018ba8950e15df3a9cdf3a5abc4","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:51:43.099838Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:04.024925Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.554863Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-08-06T04:39:04.024925Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:04.024925Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:dd887c03fd80b3aedd37017cde7e88d1d1e694870031f871b3309cdd68f493ac","observation_id":"74b92fd2-80fe-457e-8dfc-f7d363cc0b3b","resolution":{"observed_at":"2026-08-06T04:39:04.024925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-08-04T07:59:53.046706Z","title":"Scaling up rl: Unlocking di- verse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.23486","last_updated":"2026-07-03T18:03:08Z","snapshot_observed_at":"2026-08-04T07:59:51.187696Z","submitted_at":"2025-10-27T16:17:45Z","title":"Learning to Reason Efficiently with Discounted Reinforcement Learning","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T07:59:53.046706Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2510.23486"},"observation_digest":"sha256:d1ffb00273318e1515c2c0c1646c4b83dfe18f74d8f4936c080a393a6c23d9c1","observation_id":"da2f79da-b1fe-4b5c-bc8a-065e3102426e","resolution":{"observed_at":"2026-08-04T07:59:53.046706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:03:15.222571Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:61ec5657307034c0f2b8090bcbc4ee176eb1e7627784d6feaacb06147038e68a","observation_id":"3310297e-1a88-4046-94cf-424c1b424a51","resolution":{"observed_at":"2026-05-11T09:25:59.026410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-12T22:48:45.647588Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T22:48:45.647588Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:19dae64e3f3db116422e5c632ca8c86f6e4ccba2425c04ad44b4dc1bbb589fb4","observation_id":"ddab7b49-4cd9-47a9-8686-07871448f7bd","resolution":{"observed_at":"2026-07-12T22:48:45.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2604.15306","last_updated":"2026-04-16T17:59:43Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-04-16T17:59:43Z","title":"Generalization in LLM Problem Solving: The Case of the Shortest Path","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T10:37:45.355872Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2604.15306"},"observation_digest":"sha256:7b23ecd960b0de76e4196528929a6031c74c0f12181f4e19527facb265c0a6b0","observation_id":"19e525d1-700f-4d79-b634-ea8bad51050a","resolution":{"observed_at":"2026-05-10T10:39:38.040670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2605.17295","last_updated":"2026-05-17T07:14:44Z","snapshot_observed_at":"2026-08-05T14:05:32.700721Z","submitted_at":"2026-05-17T07:14:44Z","title":"DISA: Offline Importance Sampling for Distribution-Matching LLM-RL","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T15:11:43.235574Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2605.17295"},"observation_digest":"sha256:ba91a40a884f10b982af7ff173ff8198b46e5e41885ab64d40dcc0fc0a0c937c","observation_id":"e5e3e00a-54c4-4420-88fc-74d3b10c6268","resolution":{"observed_at":"2026-05-20T15:13:24.864105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2605.23454","last_updated":"2026-05-25T06:33:52Z","snapshot_observed_at":"2026-07-06T23:33:39.204744Z","submitted_at":"2026-05-22T10:09:28Z","title":"ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T04:31:37.641598Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2605.23454"},"observation_digest":"sha256:2c783298001e30b1ea0d098596e5f4cb91dc92679ab32d715b6ef89aeeff3666","observation_id":"087dd9df-be03-46a5-a491-625313e27927","resolution":{"observed_at":"2026-05-25T04:35:21.594882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2605.23454","last_updated":"2026-05-25T06:33:52Z","snapshot_observed_at":"2026-07-06T23:33:39.204744Z","submitted_at":"2026-05-22T10:09:28Z","title":"ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T16:21:40.582248Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2605.23454"},"observation_digest":"sha256:b376860dbfb908fab4a9872108cd207ccaa62b60860a5238e1137de79641b1e4","observation_id":"85b190e6-9899-4bb1-95db-2d694c32d13a","resolution":{"observed_at":"2026-06-30T16:24:55.362639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"cited_work":{"arxiv_id":"2507.12507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12507","snapshot_observed_at":"2026-07-01T20:56:13.554863Z","title":"Scaling up rl: Unlocking diverse reasoning in llms via prolonged training.arXiv preprint arXiv:2507.12507","venue":null,"work_id":"dacc4e63-95a4-4ed7-8af2-3b6b4fc26994","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":226,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.12507","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:68ae35d79bbcd7cc66e4898fcf8b7fcedde96dc77c319d9f382cc16197daf886","observation_id":"373a9187-b9f6-4da7-8a24-f1581a8da92d","resolution":{"observed_at":"2026-07-01T20:56:13.556324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12507/citation-record","integrity":"/paper/2507.12507/integrity","json":"/paper/2507.12507/citation-record.json","paper":"/paper/2507.12507"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T16:51:41.308878Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.308878Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:38a3cce2ccec02cd98bb6a35928906495d553eca41adeabf0be22a196160d418","observation_id":"01702ac7-f90e-41df-ad01-e3366eed0b87","resolution":{"observed_at":"2026-08-06T16:51:41.308878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:51:41.379398Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.379398Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:2ed0e4c5ac7d184f3c133f7f3c7fc64f59338025a034ac49b620a509ab7bdb3f","observation_id":"b91c1ff4-f3e1-4e84-836e-c7ef764722fb","resolution":{"observed_at":"2026-08-06T16:51:41.379398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.505347Z","title":"Tang, Manan Roongta, Colin Cai, Jef- frey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"8ea19dd7-3abc-4a03-9b2b-2674f920f70e","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.478402Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:e6bd7d615df97707243e31bed33028b74a44c54e61d83fa720c7a4ca2b4e7127","observation_id":"9cd6446e-a56c-4d76-832e-a6d630ed29b0","resolution":{"observed_at":"2026-08-06T16:51:44.536753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:41.605352Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.605352Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:f6a86e8c3d8b383d22bf351475f104efb42dc7908e6e3feeb4697fe5fdd1b127","observation_id":"ae443173-a672-4bb6-87ec-464a477d3bef","resolution":{"observed_at":"2026-08-06T16:51:41.605352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-06T16:51:41.675432Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.675432Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:8285105c9a66bb8e56645c03cb2ca0fe10e67f6f233bd5bc104eba6dc58161d8","observation_id":"d72de7c8-7f04-4e43-b906-ee8f2bc20d39","resolution":{"observed_at":"2026-08-06T16:51:41.675432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:41.754532Z","title":"Scp-116k: A high-quality problem-solution dataset and a generalized pipeline for automated extraction in the higher education science domain, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.754532Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:8dd919cf7792d26a20d5243f779d21541120daf25c9978f7db4cc5204b82ffa0","observation_id":"e3eded81-4d23-4ab7-abbf-2568a743311f","resolution":{"observed_at":"2026-08-06T16:51:41.754532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.405240Z","title":"Reasoning gym: Reasoning environments for reinforcement learning with verifiable rewards, 2025","venue":null,"work_id":"507cb78e-1d45-4062-91e1-c6616f59fd0a","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.839172Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:dd03b2c33f3430e1f3bf2291831ef5a7e0b00b63c5436d688f9d06f8524660f6","observation_id":"b7202fe5-07b3-4c21-8477-6aec33c4b1fc","resolution":{"observed_at":"2026-08-06T16:51:44.440037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.330455Z","title":null,"venue":null,"work_id":"864119cd-92b9-4d57-97ef-8409a036de2c","year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.927847Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:dda40905acb135241cee0b43984f0cc62f4eaeb39be12013d978e72bf552a5e4","observation_id":"e2d45004-e28f-4f90-b895-4a4bf75b0781","resolution":{"observed_at":"2026-08-06T16:51:44.361140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:41.986503Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:41.986503Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:5003e33af237fd4d1550c78aafde87ea2a38ac27ad8d61c1ae39a4b69c31afdd","observation_id":"6c2e0656-9b38-4af2-8d61-d9e6fb88c713","resolution":{"observed_at":"2026-08-06T16:51:41.986503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T16:51:42.072510Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.072510Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:f701d9204d4b40f92343fca46af1c3bf591e3fac2e4e3b33ab343418cd8d2681","observation_id":"73910816-2529-43d4-ba57-7b29a62e8611","resolution":{"observed_at":"2026-08-06T16:51:42.072510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.132236Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.132236Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:366eea59586a40e67cb15297a1e54cf705847b9a1f6edf330c01709948450772","observation_id":"38a9ed1a-7369-4098-9a0b-75cbc62aa494","resolution":{"observed_at":"2026-08-06T16:51:42.132236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.235851Z","title":"Approximating KL Divergence","venue":null,"work_id":"d6717539-530f-47ca-ba7a-66e3425b3064","year":null},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.192659Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:fbc005b31df7339b97f5e68b47a6c484754ee0931bd3a95844a57da3b67bc7fb","observation_id":"44a62020-97b4-44bf-b019-693d73a66d65","resolution":{"observed_at":"2026-08-06T16:51:44.270150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.156787Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level","venue":null,"work_id":"54dac1a2-2ca8-4161-8f38-5fa6eceb4d89","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.236452Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:2b0e0f26db9b4298de1f9f297a4bab94d9b8b95c89ebba46bf7e6a3c4ed62a97","observation_id":"e9f94756-acd8-4fa3-9f76-d3a664121d0b","resolution":{"observed_at":"2026-08-06T16:51:44.190811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.092250Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":"6470f07a-6e09-4ef8-bb48-6f6d02bbe6ef","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.281094Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:e8eb9ec4c5a8253557f508f672e37f8fed447cee924eda1562077b977e0113e7","observation_id":"5036a461-add3-44f6-971b-82c784a0fff8","resolution":{"observed_at":"2026-08-06T16:51:44.120691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:44.047770Z","title":"Skywork open reasoner series.https://capricious-hydrogen-41c .notion.site/Skywork-Open-Reaonser- Series-1d0bc9ae823a80459b46c149e4f51680, 2025","venue":null,"work_id":"763358ba-b5ea-45c9-87bd-1dacb5dc180e","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.312913Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:fa91c87912120b8b94455a7955e2d107a631993edf77ec170fe47045a3cddce0","observation_id":"06296c41-5472-4ca1-a519-acb330813ae0","resolution":{"observed_at":"2026-08-06T16:51:44.066802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.859497Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"2fb8fe48-783a-4a21-927d-e6732f1585d0","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.366724Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:493853940cecfb54d2ae229a04e52881a4f442632638b022df27fb4976eedb27","observation_id":"9fb672b9-d13d-4e17-97ff-e2bb93fea91c","resolution":{"observed_at":"2026-08-06T16:51:43.928142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.428615Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.428615Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:3bddf78bac44d5ae5758e9d896414fd72a45213852b7b1019586c96919f9514c","observation_id":"1f6e9583-fd27-417e-ae19-f98d530e3e09","resolution":{"observed_at":"2026-08-06T16:51:42.428615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.767319Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient.https://hkust-nlp.notion.site/ simplerl-reason, 2025","venue":null,"work_id":"2b623820-b689-4686-b351-33e18751632d","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.481817Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:efd019522c89d8f7402d5241100d53493ce21c611b1bd52d61677cd73273a69b","observation_id":"4371198a-3b07-42c5-a489-2af2baca32d0","resolution":{"observed_at":"2026-08-06T16:51:43.806690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.668165Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"5a0d50c6-bd55-4e94-bd7e-1b7a198655c7","year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.511720Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:a3f0d68964428f2be7a257839c7cd6683c7ffc8536e91a679edda80b0892f8b2","observation_id":"9ec5ac18-d477-4187-bdce-9003b7eb8312","resolution":{"observed_at":"2026-08-06T16:51:43.711163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.583377Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"594969fd-eda6-4179-b477-bd9ebf86b324","year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.546714Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:47cb9f5c3161bd7be493027c5bab00f87ab326867d624abb009b3241204fb23a","observation_id":"62f2ad05-1b60-44e6-b401-05a5ffa833e7","resolution":{"observed_at":"2026-08-06T16:51:43.608952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.504066Z","title":"American mathematics competition - amc","venue":null,"work_id":"c16261c5-5779-481c-ab4e-ce3d86b66e59","year":null},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.576951Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:e001a339fecb583338b7cfc5aae0b0588307b8569fa85c3642ca40abef7f69aa","observation_id":"ea63ccc2-ada3-4e43-b86d-47132b004ac6","resolution":{"observed_at":"2026-08-06T16:51:43.543312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.599645Z","title":"Measuring mathematical problem solving with the math dataset, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.599645Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:537f0162f65cac94d384c931363e29b6a1097282127b0c4f7a4d1e4c704c11dd","observation_id":"c7028bb1-2669-48a3-b27d-c54cbecb0cb6","resolution":{"observed_at":"2026-08-06T16:51:42.599645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.633994Z","title":"Solving quantitative reasoning problems with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.633994Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:45fb380943532c4eed4089a517a13ebccf80103ff6ed38fde21ef682da9d0c36","observation_id":"bde776d0-36a9-4c99-a458-dfee812f1963","resolution":{"observed_at":"2026-08-06T16:51:42.633994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.657244Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.657244Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:89523cf05a8679cf04dc7bde2807d4a4b37af11ad28738ffe7436eba05900a22","observation_id":"58383f93-4bd2-4994-9394-11a5d15a3604","resolution":{"observed_at":"2026-08-06T16:51:42.657244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.719030Z","title":"Measuring coding challenge competence with apps, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.719030Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:a4fbc6f8926ec4e04a712579e4d089f70cd115c145de7d06c6c66dcb23d2e2cb","observation_id":"43299953-156f-4e44-91f1-fd7833a838ea","resolution":{"observed_at":"2026-08-06T16:51:42.719030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.778292Z","title":"Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.778292Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:6cd6f97556b465d1f9c6aece78941839325fdf7630f51884ea316ffe115e7d7f","observation_id":"31cdb266-0bbe-4b21-ba0e-157ff5892789","resolution":{"observed_at":"2026-08-06T16:51:42.778292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.831655Z","title":"Taco: Topics in algorithmic code generation dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.831655Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:c02909ac55a046fd7e11da0dce1838a584c700c2559f9be28d345bce70b1de8e","observation_id":"12403a07-828b-4577-9316-ef7bc464d2d8","resolution":{"observed_at":"2026-08-06T16:51:42.831655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.383851Z","title":"Is your code generated by chatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"76494209-bdc1-487b-8a1c-3d1793a11011","year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.871217Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:bf8cfd79f85f4fbaf863760f4e0a6136bf38fb435f25c7fcee8a95a8c55edf88","observation_id":"98a14543-e3ae-4cb7-bccf-8b9d918c770c","resolution":{"observed_at":"2026-08-06T16:51:43.418470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.887053Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.887053Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:6b8ea65d83abca530f7cb0c728e6b88dac61a91902f25fc95ecde61d7d1e236d","observation_id":"ae44f13a-84c5-4e58-82bc-276933a6febe","resolution":{"observed_at":"2026-08-06T16:51:42.887053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.908581Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.908581Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:8a92cf3f82c70ac03d2577e413e3f99fe6477f434efccebd06bfc954fc10541e","observation_id":"202e4379-5d88-4739-af38-9804f644e500","resolution":{"observed_at":"2026-08-06T16:51:42.908581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:42.984504Z","title":"Online difficulty filtering for reasoning oriented reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:42.984504Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:18abd141211ac43f44049b9f86b98d3a9465e6e445489e3c7e1ff5fb613f6bde","observation_id":"e0df78d3-4be0-4360-8fef-94fdf4fc1630","resolution":{"observed_at":"2026-08-06T16:51:42.984504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.316254Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"414f5bf0-a0d9-4ff7-966a-973fe72993a1","year":2023},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:43.036697Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:1832820f1268d2db3c654b783dc5a92044f137af6b4ca2fac7074a17221d6cc0","observation_id":"bba4a0ec-2391-4fa3-a991-b13230e25b7a","resolution":{"observed_at":"2026-08-06T16:51:43.341473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:43.252671Z","title":"The curious case of neural text degeneration, 2020","venue":null,"work_id":"56a531a0-a04b-4c14-b969-bfe374da73d5","year":2020},"citing_paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:43.099838Z"},"links":{"citing_paper":"/paper/2507.12507"},"observation_digest":"sha256:ba389d2d2d1b1f36935b338219add023ce0a8547400c36f974c72d9923034356","observation_id":"3573b1db-f3f2-4d53-8cdc-f1b92d7d675d","resolution":{"observed_at":"2026-08-06T16:51:43.283087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12507","last_updated":"2025-07-16T17:59:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T16:42:47.936886Z","submitted_at":"2025-07-16T17:59:24Z","title":"Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 9 inbound Pith citation observations for arXiv:2507.12507."}