{"as_of":"2026-08-08T17:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5e61a6a9a61d24ee80bd3d645de77a921ba345f3e1dcd014abd0433b1a05df2","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:26:48.296848Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:53:10.631113Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:08.075019Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-08-04T10:53:10.631113Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.631113Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:0d92f66711e08cd121e0869d5d67b369fce9df9028c99fb7424dbe694f944133","observation_id":"63ed6416-f211-42d3-8ae8-6792164f8643","resolution":{"observed_at":"2026-08-04T10:53:10.631113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-03T01:58:39.053103Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T17:58:38.234197Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:ffd3629161a6bde9615d3afb755a2405ac328725612aaf3d2b82b312e835dff5","observation_id":"e5a95a1a-5436-40a1-9875-db81b3a9ba99","resolution":{"observed_at":"2026-05-09T06:55:42.926347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-03T01:58:39.053103Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:09:39.645781Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:f4c69f8505c09346355de0b3ab1077b5e816493e565ceaf7c341d4dd16963ebd","observation_id":"da54ada4-7c1f-4b5b-8944-c9de425040ab","resolution":{"observed_at":"2026-05-11T03:55:54.508842Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-03T01:58:39.053103Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T17:32:34.585808Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:c8726338317019c162b1caf398e4cf09ad538321480b22ae372a6cc2d3d71acb","observation_id":"da2a00c6-4e88-4cb1-998e-660119840990","resolution":{"observed_at":"2026-05-19T17:32:41.453150Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.11636","last_updated":"2026-05-12T06:58:35Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:58:35Z","title":"Seir\\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:49.761472Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.11636"},"observation_digest":"sha256:20867b40a7d54881d0b556ced4a002b21b5ad03cbd27148c1b0656fa319bfdc2","observation_id":"50102c52-6333-46ce-867d-49c934cbcc78","resolution":{"observed_at":"2026-05-13T01:22:01.670232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.21467","last_updated":"2026-05-20T17:53:09Z","snapshot_observed_at":"2026-08-02T18:02:44.990875Z","submitted_at":"2026-05-20T17:53:09Z","title":"DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-21T05:24:46.545570Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.21467"},"observation_digest":"sha256:8d98adee32483fcd4d59c3e207cf4cee7704133c72f3d7963f9d906f00a6c6da","observation_id":"48091707-a566-4411-ab25-00bddaffb930","resolution":{"observed_at":"2026-05-21T05:29:40.154298Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.22567","last_updated":"2026-05-21T14:47:52Z","snapshot_observed_at":"2026-07-06T23:32:54.127514Z","submitted_at":"2026-05-21T14:47:52Z","title":"LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-22T06:19:44.377733Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.22567"},"observation_digest":"sha256:4d1566f96ca10ce577cec1a441d7d72c3253233241d1818beb5c1ba2e6ffd4f4","observation_id":"604f0662-faf6-49e7-87a6-41b31def1ce5","resolution":{"observed_at":"2026-05-22T06:21:10.335384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2606.13680","last_updated":"2026-06-11T17:59:52Z","snapshot_observed_at":"2026-07-06T23:52:23.981568Z","submitted_at":"2026-06-11T17:59:52Z","title":"Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T06:30:55.592334Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2606.13680"},"observation_digest":"sha256:2eeeef54ddc6105c5e67cb6947172a77cf434e885dab95c965f29bce3855066a","observation_id":"102dbb83-68ec-464a-a929-a3df65e0e30e","resolution":{"observed_at":"2026-07-03T15:28:33.912680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:9e9c4f96ae3113aa37b875ad6e5d74bbf29d0128e87083292526ab34cb89572b","observation_id":"5093c845-1be9-4bd5-a621-1039b93d1e57","resolution":{"observed_at":"2026-07-03T20:48:56.192377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-02T04:58:05.165698Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:15.784610Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:d7cabdeac7e5b017e64fbf2c190e7bb90795a2ad7cac38af818ccde0baf608ab","observation_id":"49501d2a-a3eb-4771-bbb5-a115b9e2e2b4","resolution":{"observed_at":"2026-07-04T20:00:08.076804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-02T04:58:05.165698Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T05:29:21.598397Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:829b3b232a86bc1f1900d0f9fc0f49cb82d717fbe2115c0e02c951917c6d5863","observation_id":"e162964d-6e0c-4a53-96a2-b7f75a8d13c6","resolution":{"observed_at":"2026-07-04T13:09:50.539506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-08-01T12:54:36.127455Z","title":"Stephint: Multi-level stepwise hints enhance reinforcement learning to reason","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-07T08:18:38.032175Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:36.127455Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:b0661fcbfab53243c0c6b540434bbea752a9ed84b17c9e1a56079d5cac4c2692","observation_id":"7b0118de-0224-4485-af04-c1dad64f514f","resolution":{"observed_at":"2026-08-01T12:54:36.127455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02841/citation-record","integrity":"/paper/2507.02841/integrity","json":"/paper/2507.02841/citation-record.json","paper":"/paper/2507.02841"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T20:26:45.550459Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.550459Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:0c2112064b7897e7dec1066a817d78ef69fa29a598e4f5054143250c73b08582","observation_id":"53902c7f-ceaa-4cd8-ae04-df45ca4878b2","resolution":{"observed_at":"2026-08-06T20:26:45.550459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T20:26:45.878265Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.878265Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:0871f096f9198f57eff9eedb480ca053b06ca86f400735b26e43180afd4aa63b","observation_id":"657f7dfc-fbbc-40ff-9958-12be451463f3","resolution":{"observed_at":"2026-08-06T20:26:45.878265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T20:26:46.011935Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.011935Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:2ae6a07fbdc63159366cf8e63f626a3b8d4699b1f8197cd7d8fb52d2fbf818b9","observation_id":"93a0d590-15ee-4f88-9130-d17931502e63","resolution":{"observed_at":"2026-08-06T20:26:46.011935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-06T20:26:46.372789Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.372789Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:49eafd123d7d7c9de35cf19d219f59055f2c518f926abfdf15de5227545a59b1","observation_id":"5086abbf-6a0c-47bf-89e1-13bc93dfb8a8","resolution":{"observed_at":"2026-08-06T20:26:46.372789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T20:26:46.458931Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.458931Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:856dbf080852cc19f4df317d027273959ac27f32e4a67d9bc42183cba24ba3eb","observation_id":"806c79e2-5a96-4689-90ea-3f25cfc6655e","resolution":{"observed_at":"2026-08-06T20:26:46.458931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T20:26:46.553671Z","title":"Open-reasoner- zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.553671Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:e42ad1a46f3085ba2ebba8c96e930fc15b196e18f4eaaa22f4076241cb3615e3","observation_id":"b383e2a9-380d-49a0-bf16-fe6abb213d44","resolution":{"observed_at":"2026-08-06T20:26:46.553671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T20:26:46.651273Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.651273Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:942cabd9e2e224e8eb986f067a99fc7651e610e090816a37b77fc822677ccfdf","observation_id":"200c78f7-87fc-4304-90aa-fd1b3003eee1","resolution":{"observed_at":"2026-08-06T20:26:46.651273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T20:26:46.745830Z","title":"Under- standing r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.745830Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:f39046f700fb9b8c9c92e964edd8ee8b3008ce84d086d91703a58b628ee14082","observation_id":"6ac67542-5f34-49c7-b98a-53504476c0d9","resolution":{"observed_at":"2026-08-06T20:26:46.745830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-07T13:00:02.187580Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-06T20:26:46.857127Z","title":"David JC MacKay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.857127Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:a0c8d1e80ecd77273ce5ead7b5caab170af4e55ee5eaad245ac6c32fbbab9392","observation_id":"c1e0f7d7-0436-40f6-9d38-34d50fec9880","resolution":{"observed_at":"2026-08-06T20:26:46.857127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:48.603795Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"a6474cae-d9ed-4cd2-8821-d0b92e8834cf","year":1928},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.065513Z"},"links":{"citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:563036c87f6d331013eeb225aba9012aca79dbdb477d23f7b1e59d5bff43c8f0","observation_id":"7aaf876e-1be8-4460-aac9-ebda4c7a5c30","resolution":{"observed_at":"2026-08-06T20:26:48.607497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-08T15:29:26.223468Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T20:26:47.156279Z","title":"Trust region policy optimiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.156279Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:520e111a91ece2f832b1d2dfb178520eab5dac57df2ec964133ca97e885e8dd1","observation_id":"1f6ef865-02fe-46fb-a6e1-f9f437debb17","resolution":{"observed_at":"2026-08-06T20:26:47.156279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T20:26:47.348775Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.348775Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:0ced39f280c135090a9c73c9c63d2f71a560a403279fb91f690ac89ba9243f8e","observation_id":"70addeb1-6245-49eb-9b54-4269a32733bd","resolution":{"observed_at":"2026-08-06T20:26:47.348775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T20:26:47.488611Z","title":"github.io/blog/qwq-32b/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.488611Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:3d97e124cc98aaea4b53ac54599fd4268af0493829627b85c5f85cdf52acd61c","observation_id":"93f8688a-5a95-4f2c-8ade-b482b719f4a2","resolution":{"observed_at":"2026-08-06T20:26:47.488611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18478","last_updated":"2025-06-02T14:26:19Z","snapshot_observed_at":"2026-08-07T01:30:44.496004Z","submitted_at":"2024-11-27T16:19:00Z","title":"Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18478","snapshot_observed_at":"2026-08-06T20:26:47.740169Z","title":"Be- yond examples: High-level automated reasoning paradigm in in-context learning via mcts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.740169Z"},"links":{"cited_paper":"/paper/2411.18478","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:8b86d71157e29f0960992150ce5dfcc25a701cf2892082be5213553bd44a84bd","observation_id":"1fcf59b5-b3a2-4d95-ab77-06c710e09d8c","resolution":{"observed_at":"2026-08-06T20:26:47.740169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-06T20:26:47.836925Z","title":"Learning to reason under off-policy guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.836925Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:c044a8b04fc62abc765ec0a4268204ee58eaf59daef27b395465b2df9d7c344d","observation_id":"1a7f977f-f13f-4f48-a2e8-ee4c534fe2b4","resolution":{"observed_at":"2026-08-06T20:26:47.836925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T20:26:47.918660Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.918660Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:ad85bb3f7128e9edaae48ef5dbefe542a8c5086848190b6790179fa4ebafe363","observation_id":"188137c9-c0d6-41d2-bfc0-301584891c98","resolution":{"observed_at":"2026-08-06T20:26:47.918660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T20:26:48.035446Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:48.035446Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:b89fdf61156ab658c1b500e65fb427061669756171163adee58eadaebb51743a","observation_id":"3148fa1c-30e0-4b98-acfb-40c08c2a5224","resolution":{"observed_at":"2026-08-06T20:26:48.035446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T20:26:48.085634Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:48.085634Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:29c24458ec3da34f7ba6aa3d39603fe47764c55b2b7abf17beca3593c88e0146","observation_id":"1551ff57-ec59-4a4b-b813-29883e73e219","resolution":{"observed_at":"2026-08-06T20:26:48.085634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T20:26:48.151553Z","title":"Simplerl-zoo: Investigat- ing and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:48.151553Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:472bffa7142d01f3a0773028afadf482e70b4a74d54280c531886c3cf726a74c","observation_id":"59db289d-0fdf-468d-b436-3c737347f318","resolution":{"observed_at":"2026-08-06T20:26:48.151553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:48.594175Z","title":null,"venue":null,"work_id":"6639c1dd-ff66-49dc-9faa-16212612c714","year":2003},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:48.296848Z"},"links":{"citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:cd175661c2087c4b56fb0201e5a13460b0237eb74d851601a324b3600b955608","observation_id":"23ad57c4-f146-45a3-9a69-58be11b90cb3","resolution":{"observed_at":"2026-08-06T20:26:48.597951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T20:26:47.242484Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":1948,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.242484Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:dcb17559ea983621f2337608a476002a9519b53ae30925b8f80c75dedbd72869","observation_id":"26de7637-ffdd-4a6c-869b-47c3972b6a63","resolution":{"observed_at":"2026-08-06T20:26:47.242484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14830","last_updated":"2024-02-16T23:44:38Z","snapshot_observed_at":"2026-08-01T01:16:04.260529Z","submitted_at":"2024-02-16T23:44:38Z","title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14830","snapshot_observed_at":"2026-08-06T20:26:46.985350Z","title":"Orca-math: Unlocking the potential of slms in grade school math","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.985350Z"},"links":{"cited_paper":"/paper/2402.14830","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:3d301fc384177005c4fe97afce9559242ce5502dceac9812c8c09afddf696168","observation_id":"7c032893-f8dc-4e88-9ad2-bbd2e931f2cd","resolution":{"observed_at":"2026-08-06T20:26:46.985350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T20:26:45.633252Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.633252Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:905af0c92ec6dc4831c34e441ed5e500884d936c8641e5622d427523aa8576f5","observation_id":"42f467dd-ab2f-4c2b-8753-a8a7af1b99b5","resolution":{"observed_at":"2026-08-06T20:26:45.633252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-06T20:26:45.833877Z","title":"Rea- soning with exploration: An entropy perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.833877Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:876ee4ae135df59c8267ee1d3c870730c9b5c92067f2dcc868b3db27a9012415","observation_id":"b04e2f4d-a1b8-467c-8b58-6f70f84d6524","resolution":{"observed_at":"2026-08-06T20:26:45.833877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17120","last_updated":"2024-10-29T17:02:45Z","snapshot_observed_at":"2026-07-06T17:09:19.909685Z","submitted_at":"2023-12-28T16:55:40Z","title":"MathPile: A Billion-Token-Scale Pretraining Corpus for Math","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17120","snapshot_observed_at":"2026-08-06T20:26:47.613196Z","title":"Generative ai for math: Part i–mathpile: A billion-token-scale pretrain- ing corpus for math","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.613196Z"},"links":{"cited_paper":"/paper/2312.17120","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:5d5602d9cc48979e80c8950f4479a8a2f3823e341c0c0334dd0321bf5af77b05","observation_id":"91e9def5-e837-48b2-b972-09dd171b7349","resolution":{"observed_at":"2026-08-06T20:26:47.613196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:26:46.134022Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.134022Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:67ed4e7b89987e98b9de36ab48981859a3568326787c3d0ac59496c8e3ff5f10","observation_id":"06f84943-4e26-4301-82be-f15ef631ab84","resolution":{"observed_at":"2026-08-06T20:26:46.134022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:26:46.255880Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.255880Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:1f30b0c99b06c879323b65517a11f3c6bbbc5ee15ba599d268a262b1d1f4285f","observation_id":"5f09d8f1-7c70-4020-8387-322b242215ba","resolution":{"observed_at":"2026-08-06T20:26:46.255880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T20:26:45.719770Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.719770Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:97510e796e790688cb95f94aa4bdb06545c6a2d57a76c4b82ee8752da20cde1e","observation_id":"98de604d-3fd3-4c47-9df0-62ca1eb1dfdc","resolution":{"observed_at":"2026-08-06T20:26:45.719770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T01:31:50.364254Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 12 inbound Pith citation observations for arXiv:2507.02841."}