{"as_of":"2026-08-08T04:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72284d5de9bbe85797da3154a398e6aac229078a48b4210c53fd76638e3ff578","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:03.887091Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:35.392271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:09:44.995719Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-07-04T10:09:44.995719Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning.arXiv preprint arXiv:2506.01096, 2025a","venue":null,"work_id":"610cb02e-4ce1-409c-8693-5312275e2e86","year":2025},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:54f2c582bb4704fc08a67f1087c94e4779e1c47c5ef2b43097bed59239bcabd8","observation_id":"90be6e53-f651-415a-b8a1-e2b32ae7e8e1","resolution":{"observed_at":"2026-05-19T01:16:56.964027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-08-04T16:07:35.392271Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:35.392271Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:5e2a402b3119f354df8b5e79157719022885a702b50fccb3b095338aa1c58492","observation_id":"610758d7-d080-41fe-9881-233359ab642e","resolution":{"observed_at":"2026-08-04T16:07:35.392271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-08-03T04:22:10.295612Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-05T16:17:49.573679Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.295612Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:f55fc09a7e91bf9957695123c96653cabc1810d609488ca72a4c301d048af9f1","observation_id":"a2667e53-be8e-46f9-981c-14079b6fe28c","resolution":{"observed_at":"2026-08-03T04:22:10.295612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-07-04T10:09:44.995719Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning.arXiv preprint arXiv:2506.01096, 2025a","venue":null,"work_id":"610cb02e-4ce1-409c-8693-5312275e2e86","year":2025},"citing_paper":{"arxiv_id":"2604.23747","last_updated":"2026-04-26T14:53:48Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T14:53:48Z","title":"SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T06:44:34.968571Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2604.23747"},"observation_digest":"sha256:4288ca5c8daeeff471cf703f05a3d3cd6ffb05001edd0851006f3a488dddbe39","observation_id":"57240f1c-a150-40d6-ae3d-47b02cb56f43","resolution":{"observed_at":"2026-05-11T21:06:14.394139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-07-04T10:09:44.995719Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning.arXiv preprint arXiv:2506.01096, 2025a","venue":null,"work_id":"610cb02e-4ce1-409c-8693-5312275e2e86","year":2025},"citing_paper":{"arxiv_id":"2605.15012","last_updated":"2026-05-14T16:12:30Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T16:12:30Z","title":"Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T03:18:26.590871Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2605.15012"},"observation_digest":"sha256:86d79842ef85909259e4df9f9d21463f9b5b89c484a3dccc218bcef4afc172da","observation_id":"cd5e782a-7809-47d7-a165-0c67046e81f1","resolution":{"observed_at":"2026-05-15T03:19:43.113819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-07-04T10:09:44.995719Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning.arXiv preprint arXiv:2506.01096, 2025a","venue":null,"work_id":"610cb02e-4ce1-409c-8693-5312275e2e86","year":2025},"citing_paper":{"arxiv_id":"2606.09932","last_updated":"2026-06-07T17:58:58Z","snapshot_observed_at":"2026-07-06T23:49:12.754871Z","submitted_at":"2026-06-07T17:58:58Z","title":"When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T18:49:47.876179Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2606.09932"},"observation_digest":"sha256:ba2d204c9d29b6a5134c79f11ccc3f7bb43d524c20a88f59f4e809cfe3260e0a","observation_id":"f2aca1d8-0c27-43b2-9113-1b2e1dc0225e","resolution":{"observed_at":"2026-07-02T22:27:26.464680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-07-04T10:09:44.995719Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning.arXiv preprint arXiv:2506.01096, 2025a","venue":null,"work_id":"610cb02e-4ce1-409c-8693-5312275e2e86","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:85f1050b83a179216f7dd6be7989ab9858fd92c29b1f5452753a7d1dd9f752cc","observation_id":"92ee178a-556f-4350-8c19-7bb3efef8f13","resolution":{"observed_at":"2026-07-03T20:38:56.058157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-07-04T10:09:44.995719Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning.arXiv preprint arXiv:2506.01096, 2025a","venue":null,"work_id":"610cb02e-4ce1-409c-8693-5312275e2e86","year":2025},"citing_paper":{"arxiv_id":"2606.23678","last_updated":"2026-06-22T17:58:54Z","snapshot_observed_at":"2026-08-07T05:35:38.415603Z","submitted_at":"2026-06-22T17:58:54Z","title":"AIR: Adaptive Interleaved Reasoning with Code in MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T09:06:38.001604Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2606.23678"},"observation_digest":"sha256:88126db9a9e6db0ebb097a0555a37117a37f23922ad048e2b65960a865088117","observation_id":"5323e6c5-86e5-44d6-a07b-b521c3fe5daa","resolution":{"observed_at":"2026-07-04T10:09:44.997118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01096/citation-record","integrity":"/paper/2506.01096/integrity","json":"/paper/2506.01096/citation-record.json","paper":"/paper/2506.01096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.083828Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.083828Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:a54ba2f4f2d1c78aa6b98565b3ba09134a352aa7381dd662ab818d5af95946c5","observation_id":"befbb2e6-afc4-4ca6-b717-624346b3f37c","resolution":{"observed_at":"2026-08-07T11:55:03.083828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T11:55:03.113151Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.113151Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:c3827c50da395fbc71360905b3910170aeeef8f4dc0e3050145d78a6e1b63f52","observation_id":"b64567fd-2c6f-4e78-b336-93790fcfb5c4","resolution":{"observed_at":"2026-08-07T11:55:03.113151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.137006Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.137006Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:f10741f929695f1181cf2363fa3b30563d89501bb2540e19928a784eedef8fb8","observation_id":"22df4bdb-0ecf-42fe-9f2a-95eebf2250fd","resolution":{"observed_at":"2026-08-07T11:55:03.137006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10001","last_updated":"2023-06-01T05:38:00Z","snapshot_observed_at":"2026-08-07T18:44:16.941060Z","submitted_at":"2022-12-20T05:20:54Z","title":"Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10001","snapshot_observed_at":"2026-08-07T11:55:03.162009Z","title":"Towards understanding chain-of-thought prompting: An empirical study of what matters","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.162009Z"},"links":{"cited_paper":"/paper/2212.10001","citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:0e580547a51fb4ae058adc8aef67f7aaccb1b47b1702a030e1c68024ef6b3913","observation_id":"e489ebc3-cc2f-4070-8a70-64637c89b932","resolution":{"observed_at":"2026-08-07T11:55:03.162009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T11:55:03.190168Z","title":"Automatic chain of thought prompting in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.190168Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:3fad69cd3cc9db05a1538c86b8f285bfe953f4e55510a1a0efe0d9f2fdad9b25","observation_id":"bcd4c7a1-78ae-496b-8327-50f9e70e0ea2","resolution":{"observed_at":"2026-08-07T11:55:03.190168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09267","last_updated":"2024-04-21T01:45:34Z","snapshot_observed_at":"2026-08-07T12:16:15.023650Z","submitted_at":"2023-08-18T03:12:59Z","title":"GraphReason: Enhancing Reasoning Capabilities of Large Language Models through A Graph-Based Verification Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09267","snapshot_observed_at":"2026-08-07T11:55:03.225522Z","title":"Graphreason: Enhancing reasoning capabilities of large language models through a graph-based verification approach","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.225522Z"},"links":{"cited_paper":"/paper/2308.09267","citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:c8f4a265054747b4e04e66823c7bdca2b655ab6aa7a2d2b03114c5978820f06a","observation_id":"28964c46-5547-4cfb-9622-825fff163593","resolution":{"observed_at":"2026-08-07T11:55:03.225522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.258257Z","title":"A survey on test-time scaling in large language models: What, how, where, and how well?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.258257Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:fec4a005ff38e1be7b14e9fb57b2f318789772b8d7191594c87048e5c9bc199f","observation_id":"94df85cb-db32-452c-8c20-7f5a5de93bd6","resolution":{"observed_at":"2026-08-07T11:55:03.258257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:55:03.285532Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.285532Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:5802389bb81f6f88db514403fbb125214490682f83d85b34054f6f7b4df64b32","observation_id":"9338ddea-c370-4b9f-9e52-7648c2347d4a","resolution":{"observed_at":"2026-08-07T11:55:03.285532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.314686Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.314686Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:f65c0dc2ebba813cbd87136eec94db4ec14e082b10118eff483c1b66fccb1c11","observation_id":"21414b3c-ceb8-4ef5-bd79-08a078c9f758","resolution":{"observed_at":"2026-08-07T11:55:03.314686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.594011Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":"d1fcd165-9607-4f1c-97eb-b336872da396","year":2017},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.334322Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:caf58ccd219623c9ee39ad21feb627b37c547d8bebd9b916ba38afa4cbc6a153","observation_id":"a969b981-7b64-4289-ba12-3d61c909853d","resolution":{"observed_at":"2026-08-07T11:55:04.617153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.363724Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.363724Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:b6886874ec5821b472b3a88b39f941426aa22dcbe46c0d02a8733b470e1d2fe6","observation_id":"03d3db60-1000-4849-9aa6-25c1a68c462d","resolution":{"observed_at":"2026-08-07T11:55:03.363724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.392816Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.392816Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:05067eefce29afc9bc9b6825468d328b8464d670832c4b4555fbe9e4c0145bde","observation_id":"307598cd-6566-4d6d-913e-09f248b5ed0a","resolution":{"observed_at":"2026-08-07T11:55:03.392816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.418313Z","title":"Hindsight experience replay, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.418313Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:1b56bf4e66579a2a43f8e1e06d031501d69b8f8f3b8f83f208efc606855c96ce","observation_id":"8ff2667a-f840-4707-9cb1-31dfb2a487bb","resolution":{"observed_at":"2026-08-07T11:55:03.418313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.517933Z","title":"Stanley, and Jeff Clune","venue":null,"work_id":"f6d368c0-8c6b-436d-883d-4c9f403360f3","year":2021},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.444735Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:0f7958c3544849c5649d4180d8e85c6eddb37e6f4582223592692ad55ff467da","observation_id":"abc38dc6-2f94-494e-b86a-b65268e36b42","resolution":{"observed_at":"2026-08-07T11:55:04.539004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.461762Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.461762Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:09ba4d39e46bb9338a4865e3f6f69dfd60dce2cf667efc0cb5fc7de1394d807e","observation_id":"5290c543-ebdb-4740-bab8-1459b4cd6b8b","resolution":{"observed_at":"2026-08-07T11:55:03.461762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.478502Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.478502Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:c20ff9c49c221d12591ae3197d82ed67cf0e2cf16ee42d73e1574b1b3f08273f","observation_id":"66b64877-5f87-45f8-9fc2-d3921434baa7","resolution":{"observed_at":"2026-08-07T11:55:03.478502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.503125Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.503125Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:400427bc1428fb89e9aef14d36cf29de4ad8bbda6b53a4e202026a1ad150dd59","observation_id":"b3c40d56-544e-4eb5-9c02-248ecbc58e44","resolution":{"observed_at":"2026-08-07T11:55:03.503125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.525409Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.525409Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:d3d7cfd7a59bb6e20934aa095a80b44403e66d2d3b2138ad84e40433d92c8f4b","observation_id":"a4f97168-a213-4f81-b3c9-2d302dc6a4ad","resolution":{"observed_at":"2026-08-07T11:55:03.525409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.549531Z","title":"An empirical study of catastrophic forgetting in large language models during continual fine-tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.549531Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:aca4b3961e0a0ebd7f6cb6efdb3bec6a2fe54b139dd304b65d697965719d4e95","observation_id":"cf41f148-c6c9-49c2-8ced-fc8de2eb4132","resolution":{"observed_at":"2026-08-07T11:55:03.549531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.424683Z","title":"Understanding catastrophic forgetting in language models via implicit inference, 2024","venue":null,"work_id":"48629b9e-8fc7-4421-bc4d-ff5329d511b2","year":2024},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.569493Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:a22243002c74b57ef62162fb9ae79d87e9b0964b4286ce61ba236bc4f6e347ae","observation_id":"306ca55a-8977-4c43-b068-e7ae00219c95","resolution":{"observed_at":"2026-08-07T11:55:04.448228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.365921Z","title":"Mitigating forgetting in llm supervised fine-tuning and preference learning, 2025","venue":null,"work_id":"1ecc21ea-f149-47f3-8346-b834c5edefa6","year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.597604Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:a30c1593af894dbfe8faf238baf324c7108da2f70f38e82184a5cc563e227e23","observation_id":"8fa6a720-8bdc-4362-8e8c-d8a6ea5fc475","resolution":{"observed_at":"2026-08-07T11:55:04.390818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.314501Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025","venue":null,"work_id":"578269c3-f999-4813-89b6-afe3121a6ed8","year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.612392Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:28f61eb9c3d9ca2b1c023ba703c544290eb1e0bee58dfdca305e0bda5a8fb5fa","observation_id":"7760956e-231c-420d-9098-dd4431ee79b7","resolution":{"observed_at":"2026-08-07T11:55:04.329093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.259752Z","title":"Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynam- ics, and success amplification, 2025","venue":null,"work_id":"ed5984c9-eeb8-40d7-86bd-3d8145c3f874","year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.639324Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:ed8e92ee144895e52fb07e824985b7bac815724806e406d308f56aa1a2e40447","observation_id":"c994f4fb-60e2-4653-a303-8b40efe3183d","resolution":{"observed_at":"2026-08-07T11:55:04.276059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.659964Z","title":"Rlhf workflow: From reward modeling to online rlhf, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.659964Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:964f93fdee8f4f2879144ac10941fdfad19c5eca4df3b49946812ce85e9ae48a","observation_id":"f531e55b-b3be-4cf7-a260-6a016059b088","resolution":{"observed_at":"2026-08-07T11:55:03.659964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.200446Z","title":"Crowder, Darrien M","venue":null,"work_id":"75b86c78-05d7-42c4-93ab-189dc71d3b4a","year":2024},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.678865Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:72e3426fb84da64c130829ad90d5031db26df4a8e8afba5bedf9d90f53196f7d","observation_id":"7fb36c3a-5c5a-4138-b997-813bbe4ba6ef","resolution":{"observed_at":"2026-08-07T11:55:04.220507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.696541Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.696541Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:4dd65bb83fde453a12730249d1def1ed5b9135f1bd113d39a416cdf64f4b314c","observation_id":"b572a305-ed7f-472d-8378-deeb0e62d57e","resolution":{"observed_at":"2026-08-07T11:55:03.696541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.714451Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.714451Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:f3790580959d951ea1fdbdab0e6ff13709b32756c70e1b4170c006a2572d7476","observation_id":"f13cb632-7ea4-4904-b1d0-f366d20484a3","resolution":{"observed_at":"2026-08-07T11:55:03.714451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.139033Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":"9e7e76a1-ff08-46c4-bfb4-efe1517b5e19","year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.744487Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:0132a684a6b4d869b3ef56e059bffd2f84071772c2197114c00bc05bc87d0db5","observation_id":"d2ca067d-23e6-4fbe-8ca9-5a00079695ab","resolution":{"observed_at":"2026-08-07T11:55:04.160449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.769727Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.769727Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:48d298aa104dfe30381248393e96316c4aa0cb73a28d224f2a24546a41fb44db","observation_id":"7c5fd51e-0392-4108-80d5-b889e39e837d","resolution":{"observed_at":"2026-08-07T11:55:03.769727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.797022Z","title":"Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.797022Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:1d64252c47067d8701e388e93426c4a68c0a59f8db3bc3986e71a0157b317368","observation_id":"2d5c1627-49cc-48f1-b045-a3fb593e2a90","resolution":{"observed_at":"2026-08-07T11:55:03.797022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.817483Z","title":"Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.817483Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:76c06f7adaba9f4e82c7a51b55bdcdfbf1e34d614286d438db57373859c92459","observation_id":"434d5553-358d-418f-bc3a-f4b96d842bf7","resolution":{"observed_at":"2026-08-07T11:55:03.817483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:03.834330Z","title":"Limo: Less is more for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.834330Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:c1030d15765e10ef877647d37ba0fbf974d48afc9a9591118e8cb2c4f1cf86d0","observation_id":"cffc18b3-eda4-484a-b3b8-37a3de341bae","resolution":{"observed_at":"2026-08-07T11:55:03.834330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.054847Z","title":"Hitab: A hierarchical table dataset for question answering and natural language generation, 2022","venue":null,"work_id":"8b6d0741-bf82-4868-a0f7-3085ebd90dc0","year":2022},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.864678Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:09f1ee55e8bbac72574448e633ed1ea10fbf8fb44a3f7175ed72a77f2940624b","observation_id":"a69a6886-5641-4d42-a851-a7db21a2cc25","resolution":{"observed_at":"2026-08-07T11:55:04.073692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:04.003380Z","title":"Let’s think step by step and output the final answer in boxed{}","venue":null,"work_id":"d8b21441-6ac2-47d7-8799-ce872b3108f8","year":2024},"citing_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:03.887091Z"},"links":{"citing_paper":"/paper/2506.01096"},"observation_digest":"sha256:309aed501fc050c13330a9d13666e6739b8c8353de3e7ee6d64a9fa306b5962a","observation_id":"d6d5564e-2666-4335-8238-642123a62d77","resolution":{"observed_at":"2026-08-07T11:55:04.023395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:48:21.020886Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 8 inbound Pith citation observations for arXiv:2506.01096."}