{"as_of":"2026-08-22T08:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95d0c215a8fd967d7640722d9912d71b342a0b4a0732b0a93b13eed33bdf9b33","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:57:45.104367Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:47:16.811511Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:48:56.162598Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-08-03T19:38:20.902182Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-13T20:04:46.001790Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T19:38:20.902182Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:e18f044c5b456fb94f7d51d61ca42ae568b4b876bbc0f02e3d57534eb631566b","observation_id":"6bae0d82-242d-44fe-b444-564415b7a378","resolution":{"observed_at":"2026-08-03T19:38:20.902182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-08-04T06:47:16.811511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-13T20:04:46.001790Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.811511Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:65e9d8f8efac3be15b2b33692eea9cb7e4c30f6b8a5b678b285261100f03863e","observation_id":"f658452d-372c-446c-8f25-3536e859720a","resolution":{"observed_at":"2026-08-04T06:47:16.811511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":"2509.06923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-07-03T20:48:56.162598Z","title":"Staying in the sweet spot: Responsive reasoning evolution via capability-adaptive hint scaffolding.arXiv preprint arXiv:2509.06923, 2025","venue":null,"work_id":"3b7ceaaf-66ed-4fe8-9876-32f0a95bad27","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-16T19:46:17.627976Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T17:58:38.234197Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:ab5c3f9a04db79cb1d8240490e12c4cbef26dae1928b34dcc8d2a18fa724e79b","observation_id":"3eb694fb-4925-4ce6-9c72-fe6ffc122af1","resolution":{"observed_at":"2026-05-09T06:55:42.890276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":"2509.06923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-07-03T20:48:56.162598Z","title":"Staying in the sweet spot: Responsive reasoning evolution via capability-adaptive hint scaffolding.arXiv preprint arXiv:2509.06923, 2025","venue":null,"work_id":"3b7ceaaf-66ed-4fe8-9876-32f0a95bad27","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-16T19:46:17.627976Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:09:39.645781Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:46073b920fa9d067ca902fbe0e69dca1f87b3f2ed3841ed25e0441e344810dd4","observation_id":"5555d0e5-89ba-4846-9d58-27c7ba9e3fed","resolution":{"observed_at":"2026-05-11T03:55:54.622226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":"2509.06923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-07-03T20:48:56.162598Z","title":"Staying in the sweet spot: Responsive reasoning evolution via capability-adaptive hint scaffolding.arXiv preprint arXiv:2509.06923, 2025","venue":null,"work_id":"3b7ceaaf-66ed-4fe8-9876-32f0a95bad27","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-16T19:46:17.627976Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T17:32:34.585808Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:5eec00ca7fa9e511394296c2205fb63bf123591e6c72cb6028e825394fdfb9a7","observation_id":"29675988-4aa4-4541-a9a8-fc710c32bfec","resolution":{"observed_at":"2026-05-19T17:32:41.462913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":"2509.06923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-07-03T20:48:56.162598Z","title":"Staying in the sweet spot: Responsive reasoning evolution via capability-adaptive hint scaffolding.arXiv preprint arXiv:2509.06923, 2025","venue":null,"work_id":"3b7ceaaf-66ed-4fe8-9876-32f0a95bad27","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:9004dec1c47208dcc859de2f3c69394d6ac37246af1563e08d38dd7dd062ab9e","observation_id":"1741a719-b144-4594-bf07-22b160e3657b","resolution":{"observed_at":"2026-07-03T20:48:56.164138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-08-01T12:54:33.943411Z","title":"Staying in the sweet spot: Responsive reasoning evolution via capability-adaptive hint scaffolding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-12T20:21:39.140409Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:33.943411Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:6fd3a32458a869e03dbb31c9d3aa2c83c34a327fe0a5debc08b6c0d5137ecebc","observation_id":"5c8df385-a953-4309-8779-b0c3f383755d","resolution":{"observed_at":"2026-08-01T12:54:33.943411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-08-01T07:34:54.765756Z","title":"arXiv preprint arXiv:2509.06923 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-16T00:02:01.281766Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:54.765756Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:a1b0a1c4f7c46d7f6e4360eeb7216764ecda476985842f6943cde07ed1a8623b","observation_id":"26c06b32-36c7-43d3-ba09-8a252be4e03a","resolution":{"observed_at":"2026-08-01T07:34:54.765756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06923/citation-record","integrity":"/paper/2509.06923/integrity","json":"/paper/2509.06923/citation-record.json","paper":"/paper/2509.06923"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-16T22:33:00.173650Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-04T22:57:44.986207Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:44.986207Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:316e0c744d4ac3ae4e67f3f53765fa859c11861964b17ae2853c79e0b8bd16dd","observation_id":"93596ae4-2186-456b-8029-e254c01e1a43","resolution":{"observed_at":"2026-08-04T22:57:44.986207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.469128Z","title":"Item Response Theory -- A Statistical Framework for Educational and Psychological Measurement , August 2021","venue":null,"work_id":"1ac7d2ae-91ec-4756-b775-127d4cee6565","year":2021},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:44.989509Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:30cbc737bec500ca0941bb6cabbcd160e6291e9ebb6db04b9b69170910e78a53","observation_id":"9f01f223-f52c-4166-aade-c1a4a12ac517","resolution":{"observed_at":"2026-08-04T22:57:45.472117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.461794Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":"aefd4bc5-361d-42d7-96c0-450406c78833","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:44.992098Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:e5db600b9ee8867a4dc6bd75a5202e9593ed1e008e78498acc6a10982ac755e3","observation_id":"f72a7458-a5a3-4c0d-b06e-ada7f85cd201","resolution":{"observed_at":"2026-08-04T22:57:45.464284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.454245Z","title":"Think you have Solved Question Answering ? Try ARC , the AI2 Reasoning Challenge , March 2018","venue":null,"work_id":"6641f8ab-3033-4526-837e-a2aaaf3a9624","year":2018},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:44.994980Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:cbb943425ad069b44570d3350a591d4c47f422ddfb3a6d6da8456dc70eb78aac","observation_id":"0c404b07-eea7-406f-806f-656d7a4b564f","resolution":{"observed_at":"2026-08-04T22:57:45.456985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.446538Z","title":"Training Verifiers to Solve Math Word Problems , November 2021","venue":null,"work_id":"521c892b-c226-48dd-929b-aa15803963f1","year":2021},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:44.997663Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:ebd8c0bf46b693c9b690cfc6956fac0312db1acffc14b315d23649eacbce5ddd","observation_id":"42a70a16-2e3f-4666-839f-92788dbf398b","resolution":{"observed_at":"2026-08-04T22:57:45.449215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.438782Z","title":null,"venue":null,"work_id":"1c9e7f42-a873-4640-881c-e2caaea2e0bb","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.000383Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:48b6aebabccefe76af2c19a24817a220a3189b559319d405ed2d071a2e4cbb4e","observation_id":"d9d605fe-c2cf-4b35-89ee-81d908e2c15c","resolution":{"observed_at":"2026-08-04T22:57:45.441467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.430573Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":"521c294e-e676-4f09-91cb-4cb771c1dcf4","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.003588Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:0e4aa5c10d6ff92683dc791182f53b5d60cf6f7ce2f220e59077dd8e221da703","observation_id":"a698d10c-3860-45c8-aeaa-acfabdc15edf","resolution":{"observed_at":"2026-08-04T22:57:45.433454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.422852Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay , July 2025","venue":null,"work_id":"f3e0c532-053b-4a94-b814-34290ccbfd91","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.006413Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:4f9d9480af5a98a04e28ab3765ab75f5d20240e1388e4d25d1c022eddce3902f","observation_id":"99a581eb-bb46-4b04-b1fd-195bbee553d2","resolution":{"observed_at":"2026-08-04T22:57:45.425536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.414936Z","title":"SRFT : A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning , June 2025","venue":null,"work_id":"f53081bf-f523-4542-b202-55065b2c33db","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.008794Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:fe7c7351d3cbf32e65ba3275f5531fbac76e9299f03275a4187aa052d6ccfffc","observation_id":"b5f9c3cd-c6c7-4d1f-bda7-b4f83407fd66","resolution":{"observed_at":"2026-08-04T22:57:45.417758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.407308Z","title":null,"venue":null,"work_id":"f369b7ef-8b7e-4ea5-8e5a-88a270ec1173","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.011241Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:f073a2f91b8a1dc4e6719f09cb6e8fcbd0d81156b2d447c04059032d038b487e","observation_id":"ee9c28cb-9cb1-48b0-92d5-219e85d86a43","resolution":{"observed_at":"2026-08-04T22:57:45.409813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.399415Z","title":"Navigate the Unknown : Enhancing LLM Reasoning with Intrinsic Motivation Guided Exploration , July 2025","venue":null,"work_id":"b9b4e612-955f-484c-aa52-15c611abde5d","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.013676Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:e6a46bbfaee2df89e17e9caae1b098ba1301120b3754da3123c6b7a61b6b55a9","observation_id":"2f0548de-d50d-44aa-9e93-ff7fe17aa989","resolution":{"observed_at":"2026-08-04T22:57:45.402185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.016293Z","title":"OlympiadBench : A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.016293Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:45769a5dc0732eeaec18b8ad9ec735a89f4a8e2ba3eda813cad50a67a844d217","observation_id":"64a1f6c6-343e-4a1f-b2df-68829cac0f7b","resolution":{"observed_at":"2026-08-04T22:57:45.016293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.386441Z","title":"DeepMath-103K : A Large-Scale , Challenging , Decontaminated , and Verifiable Mathematical Dataset for Advancing Reasoning , May 2025","venue":null,"work_id":"7bb75c26-46b1-4b82-bc2d-42fe287c1880","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.018722Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:ede0efb2e6038f493052c837f7d9f27e5a90fe9cab357b1fc1e9952d8c234278","observation_id":"0fc34b23-ffb7-43b1-9b4c-c1d52cc4a21c","resolution":{"observed_at":"2026-08-04T22:57:45.389184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.378511Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":null,"work_id":"20e03bd1-395b-4074-9482-85c7ec694375","year":2021},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.021109Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:3b5bc67aed208d6569ab703dede0f4d9e81069746e759f1297116367bc14fe0e","observation_id":"128cd7d8-352d-48c6-b544-6c6f867fa5d3","resolution":{"observed_at":"2026-08-04T22:57:45.381414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.369813Z","title":"Mathruler","venue":null,"work_id":"65aeba99-6d6b-41b3-aa7a-0e2ad80308dd","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.023497Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:1e935dd1d6d8925302843c1186e459a8dce56a346a406ae266bfa18887d6caac","observation_id":"e6ed8466-8181-49ef-94a1-76896f5398ea","resolution":{"observed_at":"2026-08-04T22:57:45.373069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.361982Z","title":"Boosting MLLM Reasoning with Text-Debiased Hint-GRPO , June 2025 a","venue":null,"work_id":"d4d9a25c-baa1-4fed-af64-ac61ddee67ee","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.026025Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:688cf19071c7bc9192a1c5dfb2e239a396f7355a999d7a445b1e35b6e6cc403f","observation_id":"83710495-76b5-4dd1-a7ee-0d251dee9197","resolution":{"observed_at":"2026-08-04T22:57:45.364754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.354355Z","title":"Ponti, and Ivan Titov","venue":null,"work_id":"cfb64b19-70d8-416a-912a-223266c2eb95","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.028454Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:34929886cb0fe58c6ca3ebef012e4697e33e757ee98f8e4b5a7145b9f8f5db44","observation_id":"258492ce-cfe1-47b0-9d46-7284a74843c5","resolution":{"observed_at":"2026-08-04T22:57:45.356909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.346482Z","title":"o pf, Yannic Kilcher, Dimitri Von R \\","venue":null,"work_id":"299269ec-d5b7-42e3-9a06-9b9b10918eb7","year":2023},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.030895Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:2c8bbbcc4074b3bf7f04de3a0467acdbd5150c4832010ce2fa293c63068fb51e","observation_id":"1523fefe-0cc4-4194-b2bd-eafbbf98d6b1","resolution":{"observed_at":"2026-08-04T22:57:45.349070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.338494Z","title":"Solving Quantitative Reasoning Problems with Language Models","venue":null,"work_id":"3a8fbd72-d8a1-4499-bd59-37aad1051cc9","year":2022},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.033305Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:6f2fdb4b2ff45e04e45b85abfae2c72e39e98ed33f14ce9aab1b334df32fcc32","observation_id":"2a5ccdd0-5724-4b9e-b8ed-9c913285f29f","resolution":{"observed_at":"2026-08-04T22:57:45.341399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.035812Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.035812Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:99e1b1e5b5d91456849acb2aa211b1f500d46886d04ff735a95a900ba060a757","observation_id":"c8abb6ee-5f90-4724-b2d2-bcf58a1be024","resolution":{"observed_at":"2026-08-04T22:57:45.035812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.325024Z","title":"UFT : Unifying Supervised and Reinforcement Fine-Tuning , May 2025 a","venue":null,"work_id":"da78f586-5e06-4da0-b1ef-ef64c44a0eba","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.038216Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:4913a3c6978c525b47f8ca37626553199c9c18af5f35825e38c3e0517166dcc5","observation_id":"b6586b87-5bf7-476e-a3d2-6ecf533b3494","resolution":{"observed_at":"2026-08-04T22:57:45.327724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.317729Z","title":"Understanding R1-Zero-Like Training : A Critical Perspective , March 2025 b","venue":null,"work_id":"5daeac94-fc2b-4a50-b240-c9b4bf5109b8","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.040623Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:44cc05db428ee51d35480cec96986baba354f9bf21cb72fabb93fbed8160d69e","observation_id":"52566960-7312-407a-bcaa-08293655759c","resolution":{"observed_at":"2026-08-04T22:57:45.320373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.042861Z","title":"Lmfit: Non-linear least-squares minimization and curve-fitting for python, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.042861Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:a633b7840d863f879837ffa66ac9c35d21d389e88b780c3e65115dbb4d3ef0f3","observation_id":"d4f5f2dc-0568-401a-84ba-a8e30d5b49e6","resolution":{"observed_at":"2026-08-04T22:57:45.042861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.310412Z","title":null,"venue":null,"work_id":"55bcca04-d0b5-43e9-97b7-d5a54cad96a1","year":2024},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.045203Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:e39f8ddae086ca4e91f441e9b0871b55fccdb41f500898969c04b11cafeeab52","observation_id":"351e1c8d-a033-4fbb-8e11-123c0533b1c4","resolution":{"observed_at":"2026-08-04T22:57:45.313024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.302781Z","title":"Qwen2.5 Technical Report , January 2025","venue":null,"work_id":"b4e88442-76b1-4598-91bb-3dac6b628dd3","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.047861Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:3605878fe0f3944504e37e93bcf5156285d2174808a134ce0b82943903e3d910","observation_id":"27e2390e-3676-4df5-b62c-41388186a7f7","resolution":{"observed_at":"2026-08-04T22:57:45.305385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.295357Z","title":null,"venue":null,"work_id":"cf7f3e30-02ea-4af6-9061-fb78be975dd8","year":2023},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.050279Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:a2bd17b70ff376ed271073137530098a3df9b28a116fdfd863d6cfcbae451f5a","observation_id":"440ee493-f604-4abd-8b83-3b4186e47f61","resolution":{"observed_at":"2026-08-04T22:57:45.297896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.287990Z","title":"LLMs are Greedy Agents : Effects of RL Fine-tuning on Decision-Making Abilities , April 2025","venue":null,"work_id":"bcf8792f-7a05-4dc0-a5ac-a2fceb051f9a","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.052662Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:ad265e34c4193f8536ea307da0616eb80f3f8e58bab73a8cba3af11f50b77c7e","observation_id":"0b1990f7-f032-4d9a-bf1d-04074a768a88","resolution":{"observed_at":"2026-08-04T22:57:45.290551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.280933Z","title":null,"venue":null,"work_id":"81f5c12a-6fe6-4f1f-bf08-fe2174036f55","year":2024},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.055037Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:f805f81f85a8f321c1bed0c5be5024b8eaba2b2a17f440b03e090eeff0501a2a","observation_id":"da49e5ef-5b6b-4446-81c8-402d62e139e1","resolution":{"observed_at":"2026-08-04T22:57:45.283399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.057545Z","title":"HybridFlow : A Flexible and Efficient RLHF Framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.057545Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:de62b9886ef517e8cdfae9d9b8790db093f8c5757d91a29199b33ef5ade9233c","observation_id":"8a1355ea-9f4b-4af1-bb47-3b9076efcf10","resolution":{"observed_at":"2026-08-04T22:57:45.057545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.273642Z","title":"Uncertainty and influence aware reward model refinement for reinforcement learning from human feedback","venue":null,"work_id":"a36ebe7f-615b-463f-849a-861488a2f720","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.060059Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:39505b952196930a880fb254419e36d04f63325151b05406c42614bf925fb102","observation_id":"5a9b3187-dec7-4f36-9d57-9b7164f1c263","resolution":{"observed_at":"2026-08-04T22:57:45.276390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.266133Z","title":null,"venue":null,"work_id":"f26dbec6-1c5d-4164-a097-ae71dc0f7868","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.062279Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:b33c5a9b0d11d5e57c826f4874bceb826fc873d78fbad317b18133092bfc66a1","observation_id":"c4afeeb9-bb6e-4f67-bcc8-36fa5a480d1e","resolution":{"observed_at":"2026-08-04T22:57:45.268789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.258635Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example , May 2025","venue":null,"work_id":"2aa7d9ed-0622-4016-8b4f-19ad045ffaaa","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.064634Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:cc02e1a5328599093d0affaf1a91e57fbc5b6424472c9cf838374ee9573eed8d","observation_id":"a042cc48-e491-4367-a15f-ba10ddfc2889","resolution":{"observed_at":"2026-08-04T22:57:45.261294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.251029Z","title":"MMLU-Pro : A More Robust and Challenging Multi-Task Language Understanding Benchmark","venue":null,"work_id":"3ece237b-9d34-4969-88de-d51cf511870a","year":2024},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.067201Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:5272744d094883342111441421da4473d0cf0c6b8b5c349f377a5a1d22268e1d","observation_id":"7d642c7a-26ee-4614-a887-56f5d4f13efc","resolution":{"observed_at":"2026-08-04T22:57:45.253931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.243367Z","title":"Thought- Augmented Policy Optimization : Bridging External Guidance and Internal Capabilities , May 2025","venue":null,"work_id":"2db7c3a1-c91f-4d57-8714-4ba980c2d985","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.069522Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:18020d22c46e4214f217a0934a568a5ecb0945561a422bf39a5e968591de6101","observation_id":"f3a9728c-70db-4145-b27d-c442f6cf7f71","resolution":{"observed_at":"2026-08-04T22:57:45.246019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.235686Z","title":"Learning to Reason under Off-Policy Guidance , May 2025","venue":null,"work_id":"f4420fd3-c6fd-45d5-a54d-d8bf7d6e39ed","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.071834Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:4f191b8d6d1b6006c36d1c95fda82cd242b8ed14d48ef0403a1018f3fb99b27f","observation_id":"dc81abd4-de63-48b4-ad50-b15edc21dfc4","resolution":{"observed_at":"2026-08-04T22:57:45.238451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.227285Z","title":"DAPO : An Open-Source LLM Reinforcement Learning System at Scale , May 2025","venue":null,"work_id":"3237ae8b-6e52-48ed-9fae-a1ae790e314d","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.074426Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:361df025bfa045340a1400fa7936d78b39b367201695a4c62bb22af0ddd14db4","observation_id":"7de74d27-420a-46d5-accb-76d188db3c9a","resolution":{"observed_at":"2026-08-04T22:57:45.230201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.218881Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model ?, May 2025","venue":null,"work_id":"a2e8d77c-d655-4a0a-aa3c-cbedf971de4a","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.076905Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:bc2dc0757ee0b0f086984eeb8a09ddb8641a17158acf77b7f11b207ba8b845f2","observation_id":"fbd018f8-824d-4551-a4b1-a7e4d18bc2e7","resolution":{"observed_at":"2026-08-04T22:57:45.221829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.210787Z","title":"SimpleRL-Zoo : Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild , August 2025","venue":null,"work_id":"2b054d9b-6c0c-4f17-bdfa-0758f2ef8185","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.079396Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:7ee3ea80afbbec08a8348c02f26e564f9834da7a8cad0e9c185026abb7b203eb","observation_id":"a1ee149a-4753-4272-9eb4-ef54db05394b","resolution":{"observed_at":"2026-08-04T22:57:45.213621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.202532Z","title":"StepHint : Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason , July 2025 a","venue":null,"work_id":"1e6105c5-6b4e-4578-95ea-4742d82a9518","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.081843Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:2a3f6b4483df64a96403d075aa41e3b057c772a8e14cd1cbdd9b426ccd54f234","observation_id":"325aeb21-5b34-4a23-8e05-3647e2110441","resolution":{"observed_at":"2026-08-04T22:57:45.205387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-20T06:16:23.875749Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-04T22:57:45.084185Z","title":"A survey on test-time scaling in large language models: What, how, where, and how well? arXiv preprint arXiv:2503.24235, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.084185Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:0ef8eae4b1cca99c96a173435175a04529b11544be0690ed7a4e4a2d4e5e12d0","observation_id":"d7169412-fd5a-4bec-adf4-814bad7d7b24","resolution":{"observed_at":"2026-08-04T22:57:45.084185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.088987Z","title":"On-policy rl meets off-policy experts: Harmonizing supervised fine-tuning and reinforcement learning via dynamic weighting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.088987Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:75f15f6e726f5389bc7ebfc70884eec4990d611c98cf8d2f0e16d48f04dc0cbf","observation_id":"3bef1975-8d57-4f09-9fb7-75dd75b0e87f","resolution":{"observed_at":"2026-08-04T22:57:45.088987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.194451Z","title":"Echo Chamber : RL Post-training Amplifies Behaviors Learned in Pretraining , August 2025","venue":null,"work_id":"515ef7c1-12ca-4129-a496-c1c5ec355e3d","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.091369Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:0670e99f68ced225c456fb98d672062b39dec27a60231d17be50e27816fbfb07","observation_id":"50486305-c0d1-4b4e-965b-454f40074b50","resolution":{"observed_at":"2026-08-04T22:57:45.197229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.183606Z","title":"Group Sequence Policy Optimization , July 2025","venue":null,"work_id":"af475d1c-2a85-4b03-9b94-48a884eba006","year":2025},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.093647Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:65cf276ddf2bbdc126a818eee871aaf748654f9bc8817f9b1aeb109c94d1d127","observation_id":"22592da0-e03e-4ceb-9c7a-c9e9b6d2cb2e","resolution":{"observed_at":"2026-08-04T22:57:45.188053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.096137Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.096137Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:ed0552a4ebee381f7acae4ea9f8a3e1d5ea20fac6a70ebe599c1b1ff43e2c64a","observation_id":"5fec02c9-cf42-4118-a9b8-5cef6f0466b6","resolution":{"observed_at":"2026-08-04T22:57:45.096137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.099078Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.099078Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:3a5359921a3e5a37eb9c030512122e610b36ef6ab92df505670eae91b6cd7027","observation_id":"3edaec59-f97c-47cd-878a-02b920373b33","resolution":{"observed_at":"2026-08-04T22:57:45.099078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.101843Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.101843Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:d5ad2b1cee6c6981e050d400fdd7c0bc9d88fb77df41692834fdd457aa6725ee","observation_id":"5219136e-5216-4351-8e00-d35529b61fd5","resolution":{"observed_at":"2026-08-04T22:57:45.101843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:57:45.104367Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T22:57:45.104367Z"},"links":{"citing_paper":"/paper/2509.06923"},"observation_digest":"sha256:7f6d84f19b996907f8b15dfa9aa9c7e91bcb60b05ef75ca714b73380db52f24c","observation_id":"aace86a0-1040-45b1-9f85-196a0abd9acb","resolution":{"observed_at":"2026-08-04T22:57:45.104367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T22:52:11.613402Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 8 inbound Pith citation observations for arXiv:2509.06923."}