{"as_of":"2026-08-20T12:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a124ba53109a752acec92156830332143a9b1b2395114a49160c6f453037198d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:45:00.496048Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:48:20.040368Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T00:45:49.091631Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":"2412.17256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17256","snapshot_observed_at":"2026-07-09T00:45:49.091631Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","venue":"cs.AI","work_id":"26ea9717-aa39-4eb3-9da5-2baf339728a8","year":2024},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-20T08:13:05.630967Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":190,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2412.17256","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:69e2044dc3b402d1bcc19edbd7ad5fe6e81006b5006c73dcbecccc3b90bb55b8","observation_id":"1b98c00d-2666-435b-a578-81451eae74a0","resolution":{"observed_at":"2026-05-13T01:36:24.263902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17256","snapshot_observed_at":"2026-08-16T00:48:20.040368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02665","last_updated":"2025-05-08T05:27:18Z","snapshot_observed_at":"2026-08-18T12:36:55.051772Z","submitted_at":"2025-05-05T14:14:59Z","title":"A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-16T00:48:20.040368Z"},"links":{"cited_paper":"/paper/2412.17256","citing_paper":"/paper/2505.02665"},"observation_digest":"sha256:b0b97fa8ccee92f98ceb59cbeefae4807dbf26b7a62c9ecc9b05cacdd223ba38","observation_id":"50fadc9b-6b87-48f1-af34-12ddb1617969","resolution":{"observed_at":"2026-08-16T00:48:20.040368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17256","snapshot_observed_at":"2026-08-07T14:45:19.802170Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17829","last_updated":"2025-05-23T12:42:50Z","snapshot_observed_at":"2026-08-19T17:21:30.795088Z","submitted_at":"2025-05-23T12:42:50Z","title":"Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:45:19.802170Z"},"links":{"cited_paper":"/paper/2412.17256","citing_paper":"/paper/2505.17829"},"observation_digest":"sha256:a3ed94de630786b7db99fd3cb28869ecc5cee2af57a656cb8d082239a06c91b6","observation_id":"74de4af0-8adf-4a44-9744-56519d94e536","resolution":{"observed_at":"2026-08-07T14:45:19.802170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17256","snapshot_observed_at":"2026-08-03T02:43:38.300114Z","title":"B-star: Monitoring and balancing exploration and exploitation in self-taught reasoners.arXiv preprint arXiv:2412.17256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10014","last_updated":"2026-05-31T19:13:22Z","snapshot_observed_at":"2026-08-15T17:40:06.025692Z","submitted_at":"2026-02-10T17:36:41Z","title":"A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T02:43:38.300114Z"},"links":{"cited_paper":"/paper/2412.17256","citing_paper":"/paper/2602.10014"},"observation_digest":"sha256:f184a429b28410467c9f757a6a0ba640e7e33b070ab131909f86aa910fc44a8d","observation_id":"95a82f25-5c48-47a9-b428-55d1ef7f0dd4","resolution":{"observed_at":"2026-08-03T02:43:38.300114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":"2412.17256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17256","snapshot_observed_at":"2026-07-09T00:45:49.091631Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","venue":"cs.AI","work_id":"26ea9717-aa39-4eb3-9da5-2baf339728a8","year":2024},"citing_paper":{"arxiv_id":"2605.09315","last_updated":"2026-05-10T04:20:24Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T04:20:24Z","title":"Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:10:31.784413Z"},"links":{"cited_paper":"/paper/2412.17256","citing_paper":"/paper/2605.09315"},"observation_digest":"sha256:c265fb6a0ea5508111db89c0eee89f7627005622abb7b39a2b69cef5d9400d97","observation_id":"0c2f13c9-6066-49f8-848f-e4594bbe359a","resolution":{"observed_at":"2026-05-12T06:31:29.178804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":"2412.17256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17256","snapshot_observed_at":"2026-07-09T00:45:49.091631Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","venue":"cs.AI","work_id":"26ea9717-aa39-4eb3-9da5-2baf339728a8","year":2024},"citing_paper":{"arxiv_id":"2607.06974","last_updated":"2026-07-08T03:51:37Z","snapshot_observed_at":"2026-08-16T17:17:21.546350Z","submitted_at":"2026-07-08T03:51:37Z","title":"MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-09T00:45:00.847714Z"},"links":{"cited_paper":"/paper/2412.17256","citing_paper":"/paper/2607.06974"},"observation_digest":"sha256:d3a67d85b6bca4521d4a4f339defd60bc50e0406ebdd4b60e67280d6dd346bb4","observation_id":"2d9421a3-209a-4604-adcc-b94e054a9bd5","resolution":{"observed_at":"2026-07-09T00:45:49.092945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17256/citation-record","integrity":"/paper/2412.17256/integrity","json":"/paper/2412.17256/citation-record.json","paper":"/paper/2412.17256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:01.085003Z","title":"without RM","venue":null,"work_id":"95b90958-f882-45be-9c3a-278c652135b6","year":2016},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.496048Z"},"links":{"citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:aeb8abfdc468f7be8f73602d506fe25be3a4aa0439c1929a87e9f76403379f80","observation_id":"57bd1add-80a5-4f4a-bfed-da43f8b57f74","resolution":{"observed_at":"2026-08-11T05:45:01.090419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T05:45:00.344187Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.344187Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:fe3e24d61b79ddd60066b35c08795b287e4cc8ef3f786ba146b618026c8aaf84","observation_id":"1a3f4f53-b9cd-43a6-8d16-5130ae0ed74e","resolution":{"observed_at":"2026-08-11T05:45:00.344187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-11T05:45:00.354898Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.354898Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:3ed895d44e9402dd9781217bf2846b6cec274410410400d5a191bea67a832c28","observation_id":"1161d321-4de4-4b1d-bf7c-ec018ac1e99d","resolution":{"observed_at":"2026-08-11T05:45:00.354898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T05:45:00.364355Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.364355Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:e72e7e276de087d6d3e15166d21caa764247de945417bcdbbde9220f976eec0f","observation_id":"189e7789-9db7-4d1e-bfba-94e870164db9","resolution":{"observed_at":"2026-08-11T05:45:00.364355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06457","last_updated":"2024-08-14T02:41:48Z","snapshot_observed_at":"2026-08-20T09:22:11.974261Z","submitted_at":"2024-02-09T15:02:56Z","title":"V-STaR: Training Verifiers for Self-Taught Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06457","snapshot_observed_at":"2026-08-11T05:45:00.369599Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.369599Z"},"links":{"cited_paper":"/paper/2402.06457","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:4d786f2d73f13724f313c2d680804e5d9e901749ae7c13e030f988492c888fef","observation_id":"988c32f2-3d7e-4137-8584-c808bf1b912e","resolution":{"observed_at":"2026-08-11T05:45:00.369599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-11T05:45:00.374724Z","title":"Large language models can self-improve","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.374724Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:52f00b9b55a30f81e584ec555950617ba15582064338c2bce6e25a985ff44456","observation_id":"20a3b666-2f59-44bb-909f-7832fbc1c03b","resolution":{"observed_at":"2026-08-11T05:45:00.374724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09846","last_updated":"2017-11-28T16:16:21Z","snapshot_observed_at":"2026-08-15T05:47:29.683783Z","submitted_at":"2017-11-27T17:33:27Z","title":"Population Based Training of Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09846","snapshot_observed_at":"2026-08-11T05:45:00.379674Z","title":"Population based training of neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.379674Z"},"links":{"cited_paper":"/paper/1711.09846","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:b59f6c3b69e4213c1882212d8095ed50cd03135df905c8a9bbe1c0a4cf516283","observation_id":"1fa27432-b4e1-4c8f-803d-7575ee8dda83","resolution":{"observed_at":"2026-08-11T05:45:00.379674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T05:45:00.384910Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.384910Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:ec58cf9f68acabb55ba8032a24cb7583c0c305bd9dfdf347d835381f5f3ea3c5","observation_id":"d34ce381-1dad-4898-882b-b863d28954f1","resolution":{"observed_at":"2026-08-11T05:45:00.384910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11527","last_updated":"2019-06-27T09:59:44Z","snapshot_observed_at":"2026-08-19T12:16:18.280669Z","submitted_at":"2019-06-27T09:59:44Z","title":"Hyp-RL : Hyperparameter Optimization by Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.11527","snapshot_observed_at":"2026-08-11T05:45:00.389727Z","title":"Hyp-rl: Hyperparameter optimization by reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.389727Z"},"links":{"cited_paper":"/paper/1906.11527","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:af376c2e02eb7efeb1729308bde0119a3fbba2d3569751fa98b4b0f07ed41b12","observation_id":"cf865fb5-1a51-436a-9246-5f398f760285","resolution":{"observed_at":"2026-08-11T05:45:00.389727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02336","last_updated":"2023-05-24T04:08:08Z","snapshot_observed_at":"2026-08-16T16:55:09.947238Z","submitted_at":"2022-06-06T03:38:36Z","title":"Making Large Language Models Better Reasoners with Step-Aware Verifier","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02336","snapshot_observed_at":"2026-08-11T05:45:00.398974Z","title":"Making large language models better reasoners with step-aware verifier","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.398974Z"},"links":{"cited_paper":"/paper/2206.02336","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:b44a5f69ec28d57884e4a7fcf5850175dfb55bea9c365e79aec1cf1a0b83b0c0","observation_id":"62626659-c487-4d49-a835-979d4507486f","resolution":{"observed_at":"2026-08-11T05:45:00.398974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-11T05:45:00.403199Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.403199Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:e0519e894720120d01808f052dffb890024e89588e8d3015e2ae4ecb7ae3f6f3","observation_id":"02490e2a-525c-4095-a99c-9a435be3b40e","resolution":{"observed_at":"2026-08-11T05:45:00.403199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-11T05:45:00.407606Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.407606Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:6f19c0cc33896e08e29ea46a137e0631a17636c0bedf8d71d915c47a50529717","observation_id":"6b0b947a-e388-4dd9-818e-146b63b02312","resolution":{"observed_at":"2026-08-11T05:45:00.407606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-16T13:56:31.553308Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-11T05:45:00.416659Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.416659Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:34c8d06178124744398ea5c58f1e8152be8d836472cdc61e8856cbc5e2e18efd","observation_id":"bb2798a1-0234-499b-9b34-8e1879d888f6","resolution":{"observed_at":"2026-08-11T05:45:00.416659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T05:45:00.421322Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.421322Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:56055184ee57537d3f957e9946f9c6f0e2c84cd20164c587ffbe370f8460aa64","observation_id":"08c31d2a-9b31-4b6a-96c1-cb51afef8579","resolution":{"observed_at":"2026-08-11T05:45:00.421322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09820","last_updated":"2018-04-24T17:43:51Z","snapshot_observed_at":"2026-08-17T07:35:35.245331Z","submitted_at":"2018-03-26T20:05:59Z","title":"A disciplined approach to neural network hyper-parameters: Part 1 -- learning rate, batch size, momentum, and weight decay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09820","snapshot_observed_at":"2026-08-11T05:45:00.431542Z","title":"A disciplined approach to neural network hyper-parameters: Part 1–learning rate, batch size, momentum, and weight decay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.431542Z"},"links":{"cited_paper":"/paper/1803.09820","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:202449ab89093d6a52512f52ad109471fdcb6f644a26052852b296ca53c7fd1c","observation_id":"fad7db1f-9d20-4785-908b-ce55168e1715","resolution":{"observed_at":"2026-08-11T05:45:00.431542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09472","last_updated":"2024-12-10T08:54:09Z","snapshot_observed_at":"2026-08-16T14:09:47.245140Z","submitted_at":"2024-03-14T15:12:38Z","title":"Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09472","snapshot_observed_at":"2026-08-11T05:45:00.436365Z","title":"Easy-to-hard generalization: Scalable alignment beyond human supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.436365Z"},"links":{"cited_paper":"/paper/2403.09472","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:8997f24ae74612391d2f154ba5a38fcac5a78dd002856ea2f0255a685c0d6e82","observation_id":"51da734d-8572-4aed-8ed8-984e51bdb9b9","resolution":{"observed_at":"2026-08-11T05:45:00.436365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13690","last_updated":"2024-12-23T17:32:21Z","snapshot_observed_at":"2026-08-19T18:43:23.430264Z","submitted_at":"2024-06-18T07:14:02Z","title":"DART-Math: Difficulty-Aware Rejection Tuning for Mathematical Problem-Solving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13690","snapshot_observed_at":"2026-08-11T05:45:00.441500Z","title":"Dart-math: Difficulty-aware rejection tuning for mathematical problem-solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.441500Z"},"links":{"cited_paper":"/paper/2407.13690","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:795cbcc43a4870fa829d8d79d9122a1a9099b5e5e8d809c18e9288f05c616288","observation_id":"b24583ef-ae6f-4a7c-be2e-6dae4539ebcb","resolution":{"observed_at":"2026-08-11T05:45:00.441500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-11T05:45:00.446537Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.446537Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:b9d5a27654425e0a255a4c7bce30900234f7ffe0dbf3516da86b1b30159c6a98","observation_id":"9d31095f-0620-4f90-9bc9-d8493252ea8f","resolution":{"observed_at":"2026-08-11T05:45:00.446537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03733","last_updated":"2024-10-18T23:53:07Z","snapshot_observed_at":"2026-08-18T11:14:48.642312Z","submitted_at":"2024-09-05T17:44:49Z","title":"Planning In Natural Language Improves LLM Search For Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03733","snapshot_observed_at":"2026-08-11T05:45:00.451299Z","title":"Planning in natural language improves llm search for code generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.451299Z"},"links":{"cited_paper":"/paper/2409.03733","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:df1b0627636cd966666003cb43858a2678f4501a5adbad16ed444d2f74bf1518","observation_id":"97c6282f-1662-4f36-a741-ab1f761e8f68","resolution":{"observed_at":"2026-08-11T05:45:00.451299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:01.178361Z","title":"12 Published as a conference paper at ICLR 2025 Wikipedia contributors","venue":null,"work_id":"2409a512-dd42-4e53-8b70-7d629b7895ca","year":2018},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.456151Z"},"links":{"citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:f1ab75063c90e411a4e74b31d1697bda421a48f9073c07b95cebc27c12395f20","observation_id":"cbc79678-3d02-4d0c-b88a-822269dacd70","resolution":{"observed_at":"2026-08-11T05:45:01.184571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05013","last_updated":"2024-07-06T09:07:11Z","snapshot_observed_at":"2026-08-17T22:19:26.833859Z","submitted_at":"2024-07-06T09:07:11Z","title":"Progress or Regress? Self-Improvement Reversal in Post-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05013","snapshot_observed_at":"2026-08-11T05:45:00.460966Z","title":"[Online; accessed 26- November-2024]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.460966Z"},"links":{"cited_paper":"/paper/2407.05013","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:e18d51f8d5cb2319572f18fadf263e0892a3b722280d41f9238282d1a451f1b7","observation_id":"312975e6-0706-4e03-9a73-5d4d1b5c4012","resolution":{"observed_at":"2026-08-11T05:45:00.460966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-08-15T09:21:11.223719Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03409","snapshot_observed_at":"2026-08-11T05:45:00.466197Z","title":"Large language models as optimizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.466197Z"},"links":{"cited_paper":"/paper/2309.03409","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:42d29686e0dbce6f4546f106581bdb91e1a8e9bc7c12463551c5044c3fc45ea3","observation_id":"fe972380-60d1-4233-b33b-410a1da387aa","resolution":{"observed_at":"2026-08-11T05:45:00.466197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-16T18:17:11.146813Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-11T05:45:00.471178Z","title":"Scaling relationship on learning mathematical reasoning with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.471178Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:e8a23fe3d0a2f80bff5fd92eed9ddf1b312a55f4aaf98edb443ef4acc1a3baa5","observation_id":"7aae4dd8-3a27-4efb-810f-44026970f759","resolution":{"observed_at":"2026-08-11T05:45:00.471178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:01.157911Z","title":"Answer\" indicates matching against the ground-truth final answer, and","venue":null,"work_id":"e03b46aa-948f-4681-851b-da7165e492b9","year":2025},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.476231Z"},"links":{"citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:a8f1bb1e8f2ab280252ae9406b51c6e7b90e10924e37cd766f2e8cd002b14d2a","observation_id":"3fddc3b9-30c7-4ffb-beef-85ce43b30eed","resolution":{"observed_at":"2026-08-11T05:45:01.163780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:01.140038Z","title":"For the MATH dataset, we follow previous settings (Lightman et al., 2023; Wang et al., 2024b; Sun et al.,","venue":null,"work_id":"6ab46471-3c64-4bc6-86aa-30518855a873","year":2023},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.481101Z"},"links":{"citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:307b7721d42e8db647a3dcaab8527238bcea767b3aa56a55acdbb3090dfbf89a","observation_id":"b09d34dc-1998-430e-98a0-f12635aa6079","resolution":{"observed_at":"2026-08-11T05:45:01.145898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:01.102886Z","title":"For baselines, we uniformly sample 32 candidate responses per query with a temperature of 0.4","venue":null,"work_id":"9c029062-062a-44bf-9390-9795d1383941","year":2024},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.491519Z"},"links":{"citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:c35c64562ed8ec2d9ae8aea2b50a1b459f41e680db8624193afd3dbf73d56909","observation_id":"b7a18344-fcdf-4179-abc9-d898f2afc52a","resolution":{"observed_at":"2026-08-11T05:45:01.108400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:45:01.121190Z","title":"For the Process Reward Model (PRM), we automatically generate process annotations following the MATH-Shepherd approach (Wang et al., 2024b)","venue":null,"work_id":"d3a96aa1-f901-4bad-a84d-ef1c69f347c1","year":2023},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.486533Z"},"links":{"citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:8d4b9e56ec23592413603c804b231564e6a301e2793741dc0086d57781e21f92","observation_id":"cbaea97a-41f4-4645-ad90-703476551a4d","resolution":{"observed_at":"2026-08-11T05:45:01.127958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-19T14:36:56.493613Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-11T05:45:00.426531Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.426531Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:f29018ed9a5e161d58bdb0bf09aad6f932e5eee5f0390fdb3f98bc7091388570","observation_id":"9f49c1a7-e212-4bc3-a9ba-bc786c6bdd6b","resolution":{"observed_at":"2026-08-11T05:45:00.426531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02396","last_updated":"2023-06-05T06:00:17Z","snapshot_observed_at":"2026-08-16T15:42:34.819133Z","submitted_at":"2023-04-05T12:14:41Z","title":"AutoRL Hyperparameter Landscapes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02396","snapshot_observed_at":"2026-08-11T05:45:00.411942Z","title":"Autorl hyperparameter landscapes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.411942Z"},"links":{"cited_paper":"/paper/2304.02396","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:1a4b0b6c13a2a41e69d65ec41dfb99c138a529ccee601ddb0b24139118742a24","observation_id":"df973591-8902-41af-a403-faec8186a1c9","resolution":{"observed_at":"2026-08-11T05:45:00.411942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10397","last_updated":"2022-11-23T07:42:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-21T10:18:37Z","title":"CodeT: Code Generation with Generated Tests","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10397","snapshot_observed_at":"2026-08-11T05:45:00.323238Z","title":"Codet: Code generation with generated tests","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.323238Z"},"links":{"cited_paper":"/paper/2207.10397","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:67f77b27638f5e00879e768863cd6a238f6b06040f40ec35b131c1fe0900b4b1","observation_id":"678e6045-3047-4e48-b3d9-247cf1a95873","resolution":{"observed_at":"2026-08-11T05:45:00.323238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T05:45:00.338933Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.338933Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:562318164342b00d6535a08056f2b2c8e75db7b55abe4b19dd1af289e5dbc48f","observation_id":"5ca22ffc-ce6f-4c0b-8923-0f88d285d181","resolution":{"observed_at":"2026-08-11T05:45:00.338933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11182","last_updated":"2022-01-26T20:43:13Z","snapshot_observed_at":"2026-08-20T09:35:54.731756Z","submitted_at":"2022-01-26T20:43:13Z","title":"Hyperparameter Tuning for Deep Reinforcement Learning Applications","version":1},"cited_work":{"arxiv_id":"2201.11182","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.11182","snapshot_observed_at":"2026-08-11T05:45:00.785528Z","title":"Hyperparameter Tuning for Deep Reinforcement Learning Applications","venue":"cs.LG","work_id":"774c265f-6cb4-4093-83fb-54237660feca","year":2022},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.394591Z"},"links":{"cited_paper":"/paper/2201.11182","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:461665d432ed8357163a69ef0e28de829953ac9eab0080a1484df1bcb8eaf30e","observation_id":"b8ad65a8-f03b-48cb-98ef-df405ef0036e","resolution":{"observed_at":"2026-08-11T05:45:00.793440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04782","last_updated":"2018-02-26T01:36:49Z","snapshot_observed_at":"2026-08-14T21:11:57.542361Z","submitted_at":"2017-03-14T22:28:27Z","title":"Online Learning Rate Adaptation with Hypergradient Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04782","snapshot_observed_at":"2026-08-11T05:45:00.318006Z","title":"Online learning rate adaptation with hypergradient descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.318006Z"},"links":{"cited_paper":"/paper/1703.04782","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:e3ecaf7160c768c7469c3bd5a6fba4ae8fea3e18b97ad5709328e71209d98f38","observation_id":"7bcffeca-efd5-4ceb-ac2b-23840ab31f17","resolution":{"observed_at":"2026-08-11T05:45:00.318006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T05:45:00.333827Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.333827Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:54158dd170b2626a991408b1c32531fb7fcf4a6575b4275fe181cc47d51dd29b","observation_id":"7dbbc932-b27f-4484-87f8-3bc30eb3bbae","resolution":{"observed_at":"2026-08-11T05:45:00.333827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T05:45:00.328549Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.328549Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:00264fe5647e78fe732067c712a054e03e06f35f97cfaaa926706968a46c3a45","observation_id":"9fded7f3-63dd-46f9-83cf-134bc088685f","resolution":{"observed_at":"2026-08-11T05:45:00.328549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-20T11:08:15.972755Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-11T05:45:00.359505Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.359505Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:0413906eb6416c4aaf08ebb8dc27e322077d45906f82630a934835869a2a719c","observation_id":"ba1be8f6-1e9c-46e5-9890-b523a464221c","resolution":{"observed_at":"2026-08-11T05:45:00.359505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01555","last_updated":"2021-03-17T14:43:36Z","snapshot_observed_at":"2026-08-13T21:42:12.882073Z","submitted_at":"2020-09-03T10:04:06Z","title":"Sample-Efficient Automated Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2009.01555","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.01555","snapshot_observed_at":"2026-08-11T05:45:00.957610Z","title":"Sample-Efficient Automated Deep Reinforcement Learning","venue":"cs.LG","work_id":"9a577ea3-f746-47c5-99c2-e3f34fcdc497","year":2020},"citing_paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T05:45:00.350019Z"},"links":{"cited_paper":"/paper/2009.01555","citing_paper":"/paper/2412.17256"},"observation_digest":"sha256:9e0ff1d43435d085490ce5f0cfafcfc9d3627a4a265b1e0007ab520bd1e82777","observation_id":"9cb6829f-b254-48fb-a735-126e4665de2f","resolution":{"observed_at":"2026-08-11T05:45:00.963917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.17256","last_updated":"2025-03-04T06:29:50Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T05:57:08.449467Z","submitted_at":"2024-12-23T03:58:34Z","title":"B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 6 inbound Pith citation observations for arXiv:2412.17256."}