{"as_of":"2026-08-14T03:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eae562b6386a3b0720c7c71d53e95ebfe0860c4b8af633a4593251c20d67bbf6","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T19:56:09.820812Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.08088/citation-record","integrity":"/paper/2606.08088/integrity","json":"/paper/2606.08088/citation-record.json","paper":"/paper/2606.08088"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:b3fefe53572b1b19f473476b30a184c27d161ac42af6534661e573b9724c1465","observation_id":"0eac99e5-97d9-40c1-a7d4-60571501673e","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-13T20:36:12.184426Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":"2504.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-07-09T03:25:57.840663Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","venue":"cs.CL","work_id":"3dea79f1-73da-4db2-8d7b-64013c3c5fa5","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:9b110d6c131f0bb839b7cc61d9f31be3786a3e390c2495173237db4113911bd0","observation_id":"457f3a84-162b-4381-8e5e-f7a65fda66f9","resolution":{"observed_at":"2026-07-02T21:07:23.905688Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.18470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:02.583010Z","title":"Pan and H","venue":null,"work_id":"350b6461-07bc-469c-8a06-7ba712d7c0db","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:34d241c6ec8bd899abe59da4aebfdf916599368404b8f136a04bd73ca4b093be","observation_id":"5e4d0d75-8a83-4d5d-8486-225e33f4ba50","resolution":{"observed_at":"2026-07-02T21:07:23.938374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-08-02T15:24:09.026985Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:c39f68a55164032922e4363615c0ec423004ee3b91ebfe29980825ab5ebb7240","observation_id":"aa580c9a-1676-4f23-8d9d-52405be4a5f2","resolution":{"observed_at":"2026-07-02T21:07:23.933247Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.920901Z","title":"arXiv preprint arXiv:2601.18533 , year=","venue":null,"work_id":"4599e88c-04ad-48e2-a23e-e9d45c9f2eea","year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:0fba99e590fdb8097c7966a6f8cb6f8971b73cae700bf3b44a731952e0887550","observation_id":"a4fbc573-08a0-4e9b-bcd5-e54607ad84ea","resolution":{"observed_at":"2026-07-02T21:07:23.922659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.923615Z","title":"Hansen and Duo Peng and Yuhui Zhang and Alejandro Lozano and Min Woo Sun and Emma Lundberg and Serena Yeung-Levy , year=","venue":null,"work_id":"24cdde52-11e0-4409-8656-4a46c92a8552","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:f1bee888f24475af25353e674ea39af2b6bab6b17f02ad7021e4a51c27ada2be","observation_id":"f129b06e-b4d6-4fd2-bbd7-2f3857fb4541","resolution":{"observed_at":"2026-07-02T21:07:23.925100Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:f1fca8855442a35806a645850061114fd29f1099606a7ea4e715d24289c7fa07","observation_id":"ce1eebc0-fa28-43cd-9131-117f7bf7fd6b","resolution":{"observed_at":"2026-07-02T21:07:23.927648Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03525","last_updated":"2026-05-26T16:39:06Z","snapshot_observed_at":"2026-08-06T03:27:45.707151Z","submitted_at":"2026-01-07T02:29:49Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","version":3},"cited_work":{"arxiv_id":"2601.03525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03525","snapshot_observed_at":"2026-07-02T21:07:23.934381Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","venue":"cs.LG","work_id":"891e1e22-0fb7-462e-a817-6d7351c367ee","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2601.03525","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:ede0ab5c2f0267d629064aab2d86023e52f580669a52e383b72f6b44c9a0add2","observation_id":"64b39f26-c202-4303-b120-3769212a0f2d","resolution":{"observed_at":"2026-07-02T21:07:23.935694Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.401684Z","title":"Save the good prefix: Precise error penalization via process-supervised rl to enhance llm reasoning","venue":null,"work_id":"5419b17d-0e9d-40bf-ab19-7ee39f8c99ab","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:1f988200fd087ce8c9d076c186b614c18e0e46d2fe936eb0a4f2eec8de0151f5","observation_id":"5795dac7-6c37-4d11-a626-c7a151ce49f5","resolution":{"observed_at":"2026-07-02T21:07:23.908613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13213","last_updated":"2025-08-07T01:33:12Z","snapshot_observed_at":"2026-08-13T04:14:19.187289Z","submitted_at":"2024-02-20T18:24:47Z","title":"Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A","version":4},"cited_work":{"arxiv_id":"2402.13213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13213","snapshot_observed_at":"2026-07-02T21:07:23.912546Z","title":"Softmax probabilities (mostly) predict large language model correctness on multiple-choice q&a","venue":null,"work_id":"d46c9875-4f26-41fd-8e58-2bbb5f1f8276","year":2024},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2402.13213","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:68f770afa32203afbff41add84812b3ccdc0b37f09d529ec5a3965c6745c6fde","observation_id":"96734832-56cb-42d8-90c9-2cd72e1a68b6","resolution":{"observed_at":"2026-07-02T21:07:23.914209Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:8aace0e6e4d42f23d083a911819e75bf52a925618ae0725c19cd7209fd66d21e","observation_id":"a4df47c0-54a5-4439-8c05-c1f63bbcbcc6","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:2ad32cb12874760cbf77a74d8db193a34a1e39ac412c882a48e0feff33bc89fa","observation_id":"81f6aee7-5482-4a80-b541-26cb9dcd9333","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:2a90c8c7faed95824a73ee7385ea8fb272261e409abc86a2525d76b3bab49855","observation_id":"718dc540-162a-4b4e-ba19-b8a81123df5c","resolution":{"observed_at":"2026-07-02T21:07:23.900753Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Proceedings of the 2023 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:de5fc10848e4f3ffa4de187fe9c65b77e023eee99b2cc060e5960c56f0bf4763","observation_id":"fd4058a2-76b9-4c82-9ac9-bb9209ebcec3","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13275","last_updated":"2024-01-28T09:07:13Z","snapshot_observed_at":"2026-08-13T04:35:46.259672Z","submitted_at":"2024-01-24T07:34:55Z","title":"Can AI Assistants Know What They Don't Know?","version":2},"cited_work":{"arxiv_id":"2401.13275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13275","snapshot_observed_at":"2026-07-02T21:07:23.896328Z","title":"arXiv preprint arXiv:2401.13275 , year=","venue":null,"work_id":"6e299f5d-4f7c-4d97-914e-139ede35a3dc","year":2024},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2401.13275","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:38766e79207aed953438e10e3cbf333bd1f9d5985a9c25c72b9b6f487f38427c","observation_id":"8c9aaf55-e41e-4f80-9b30-39471778c1b3","resolution":{"observed_at":"2026-07-02T21:07:23.898118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:f98f6eb135f5c215c8ab6d13bddbe73a4640dab4850c292d0dd252d37e7b1d18","observation_id":"2e75d40d-a96f-491f-82ca-8a19ca6aab03","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10315","last_updated":"2024-04-16T06:47:49Z","snapshot_observed_at":"2026-08-13T00:29:21.973177Z","submitted_at":"2024-04-16T06:47:49Z","title":"Enhancing Confidence Expression in Large Language Models Through Learning from Past Experience","version":1},"cited_work":{"arxiv_id":"2404.10315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10315","snapshot_observed_at":"2026-07-04T12:59:52.891053Z","title":"Enhancing confidence expression in large language models through learning from past experience","venue":null,"work_id":"78ad06b4-12a4-49e3-aa65-a61a7ddcf9e2","year":2024},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2404.10315","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:7861d4ce44555636b26167ffc328118b69fee7f63215f4032b72a796804ccf3b","observation_id":"1cdb34c0-bea1-4a2e-88bb-51c9e8898260","resolution":{"observed_at":"2026-07-02T21:07:23.894907Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:1aea6476115210628e3279489efc8c5ae0fbc02ba172b0d4fc275f21aa97323b","observation_id":"69a4c557-380b-43e4-82f2-9f8c87ed3f95","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:c7a69b2357ba46f343e5a446cf36b72d54f44b8ea789be7a12c9a7d34c915e20","observation_id":"be217a70-f455-46b5-a1e4-3587adc67dca","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:c0cdf10f22a8bd094e2ee2d4a33d6b7168630bd33984d1a59cf88b06a59d1794","observation_id":"c8d6598e-6707-4d0e-8607-463a32089b58","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:a3ddb44b73fb30cb7ee59eaffed85fe5e10b7372c2b4defd6d610600644c9700","observation_id":"59cb0b50-4c60-4f3c-abb6-e8925981db91","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.02623","doi":"10.48550/arxiv.2503.02623","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.02623 (2025)","venue":"arXiv (Cornell University)","work_id":"2dfada27-5b98-46b2-a288-443735b20e73","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:db9a601a5b87d3978b72e002eeeba2b40190d9ad3965e0ea15e6795d79817cd9","observation_id":"2c3a458f-77f4-4c05-af5f-d4c24edde5ab","resolution":{"observed_at":"2026-07-02T21:07:23.892354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:3736d2302cbcf9aa06f7e1e05b7da086c4e7bc3a5a186fcae7e6cef732a75fc6","observation_id":"711a585e-f576-4671-8362-1e59c642e8ca","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:fd7690ae119eee5a33350d4373cd69147122a80cd0139c7d65b8612221b51d58","observation_id":"526eddf0-9368-4a52-81aa-eae1d528d6d9","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":"2302.09664","doi":"10.48550/arxiv.2302.09664","metadata_source":"pith","pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","venue":"cs.CL","work_id":"d66d411b-c2c1-4cd6-8a6b-9fac872fa257","year":2023},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:d603270b43cd8770a9d090c567d253bbbd35f3656f322ab6535922d2df46e4d2","observation_id":"c6e5bd6e-77d1-4f5d-80be-4eb688219c2b","resolution":{"observed_at":"2026-07-02T21:07:23.903092Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10236","last_updated":"2025-01-05T06:15:04Z","snapshot_observed_at":"2026-08-13T14:21:15.807570Z","submitted_at":"2023-07-16T08:28:04Z","title":"Look Before You Leap: An Exploratory Study of Uncertainty Measurement for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.10236","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10236","snapshot_observed_at":"2026-07-03T18:08:46.635429Z","title":"Look before you leap: An exploratory study of uncertainty measurement for large language models.CoRR, abs/2307.10236","venue":null,"work_id":"50e2761a-1893-4580-b1dd-fe617e8fd2c4","year":2023},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2307.10236","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:29e02abde7bb1948eb8132677889a4cf45a331c7f373a3deed68c522667e96f8","observation_id":"caa66479-c02b-41e8-92a3-5e8caa048f64","resolution":{"observed_at":"2026-07-02T21:07:23.911497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:7bc97882291e6f0ae2c85e12b3ced30cfa26dfc61337ea55e1b84e375bd4ab1a","observation_id":"6acfe10f-7eb1-411e-b246-8ed429bd522f","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-08-12T17:10:09.978771Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":"2508.15260","doi":"10.48550/arxiv.2508.15260","metadata_source":"pith","pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Think with Confidence","venue":"cs.LG","work_id":"39c40c74-9f55-406d-b67a-37d9b88aa6b3","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:df2cede9c40b3d108831e546c91c5f1446d9289b829a0c2bcd985c515330660c","observation_id":"da3faedb-e85a-4033-a526-74de54257a75","resolution":{"observed_at":"2026-07-02T21:07:23.886476Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.879372Z","title":"Harder is better: Boost- ing mathematical reasoning via difficulty-aware grpo and multi-aspect question reformulation","venue":null,"work_id":"3065ba72-7cd8-4bef-9c29-a9cdeaf219b7","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:22abdfe91580609f11aeccf98e675795f897d18b8a97d75e48c5b2961295622e","observation_id":"fa41559d-c7d7-4b17-8d5a-b67068d91256","resolution":{"observed_at":"2026-07-02T21:07:23.881098Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:91d92bcb6b7b850ccae1c0ff9794bb1f80770fd6192a09a7917713d1ca058dfd","observation_id":"fef274b5-193e-442b-883b-76f7d264321b","resolution":{"observed_at":"2026-07-02T21:07:23.878243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:1ce5412741524766b624abbdff2bc6fda3819f8bd00016d3ec2b61d33ea9d2c0","observation_id":"fc381771-0383-4da4-9c5c-5aae583d23cb","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-12T16:05:52.077251Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:ebebb0e4c63b2a0d9fe74ec74dd7a07a52169c482acd3d628161e573523096f2","observation_id":"d3d1ff10-4d27-43ec-8f1f-fc2b63b4a30a","resolution":{"observed_at":"2026-07-02T21:07:23.915385Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-08-12T16:05:03.602321Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2511.20347","doi":"10.48550/arxiv.2511.20347","metadata_source":"pith","pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Adaptive Policy Optimization","venue":"cs.LG","work_id":"2d2c49f8-7feb-48c2-af7e-025b94c5d4f9","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:a41153abeec2f8d6c906aad160af9fcbbea5a5f96aa8f9ca7afb51b93edd33d1","observation_id":"e6374cfc-faf8-4d27-bc8b-b7406f62002d","resolution":{"observed_at":"2026-07-02T21:07:23.883819Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:00c529186dfeb7666dd78fbba8203e95e921cc50593ffeb4c1eff2a64ca44f03","observation_id":"acf14a0f-0a73-4baa-aec8-9768f1748718","resolution":{"observed_at":"2026-07-02T21:07:23.875133Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:970e45895e993ea8865851cdb1fb47b5c71d69b5b5828fd18d032b17b67ec00d","observation_id":"4c401f2b-8499-4af7-9022-9e5fa945f24c","resolution":{"observed_at":"2026-07-02T21:07:23.866648Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:0e2be295fd45aaf8b3dfa0e9bf84e45afaa4a2252f14b3bcc39fd72bc270f901","observation_id":"26e49a38-037d-41f7-972b-ebddbf7287e7","resolution":{"observed_at":"2026-07-02T21:07:23.858140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:25057ac964102d9ea80701bbf2cff3a9fc7d2ea5e797c841ae15dd7372c4a298","observation_id":"1934d145-c540-4c41-9459-d1bae4cdbfcb","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:0df489fe6cca25803f8c172c240b0a3dcbc4061d88a6a98702137b195e2dc255","observation_id":"6df45bed-9891-4866-9394-011220556066","resolution":{"observed_at":"2026-07-02T21:07:23.860897Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-13T17:31:32.138475Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:0fa964c35a499f7c058cb38baca0bdf051fa0c9dbb74dcff9bfe8924f676971e","observation_id":"368189ad-bd44-4324-b428-4e84ad633ca6","resolution":{"observed_at":"2026-07-02T21:07:23.863986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:af259d1928fc61b718b291a8a68cdbf40cbb7745e26ed910a1b768da8f4597ff","observation_id":"8151db6a-0ee4-488c-92c7-049b71de7618","resolution":{"observed_at":"2026-07-02T21:07:23.848807Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:8784ef38c2c52a583184c5c2b117ba235ca153976b826c311b0c3da17dd579e5","observation_id":"86a42992-4a6b-46bc-957d-59eadd424386","resolution":{"observed_at":"2026-07-02T21:07:23.851671Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:30a9369123afa8fbddef4dac5a27f29e2a5ee6b06e88f61ffb8a709b92c579a9","observation_id":"cff1f99b-280b-4be0-a7dd-a7e6ac01f7b0","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:56:09.820812Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:982f7dad76cc298f41460f8553895912a9785141b4ca320f6a362ed1ab4bb8e1","observation_id":"fe411c30-a9a1-4d1f-b629-5f0408d35319","resolution":{"observed_at":"2026-06-27T19:56:09.820812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":"2503.18892","doi":"10.48550/arxiv.2503.18892","metadata_source":"pith","pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","venue":"cs.LG","work_id":"94a68437-02e7-425a-91b2-5846ddcbd38c","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:3673d1f5fd81f7bb690b3d56f9f5f05fa8004cfd60de84a02405db930d194794","observation_id":"7f39cbde-8113-4c3d-9d18-7008bbbd13ca","resolution":{"observed_at":"2026-07-02T21:07:23.854950Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.17736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.868093Z","title":"arXiv preprint arXiv:2503.17736 , year=","venue":null,"work_id":"ccd0a79a-2de4-4173-8275-4245b75d00d0","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:6b635c04350661ddf495cae5de07279ba8a8b0b56eb950919e4bb9b4c8b5f1e2","observation_id":"9dfb7d77-5ad6-4732-a83e-ee13de50b8cc","resolution":{"observed_at":"2026-07-02T21:07:23.869714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07956","last_updated":"2025-04-10T17:59:03Z","snapshot_observed_at":"2026-08-07T16:06:45.494945Z","submitted_at":"2025-04-10T17:59:03Z","title":"VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":"2504.07956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07956","snapshot_observed_at":"2026-07-04T05:49:36.609405Z","title":"Vcr-bench: A comprehensive evaluation framework for video chain-of-thought reasoning","venue":null,"work_id":"bc64fca8-39fc-44be-bafa-6fefc7c0275b","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2504.07956","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:59a34104533c7e32e9c4788f0227d541ce640b886728a6b1985267e0aee93d35","observation_id":"7a0ee72f-3988-4eb9-9088-b2e897cb7516","resolution":{"observed_at":"2026-07-02T21:07:23.872673Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:19:04.020303Z","title":"Vision-deepresearch benchmark: Rethinking visual and textual search for multimodal large language models","venue":null,"work_id":"bd092ac1-e4dd-466f-aadc-06f35e1feb81","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:acf924e31abca0ea9afa41a8d17740b1d567ff75719f3b22cb15e0f2037cfa2c","observation_id":"f7e8c7b0-933b-480c-a001-3ca2db9532f1","resolution":{"observed_at":"2026-07-02T21:07:23.916853Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.918077Z","title":"arXiv preprint arXiv:2510.01304 , year=","venue":null,"work_id":"018cbc22-787a-4b43-b731-08e5fbe9d7af","year":2025},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:2f8b2c97896061417f4440af838a80843e9e51c65728cffffc5cd7c18cabba15","observation_id":"55701cbf-2b2c-4166-b565-84f8ab479874","resolution":{"observed_at":"2026-07-02T21:07:23.919756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"cited_work":{"arxiv_id":"2605.16079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.16079","snapshot_observed_at":"2026-07-02T21:07:23.929020Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","venue":"cs.CV","work_id":"0e60d904-0b9a-4a41-87a7-8ef9c3c00dd3","year":2026},"citing_paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T19:56:09.820812Z"},"links":{"cited_paper":"/paper/2605.16079","citing_paper":"/paper/2606.08088"},"observation_digest":"sha256:d3f725c5c01912d7bd1acd71c3e49a6c81c5b73132a26600502064d2cf3cf06b","observation_id":"ffb93de8-b762-45ef-97df-7016bb2954df","resolution":{"observed_at":"2026-07-02T21:07:23.930391Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.08088","last_updated":"2026-06-06T10:23:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T18:34:53.119811Z","submitted_at":"2026-06-06T10:23:24Z","title":"ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":26,"parse_uncertain":0,"unresolved":16,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2606.08088."}