{"as_of":"2026-08-02T02:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35073eb0e3666c52f8269cb52949dcc556fef1b5f980a5af8b7e57cd524d7949","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T08:19:09.437464Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T06:48:41.331963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23333","snapshot_observed_at":"2026-07-31T06:48:41.331963Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28457","last_updated":"2026-07-30T16:20:58Z","snapshot_observed_at":"2026-08-02T02:49:17.716936Z","submitted_at":"2026-07-30T16:20:58Z","title":"SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T06:48:41.331963Z"},"links":{"cited_paper":"/paper/2604.23333","citing_paper":"/paper/2607.28457"},"observation_digest":"sha256:06a83e4a1f43f6ff547fe937589ea7bde243422c78887cb59be02432972916ac","observation_id":"bdca9a63-aad3-4285-995c-87118c8e3c97","resolution":{"observed_at":"2026-07-31T06:48:41.331963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.23333/citation-record","integrity":"/paper/2604.23333/integrity","json":"/paper/2604.23333/citation-record.json","paper":"/paper/2604.23333"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":"7a60db42-d788-4830-8e34-82b3bbb2b0a3","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:1de48d7110c6cbe444214ceed07190e31b35fb58f4ec02200f21c0c52e571adc","observation_id":"fd1272f0-df01-4d45-bd9a-e081c8a22cd4","resolution":{"observed_at":"2026-05-26T17:07:40.604886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1214/24-aoas1998","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Barber, R","venue":null,"work_id":"d83608d1-5363-44ac-aa0f-05f310a15290","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:739c703e31540adb74375987db8ab9bd075cab017f4198c004f2077943d8898f","observation_id":"62a90c69-16d0-4d4a-a952-d2b07ca5febd","resolution":{"observed_at":"2026-05-08T22:34:28.718729Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-11T18:49:04.205348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T18:49:04.205348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conformal risk control","venue":null,"work_id":"7ee11d6b-8be7-4df3-841e-e45c16af5f39","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:af2d76c99e249bbbc6d073f444be634d10d38914b09e1aaeb3e389077d022340","observation_id":"3b4e2a25-f8b2-4cb2-8cec-dd36660a7133","resolution":{"observed_at":"2026-05-26T17:07:40.632806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.1429","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconsidering LLM uncertainty estimation methods in the wild","venue":null,"work_id":"ab1a4e2f-d5c2-47b3-b1b4-0f0ab35ef692","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:f9d5a6e02800dd6e5b14abf3a62d7c9dcbd46bbcf870235ff3deaef3e3f7af09","observation_id":"225b676f-c243-467c-9aae-729aa5860759","resolution":{"observed_at":"2026-05-08T22:34:28.669854Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linguistic calibration of long-form generations","venue":null,"work_id":"7ee1cfd5-ded6-4522-b42c-bb7afb487d15","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:8080bdc66dc2fc897d277a032443cacf22adab5f4bc2d13cc263c4ee999ae690","observation_id":"b1cecae0-2a6c-4066-9c2f-4771d76c1a43","resolution":{"observed_at":"2026-05-26T17:07:40.599634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rewarding doubt: A reinforcement learning approach to calibrated confidence expression of large language models","venue":null,"work_id":"10b549ac-4f4b-4436-807b-33ba465688e6","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:22c6cdc9173fd8e12ef5d0fbc6d3a15a16cd5e5d2724c66e7ea5d7c8df779545","observation_id":"c6414d67-98ad-45a9-b3ca-bde9d0fccd34","resolution":{"observed_at":"2026-05-26T17:07:40.628017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.04112","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bereket and J","venue":null,"work_id":"d2bf2aef-23c7-4efd-888b-be207727d96c","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:b3e23f86e36328581f251ea74f866a844ed7d8a504eac866b058cd4b561a0ae3","observation_id":"fff23457-9f47-4199-a675-a01faf932cb1","resolution":{"observed_at":"2026-05-11T20:41:12.302769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.260","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:06:57.491580Z","title":"Do Androids Know They’re Only Dreaming of Electric Sheep?","venue":"Findings of the Association for Computational Linguistics ACL 2024","work_id":"c6f88fb4-0bb4-4e28-b474-d2333c3f4128","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:d6dfecef9c7123ff50c79f94f80c19f2f60b9200f7a8271a8d70f6cfbd286cc8","observation_id":"04ee208a-c0da-4018-878d-53383f949a62","resolution":{"observed_at":"2026-05-08T22:34:28.714791Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:03.797898+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:03.797898+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.774","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uncertain Natural Language Inference","venue":null,"work_id":"3a247380-f778-4a2a-ab58-935831559980","year":2020},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:ab6cdba052f2363d51dc3e9af3504fe46117920baac2e486f995d0236133accc","observation_id":"e45f9f31-1f6b-4c2a-9566-a3afb12a81c8","resolution":{"observed_at":"2026-05-08T22:34:28.677536Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-20T19:52:56.330865+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T19:52:56.330865+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.75","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A close look into the calibration of pre-trained language models","venue":null,"work_id":"1b00ce19-cfc6-47dc-9e35-100f837f6d68","year":2023},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:db118c54f148d637499fee20e4a60c7eee14600be273d61e6c28836bd71d3e75","observation_id":"194d0830-dfe6-4e88-8a46-9f14ad0fc725","resolution":{"observed_at":"2026-05-08T22:34:28.673639Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind the confidence gap: Overconfidence, calibration, and distractor effects in large language models","venue":null,"work_id":"b9108be3-fbb4-4cd0-b0e7-b1b0de5195cb","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:57125483c6a7599f9e073331266d50a751f0122570f2bc701d5e583047647fca","observation_id":"acad2e9a-1d91-407a-b682-c58cdc0cd67f","resolution":{"observed_at":"2026-05-26T17:07:40.625395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating language models as risk scores","venue":null,"work_id":"2af5f917-d689-4262-8bed-028b389e1992","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:d13401bf3387ce8969883b5d7e2f4cdbe2337d0cb50955f074f2163861c91dae","observation_id":"ba73bd9c-b312-46b3-a77a-b3986201bb76","resolution":{"observed_at":"2026-05-26T17:07:40.597097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2603.09309 (2026)","venue":null,"work_id":"039b93c6-64c7-4da4-acd6-acbb713ff0a7","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:0bcead34be2efd01fc6cc81ddd60bd6adb74eedc334ba85c263d6575e0fd82df","observation_id":"8118ff22-c021-447c-a758-fbe4a6bca34c","resolution":{"observed_at":"2026-05-11T20:41:12.062181Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16806","last_updated":"2026-05-15T00:00:51Z","snapshot_observed_at":"2026-07-06T22:01:12.359748Z","submitted_at":"2025-07-22T17:56:01Z","title":"Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty","version":2},"cited_work":{"arxiv_id":"2507.16806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.16806","snapshot_observed_at":"2026-07-10T01:16:41.377531Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307, Abu Dhabi, United Arab Emirates","venue":"cs.LG","work_id":"f782e200-f772-4bab-b33a-02ad5e0437b7","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2507.16806","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:5bbfb82e558223faff48c1665720cf97f4514fbd305f66a772de0b7e60f41473","observation_id":"a0df8c10-e56c-4d0c-9234-65c0e2dc5bd2","resolution":{"observed_at":"2026-05-20T00:00:22.282912Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:4914119695ddd6aa29c894b50c78c987b9b8c63a589dd779a6aa26bfdc48db84","observation_id":"4274fba9-8265-405c-9bd1-0cd480105a2c","resolution":{"observed_at":"2026-05-11T20:41:12.070150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calibration of pre-trained transformers","venue":null,"work_id":"602c6ad3-bcbe-41e6-a2de-37eabcb4b8cf","year":2020},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:9852fce005fa9bbe4fc7ced64bf267787fa977bc1a0671698b59294ffd13aead","observation_id":"d128a3c7-bd13-45a0-a906-8638ac224943","resolution":{"observed_at":"2026-05-26T17:07:40.602127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:07:37.716446Z","title":"Detecting hallucinations in large language models using semantic entropy","venue":null,"work_id":"972a399d-a864-4bc4-9329-a8b8bcf07995","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:aa69892fe29f3375e1fdbd1d356eb9e9590a0ecc8130027e07d0830a6d270bec","observation_id":"5c09aea8-7652-4c17-a01f-69ddf6ec0e34","resolution":{"observed_at":"2026-05-26T17:07:40.607466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-07-06T22:16:00.776125Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":"2508.15260","doi":"10.48550/arxiv.2508.15260","metadata_source":"pith","pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Deep Think with Confidence","venue":"cs.LG","work_id":"39c40c74-9f55-406d-b67a-37d9b88aa6b3","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:2b01ba20aa1419eb843d9d318dc878293b1075ba4897f41022481a9af8fdc760","observation_id":"af936a36-0466-4beb-b767-25f7106813be","resolution":{"observed_at":"2026-05-16T11:30:21.518780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-07-06T21:05:15.750647Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:8044c34c5a0eb26b9e7e5ca9662693c983af29e3420c9a66214bee2720ce4f5e","observation_id":"c9324866-5083-4271-b0cc-967a7d707468","resolution":{"observed_at":"2026-05-11T20:41:12.225348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On calibration of modern neural networks","venue":null,"work_id":"5efd8bf1-a2f3-41fe-a5c7-1902f46c85ec","year":2017},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:71e8ad3be21e4e4c6f341cc6e1e4fddfce7eaf03d829a82a4f48fd4e492b23cc","observation_id":"43982279-c7db-46c1-8238-4f257e4d80a2","resolution":{"observed_at":"2026-05-26T17:07:40.630777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language model cascades: Token-level uncertainty and beyond","venue":null,"work_id":"80a8c473-207a-4b69-a31d-5ff1d58f0f37","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:f947f698588598910858629f67d4a1b4078c2b414f949baf10e1c9255e732670","observation_id":"d904375c-697d-4c78-bfac-a464c7c4f4d1","resolution":{"observed_at":"2026-05-26T17:07:40.589798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.211","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.148191Z","title":"O lympiad B ench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":null,"work_id":"7b3c92e2-292d-4caa-8dbe-e949ccf083a8","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:672d166a966c3c77e8ff15bb14d5b53737177f82f68aa764b8beef02047b5021","observation_id":"c4b1cfdc-ba02-415c-bf80-965992023719","resolution":{"observed_at":"2026-05-08T22:34:28.661171Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-13T13:50:25.306557+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T13:50:25.306557+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"37f414f7-12dc-414d-92d4-b4f0701d3a0f","year":2021},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:0c01f8200d3b74fbadb54f0aab275ffac40a8b51e9a2cdb2ddcf0b47d5b46faf","observation_id":"f5ec1206-ee0a-46ff-bea3-076db50247b8","resolution":{"observed_at":"2026-05-26T17:07:40.592482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00031","last_updated":"2025-02-25T00:21:14Z","snapshot_observed_at":"2026-07-06T20:44:35.837721Z","submitted_at":"2025-02-25T00:21:14Z","title":"Efficient Test-Time Scaling via Self-Calibration","version":1},"cited_work":{"arxiv_id":"2503.00031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00031","snapshot_observed_at":"2026-07-03T14:28:31.655268Z","title":"Efficient test-time scaling via self-calibration","venue":null,"work_id":"1f33ea43-25d3-47b4-bdd1-61cf6c33c69e","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2503.00031","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:92306e8de6ad24d3c49eda5a50cca29bf185af0abcf506dbd0427bfa1eb6a796","observation_id":"23fb203e-c842-48a3-bbe3-dc713987d2b4","resolution":{"observed_at":"2026-05-11T20:41:12.347697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3703155","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.243096Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":"ACM Transactions on Information Systems","work_id":"ed8c5be1-1069-44c0-8dc4-627a7de3a371","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:6a255ab312e7de552c04951c9b4cefad7d4a2380c566ea407cc02a4218388cc8","observation_id":"97eb9b03-c697-44ec-bbf5-e44f25368210","resolution":{"observed_at":"2026-05-08T22:34:28.706923Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-20T15:53:54.088987+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-20T15:53:54.088987+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-10T16:57:24.584548Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:9284c3a368fd64a41610c80b115c9073c71adf9fbb72cf525c4d2ff3db104f7e","observation_id":"57394729-3a4e-46a8-96a9-9142b2c53f53","resolution":{"observed_at":"2026-05-12T04:29:18.795354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"56eb9273-dffe-4927-98f2-16a5531cbaec","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:9c74d2d3e71c228bef7cedb2702af7820be9eab5eceba780c1d48fe95d3edcf2","observation_id":"209dc3a1-c0ce-493a-8d7e-bd530bf3520e","resolution":{"observed_at":"2026-05-26T17:07:40.594691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calibrating zero-shot cross-lingual (un-) structured predictions","venue":null,"work_id":"36d490aa-7e31-4679-a8be-3a574e1b0b95","year":2022},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:b2735877a1e69e066ed54bb921b425bf0ff3b44a962a090975085186066d04a3","observation_id":"a4d3476e-ea41-4c22-b44f-09024919246c","resolution":{"observed_at":"2026-05-26T17:07:40.609903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00636","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing the Binning Problem in Calibration Assessment through Scalar Annotations","venue":null,"work_id":"d321c9d4-b839-4cbe-84c3-0f3777b0d5cc","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:8985d6be40a99246f24263ab0275c96b92988263fe29f91500cf10e4d400d641","observation_id":"272d0462-2136-49b8-8009-f159c4627da5","resolution":{"observed_at":"2026-05-08T22:34:28.665676Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conformal linguistic calibration: Trading-off between factuality and specificity","venue":null,"work_id":"e58f40d8-5b45-4ca0-9761-4f7f553b6aa1","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:0f654c32f9dfef3f97f8023e90d984506090022744e223f3f86c5720a35cc3bf","observation_id":"b26b2712-3bb0-462a-9470-2e43a2113618","resolution":{"observed_at":"2026-05-26T17:07:40.623048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-short.50","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is that your final answer? test-time scaling improves selective question answering","venue":null,"work_id":"ee139805-3490-4de0-b23f-8de4123b9741","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:d31ebc3ac1923f552863855e0fe64bb3e067c7f868f4b1c8aea18cd29e06c83d","observation_id":"17ab1cfd-b331-4c58-9cc3-cd6521422b36","resolution":{"observed_at":"2026-05-08T22:34:28.724549Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":"2509.04664","doi":"10.48550/arxiv.2509.04664","metadata_source":"pith","pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Why Language Models Hallucinate","venue":"cs.CL","work_id":"6bfb3eed-1270-492c-8fbe-a5671f3f779c","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:3f6ac6606125d8e851f72fbe9f8b2f03f639309872af0c8c4e72e19332933a93","observation_id":"ce38668a-50ac-4cdb-bc70-758d102a26fa","resolution":{"observed_at":"2026-05-13T12:32:40.683342Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable best-of-n selection for large language models via self-certainty","venue":null,"work_id":"4115c11f-b852-4d34-99e6-c14cf451e7c0","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:dd76e65060009f5aa54da0e64c724aa64a41b60c5ed5de5747e9fd4f12a3c5b7","observation_id":"8ac5acb3-0999-47cf-91ee-67809c2ad9e8","resolution":{"observed_at":"2026-05-26T17:07:40.614155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models must be taught to know what they don't know","venue":null,"work_id":"9d01e24f-4a02-4b96-9b33-b74b9c7840ec","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:8cb3615533173df2929559a5bb4fc72be4673cacd2820027a0a81f48650b5c62","observation_id":"16f1ae38-4509-4703-ba91-7747fa83ceb7","resolution":{"observed_at":"2026-05-26T17:07:40.616558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15500","last_updated":"2026-05-26T15:01:26Z","snapshot_observed_at":"2026-07-14T00:17:59.988083Z","submitted_at":"2026-03-16T16:31:24Z","title":"Understanding Reasoning in LLMs through Strategic Information Allocation under Uncertainty","version":2},"cited_work":{"arxiv_id":"2603.15500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.15500","snapshot_observed_at":"2026-06-29T12:23:24.142094Z","title":"Understanding reasoning in llms through strategic information allocation under uncertainty","venue":"cs.AI","work_id":"9ed869da-a6f2-4695-87a7-fd4a4460e35f","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2603.15500","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:5223e1b7586fba387fb38c689593381b033cdd47e0a04ed94ceb0a840243fc75","observation_id":"bcee4fd1-bbbe-4aed-b8b1-c3d7b6ecc4da","resolution":{"observed_at":"2026-05-27T03:05:05.764939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15927","last_updated":"2024-06-22T19:46:06Z","snapshot_observed_at":"2026-07-30T04:59:24.269176Z","submitted_at":"2024-06-22T19:46:06Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","version":1},"cited_work":{"arxiv_id":"2406.15927","doi":"10.48550/arxiv.2406.15927","metadata_source":"pith","pith_arxiv_id":"2406.15927","snapshot_observed_at":"2026-07-11T03:07:50.627769Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","venue":"cs.CL","work_id":"5977e285-35c6-4724-813a-e9560aa2439c","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2406.15927","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:bab46aa7f01eeb4da11dbdadc04d76e46bafe437a6a7c0c08ef83f47a0b11f31","observation_id":"97afc72d-bee6-4933-96a9-1af084c9ac6d","resolution":{"observed_at":"2026-05-18T00:52:02.773759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic entropy probes: Robust and cheap hallucination detection in LLM s","venue":null,"work_id":"8191ac41-2cd0-4be1-b8b9-24bc29ec9155","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:756a1cf3bdbeecd2276ab4b95dfa095c5319f133ca91749bf9a4893a65c5d72b","observation_id":"1dee103a-586c-4888-8e3a-421aa1345968","resolution":{"observed_at":"2026-05-26T17:07:40.637437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think with moderation: Reasoning models and confidence calibration in the climate domain","venue":null,"work_id":"153a0d19-43d1-4b85-97c1-c067f09025ee","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:3cc5ed760c02a507db205e3f320de6ba1968007c369d78c36b2bdd289ae5dc14","observation_id":"09986e8b-bda9-4e4b-a042-03608dbf0347","resolution":{"observed_at":"2026-05-26T17:07:40.576742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hwang, Jiangjiang Yang, Ronan Le Bras, Oyvind Tafjord, Christopher Wilhelm, Luca Soldaini, Noah A","venue":null,"work_id":"7ad15fb4-8f36-47f6-8601-12e8c6b676d1","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:6d3882e27f945148dea62e04bf04922a9771a4bdb74beb3bbcbb3fd23cd58ba7","observation_id":"b1f51ffa-1a68-4259-bf99-b87b2264c5e8","resolution":{"observed_at":"2026-05-26T17:07:40.635129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming overconfidence in LLM s: Reward calibration in RLHF","venue":null,"work_id":"f31671db-effb-4dbf-b9b7-580878dcb384","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:8c85d6d817932e29633b2a73dbb6aeffda533cbf6e4f7f8f1d815547f1208730","observation_id":"77afc915-3c1a-4fc3-8d64-d3b92a4b9313","resolution":{"observed_at":"2026-05-26T17:07:40.579581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01478","last_updated":"2025-01-02T12:09:17Z","snapshot_observed_at":"2026-07-06T20:15:54.645357Z","submitted_at":"2025-01-02T12:09:17Z","title":"Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search","version":1},"cited_work":{"arxiv_id":"2501.01478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01478","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Li, X., Yu, Z., and Xiong, C","venue":null,"work_id":"40b66ca2-1002-4eda-9594-78ac06a2e5c9","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2501.01478","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:9081755ff65e4cff023286300a38e43d20616f05010640981c3c45c5a43bd331","observation_id":"082160ae-529d-4a88-befb-decc08150de8","resolution":{"observed_at":"2026-05-11T20:41:12.130965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conftuner: Training large language models to express their confidence verbally","venue":null,"work_id":"2da4edf1-e6e9-4810-acdd-c5b51d420d0a","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:161b6284cf43642baa68fe4bbdfb8e8c5972a97369f33e26e8dc8d22dc5b4cab","observation_id":"dd8714b0-c0d3-408b-babd-f7873d1e2c3b","resolution":{"observed_at":"2026-05-26T17:07:40.582151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let's verify step by step","venue":null,"work_id":"bf20acc6-c9ab-40aa-8e5e-90dcf50c8bb4","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:e6161188c4d07ab2706585b146bb15f4c7d074705867621e28813838f523fe30","observation_id":"2d407fa2-085d-4b4d-97f8-0d7402e37f9c","resolution":{"observed_at":"2026-05-26T17:07:40.584677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23129","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T10:35:42.095198Z","title":"C 2gspg: Confidence- calibrated group sequence policy gradient towards self- aware reasoning.arXiv preprint arXiv:2509.23129","venue":null,"work_id":"2db73b20-2ecf-4ea3-9957-8f8bb54469ac","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:d7e7e3cdf72ee3914137f2ba4a498573c7214e49a6ad0ba29f59ded80c87aa5b","observation_id":"c87b0da9-7f0d-400a-9f90-cd8ba3d6a707","resolution":{"observed_at":"2026-05-11T20:41:12.314348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C\\ 2\\ GSPG : Confidence-calibrated group sequence policy gradient towards self-aware reasoning","venue":null,"work_id":"7ff36a54-050b-464b-9a03-8709959aecd2","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:8efcb51ca9cee7500beffa16b10084e362e57641e57e516000fe8ec87cfc200e","observation_id":"3058fae0-faa6-4bc3-b902-88b091090a92","resolution":{"observed_at":"2026-05-26T17:07:40.618713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logiqa: a challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":"dea9e39e-6c21-40f6-8dfd-0be6212e36aa","year":2021},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:44d58641b2065e79c33ebaaefef7770c44257fb368b2da788ee23d3dc9093ca8","observation_id":"e3f73d66-006e-4162-b625-92efe674a175","resolution":{"observed_at":"2026-05-26T17:07:40.620953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1205","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wong, Lidia S","venue":null,"work_id":"abef3e81-4e30-4358-a1f7-591ea7349653","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:ee512a8bd146eccbe29df5caeaf21c03a1f99f0dcc291dea53d3af6a4c17cfd1","observation_id":"94d6c7db-a1ad-42e8-a479-bf9da999bdf4","resolution":{"observed_at":"2026-05-08T22:34:28.702470Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3711896.3736569","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Uncertainty quantification and confidence calibration in large language models: A survey","venue":null,"work_id":"f3dca619-572e-40de-942b-cc7771689460","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:f2931d0a16171582d90e90c7fee8bdb4f9d33df8d8b38baf6b9e675cca693a06","observation_id":"f0c7e4a7-4d68-46ec-bdaa-445d282696b7","resolution":{"observed_at":"2026-05-08T22:34:28.695062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-12T15:19:26.025228+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T15:19:26.025228+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your pre-trained LLM is secretly an unsupervised confidence calibrator","venue":null,"work_id":"6b10f92d-e3df-4c3a-8f99-7079b5944228","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:188fc3d7a1f3629a405d437d1c2e1d97fd49560a86ea901a738091aa6a3d8c74","observation_id":"c7a4a1e5-b2da-4a83-acb3-e32c4c20add6","resolution":{"observed_at":"2026-05-26T17:07:40.571118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improve mathematical reasoning in language models with automated process supervision, 2025 b","venue":null,"work_id":"b5b8ab55-1dc0-4eeb-8a89-a4ab6d73eeb5","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:0fea6d1b770e033068f5321ac1267cda62a5b2d62ba956abc4667b0f482b4c37","observation_id":"b11ff9b4-14cd-4bf4-af4a-9dc9f798cb6b","resolution":{"observed_at":"2026-05-26T17:07:40.573802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.09117","last_updated":"2026-05-27T02:49:05Z","snapshot_observed_at":"2026-07-15T12:13:14.577374Z","submitted_at":"2026-03-10T02:47:59Z","title":"Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards","version":3},"cited_work":{"arxiv_id":"2603.09117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.09117","snapshot_observed_at":"2026-07-10T01:16:41.380452Z","title":"Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards","venue":"cs.LG","work_id":"8ce2624c-609a-462d-9085-c3a55b82fe1a","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2603.09117","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:1958e2d0b57e7242524331755590102dd9ce93e6118efed5075b803fbb3b2b61","observation_id":"9cce0c0d-49b6-4f68-acbd-e568ed75d00c","resolution":{"observed_at":"2026-05-11T20:41:12.120451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning about uncertainty: Do reasoning models know when they don’t know? In Findings of the Association for Computational Linguistics: EACL 2026, pp.\\ 3408--3458","venue":null,"work_id":"e5205024-f275-45c4-916e-332444837551","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:46d207317b13b1e2670b6bcf365bb7232926e502897e17717f7adf374bbca95d","observation_id":"56b1c3ce-564e-4dd5-8e15-9a1589a609e0","resolution":{"observed_at":"2026-05-26T17:07:40.587369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25052","doi":"10.48550/arxiv.2603.25052","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Closing the confidence-faithfulness gap in large language models","venue":null,"work_id":"d4bd573e-5d71-4019-bed7-cfcbbaad24a1","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:cd427d23b9dfd63a86f23601cb648c8ab42dc7baabd3a57317f06a6b09081624","observation_id":"042d080c-1e64-46f7-b973-e6b939b4385f","resolution":{"observed_at":"2026-05-11T20:41:12.139298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.1025","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:58.254693Z","title":"S1: Simple test-time scaling","venue":null,"work_id":"16de4a03-b204-42b7-ab29-734d87b8cd33","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:ca2e3d3206348df86f3187bfc5015fa0f4bd6d799a3b4d50ab8c214e62b6b7a6","observation_id":"6e9acc8b-3d9e-49ec-9a54-1c0f3714c54c","resolution":{"observed_at":"2026-05-08T22:34:28.698725Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-16T19:20:54.872421+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T19:20:54.872421+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.675","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:51:44.076033Z","title":"When do LLM s need retrieval augmentation? mitigating LLM s' overconfidence helps retrieval augmentation","venue":null,"work_id":"d7358b9f-5212-4db2-ac01-9532b7f8e4b5","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:f8bc8941a0f8edc5f4849745618d2d3c44bb4b83fc534181d8829c562f9204c7","observation_id":"afc0299a-d722-4046-8cff-7c92ce147dc4","resolution":{"observed_at":"2026-05-08T22:34:28.721488Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:398799a59667300bd0ea05c4b652c5a533471b0214596c2e2a114ad63b2d3ff6","observation_id":"3f7fcfc4-3b30-4d0c-aa81-12789e3a1092","resolution":{"observed_at":"2026-05-11T20:41:12.150846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v29i1.9602","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:57:33.833951Z","title":"Obtaining well calibrated probabilities using bayesian binning","venue":null,"work_id":"34281328-717c-4789-a36e-f9fcd05b7e2e","year":2015},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:c8011d95b78d66501fb9f0e5d7138eccc47827bb6cb53036cd160f1e39e2f279","observation_id":"fc5695f9-3798-490d-b24a-2275385ab356","resolution":{"observed_at":"2026-05-08T22:34:28.650353Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimizing anytime reasoning via budget relative policy optimization","venue":null,"work_id":"0bb3eb41-46be-4fbb-b077-b4686e4359d5","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:7e94876d5e0e36c13f68c49ea3f800862e833586421c611339395f31744ca87d","observation_id":"836030a4-e0c3-4e41-a2fd-dfa71c0c7075","resolution":{"observed_at":"2026-05-26T17:07:40.568389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Demystifying reasoning dynamics with mutual information: Thinking tokens are information peaks in LLM reasoning","venue":null,"work_id":"67c7f4a7-3051-40c6-8c88-fd367e1fa420","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:3548f1ea8a32e6d6128cb127b1f61a82f43a5280402ffbbecec00400b2731b2d","observation_id":"f000ed63-aa98-4381-b60f-c7546516f89d","resolution":{"observed_at":"2026-05-26T17:07:40.612001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"68634e7f-af56-409a-b33e-34bd56fc2b1c","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:b201f456436134287f89c843d16b28a42307db6515926e2f8fe57ee320b51719","observation_id":"63f45eef-7739-40cf-ae97-8b8b72d513f3","resolution":{"observed_at":"2026-05-26T17:07:40.639483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jaakkola, and Regina Barzilay","venue":null,"work_id":"484d6501-aa88-4bfa-8201-0a46070fa277","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:445b42619464d8f83565926502803df2d43e44156e3250c792fec3c6233a05b4","observation_id":"dfd38fd5-50d0-4a01-b2cc-a2b5b3009daa","resolution":{"observed_at":"2026-05-26T17:07:40.667772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:45:12.938750Z","title":null,"venue":null,"work_id":"97525236-1aa0-43c2-9ec5-0d664c1c4656","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:214a67209de690249ba2ce4d9926c795d5461f235be713c7dae9d01be0109294","observation_id":"27357831-5c28-49cc-9e59-230ea2d037d3","resolution":{"observed_at":"2026-05-26T17:07:40.669826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:9e2e7b27cb69f929151a3890b0f2de4830cdf6c00cf355a169523d2b82c97847","observation_id":"aa1f0fe6-6909-4013-956e-2eb5adae305f","resolution":{"observed_at":"2026-05-11T20:41:12.187773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rewarding progress: Scaling automated process verifiers for LLM reasoning","venue":null,"work_id":"05fde06b-f4d0-4e9e-bd62-ba153b391caf","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:5a70875686af59e239478386f783724368b0673bd36a412b2d0afced7df6bcb0","observation_id":"b2eedcdf-8de0-4752-a704-3c85b4f9af32","resolution":{"observed_at":"2026-05-26T17:07:40.672070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A tutorial on conformal prediction","venue":null,"work_id":"7623bbd9-ba19-4254-9ab7-243fee2158a4","year":2008},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:c886fcbfa03e74b289b46ddebba811f372395bf4a234b2111eb0e0040a610078","observation_id":"2607e0b4-fb40-4f1a-995e-5357094e4e07","resolution":{"observed_at":"2026-05-26T17:07:40.674355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:7eb547574bec612b5892865377b628acca1ec8c5f674cf345b406fbae20d8c2e","observation_id":"ce80752b-fd38-483a-8c1c-b25113cae32e","resolution":{"observed_at":"2026-05-11T20:41:12.211505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wornell, and Soumya Ghosh","venue":null,"work_id":"42d168ab-edfd-4e23-8ec2-98bd8130a5dc","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:d76ca5a520d963ac12c60db3d22a51cef32b812a462a8db704a356906e79ec32","observation_id":"d8352934-9bbe-4f7d-9cee-2fec2acacbbd","resolution":{"observed_at":"2026-05-26T17:07:40.665602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":"05100adf-5950-4a50-9213-689df308a08a","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:a3d728cdb298a214b4fd8bb439a459b8d6657fdcc2a3472948e999841469b9e5","observation_id":"705a36ed-57d3-4547-8498-a3a00013c4c4","resolution":{"observed_at":"2026-05-26T17:07:40.676674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i27.35063","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:32:43.385233Z","title":"Alison Noble","venue":null,"work_id":"a190ab54-3d70-4488-878e-bec1ae47fbd7","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:206c4957d146657d8e29fbc97840498cbbf8406039742fb64db81f1a2d7b428a","observation_id":"20160f7c-1ef9-4585-bc4a-6178ee6e8d61","resolution":{"observed_at":"2026-05-08T22:34:28.681327Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.330","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:40.720628Z","title":"doi: 10.18653/v1/2023.emnlp-main.330","venue":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing","work_id":"6549f947-2f84-4008-aefb-8c2b952c2ee6","year":2023},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:21286bd2520c7050ad2fa448fc3634ae872c4fceb7790d4749ccddfef98b780f","observation_id":"e499919b-990c-4cd5-a36b-7b3259358bef","resolution":{"observed_at":"2026-05-08T22:34:28.689505Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-14T22:19:52.292485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T22:19:52.292485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06707","last_updated":"2024-10-09T09:20:24Z","snapshot_observed_at":"2026-07-06T19:30:17.275798Z","submitted_at":"2024-10-09T09:20:24Z","title":"Calibrating Verbalized Probabilities for Large Language Models","version":1},"cited_work":{"arxiv_id":"2410.06707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.06707","snapshot_observed_at":"2026-07-04T03:39:30.311941Z","title":"Calibrating verbalized probabilities for large language models, 2024 a","venue":null,"work_id":"e3e3e3c5-8e7c-4acf-974f-9b3d7bff2fbd","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2410.06707","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:4ab5c405416ccdb8183bd7ed9f93e32cc56b4cc505f7abb20e18105d30e96131","observation_id":"3d18eb14-21ed-43f4-a7a2-9535c6f8dc6f","resolution":{"observed_at":"2026-05-11T20:41:12.166451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Always tell me the odds: Fine-grained conditional probability estimation","venue":null,"work_id":"09d7d3bd-e180-4849-be47-71af1326dd60","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:e5bec68db0e04aaedf7b53fa79dd523140f748a6a6fe59648eddd104c9c1e19d","observation_id":"f29053d1-b153-4b8f-9b29-2e95abf12c62","resolution":{"observed_at":"2026-05-26T17:07:40.678770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":"2312.08935","doi":"10.48550/arxiv.2312.08935","metadata_source":"pith","pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","venue":"cs.AI","work_id":"fb547990-d48e-4ba3-a047-af1e506e8290","year":2023},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:c833f58d6e8d157677a2aab66038eb7b95992cb71b3b4860eed1777568b3ca88","observation_id":"70421b68-46a3-48ac-a7a3-2a368cf2f1de","resolution":{"observed_at":"2026-05-14T22:34:16.071337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calibrating verbalized confidence with self-generated distractors","venue":null,"work_id":"6df421f4-cdd4-4d47-8200-5837cae8ca2b","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:d98517dce91f5ff214a05b80848af7951bcd0ee27314237b8e851591d11ff22c","observation_id":"00c0c9c8-38b9-4b76-bea2-d5827b685676","resolution":{"observed_at":"2026-05-26T17:07:40.680939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03814","last_updated":"2026-05-14T02:01:19Z","snapshot_observed_at":"2026-07-06T22:44:23.981940Z","submitted_at":"2026-02-03T18:17:22Z","title":"Conformal Thinking: Risk Control for Reasoning on a Compute Budget","version":2},"cited_work":{"arxiv_id":"2602.03814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03814","snapshot_observed_at":"2026-07-03T12:58:07.471494Z","title":"Conformal thinking: Risk control for reasoning on a compute budget","venue":"cs.AI","work_id":"c66aa1dc-18c1-44fa-be84-1fc4d227e4a1","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2602.03814","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:3ecd38536dcfa7d46c4040c8695378d22f1e871adaf62c904f57a80b7ba45959","observation_id":"836ac16e-1846-40c7-85a1-89adc4d56b14","resolution":{"observed_at":"2026-05-15T01:43:11.628743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.404","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C on U : Conformal uncertainty in large language models with correctness coverage guarantees","venue":null,"work_id":"6176e361-2a61-4a48-8d28-b7b865fabf13","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:e5addf3b570c560d7605b65a6a6097016bebda058fc85d2bbcc18c8277d53247","observation_id":"9cc0b33f-ee76-43b3-a0f3-b0f029817e6a","resolution":{"observed_at":"2026-05-08T22:34:28.642387Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thought calibration: Efficient and confident test-time scaling","venue":null,"work_id":"1dfea43f-8164-4a2a-be4d-2ac191409410","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:44d1d1bbd96231f6055ac70e58128685f84ddcd7d711d1abe0c067184bbfea78","observation_id":"61e175ff-4b2e-480e-a8d2-7c638f20682a","resolution":{"observed_at":"2026-05-26T17:07:40.663418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can LLM s express their uncertainty? an empirical evaluation of confidence elicitation in LLM s","venue":null,"work_id":"01c9a08f-155f-42ac-8cf8-c6150116ff36","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:89d3f7ef951c54e808b45032438cafebf03a4ecde7c8167d6e965b1b00f877b8","observation_id":"785f3ed1-e96b-4b08-a9f1-d00e2cc542af","resolution":{"observed_at":"2026-05-26T17:07:40.658902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond correctness: Harmonizing process and outcome rewards through rl training","venue":null,"work_id":"33763550-0e32-4f34-9bf0-231bea3e48e5","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:f98da4f07d33faa541a112a5b670fa7071625331581160785f0752ce91b7ec70","observation_id":"95aa9c4f-3655-48ee-9ff5-28c2c7d55180","resolution":{"observed_at":"2026-05-26T17:07:40.656468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.17871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:59:07.257949Z","title":"LLM Probability Concentration: How Alignment Shrinks the Generative Horizon","venue":null,"work_id":"b6cfbab4-4813-40b9-840a-26e378ad2ad8","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:36ca0ac543e2cfc2736acc9dc50f60fc3a36c97f9681a91817b580a08e00f91d","observation_id":"166d5225-c877-4956-a144-ed5e3ffc80db","resolution":{"observed_at":"2026-05-11T20:41:12.261594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.443","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T05:25:24.770168Z","title":"Can Large Language Models Faithfully Express Their Intrinsic Uncertainty in Words?","venue":null,"work_id":"144aa6a9-6748-4e44-bfe7-c2b7c8f723a5","year":2024},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:f9b5fac140598a4a128781a01ad2ec7bff38462ed7cdd9d77ea4567aa80dd609","observation_id":"45eb69cf-7a3a-41b9-8ba4-87f4241e0d73","resolution":{"observed_at":"2026-05-08T22:34:28.655110Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09724","last_updated":"2024-04-01T13:50:51Z","snapshot_observed_at":"2026-07-06T16:48:29.239105Z","submitted_at":"2023-11-16T09:56:28Z","title":"OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2311.09724","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09724","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outcome-supervised verifiers for planning in mathematical reasoning.arXiv preprint arXiv:2311.09724","venue":null,"work_id":"82003488-ddc6-4e53-b05d-4f011dc8d37e","year":2023},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2311.09724","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:6f8b132344a2d92fcd025a908c0672de573f521ef14340e80bb22e8f75d6b53e","observation_id":"4bcc19fd-c171-4037-ac66-9ee1108858cb","resolution":{"observed_at":"2026-05-11T20:41:12.177273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:30e4c224cb1f9fc243032c9f70507f3eb726331cdddecfeaec86f2cc3a085cbb","observation_id":"b7dca2aa-de39-4794-9998-c7cb861d1a73","resolution":{"observed_at":"2026-05-11T20:41:12.159349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning models know when they re right: Probing hidden states for self-verification","venue":null,"work_id":"d0b8fa09-ec89-4bb4-b11d-f6cb7da554db","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:4f7a9e9bc9b744f7e3b3b3dfc7889ac2d6a8edc6ee861e3e799b5ffbea15fe0a","observation_id":"d8c2b988-e882-4782-9176-d703685d228b","resolution":{"observed_at":"2026-05-26T17:07:40.660953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.287","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T05:25:24.688730Z","title":"GRPO - LEAD : A difficulty-aware reinforcement learning approach for concise mathematical reasoning in language models","venue":null,"work_id":"434e206a-d52b-44af-81e0-6c11b45be5ec","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:8ed68c975a4fc7ce752f90c9678ecab44653800000de0ca368ce9fabd9136b98","observation_id":"eae8f818-50af-405d-a294-635d846bbf80","resolution":{"observed_at":"2026-05-08T22:34:28.685372Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1141c25c-e4df-4233-a949-a8c59559f221","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:707301ab1649bd6048e20f491ff536731832f451464d4cd78f20c161d8d8f206","observation_id":"ac930bb2-b14d-4541-b5b8-aea21ce3fd93","resolution":{"observed_at":"2026-05-26T17:07:40.648955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2501.07301","doi":"10.48550/arxiv.2501.07301","metadata_source":"pith","pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","venue":"cs.CL","work_id":"9ee77906-18e8-4356-a468-1d6f7e781977","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:e9c1f4cba9ae7d467dec93e250dab6142aa61a42ffea33a0610832f576e5236b","observation_id":"a154b8bd-8a7b-44ad-9d78-cee204d0317e","resolution":{"observed_at":"2026-05-16T13:43:43.298530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.370016+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.370016+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:5695b66ff19679e76ec7b04330b47b9e0f8e57560bcc0a7c6b85d55fd3e92bab","observation_id":"8ba7f292-78cd-4085-b09f-68b8f4eebc34","resolution":{"observed_at":"2026-05-12T03:54:31.187112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calibrate before use: Improving few-shot performance of language models","venue":null,"work_id":"4ed20ed7-a8da-4956-9d2e-e4caa4804279","year":2021},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:7be4250d97efb828840d569c22187fa0eba95a5ccffd557966034b5a47242e53","observation_id":"45abc3c0-fcdc-42c2-8ebc-8520eb949ac3","resolution":{"observed_at":"2026-05-26T17:07:40.643897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08049","last_updated":"2026-04-29T02:51:24Z","snapshot_observed_at":"2026-07-06T22:32:07.945004Z","submitted_at":"2025-10-09T10:35:31Z","title":"A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models","version":3},"cited_work":{"arxiv_id":"2510.08049","doi":"10.48550/arxiv.2510.08049","metadata_source":"pith","pith_arxiv_id":"2510.08049","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models","venue":"cs.CL","work_id":"1b364adb-2d12-4e61-89fc-804d607b2735","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2510.08049","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:4e55b269490e06aff24740cec7c19494a8ca60acfb0aae9245afdfb5bea6638e","observation_id":"5fdcce4e-9326-46b4-bab9-8b0875ca0526","resolution":{"observed_at":"2026-05-11T20:41:12.237411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.311803Z","title":"write newline","venue":null,"work_id":"8e5fda61-e601-4df4-8204-015bee341570","year":null},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:863bef8abb410ce21fd475d5ded9502fe35c548f3aaf62884717cdf27ecb02c0","observation_id":"b1227ec7-72df-4e76-9641-87207889a73f","resolution":{"observed_at":"2026-05-26T17:07:40.646716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:44.012295Z","title":"@esa (Ref","venue":null,"work_id":"b058608d-98d0-4821-a4ae-403d2b7cd411","year":null},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:18645eb022dad121217f404608939890be80e26ef1f8abe02ec7b3ec67172629","observation_id":"bd5e107c-3794-471b-8f10-38d9c9321a18","resolution":{"observed_at":"2026-05-26T17:07:40.651575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.337191Z","title":null,"venue":null,"work_id":"ea79bfb8-d434-45e9-8607-416d3839ec5c","year":null},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:b4915be6cb6ac7fbc038b168b26e6e7087c59e49847cecd75ecb6e9992532650","observation_id":"e5932a13-9554-468e-b6c1-c8f485b73438","resolution":{"observed_at":"2026-05-26T17:07:40.654239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c149604e-3fa2-430b-8e11-6453bed479b5","year":null},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:07f2fe4700c4f99f314b631a7d0db6bba4fa70d9a1a85520c7bcd650c226bb92","observation_id":"a834bab9-d393-4e5d-bafc-03898712ac4d","resolution":{"observed_at":"2026-05-26T17:07:40.641516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":5,"verified_exact":40,"verified_fuzzy":43},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 1 inbound Pith citation observation for arXiv:2604.23333."}