{"as_of":"2026-08-14T02:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f1c4f37810034e3f209d8272215b499c7ab1059f970f870a5086efd578de5bc","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:30:27.620057Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:07:50.378958Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-08-03T16:16:29.383723Z","title":"Token-level uncertainty estima- tion for large language model reasoning.arXiv preprint arXiv:2505.11737, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14177","last_updated":"2026-06-03T14:26:01Z","snapshot_observed_at":"2026-08-09T21:51:36.770626Z","submitted_at":"2025-12-16T08:15:24Z","title":"Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T16:16:29.383723Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2512.14177"},"observation_digest":"sha256:4d64aca4d78356c29fb90b6fc4df9a136b05b030ebb8ec618d87f91121e03297","observation_id":"f7ef378b-40fd-4f59-a19e-25d06754ba4c","resolution":{"observed_at":"2026-08-03T16:16:29.383723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":"2505.11737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-07-11T03:07:50.378958Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","venue":"cs.LG","work_id":"af205024-cfe1-446b-a932-e9327be79c1f","year":2025},"citing_paper":{"arxiv_id":"2601.21214","last_updated":"2026-05-01T16:33:48Z","snapshot_observed_at":"2026-08-11T15:28:48.553150Z","submitted_at":"2026-01-29T03:24:32Z","title":"Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2601.21214"},"observation_digest":"sha256:676812aadaaf0d7066fe754b139ef7bbd302749ef207db0649b2765081c80b83","observation_id":"0ef053b1-8b98-4ab0-8527-f7b5173820f7","resolution":{"observed_at":"2026-05-16T10:27:44.288866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-08-02T20:30:59.658434Z","title":"Tokur: Token-level uncertainty estimation for large language model reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00171","last_updated":"2026-05-30T15:21:48Z","snapshot_observed_at":"2026-08-13T14:17:58.271358Z","submitted_at":"2026-02-26T15:41:26Z","title":"LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T20:30:59.658434Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2603.00171"},"observation_digest":"sha256:8ec1cda9378de082a80696d8e9f74580d7c43db943aa4f7268b3239cb9212a53","observation_id":"629600cc-b54d-4b96-a783-9bbc168dd5d9","resolution":{"observed_at":"2026-08-02T20:30:59.658434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":"2505.11737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-07-11T03:07:50.378958Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","venue":"cs.LG","work_id":"af205024-cfe1-446b-a932-e9327be79c1f","year":2025},"citing_paper":{"arxiv_id":"2604.03216","last_updated":"2026-04-03T17:44:32Z","snapshot_observed_at":"2026-08-11T12:50:25.814506Z","submitted_at":"2026-04-03T17:44:32Z","title":"BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-13T19:48:13.133733Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2604.03216"},"observation_digest":"sha256:5e6ce3931080060a5fd97c947fb118136b3c87eb3c0609f4403967ac0b36fae1","observation_id":"d1a90c92-be96-4835-9c71-591e03eea92c","resolution":{"observed_at":"2026-05-13T19:53:11.968470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":"2505.11737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-07-11T03:07:50.378958Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","venue":"cs.LG","work_id":"af205024-cfe1-446b-a932-e9327be79c1f","year":2025},"citing_paper":{"arxiv_id":"2605.10415","last_updated":"2026-05-13T13:41:26Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:52:58Z","title":"Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:36:27.730028Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2605.10415"},"observation_digest":"sha256:aa5d347148cb75b7b258d4f868f69c1095f0a84024e4180dea3918c649d3ca23","observation_id":"9bc3dafb-fa52-4179-9d76-6345cf4bf1ae","resolution":{"observed_at":"2026-05-12T06:06:25.889812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":"2505.11737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-07-11T03:07:50.378958Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","venue":"cs.LG","work_id":"af205024-cfe1-446b-a932-e9327be79c1f","year":2025},"citing_paper":{"arxiv_id":"2605.10415","last_updated":"2026-05-13T13:41:26Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:52:58Z","title":"Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T21:41:09.382812Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2605.10415"},"observation_digest":"sha256:51c7b17fef2820d1749b85dbd69408506f4faf4ee97fa93451efab5015ac890e","observation_id":"9ec8e472-acdd-424d-b2c2-4f3b2b4b405f","resolution":{"observed_at":"2026-05-14T21:43:00.552622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-08-03T02:22:19.005834Z","title":"Tokur: Token-level uncertainty estimation for large language model reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.15100","last_updated":"2026-07-31T12:11:10Z","snapshot_observed_at":"2026-08-13T00:49:19.584984Z","submitted_at":"2026-05-14T17:19:37Z","title":"Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Scaling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:19.005834Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2605.15100"},"observation_digest":"sha256:26843b9112826524ebaaf6b1f5c23e55c4bd4fa210b744299c0bfa3a65b092a3","observation_id":"b75d57a1-83aa-47f1-bb0c-cdd080b526a3","resolution":{"observed_at":"2026-08-03T02:22:19.005834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":"2505.11737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-07-11T03:07:50.378958Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","venue":"cs.LG","work_id":"af205024-cfe1-446b-a932-e9327be79c1f","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:3b25507531f0ae9708b7edecae0a8d2aae04803846a308db74e2bb1cc62cab7c","observation_id":"259e2434-5889-4dc6-891f-bf65d478325b","resolution":{"observed_at":"2026-07-03T20:38:56.088115Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":"2505.11737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-07-11T03:07:50.378958Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","venue":"cs.LG","work_id":"af205024-cfe1-446b-a932-e9327be79c1f","year":2025},"citing_paper":{"arxiv_id":"2606.19509","last_updated":"2026-06-17T18:49:44Z","snapshot_observed_at":"2026-08-12T17:13:42.106610Z","submitted_at":"2026-06-17T18:49:44Z","title":"LLM Doesn't Know What It Doesn't Know: Detecting Epistemic Blind Spots via Cross-Model Attribution Divergence on Clinical Tabular Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T20:55:17.597719Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2606.19509"},"observation_digest":"sha256:d775b23c6850283149476ab95107056ae12678ee40be0867f0c0712f861f14e5","observation_id":"b7ea7294-4129-4151-8e10-c0a81d825cf1","resolution":{"observed_at":"2026-07-04T00:49:19.120110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":"2505.11737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-07-11T03:07:50.378958Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","venue":"cs.LG","work_id":"af205024-cfe1-446b-a932-e9327be79c1f","year":2025},"citing_paper":{"arxiv_id":"2607.05721","last_updated":"2026-07-07T01:09:46Z","snapshot_observed_at":"2026-08-07T23:39:06.457781Z","submitted_at":"2026-07-07T01:09:46Z","title":"SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T03:05:42.262171Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2607.05721"},"observation_digest":"sha256:8feb19c86ba60125e308c40f5c6d7d0cccd152a41a6be23032873c7c26948ba0","observation_id":"56f1e266-74b9-4b47-a709-9edce26419a7","resolution":{"observed_at":"2026-07-11T03:07:50.405456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11737","snapshot_observed_at":"2026-08-12T05:30:27.620057Z","title":"arXiv preprint arXiv:2505.11737 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11138","last_updated":"2026-08-11T16:59:02Z","snapshot_observed_at":"2026-08-14T02:12:42.513539Z","submitted_at":"2026-08-11T16:59:02Z","title":"Attention-Path Fragility as an Uncertainty Signal in Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T05:30:27.620057Z"},"links":{"cited_paper":"/paper/2505.11737","citing_paper":"/paper/2608.11138"},"observation_digest":"sha256:dfe595989bcbd5e470655bafcf278e1fafaad3e5547005f6a625b28efdfab2f0","observation_id":"56c8d711-8f51-4f7f-adc4-8b65feda5946","resolution":{"observed_at":"2026-08-12T05:30:27.620057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11737/citation-record","integrity":"/paper/2505.11737/integrity","json":"/paper/2505.11737/citation-record.json","paper":"/paper/2505.11737"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.12264","last_updated":"2025-05-20T19:59:52Z","snapshot_observed_at":"2026-08-13T04:15:17.371216Z","submitted_at":"2024-02-19T16:26:00Z","title":"Uncertainty quantification in fine-tuned LLMs using LoRA ensembles","version":2},"cited_work":{"arxiv_id":"2402.12264","doi":"10.48550/arxiv.2402.12264","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uncertainty quantification in fine-tuned llms using lora ensembles.arXiv preprint arXiv:2402.12264","venue":"arXiv (Cornell University)","work_id":"0ced7630-4601-43e1-aba8-f6631fd17d48","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2402.12264","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:b4946189894c674f58ab5976b9792c9fee275e305fa9d0d21885e21cdd1488c4","observation_id":"83d9ff01-8294-471e-bfbf-cc7e039f0208","resolution":{"observed_at":"2026-05-22T14:01:38.433213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:25.761101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:25.761101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Area under the precision-recall curve: point estimates and confidence intervals","venue":null,"work_id":"616e152a-1945-40d2-9fa2-1d76a7e0292a","year":2013},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:368af0d1e4653cfe09c5e409426f7791857e8e36fdb7394c67749f7997ef5244","observation_id":"ff6f7838-a475-436e-870d-823d10ca3319","resolution":{"observed_at":"2026-05-22T14:04:54.161814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":"2407.21787","doi":"10.48550/arxiv.2407.21787","metadata_source":"pith","pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","venue":"cs.LG","work_id":"b124064d-5a56-42ad-86f5-3cc349b86a3a","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:b3fca3b14e0b72d12df15cc35cbc27aaf4a25f051538649a0850a84e8026fdde","observation_id":"47a895d9-b95b-4eca-88bf-993bbd877579","resolution":{"observed_at":"2026-05-22T14:01:38.259150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.742120Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"84780adb-76cf-44ac-a8b7-e24d4fa5c592","year":1901},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:d575fc97a9e92df606ab8af8d9f850cf8f2e2f28f1f7f4ab7c07b06610478d16","observation_id":"26523ef5-fa51-4265-96f9-407490d37d4d","resolution":{"observed_at":"2026-05-22T14:04:54.155325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03744","last_updated":"2024-10-21T04:10:50Z","snapshot_observed_at":"2026-08-13T04:25:27.001339Z","submitted_at":"2024-02-06T06:23:12Z","title":"INSIDE: LLMs' Internal States Retain the Power of Hallucination Detection","version":2},"cited_work":{"arxiv_id":"2402.03744","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03744","snapshot_observed_at":"2026-07-11T03:07:50.514404Z","title":"arXiv preprint arXiv:2402.03744 (2024)","venue":"cs.CL","work_id":"75a24ff3-43dd-45b4-a9e3-7ed2ead2a7a5","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2402.03744","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:1c6d4c00eea74fbd57e1a965fd1bbd24a8495cdad0489bfc9013f3537f47d952","observation_id":"d2fac832-5186-4685-abd2-de240ac6bc79","resolution":{"observed_at":"2026-05-22T14:01:38.460746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:22ff3774b8b3e9d1c7ab9a151b7ea3488fe8169dd870ef36fcbaa0daff4e3b5f","observation_id":"80a6d0b3-899b-4429-b07b-e874ba058466","resolution":{"observed_at":"2026-05-22T14:01:38.477179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.17026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T10:03:17.150647Z","title":"Understanding the uncertainty of llm explanations: A perspective based on reasoning topology.arXiv preprint arXiv:2502.17026","venue":null,"work_id":"86f8eddb-cd9a-40d4-9ee7-1b20342aa0e4","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:d90c829558f0ee7c8936253310d052c8040f9a439e474bc8d24bfc1b6500bfa4","observation_id":"6d084ad1-c0e9-4c36-9c67-03c22ed7871f","resolution":{"observed_at":"2026-05-22T14:01:38.400562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rainproof: An umbrella to shield text generator from out-of-distribution data","venue":null,"work_id":"5a24a7eb-a219-4289-8e44-5db72d927bd4","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:f26916b2a05f9e54e8af2bc42e363da1bf8f6da049a8ca31e246a1ec659a84c1","observation_id":"4f7834ef-d32e-485b-a25c-d4bd8304e23a","resolution":{"observed_at":"2026-05-22T14:04:54.158559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07461","last_updated":"2025-06-09T06:10:04Z","snapshot_observed_at":"2026-08-07T22:27:02.755086Z","submitted_at":"2025-06-09T06:10:04Z","title":"From Calibration to Collaboration: LLM Uncertainty Quantification Should Be More Human-Centered","version":1},"cited_work":{"arxiv_id":"2506.07461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07461","snapshot_observed_at":"2026-07-02T04:06:35.144894Z","title":"From calibration to collaboration: Llm uncertainty quantification should be more human-centered.arXiv preprint arXiv:2506.07461","venue":null,"work_id":"afabec60-843a-4131-ab23-c1875ef7f757","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2506.07461","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:25db7d15d4eeed53de52615061fa04dbac87e8ef0b512aa268efac5367b01407","observation_id":"1601aa2b-3880-42d3-92ce-f2b2d5e50ec7","resolution":{"observed_at":"2026-05-22T14:01:38.443500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shifting attention to relevance: Towards the predictive uncertainty quantification of free-form large language models","venue":null,"work_id":"1f034e52-5fa0-4d59-b4a6-6a278dd262d4","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:44c4e35763cf2cbc58a3012f02582dbfed60c57120d97ab636ac88e4b4edf7ff","observation_id":"31ce4579-79d7-4123-aeb7-b8fc4b580a1d","resolution":{"observed_at":"2026-05-22T14:04:54.168647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01806","last_updated":"2017-06-14T01:00:18Z","snapshot_observed_at":"2026-07-06T05:29:01.228177Z","submitted_at":"2017-02-06T22:08:46Z","title":"Beam Search Strategies for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":"1702.01806","doi":null,"metadata_source":"pith","pith_arxiv_id":"1702.01806","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beam Search Strategies for Neural Machine Translation","venue":"cs.CL","work_id":"00b2d35f-c6ed-4c4d-bbf1-93f0a15d12c9","year":2017},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/1702.01806","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:c18e5cc5b5022f9ff4b23e27aca0b742ad14501b4b0b09a36a06b55aa8cb9d75","observation_id":"77fd559c-ebac-4227-8ae2-39a265d0ffa0","resolution":{"observed_at":"2026-05-22T14:01:38.296491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-08-12T17:10:09.978771Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":"2508.15260","doi":"10.48550/arxiv.2508.15260","metadata_source":"pith","pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Think with Confidence","venue":"cs.LG","work_id":"39c40c74-9f55-406d-b67a-37d9b88aa6b3","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:e0b5c1d84b2269c77fbea9f57abbadc6069a3362b1eea081c61f9211ed97a714","observation_id":"799f2116-42b6-41c7-b2dc-1de29f97db03","resolution":{"observed_at":"2026-05-22T14:01:38.412573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:85f07dad8e52b118c5e4b12a6836c26a7b69d7c18fc210a7a2674ae69e897835","observation_id":"e1dc3c53-8cfc-41a1-ac44-427e284fefa3","resolution":{"observed_at":"2026-05-22T14:01:38.290908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":"2501.04519","doi":"10.48550/arxiv.2501.04519","metadata_source":"pith","pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","venue":"cs.CL","work_id":"49792b83-569e-4f5f-ae80-e96cbd3b7a43","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:07cfd28780519daab2aee4b74e7cafae37b39aea1fd8b016c879c9cdf241dd25","observation_id":"0ead29b4-f399-46dc-a0f7-0837fd53f05c","resolution":{"observed_at":"2026-05-22T14:01:38.382405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:07.471573+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:07.471573+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:b824b82dc091777526858a4600796f05a7eb01b9314a132c94938accc6032f2d","observation_id":"b25019a6-9755-4bac-a1d1-80a3faea5a9b","resolution":{"observed_at":"2026-05-22T14:01:38.438351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:ee9c47ca8a8b1dde67948d3ad150dd2ebdaca3e69412dae1d971042a65d8bf75","observation_id":"939a6910-bfb6-4513-9e36-58088ba7baba","resolution":{"observed_at":"2026-05-22T14:01:38.233567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08718","last_updated":"2024-06-10T21:17:24Z","snapshot_observed_at":"2026-08-13T05:25:04.396903Z","submitted_at":"2023-11-15T05:58:35Z","title":"Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling","version":2},"cited_work":{"arxiv_id":"2311.08718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08718","snapshot_observed_at":"2026-07-01T10:35:42.049914Z","title":"Decomposing uncertainty for large language models through input clarification ensembling.arXiv preprint arXiv:2311.08718","venue":null,"work_id":"132403c0-ff22-433b-ab50-62261ff0bb74","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2311.08718","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:afee2f58e751abbf720ceb504a7f5624e57e13b4fcc740837fa8055dbca9a25d","observation_id":"f58b672c-9994-404d-8fa5-8e05ec2023c7","resolution":{"observed_at":"2026-05-22T14:01:38.464971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:41d81ed62ebd588a98d701bad08c12c3749ff1330cab576740fc493fe159b2a0","observation_id":"ccd5d13c-3716-4f78-b0f8-9df0dc01609e","resolution":{"observed_at":"2026-05-22T14:01:38.395278Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18581","doi":"10.48550/arxiv.2502.18581","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable best-of-n selection for large language models via self-certainty.arXiv preprint arXiv:2502.18581","venue":"ArXiv.org","work_id":"c6eaf770-5086-4709-9b9f-b31eba94d3bc","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:6f320dc2123f3befe6f89d0ed2c3c700a00747920293301d5fd8bc40f27066f2","observation_id":"49065686-f403-4f2f-869d-11f93f3935d5","resolution":{"observed_at":"2026-05-22T14:01:38.311847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T22:21:04.566957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T22:21:04.566957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08391","last_updated":"2025-08-17T19:28:05Z","snapshot_observed_at":"2026-08-13T07:15:24.765895Z","submitted_at":"2024-06-12T16:41:31Z","title":"Large Language Models Must Be Taught to Know What They Don't Know","version":3},"cited_work":{"arxiv_id":"2406.08391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08391","snapshot_observed_at":"2026-07-03T10:37:56.337688Z","title":"Large language models must be taught to know what they don’t know","venue":null,"work_id":"49a8e462-7fcc-4d2d-96e5-cb8b630eeed4","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2406.08391","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:76fb43880230038bccdf72e9f8cf2583c1b7f8b9057e3a594faa050975b6db44","observation_id":"b5385b7a-0475-403e-ae20-a52316227076","resolution":{"observed_at":"2026-05-22T14:01:38.305531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22655","last_updated":"2025-05-28T17:59:08Z","snapshot_observed_at":"2026-08-11T00:43:57.700557Z","submitted_at":"2025-05-28T17:59:08Z","title":"Position: Uncertainty Quantification Needs Reassessment for Large-language Model Agents","version":1},"cited_work":{"arxiv_id":"2505.22655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22655","snapshot_observed_at":"2026-07-03T04:27:36.370794Z","title":"Position: Uncertainty quantification needs reassessment for large-language model agents","venue":null,"work_id":"ff4e94ee-b718-44d9-a238-e4593c92d387","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2505.22655","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:a1e03d9326449c894f58d3ed3ee67ab81315f7f3177292eb0cf94dd21ccc94de","observation_id":"3c283511-0872-4d0b-b7f7-47baecbb0d76","resolution":{"observed_at":"2026-05-22T14:01:38.240097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15927","last_updated":"2024-06-22T19:46:06Z","snapshot_observed_at":"2026-07-30T04:59:24.269176Z","submitted_at":"2024-06-22T19:46:06Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","version":1},"cited_work":{"arxiv_id":"2406.15927","doi":"10.48550/arxiv.2406.15927","metadata_source":"pith","pith_arxiv_id":"2406.15927","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","venue":"cs.CL","work_id":"5977e285-35c6-4724-813a-e9560aa2439c","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2406.15927","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:a267132ae6828987d4d82ce08f480cd27962df040b981a4732b5e0ca906c9811","observation_id":"16750add-d638-4ade-9d0a-ff98e92db484","resolution":{"observed_at":"2026-05-22T14:01:38.269837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19187","last_updated":"2024-05-20T01:53:36Z","snapshot_observed_at":"2026-08-13T11:29:16.656241Z","submitted_at":"2023-05-30T16:31:26Z","title":"Generating with Confidence: Uncertainty Quantification for Black-box Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.19187","doi":"10.48550/arxiv.2305.19187","metadata_source":"pith","pith_arxiv_id":"2305.19187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2305.19187 , year=","venue":"cs.CL","work_id":"332e0154-d69a-4bcc-9946-371ded6047ce","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2305.19187","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:b032055d53ae79311931b68d0165287d169ad607bbcf2503c8957a93a141e803","observation_id":"c01aeed3-89df-407a-a5f6-b3553f0f532f","resolution":{"observed_at":"2026-05-22T14:01:38.484546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10189","last_updated":"2024-03-28T19:41:34Z","snapshot_observed_at":"2026-08-13T17:41:58.625178Z","submitted_at":"2024-02-15T18:46:24Z","title":"Uncertainty Quantification for In-Context Learning of Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.10189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10189","snapshot_observed_at":"2026-07-01T19:16:00.104174Z","title":"Uncertainty quantification for in-context learning of large language models.arXiv preprint arXiv:2402.10189","venue":null,"work_id":"38288ae0-71b6-414f-a233-a3dc3f542e46","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2402.10189","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:6419bf973de02acfda9edd594718b4008b5b8c55f7829aef34ed29d737c88c47","observation_id":"9f88eef8-ca47-48ee-89fd-baf571793d46","resolution":{"observed_at":"2026-05-22T14:01:38.496532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02392","last_updated":"2024-10-11T17:43:48Z","snapshot_observed_at":"2026-08-13T04:27:29.364749Z","submitted_at":"2024-02-04T08:11:45Z","title":"DeLLMa: Decision Making Under Uncertainty with Large Language Models","version":3},"cited_work":{"arxiv_id":"2402.02392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.02392","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2402.02392 (2024)","venue":null,"work_id":"971fa213-4e86-4bc7-9229-5674dbd14fec","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2402.02392","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:1d1928677453bdd796581a469e01805fd44dd0cf938e51c7c184524792b10f4a","observation_id":"8376aeba-b0c0-4c09-8cd2-0a7d8e295253","resolution":{"observed_at":"2026-05-22T14:01:38.488616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15850","last_updated":"2025-06-03T22:16:32Z","snapshot_observed_at":"2026-08-07T16:50:07.430220Z","submitted_at":"2025-03-20T05:04:29Z","title":"Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":"2503.15850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15850","snapshot_observed_at":"2026-07-08T10:04:51.557247Z","title":"Uncertainty quantification and confidence calibration in large language models: A survey","venue":"cs.CL","work_id":"a20bde8c-ad90-4628-9181-724ae5e7d012","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2503.15850","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:3d8e97210b94e50c44556099d30eb798961e6817bb2397ea22d0ead4149682a1","observation_id":"507378e6-1e64-4373-80a7-bf7f9b5d75ac","resolution":{"observed_at":"2026-05-22T14:01:38.252394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"cited_work":{"arxiv_id":"2303.08896","doi":"10.48550/arxiv.2303.08896","metadata_source":"pith","pith_arxiv_id":"2303.08896","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","venue":"cs.CL","work_id":"90efebf6-4006-4176-9bf1-21a876571751","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2303.08896","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:9bfd410f65500ffe7e03b699d396e49790f20dc47163cf9f31e9c112c5ad38f2","observation_id":"eaa57b63-64b5-43c2-bf7a-bc146a5c072e","resolution":{"observed_at":"2026-05-22T14:01:38.425808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Factscore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":"4a0de9a5-f837-4764-945a-d2d6ea61527c","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:0273068e52c31e1bd62f848358fa72af79bfc08589a1c6fceac2514e3575300d","observation_id":"4fb7e880-cc71-45f8-8695-cc2219ce663c","resolution":{"observed_at":"2026-05-22T14:04:54.172146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10006","last_updated":"2018-08-31T21:59:35Z","snapshot_observed_at":"2026-08-01T09:04:28.124066Z","submitted_at":"2018-08-29T18:33:11Z","title":"Correcting Length Bias in Neural Machine Translation","version":2},"cited_work":{"arxiv_id":"1808.10006","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.10006","snapshot_observed_at":"2026-07-10T00:56:41.163251Z","title":"Correcting Length Bias in Neural Machine Translation","venue":"cs.CL","work_id":"af735184-2c77-4b2b-ac5c-6ac6978ddec4","year":2018},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/1808.10006","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:ab654f4b14db83ebbde369ef807f1272437f005e78af0a27843d675857be93cf","observation_id":"b17040dd-ffcc-4d7d-ad42-39929714d9ed","resolution":{"observed_at":"2026-05-22T14:01:38.473684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01618","last_updated":"2025-08-14T07:21:40Z","snapshot_observed_at":"2026-08-13T21:13:42.141142Z","submitted_at":"2025-02-03T18:50:50Z","title":"Rollout Roulette: A Probabilistic Inference Approach to Inference-Time Scaling of LLMs using Particle-Based Monte Carlo Methods","version":5},"cited_work":{"arxiv_id":"2502.01618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01618","snapshot_observed_at":"2026-07-03T08:07:45.281283Z","title":"A probabilistic inference approach to inference-time scaling of llms using particle-based monte carlo methods","venue":null,"work_id":"6d2b732c-6772-403a-b73b-538c2e050588","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2502.01618","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:0c6389af92caa18549c253c53ab0e8150c83d3834f0cdd9749147f6868a78e61","observation_id":"da84079e-e322-4881-b5e9-fcb073f7d014","resolution":{"observed_at":"2026-05-22T14:01:38.371687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.05723","doi":"10.48550/arxiv.2412.05723","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training-free bayesianization for low-rank adapters of large language models.arXiv preprint arXiv:2412.05723","venue":"arXiv (Cornell University)","work_id":"2c05b5c5-ba85-4e34-9523-4df5a971a4d5","year":null},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:74e97a8d226e7ce8ee596dfe1f4c56a5ba28b3ef6924547d501f5d38bc6f05e1","observation_id":"58574e17-6649-4135-a92d-7d30820324f8","resolution":{"observed_at":"2026-05-22T14:01:38.364039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:14.832913+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:14.832913+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24760","doi":"10.48550/arxiv.2505.24760","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning gym: Reasoning environments for reinforcement learning with verifiable rewards.arXiv preprint arXiv:2505.24760","venue":"ArXiv.org","work_id":"dfc22a2c-1b8e-4318-a044-e142c0608571","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:efcc6b56adfec1e28897ea9cf66422047bcf5bd4f5f3eaa064384c80fbbd63be","observation_id":"66f713f6-39b3-4e29-b8c6-c8f8ad048141","resolution":{"observed_at":"2026-05-22T14:01:38.456437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:d831f408e555f691074a72f8cf2d10f5275efea230c9fa0dc7937582b89603d3","observation_id":"8e0ff273-9888-466d-9a18-fa231f8bdeb5","resolution":{"observed_at":"2026-05-22T14:01:38.451746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback","venue":null,"work_id":"fcb67ee0-59f4-4ba0-82ff-f68c8b82cab5","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:75e2ae52ec4d6c8c549c554e20fbdf98331b45c49e799cb78cead39769e161f7","observation_id":"fd36d090-a143-44be-9e7a-b1bc56f09eab","resolution":{"observed_at":"2026-05-22T14:04:54.165145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:7a03ded71a75fc8e0010eb58bab13e842cf2acb18425a479912e30fd179fe86a","observation_id":"8158be7a-d0e1-4897-bcff-78a2e02e8328","resolution":{"observed_at":"2026-05-22T14:01:37.827431Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mutual information alleviates hallucinations in abstractive summarization","venue":null,"work_id":"c186ed52-f1ff-4df7-8511-bd1dfff9bdb0","year":2022},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:7369fc21889829755f9c2feb02139e09c0fb9eb8c10de3f9cebac0da884ddaec","observation_id":"660d57c1-4417-472d-b3fc-c1aec11ec9db","resolution":{"observed_at":"2026-05-22T14:04:54.101131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"6a1150cc-40e0-4604-82d1-bc1772e4639e","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:8129d39cd615daeb55a3db31c957eb9688e06ed9a1ea12da01ee92b7f79a1149","observation_id":"74268c40-6587-4b1d-bc15-6452a413f700","resolution":{"observed_at":"2026-05-22T14:04:54.104717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:f0cb1e2a004a61ce8259dc9f637eda5579063c6907c7fb83e894717f9247342d","observation_id":"cf779a1a-eba5-4410-95a2-b6dd1dcc4e87","resolution":{"observed_at":"2026-05-22T14:01:38.469751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11675","last_updated":"2025-01-27T16:00:59Z","snapshot_observed_at":"2026-08-12T23:40:56.994753Z","submitted_at":"2024-06-17T15:55:38Z","title":"BLoB: Bayesian Low-Rank Adaptation by Backpropagation for Large Language Models","version":5},"cited_work":{"arxiv_id":"2406.11675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11675","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blob: Bayesian low-rank adaptation by backpropagation for large language models.arXiv preprint arXiv:2406.11675","venue":null,"work_id":"1f19375b-0f7b-42db-9e7b-ee6f8fff5266","year":null},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2406.11675","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:1faea0a45b28096b504162581f52018e839bee3484b3514c8975919dcc36912f","observation_id":"dce899a5-6e22-4480-84f0-2c57615ddc70","resolution":{"observed_at":"2026-05-22T14:01:38.492763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:0ffd28fa1f178acc7b30775fde0a47879e111d4f48fb489e8e3b30f6a7b4a8e2","observation_id":"deb0be3e-7613-4e73-b85d-a0b13a040b50","resolution":{"observed_at":"2026-05-22T14:01:38.420484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:09:07.34152+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:09:07.34152+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":"2306.13063","doi":"10.48550/arxiv.2306.13063","metadata_source":"pith","pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","venue":"cs.CL","work_id":"7c5c5f6d-fd68-4f65-ac05-5d90308e8bc2","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:58c08c101011bcf6145feac1ec202dd6d5a5e50ab45b7399dbfc0e7ba5db9d05","observation_id":"9b9381a0-3fd0-43fd-9a48-d02d4e3a98f7","resolution":{"observed_at":"2026-05-22T14:01:38.406957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:10.462371+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:10.462371+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02543","last_updated":"2024-07-17T15:55:51Z","snapshot_observed_at":"2026-08-12T23:50:15.473728Z","submitted_at":"2024-06-04T17:58:18Z","title":"To Believe or Not to Believe Your LLM","version":2},"cited_work":{"arxiv_id":"2406.02543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02543","snapshot_observed_at":"2026-07-11T03:07:50.741485Z","title":"To believe or not to believe your llm.arXiv preprint arXiv:2406.02543","venue":"cs.LG","work_id":"90b6d9af-572f-4dbc-ba4c-f5f7474a3cd4","year":2024},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2406.02543","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:1055aae81173003a90bee45f76a9336c94c0d076b9459313cceeca2fca756db7","observation_id":"4d3a630b-e496-423c-8b3f-61f269d95b15","resolution":{"observed_at":"2026-05-22T14:01:38.286476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13111","last_updated":"2024-02-05T21:16:52Z","snapshot_observed_at":"2026-08-13T10:28:00.571231Z","submitted_at":"2023-08-24T23:06:21Z","title":"Bayesian Low-rank Adaptation for Large Language Models","version":5},"cited_work":{"arxiv_id":"2308.13111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13111","snapshot_observed_at":"2026-06-30T08:04:28.522413Z","title":"Bayesian low-rank adaptation for large language models.arXiv preprint arXiv:2308.13111","venue":null,"work_id":"b2b95843-e66e-4f81-938e-563b971c306c","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2308.13111","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:7f9da8fb6231c979e27a63137eb9e0dc4f63c470746f637632c5cbeb2b54f68e","observation_id":"646bc7e1-f1cc-45f7-9e86-90a6195272b8","resolution":{"observed_at":"2026-05-22T14:01:38.448290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11250","last_updated":"2025-02-16T20:00:56Z","snapshot_observed_at":"2026-08-13T03:29:20.018956Z","submitted_at":"2025-02-16T20:00:56Z","title":"Uncertainty-Aware Step-wise Verification with Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2502.11250","doi":"10.48550/arxiv.2502.11250","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11250","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uncertainty-aware step-wise verification with generative reward models.arXiv preprint arXiv:2502.11250","venue":"ArXiv.org","work_id":"b71a7a85-91b3-41aa-8e25-7d629343e411","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2502.11250","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:e126fdc84ac38f79d1de8d4444217879d9511a9faef5c95931ac7898fa3ee545","observation_id":"cf372d6d-4432-42aa-b6b4-c7ce5b1dae1a","resolution":{"observed_at":"2026-05-22T14:01:38.277808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:14.502486+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:14.502486+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17214","last_updated":"2025-06-03T04:13:58Z","snapshot_observed_at":"2026-08-07T17:53:05.247702Z","submitted_at":"2025-02-24T14:48:06Z","title":"CoT-UQ: Improving Response-wise Uncertainty Quantification in LLMs with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":"2502.17214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17214","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cot-uq: Improving response-wise uncertainty quantification in llms with chain-of-thought.arXiv preprint arXiv:2502.17214","venue":null,"work_id":"df009baf-f5a4-49b7-b690-740613e573b5","year":null},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2502.17214","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:02b869ee69d5387c500f0f2ba372dca79de2b45b841c6a3765f7ed0f4f9ba631","observation_id":"881969ea-f120-408b-a1e8-83b1435ee914","resolution":{"observed_at":"2026-05-22T14:01:38.220946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13230","last_updated":"2023-11-22T08:39:17Z","snapshot_observed_at":"2026-08-13T05:19:51.767994Z","submitted_at":"2023-11-22T08:39:17Z","title":"Enhancing Uncertainty-Based Hallucination Detection with Stronger Focus","version":1},"cited_work":{"arxiv_id":"2311.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13230","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing uncertainty-based hallucination detection with stronger focus.arXiv preprint arXiv:2311.13230","venue":null,"work_id":"23ee5068-c28b-4bcb-8e08-1b4e3934ea46","year":null},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2311.13230","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:e9c6d3eab840ea39082960ad17fc7ebdb6c230b08e546b7f9d080464bb2ac0c3","observation_id":"b1c56a53-0093-46a3-b8b2-c47f67319986","resolution":{"observed_at":"2026-05-22T14:01:38.389956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04406","last_updated":"2024-06-06T02:51:17Z","snapshot_observed_at":"2026-08-13T11:34:11.989911Z","submitted_at":"2023-10-06T17:55:11Z","title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","version":3},"cited_work":{"arxiv_id":"2310.04406","doi":"10.48550/arxiv.2310.04406","metadata_source":"pith","pith_arxiv_id":"2310.04406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models","venue":"cs.AI","work_id":"810dbb8b-e954-4797-bf0d-5d8cad94e524","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2310.04406","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:50d74be921f62eb691952f30d6697c10d5aa78b561eadd5c4350a9c139eaa959","observation_id":"1e660460-f535-4684-94e5-3f0020baae39","resolution":{"observed_at":"2026-05-22T14:01:38.246330Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T21:05:03.742856Z","title":"A theoretical study on bridging internal probability and self-consistency for llm reasoning.arXiv preprint arXiv:2510.15444","venue":null,"work_id":"bc5348b0-c42a-4271-b5fd-1d3e9cb811eb","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:55ac05a797085b5dd3473fa6027fabda121d8564442b1c532e9d63029a20b956","observation_id":"3f343d31-c1bb-4428-a353-b115c98fe112","resolution":{"observed_at":"2026-05-22T14:01:38.227719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15341","last_updated":"2025-03-19T15:40:45Z","snapshot_observed_at":"2026-08-07T16:51:34.078217Z","submitted_at":"2025-03-19T15:40:45Z","title":"Uncertainty-Guided Chain-of-Thought for Code Generation with LLMs","version":1},"cited_work":{"arxiv_id":"2503.15341","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15341","snapshot_observed_at":"2026-07-03T20:38:55.823389Z","title":"Uncertainty-guided chain-of-thought for code generation with llms.arXiv preprint arXiv:2503.15341","venue":null,"work_id":"c6e0aaea-d8da-47c2-b9fe-9f2c2cb3f74f","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2503.15341","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:347714e35541df72c3fa74f798232c9cc83c4daeb0a56e2464c41e8ba77098eb","observation_id":"000480f8-4ec4-4e95-847c-0a3a0a7a5d60","resolution":{"observed_at":"2026-05-22T14:01:38.481134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Appendix B, we present the full algorithmic description of our method with low-rank weight perturbation","venue":null,"work_id":"a5da08d5-3c1a-4f46-bcf9-cb08ba240568","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:cfe1671be802ef4f4e9b5d835146974a6a9c31b738e28b006d0f7acab69899ae","observation_id":"fe189900-c2e7-437d-8d0b-0643774c2191","resolution":{"observed_at":"2026-05-22T14:04:54.144599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2d21bfdb-6f8c-47e1-8cc0-6bd55a1fe60f","year":1999},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:613e4538a400a3fdfb11ef84b35550ad01d9479da9a2e88af33f21e195835035","observation_id":"f9a0ff79-822a-4c3e-b334-cfbc69b9168a","resolution":{"observed_at":"2026-05-22T14:04:54.147881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For Aleatoric Uncertainty (AU) and Total Uncertainty (TU) defined in Eqn","venue":null,"work_id":"59181b14-39fc-4a5e-96f6-a023a894a84b","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:a71c4eaac0ed5785952e8995e752f7729d1ad7fd705797b6bce1facb53e87b09","observation_id":"46dc3c28-f40a-40c8-aa16-00cd06d305a6","resolution":{"observed_at":"2026-05-22T14:04:54.151848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"4.2, we apply length normalization to TokUR to mitigate the bias introduced by varying sequence lengths","venue":null,"work_id":"40277ea7-6194-4520-9eab-5746fe67135f","year":2023},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:a88b99486239c38114bbe75681f6facfef4fcd78b9a76b94d8adf7f779bfad7b","observation_id":"b24b033b-9725-428d-b593-fa5910346dd7","resolution":{"observed_at":"2026-05-22T14:04:54.133057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"True”, normalized by the sum of probabilities of token “True","venue":null,"work_id":"6ee7727e-ac29-48e2-a3b1-8581014f837b","year":2018},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:6be9476b676482317ec645077833df0ef78246a3499ea8d4ed5c4e5407657ffc","observation_id":"63471ad4-10df-4091-a559-9bff0834aa25","resolution":{"observed_at":"2026-05-22T14:04:54.136630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E.3 TEST-TIMESCALING VIAUNCERTAINTYESTIMATION We provide an additional visualization of the test-time scaling results in Fig","venue":null,"work_id":"48681a96-ab55-4220-9f67-fe5e5c3700f8","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:b4606fa59225fbd6e571f89f3c7073a17fc27ce4c4627d577999994ca330928a","observation_id":"d21adb33-7a2f-4532-9d34-60715271a84d","resolution":{"observed_at":"2026-05-22T14:04:54.129580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"74f92001-687b-4b80-84ab-cd4b4e18e03f","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:fa004a8112764d4a5eab79b47fd3ee244f4e64d4b710bdfb6dd02c560d6aff18","observation_id":"677ba42e-3582-48f1-a742-ecd97fea6c37","resolution":{"observed_at":"2026-05-22T14:04:54.119115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building upon this algorithm, we use uncertainty as the score for each particle at each step to guide the model’s generation process","venue":null,"work_id":"76ae61fd-d64c-4595-ba97-f0afe749bf35","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:9aa457ea3de9893a4f5b5ae80c6e42fbb48ba61a9623bbc35880320640c63f52","observation_id":"713f43e8-ab64-465f-95a5-021523ce6a81","resolution":{"observed_at":"2026-05-22T14:04:54.122787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b0fe451f-52e8-4209-8878-a86e7f11088c","year":2036},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:833b395a23a22a72db0ebe651dda5218ba0e4f04752a4b2fc3d1eda12a0e275b","observation_id":"0124b369-065b-461e-958d-2f30f6e76130","resolution":{"observed_at":"2026-05-22T14:04:54.139914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In general, higher temperatures lead to more diverse responses","venue":null,"work_id":"7a6a6206-c450-47f8-93c6-febeae383b1f","year":2025},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:e1ac029a5975df9993bd5d102400164364f000cf3f72e7fd70b2048009bf1c55","observation_id":"a253ca48-fed2-4cf1-880b-255d0b04e84a","resolution":{"observed_at":"2026-05-22T14:04:54.126091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In addition, we introduce a naive baseline,Negative Length, which uses sequence length alone as a confidence signal","venue":null,"work_id":"3b91891c-41ce-4abf-8d09-f7868750f17f","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:7ea15502649b17a4949233109cce8e5df99c08fa3bdae932ca89eb2948b675ba","observation_id":"cbc348a7-6b45-4136-bc12-54ea994fda1b","resolution":{"observed_at":"2026-05-22T14:04:54.175859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"9600 - 7200","venue":null,"work_id":"d515f915-4ffa-4dfe-b752-0225ce5ec623","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:493d81029e3f7eb1faf2f0976c5eec91d00eb257e0e2069d84c743a26db86e7e","observation_id":"f1d82121-148f-41ed-ba09-11f09c57b74f","resolution":{"observed_at":"2026-05-22T14:04:54.115539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"9600−7200","venue":null,"work_id":"349a039a-1eec-4589-8f91-06817bab99e6","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:ce301a557d5309567b99f595449cbd3c8f2a13db6553db2fa96dc412c5b730b0","observation_id":"42d2b686-4dd1-4e35-8f88-f73ac6ab28ae","resolution":{"observed_at":"2026-05-22T14:04:54.112464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"60”. In the correct solution on the left, the model had low uncertainty for the correct answer “36","venue":null,"work_id":"6cdf23b0-69ec-421b-bd12-4f211d5a4d45","year":2026},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:2542c69f45d82d424b018b466c270fc5cdbba26f39262c6abce3b34bf297f34e","observation_id":"2ebd2217-0c3f-47f2-96bd-9d7e2208cf54","resolution":{"observed_at":"2026-05-22T14:04:54.109102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":3,"verified_exact":39,"verified_fuzzy":19},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 11 inbound Pith citation observations for arXiv:2505.11737."}