{"as_of":"2026-08-07T13:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff694a618e942ae35e3ff8c61ed22e849aaeb8969f26a24d88164a82625e509e","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T17:54:18.515174Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09438/citation-record","integrity":"/paper/2509.09438/integrity","json":"/paper/2509.09438/citation-record.json","paper":"/paper/2509.09438"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:fbc84ad254b179ada5c24a456441afc68f5f0de4f95ff9c6fe9027fce50497c9","observation_id":"08933d62-4006-400f-b7e8-14ed580ce454","resolution":{"observed_at":"2026-05-18T17:56:42.044711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3: A conversational ai model","venue":null,"work_id":"90de01b7-9411-4976-912c-8b35805a984b","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:1e39898a7ab04861a9dd79c692c4ac8c4379a925fa8ae696b8870e371f683a12","observation_id":"fdca9dc6-ff1a-4952-a999-6eb6eb42d824","resolution":{"observed_at":"2026-05-18T17:56:43.347298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:a60fc0057645e3142f530fb144cb1298896c0e802e366641ab708d57c953feaf","observation_id":"0de05903-d348-426f-8856-70c87cdcbe15","resolution":{"observed_at":"2026-05-18T17:56:42.111263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:37:02.006598Z","title":"Large language models encode clinical knowledge.Nature, 620(7972):172–180","venue":null,"work_id":"583c97a8-8780-47df-a993-86531bd4fae6","year":2023},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:47808f374fbad8426655fdbf170477ba08e3ff6e07c35feba2f5abb0989ebc82","observation_id":"109ea1f4-5ba3-4812-accd-3be8cd0c5cea","resolution":{"observed_at":"2026-05-18T17:56:43.355923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20362","last_updated":"2024-05-30T17:56:05Z","snapshot_observed_at":"2026-08-05T11:35:24.583000Z","submitted_at":"2024-05-30T17:56:05Z","title":"Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools","version":1},"cited_work":{"arxiv_id":"2405.20362","doi":"10.48550/arxiv.2405.20362","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hallucination-free? assessing the reliability of leading ai legal research tools","venue":"arXiv (Cornell University)","work_id":"1076867a-51fd-43e8-a81f-e2e3bf294795","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2405.20362","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:219b8d443f5956b55f3a02d533439f7842915f00af570a0e6661f48fc92f8789","observation_id":"90f1e092-737f-441b-8a94-678715b651c4","resolution":{"observed_at":"2026-05-18T17:56:42.104825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finben: A holistic financial benchmark for large language models.Advances in Neural Information Processing Systems, 37:95716–95743","venue":null,"work_id":"142e7c9f-b7df-4a48-8d7e-60ba60148954","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:4f9ab7b843698cdfa395536f4bced9e2d84468d2677d83cdd97a41c2bbc0d2d0","observation_id":"e860c4a1-a970-425e-a47f-018915464018","resolution":{"observed_at":"2026-05-18T17:56:43.331089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":"2207.05221","doi":"10.1145/3618260.3649777","metadata_source":"pith","pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models (Mostly) Know What They Know","venue":"cs.CL","work_id":"8ca58a10-da41-4f70-baae-7e449512e345","year":2022},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:c37e33253753cc2d86d8b2d4cbdebaec54273bde3e37c592287f01159f2b893e","observation_id":"e8cea93f-f185-4a6c-bec9-0ac77296fdcf","resolution":{"observed_at":"2026-05-18T17:56:42.097881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:54:30.360117Z","title":"On calibration of modern neural networks","venue":null,"work_id":"f57c32e7-1eed-419f-a895-c2ff731c582c","year":2017},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:8cb846507e2df0e63ce773b29ef7a944cf353f27d794734bd8d17066a561b0df","observation_id":"3782065e-5476-41b7-8f83-02116060f754","resolution":{"observed_at":"2026-05-18T17:56:43.335401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calibration of pre-trained transformers","venue":null,"work_id":"c2f369b0-6db6-400f-aa78-c2fde0fa851f","year":2020},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:891ee9eb88210018c33d9981dd2e24bf98eb26aea48025b33776ea22bdcca53b","observation_id":"c3d3c1c7-3b44-46d5-9250-a42e2e37e314","resolution":{"observed_at":"2026-05-18T17:56:43.359464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models are miscalibrated in-context learners","venue":null,"work_id":"3b84a3e8-6c2e-45b8-a4c9-702388bbeede","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:ba0b69deda736f1de8c435e11cf7663902858aade12bb997fda72b29f95b4d9f","observation_id":"cf18220f-4b9c-46e0-8967-63b23d21d73f","resolution":{"observed_at":"2026-05-18T17:56:43.339460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":"2407.21787","doi":"10.48550/arxiv.2407.21787","metadata_source":"pith","pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","venue":"cs.LG","work_id":"b124064d-5a56-42ad-86f5-3cc349b86a3a","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:85211543ccf39fb1b2a7cdbb82296a6c5c423fdfa4c8457c50dce2cd5e686a67","observation_id":"d076c677-f83b-4c5c-881a-3780e57bf923","resolution":{"observed_at":"2026-05-18T17:56:42.118255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.13246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Atomic calibration of llms in long-form generations","venue":null,"work_id":"7114871c-cb03-41d6-b281-3524b77ba0dd","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:bbf4f846863696a72c6921d8dd6b74e9a97a63923dce1b6055d0bc617fe0564e","observation_id":"0c2bcd3a-b37d-413d-b568-0eb15f60cbe9","resolution":{"observed_at":"2026-05-18T17:56:42.091914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cali- brating large language models using their generations only","venue":null,"work_id":"5b1d85e7-0f28-4474-a8b2-b2a1e3007e47","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:4754e226b3e522fa46551b80d149246349fcb9f59fb6b69e61212a8d5f068e1f","observation_id":"1301b4a4-6e97-4555-b677-726185bc6bc1","resolution":{"observed_at":"2026-05-18T17:56:43.343511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models must be taught to know what they don’t know","venue":null,"work_id":"caadf88c-e091-48bd-b4ed-f1e2bafa7432","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:5dfe1d20b410dd4051970380b32b64abfc266b857411ca0c1ac2da42f8f0e9a5","observation_id":"85e46730-e15d-473b-bbe1-eb47a51880a0","resolution":{"observed_at":"2026-05-18T17:56:43.326127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:54:30.370837Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback","venue":null,"work_id":"dd08b05c-0b77-451c-b1cf-dd6f940b176e","year":2023},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:d2886b10f3f775d52cb92ee33787606a984e612439b9921bef8a980d1c5e5a9c","observation_id":"97667c96-49ba-4fca-858f-39d8b2d0ba52","resolution":{"observed_at":"2026-05-18T17:56:43.317474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can llms express their uncertainty? an empirical evaluation of confidence elicitation in llms","venue":null,"work_id":"208e0d52-bf23-4ffa-8be8-98b649bf5f79","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:93dfdfc77fb6bdde5944556be169b8cd698299469d6f8a17b7416d23a5b4ad1a","observation_id":"4ffb4919-8d61-4eb2-b880-2a87652d84ba","resolution":{"observed_at":"2026-05-18T17:56:43.292848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linguistic calibration of long- form generations","venue":null,"work_id":"f5d1bb35-0e67-4bca-a315-dcd0d1f24a45","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:67767758c3390b995b16ef76c85bddd27f54a45337baa8e8d08c3d6e1333955d","observation_id":"c81f8858-6d2f-42cb-96ce-e32e770d285a","resolution":{"observed_at":"2026-05-18T17:56:43.285841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14309","last_updated":"2025-06-04T13:35:31Z","snapshot_observed_at":"2026-07-06T19:35:52.925493Z","submitted_at":"2024-10-18T09:15:35Z","title":"LoGU: Long-form Generation with Uncertainty Expressions","version":4},"cited_work":{"arxiv_id":"2410.14309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.14309","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logu: Long-form generation with uncertainty expressions","venue":null,"work_id":"2f775fd8-3d44-4910-984f-aebbe66fa84e","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2410.14309","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:0da57f985a61233ccf9a79dfbd055dc6b791081ddf885ec4610d4245a039f16b","observation_id":"ed53c8f4-6f6f-4feb-9322-a9a4df42770d","resolution":{"observed_at":"2026-05-18T17:56:42.130120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.16922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.856567Z","title":"Uncle: Uncertainty expressions in long-form generation","venue":null,"work_id":"8ce648a0-d3e1-4b6c-8be1-19bd88a27383","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:f543920ed4724e55f3e9fc19d228d9d4889f7cb277e9e38c020b626c3027cd92","observation_id":"3cae4aef-f9af-420c-85f0-ad995bd3d50a","resolution":{"observed_at":"2026-05-18T17:56:42.124226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14477","last_updated":"2025-04-22T19:00:41Z","snapshot_observed_at":"2026-08-07T04:24:53.360691Z","submitted_at":"2025-03-18T17:51:04Z","title":"Calibrating Verbal Uncertainty as a Linear Feature to Reduce Hallucinations","version":2},"cited_work":{"arxiv_id":"2503.14477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.14477","snapshot_observed_at":"2026-07-08T10:04:51.478844Z","title":"InThe Eleventh International Conference on Learning Representa- tions, ICLR 2023, Kigali, Rwanda, May 1-5","venue":"cs.CL","work_id":"82f28dbc-de25-4312-9a69-f756f459e7d1","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2503.14477","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:1079839ce1622daa77dba2060e7c9a7f7948cc2be16f847222342ba0111359de","observation_id":"01baacb6-a6f0-45cb-b072-f6ec600633be","resolution":{"observed_at":"2026-05-18T17:56:42.157411Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"ec23b693-8ab6-4297-9cae-78cd54ddebdb","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:87b58f26da10f5919ff18eab55920827e2f7b07c5910ba1a9f7ced578c6174fc","observation_id":"a730ad1d-a6e4-40f7-8261-808fa776e6ea","resolution":{"observed_at":"2026-05-18T17:56:43.275498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic uncertainty: Linguistic invariances for uncertainty estimation in natural language generation","venue":null,"work_id":"cc4e56f0-cfe6-4940-9f54-6ba6a04b9521","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:b05889579d1dc4cb1ec0b1d4f3dff68613e5e0735cf71999f977388e190768cb","observation_id":"89f3de43-2aa7-49b1-b27e-c74b2d8803b5","resolution":{"observed_at":"2026-05-18T17:56:43.271450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Get confused cautiously: Textual sequence memorization erasure with selective entropy maximization","venue":null,"work_id":"90bce929-4335-47af-ab89-162e3cd855ae","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:87df679105d8bf57d363157bd41dc5aefafef12967fd56ff4da274f789ec49c2","observation_id":"7a177a63-dd6b-45f0-adc9-b552778b2af1","resolution":{"observed_at":"2026-05-18T17:56:43.263942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Softmax probabilities (mostly) predict large language model correctness on multiple-choice q&a.arXiv e-prints, pages arXiv–2402","venue":null,"work_id":"2cddabee-083f-4522-8a2e-94234bf7b2eb","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:65c75661ef9c444920a8a1c93a82d50b429e997440b64c18f02021c91deabff3","observation_id":"b6b095ae-09d1-4fb3-9116-eab805e2315c","resolution":{"observed_at":"2026-05-18T17:56:43.279253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The internal state of an llm knows when it’s lying","venue":null,"work_id":"20bd5cbd-b416-4631-9108-067d443433a9","year":2023},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:656e0e52ae9f2ad1405ad7b880575fd3477b9bed2bf8a901a01419f11b77dab0","observation_id":"2190c1cd-728d-4d24-918d-0a2129f0b54f","resolution":{"observed_at":"2026-05-18T17:56:43.296344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15927","last_updated":"2024-06-22T19:46:06Z","snapshot_observed_at":"2026-07-30T04:59:24.269176Z","submitted_at":"2024-06-22T19:46:06Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","version":1},"cited_work":{"arxiv_id":"2406.15927","doi":"10.48550/arxiv.2406.15927","metadata_source":"pith","pith_arxiv_id":"2406.15927","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","venue":"cs.CL","work_id":"5977e285-35c6-4724-813a-e9560aa2439c","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2406.15927","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:e3b36c27f2ca90cf5aac9fb456773caf25d9880c4dd30f9c089e8213c9f34fcf","observation_id":"ece7dc71-df39-4251-8a8c-feff6dad8063","resolution":{"observed_at":"2026-05-18T17:56:42.145469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing language model factuality via activation- based confidence calibration and guided decoding","venue":null,"work_id":"9bce1b5b-a306-4ece-9fd2-7391a6841f0f","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:df3d4a094f377d9f767b0eb6680b0b53240ce9663d30e53f48f85a64238405ac","observation_id":"7d6f1316-593c-4071-aaea-2f799821bbaf","resolution":{"observed_at":"2026-05-18T17:56:43.267670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.14749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.408571Z","title":"arXiv preprint arXiv:2503.14749 , year=","venue":null,"work_id":"d710d1e3-834d-4add-b595-a2f778738a78","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:c287c9a0afcd2590b6fe0c000b51a5e71495a2b4adcc911a6acdd617fe384a18","observation_id":"e9223cb5-e101-4aca-a683-a8ecf4eaaa04","resolution":{"observed_at":"2026-05-18T17:56:42.151417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I don’t know: Explicit modeling of uncertainty with an [idk] token.Advances in Neural Information Processing Systems, 37:10935–10958","venue":null,"work_id":"fcea7064-024b-4d6f-a12f-055859fea07a","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:dfb8a06028b1a7481808e351603ba6e4477ff69c7e72c23e645b8505ccce06e4","observation_id":"19bd4ae3-8f3a-441d-939a-2cde8c052cdd","resolution":{"observed_at":"2026-05-18T17:56:43.234081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:cc301e8b207c3c6f806944a190cb514bee6091d1019a8e76d1964a1a385a9647","observation_id":"29798411-9659-45df-a51a-7255ac2d5da5","resolution":{"observed_at":"2026-05-18T17:56:42.056469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":"10d6b849-5e9a-4bf9-8f7d-17dd6af5abd5","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:9bfc07ba145d05a72b1632e97fff67a78799a9ce2025bf9479b112d7d1c97d2b","observation_id":"8649d25b-61e3-460c-807c-3163d90334bb","resolution":{"observed_at":"2026-05-18T17:56:43.238227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":"2412.21187","doi":"10.48550/arxiv.2412.21187","metadata_source":"pith","pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","venue":"cs.CL","work_id":"d79f8b7d-560d-4fbd-bd70-4d084f6d9ad6","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:f4b8d1bdfa010d274a389de6bd007484e16d4b4ad99b4a53f73a021a4ab49933","observation_id":"90fd3298-5194-42b6-bcda-65084ef934f4","resolution":{"observed_at":"2026-05-18T17:56:42.066613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:e0dcfa2d2faac3b69343f89cfceb0babdcae191e3a08bc63a7d59c570f14a334","observation_id":"b1f71bab-245c-47c2-b3de-02b41d321d41","resolution":{"observed_at":"2026-05-18T17:56:42.061587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Escape sky-high cost: Early-stopping self-consistency for multi-step reasoning","venue":null,"work_id":"94379ba1-da03-48ef-8ea4-fb9bbf15cf80","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:f8044353811430a88eed19d4eb14ec9903ddf53fc2b000cdd43eecb49b0f3b94","observation_id":"b57c5af3-d79b-4191-aa1c-b425c288bd7e","resolution":{"observed_at":"2026-05-18T17:56:43.249238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s sample step by step: Adaptive- consistency for efficient reasoning and coding with llms","venue":null,"work_id":"3b3eaa17-4a8c-4fc8-900e-87eba2f13519","year":2023},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:cf34bc96af9b232f5327937e037b647bcc8987318bbab8a99bd60797bbf4c273","observation_id":"50d0baf7-7392-4ebf-a69b-f83d7a040033","resolution":{"observed_at":"2026-05-18T17:56:43.241800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19877","last_updated":"2026-07-16T03:37:34Z","snapshot_observed_at":"2026-07-19T23:18:14.817743Z","submitted_at":"2025-03-25T17:41:18Z","title":"Scaling Evaluation-time Compute with Reasoning Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2503.19877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19877","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling evaluation-time compute with reasoning models as process evaluators","venue":null,"work_id":"e175b60c-adae-41f3-87b0-7d2bb8d3e54a","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2503.19877","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:6994d1056a0dffed8551fc5599d3c548b18c56e3946bb3d25dbe52b5a24feb89","observation_id":"ee976613-51b5-4b71-8077-2c62e2cca600","resolution":{"observed_at":"2026-05-20T02:04:41.392178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623","venue":null,"work_id":"f311bbfe-d6d8-410b-bd89-3da6075f8a1b","year":2023},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:9f06ecc1ba2b2e71f806aabb2eb3cd7daccefbce542c956ae62318a3268c4b06","observation_id":"f3d21a7a-9e4e-4a70-a6ae-5db6ad9d8974","resolution":{"observed_at":"2026-05-18T17:56:43.245509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.06233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Confidence improves self-consistency in llms","venue":null,"work_id":"2ead1d84-229f-4226-b5d2-c48b04b79efe","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:fee19658b49090dffbceb56435165a4fc2d58f7a590bc51ea62e78039f28c6e4","observation_id":"c8716dbb-7c67-49c1-b1b2-41f33570ca58","resolution":{"observed_at":"2026-05-18T17:56:42.084833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00031","last_updated":"2025-02-25T00:21:14Z","snapshot_observed_at":"2026-07-06T20:44:35.837721Z","submitted_at":"2025-02-25T00:21:14Z","title":"Efficient Test-Time Scaling via Self-Calibration","version":1},"cited_work":{"arxiv_id":"2503.00031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.00031","snapshot_observed_at":"2026-07-03T14:28:31.655268Z","title":"Efficient test-time scaling via self-calibration","venue":null,"work_id":"1f33ea43-25d3-47b4-bdd1-61cf6c33c69e","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2503.00031","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:207ad9a41a4891438fc29db821803eb91e50393bbe64851f3e9c988d8b4aaaa2","observation_id":"1558b01b-1e7e-4872-b6a6-17c016193889","resolution":{"observed_at":"2026-05-18T17:56:42.072706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-08-02T03:10:09.020351Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":"2508.15260","doi":"10.48550/arxiv.2508.15260","metadata_source":"pith","pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Think with Confidence","venue":"cs.LG","work_id":"39c40c74-9f55-406d-b67a-37d9b88aa6b3","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:89e94beefd0aeefeeb75a8c892e1cfdfcf89b913aca8ca1b7069c834ebc42df2","observation_id":"167cc81e-5d1d-452e-aded-20dbb3c36c63","resolution":{"observed_at":"2026-05-18T17:56:42.078309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":"ef6160da-7135-428c-8a8c-37357c77dede","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:fb4f30ea2276292fad64d395783929dcc91e696705dbdda53dbb1da6c8522e3c","observation_id":"7abfb6da-f762-4287-9bdf-6537a16da157","resolution":{"observed_at":"2026-05-18T17:56:43.229923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guiding language model reasoning with planning tokens","venue":null,"work_id":"588a69ca-4127-4edd-93f7-10eeafed20cc","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:205601dc8d5311c9dcb66de2f5746704a48a91cbe3519987877862067b16a334","observation_id":"579c00da-3e72-447f-97b4-af2bf2aeb0df","resolution":{"observed_at":"2026-05-18T17:56:43.252859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calibrated structured prediction.Advances in Neural Information Processing Systems, 28","venue":null,"work_id":"a7c33f56-4b5a-4bf2-b074-0c339d229842","year":2015},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:2db8ebac1dd972fc80bd48e3c535f5ea4d98610692cc5405c2c7d9951c3c6436","observation_id":"093ae9e3-4e72-4f5b-a013-a2241fe60813","resolution":{"observed_at":"2026-05-18T17:56:43.303661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uncertainty estimation in autoregressive structured prediction","venue":null,"work_id":"c25f9805-cde6-440a-8df5-7ba63f9d344d","year":null},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:d6d0e0c96bb1d714d98a7dc5122131ec1d1f33651f76e06bc582acd3aba98483","observation_id":"0ac20496-a55c-430d-bbb9-5c782734a6b9","resolution":{"observed_at":"2026-05-18T17:56:43.351910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods.Advances in large margin classifiers, 10(3):61–74","venue":null,"work_id":"be30688f-e8d5-42a9-80c8-37eb46f7f7ff","year":1999},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:82be9e79b901fb8ea90a04cb72a56d993aaaec9ee1e414664461faa99ba16b55","observation_id":"ff9f386e-761a-4aa3-860e-b5f66c36f861","resolution":{"observed_at":"2026-05-18T17:56:43.260423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning aware self-consistency: Leveraging reasoning paths for efficient llm sampling","venue":null,"work_id":"2f7d87b0-8a79-41c0-8b81-439c06a2fbe8","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:734ed7026d6e5f7ade24afd05f102b5523b5486f5299cf8c8a5a89401ff047f7","observation_id":"80bc7247-a912-4607-8a3e-d70ca5d3a072","resolution":{"observed_at":"2026-05-18T17:56:43.256637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":"b46f9f93-9e13-4040-bbf7-71ccbf87bea7","year":2017},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:6f541a576340874a2037341a2627ef51df0f97bf361fef328f90cec2e0af3b13","observation_id":"0c875d73-d43f-4ab7-a834-60698ff28543","resolution":{"observed_at":"2026-05-18T17:56:43.282470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Crowdsourcing multiple choice science questions","venue":null,"work_id":"fb290b23-e8b1-4574-aeea-c86a8a8204ab","year":2017},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:7fc1f91199bb1d1db79dfa2c61c5dd5d4912adc32554af81c8255997a08f51e2","observation_id":"96e64ac5-2b76-47a6-990c-f89ae605f7bf","resolution":{"observed_at":"2026-05-18T17:56:43.289130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:37:02.016439Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"ab9cb640-34d3-454d-8045-b23d7e537d81","year":2004},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:f7ca27a536bdc7b6fe22ed276deddb7809ca1f486154e43e98ccaf273d4c7baf","observation_id":"7ca5fbe7-7ef5-4fef-b421-71c07d77b853","resolution":{"observed_at":"2026-05-18T17:56:43.313162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:ce5a1f87a411146ec23f4ec6f3e67d56cceb1c7ec9f559540b3f093812912410","observation_id":"13b6c20a-52a8-48ef-95b7-ae89625033ae","resolution":{"observed_at":"2026-05-18T17:56:42.178435Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:7e4de1c0918939fb6b6a7f74cd316de830eaa399e4cadd4f25dafcf3a8a4fb87","observation_id":"0c4109c0-f65a-4f1b-936c-3f23335492b2","resolution":{"observed_at":"2026-05-18T17:56:42.168290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:8bbdf6b1d1e05b5dfb326f4f6a8b5bf1a6c57789b91598e8ef9ad20c3adf7d7d","observation_id":"24c07ed8-69f7-4b0a-ad00-488385d64e2f","resolution":{"observed_at":"2026-05-18T17:56:42.173070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:00:42.364420Z","title":"Obtaining well calibrated probabilities using bayesian binning","venue":null,"work_id":"73162984-4d0d-439b-bf21-42ccd96cd159","year":2015},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:8fe36a525f2aeac2efa92a4530bb21578e7c7632c74c5c7437b33ab5bbfb2b58","observation_id":"6f2fb485-c3aa-4696-a12b-0251b5050c98","resolution":{"observed_at":"2026-05-18T17:56:43.321835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Verification of forecasts expressed in terms of probability.Monthly weather review, 78(1):1–3","venue":null,"work_id":"1d826e05-a86a-492d-8a44-33ab7d85939f","year":1950},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:7b931cb81119c0983d4b5f0b72cb5e2d42bf7ef7dfeaaa4c107d0ab7b31d8225","observation_id":"80caeb5b-504d-48b7-8211-fb70a298da07","resolution":{"observed_at":"2026-05-18T17:56:43.308941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:feecdff7fb9631c94461fa39ff267ff7563ad6720533be2ba3391fd39d06e48b","observation_id":"9829f9ac-1a30-47f1-bfbe-6fd7cfe361bd","resolution":{"observed_at":"2026-05-18T17:56:42.140456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":"2a1305b5-ba19-4b1b-af6e-ed4ef2cb54cc","year":2019},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:4028902c2d569288cd16fd02903bcf4e3fe8851c0d456c8aaedf46151013a346","observation_id":"5a7a77d9-755d-4bfa-b0fa-147e5c5da30e","resolution":{"observed_at":"2026-05-18T17:56:43.300307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:1f0cd0fe5c431a8eac9abe87051d5d507b85fac3b5177c39b89cd0c7f16484df","observation_id":"2b7dbcc3-2b18-46a2-bed1-30c1e8c74888","resolution":{"observed_at":"2026-05-18T17:56:42.163103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17656","last_updated":"2025-09-08T04:28:15Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T09:18:56Z","title":"Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs","version":3},"cited_work":{"arxiv_id":"2505.17656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17656","snapshot_observed_at":"2026-07-02T05:16:39.641157Z","title":"Too consistent to detect: A study of self-consistent errors in llms","venue":null,"work_id":"c145b5c3-d84d-49d2-b5e0-eae0beb9be20","year":2025},"citing_paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T17:54:18.515174Z"},"links":{"cited_paper":"/paper/2505.17656","citing_paper":"/paper/2509.09438"},"observation_digest":"sha256:549a9d665cab5ac0c556f928ecda297b779d1b35339e2c1b8126e454c60b6b59","observation_id":"f7e4c79b-102c-444a-a876-cb7428721ea2","resolution":{"observed_at":"2026-05-18T17:56:42.135178Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.09438","last_updated":"2026-04-07T04:24:05Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T13:25:40Z","title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":22,"verified_fuzzy":34},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2509.09438."}