{"as_of":"2026-08-09T16:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef6129b78fc58ebdec5040cac624b2a33e5ec894b101c4b1079f45e898ff5c9c","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:05:41.210502Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04899/citation-record","integrity":"/paper/2608.04899/integrity","json":"/paper/2608.04899/citation-record.json","paper":"/paper/2608.04899"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:37.879497Z","title":"Benchmarking Uncertainty Quantification Methods for Large Language Models with LM -Polygraph","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:37.879497Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:501d02a1e5d1e282acc751d4cfb1bd2f04cb0c59ae81c348bcaf4d976b10c7cb","observation_id":"67c64fc7-7a01-438b-9011-c290c8f887c0","resolution":{"observed_at":"2026-08-06T14:05:37.879497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:37.927074Z","title":"Beyond Semantic Entropy: Boosting LLM Uncertainty Quantification with Pairwise Semantic Similarity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:37.927074Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:7124e3ae7e5d7e5bf5377e1ed73e77466b573758e8988789e02c2ec43bd44bfe","observation_id":"7a7e6c93-a5b9-478e-b940-8ca88100279b","resolution":{"observed_at":"2026-08-06T14:05:37.927074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:37.956147Z","title":"Thinking Out Loud: Do Reasoning Models Know When They ' re Right?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:37.956147Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:0ce5293b31adb1ce7f55671eccfbb92cf23ca75ec3572b6a77fd907d2f73a604","observation_id":"caba163f-e3e8-4a3a-9a87-3f11f97e151d","resolution":{"observed_at":"2026-08-06T14:05:37.956147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.004867Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.004867Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:94649a67b826616fc80bdda9516d3069901e7fa835189717338e69b4bd1bbe08","observation_id":"fc2df6d9-8137-4ac7-b10d-8df1521ceb63","resolution":{"observed_at":"2026-08-06T14:05:38.004867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.057387Z","title":"C heck E val: A reliable LLM -as-a-Judge framework for evaluating text generation using checklists","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.057387Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:57d002f33f63b96ca497087bba80a9885fa6737889e386b652468f6132120f65","observation_id":"f6c237d1-89ae-4f6a-b84f-a32fd0712050","resolution":{"observed_at":"2026-08-06T14:05:38.057387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.102656Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.102656Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:b09b86fa7717b6c8577518f2c66128473f577fc483cfff1f637c4865c0a5fead","observation_id":"8c082c08-0007-478a-97ce-a26110fa4f0a","resolution":{"observed_at":"2026-08-06T14:05:38.102656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.149210Z","title":"Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.149210Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:3bde874bc9de28bcf1132614ee49aa22ed2c9a695c749f5f6baf871e15c4a1c3","observation_id":"8424d035-3c56-4419-b41d-6805fe56d743","resolution":{"observed_at":"2026-08-06T14:05:38.149210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.184134Z","title":"Uncertainty Quantification for In-Context Learning of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.184134Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:0bcfceff5ede8321e00b78264300c6140eaad6c6ca66708a448cfed262e6d0ad","observation_id":"43b691c4-2287-4b89-8772-193c3feeb604","resolution":{"observed_at":"2026-08-06T14:05:38.184134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.283292Z","title":"A Survey of Confidence Estimation and Calibration in Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.283292Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:02bbea2f74f465fea1f50e69fb26e1c2fe9c0ea813d45dd6f3826c96db097e2b","observation_id":"0941cce5-dedf-45b8-8ad2-71979b193d44","resolution":{"observed_at":"2026-08-06T14:05:38.283292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.357788Z","title":"B ayesian Prompt Ensembles: Model Uncertainty Estimation for Black-Box Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.357788Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:b01c5992e5083202c0555e2a8132ba0c45fa74160c14d98bcff9bad2829e3d61","observation_id":"d488a415-7af0-45ba-8ea0-c62dbd6cc024","resolution":{"observed_at":"2026-08-06T14:05:38.357788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.423013Z","title":"Calibrating the Confidence of Large Language Models by Eliciting Fidelity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.423013Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:a0572260f46ce73063bc5692899c24b51a222a55b73dc7781eb8909ff57191e5","observation_id":"84f94c29-51eb-4379-8f71-c1d0d6811834","resolution":{"observed_at":"2026-08-06T14:05:38.423013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.523404Z","title":"Contextualized Sequence Likelihood: Enhanced Confidence Scores for Natural Language Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.523404Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:7df453a62bd14f5ead324cbee7dfe39e8d734b8e7a22ade87e06e4ab372100d5","observation_id":"09f6206a-bb22-4359-93d7-67e3bde20ca6","resolution":{"observed_at":"2026-08-06T14:05:38.523404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.634360Z","title":"Shifting Attention to Relevance: Towards the Predictive Uncertainty Quantification of Free-Form Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.634360Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:5e984df3ce81689450d9da64fd723f6d1a69d3d558b7904eede516573ece8fff","observation_id":"22d28937-d08e-49bd-977c-ab61269cdb4e","resolution":{"observed_at":"2026-08-06T14:05:38.634360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.345","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:41.383602Z","title":"Adaptation with Self-Evaluation to Improve Selective Prediction in LLM s","venue":null,"work_id":"2947607c-d298-4ec5-9a85-de295f291d8f","year":2023},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.744461Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:c85eda892cee01cbe36038bb6d6f74773650c456de3b08f453aedb087503e800","observation_id":"9d454fba-fe3e-44e2-848e-c2ee5eb5ebcd","resolution":{"observed_at":"2026-08-06T14:05:41.484457Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.842660Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.842660Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:042e1aaf7ece50eb7dce1f3ca76f846ea95c6dea803235299098f92887319a51","observation_id":"e53c6dec-ae7c-441d-b73d-8f80b6d37099","resolution":{"observed_at":"2026-08-06T14:05:38.842660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:38.908813Z","title":"and Ng, Andrew and Potts, Christopher","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:38.908813Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:c18abac8fcc2e7559231f7c5567938a787da9b56b78cbd9f14c951544d6542c3","observation_id":"c567c4c8-6bda-4b9c-940b-1bc8ea15e20a","resolution":{"observed_at":"2026-08-06T14:05:38.908813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:44.229813Z","title":null,"venue":null,"work_id":"3a16cec2-260f-4a3a-b3cc-758da7408eec","year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.020702Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:8a1e4f0d9982833f274f3d3d574aec8ca63bddcc693dd23a7992a9e2df688308","observation_id":"f90ee083-453a-467e-a92d-8382fc2556a2","resolution":{"observed_at":"2026-08-06T14:05:44.292357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:39.056971Z","title":"Proceedings of the 36th International Conference on Neural Information Processing Systems , articleno =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.056971Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:e28e559ff5cb0b7b2e9c513b32578641ab040b9bebabb996bae6421deb479c38","observation_id":"01d8053b-95cf-4bc5-8fe0-602a82ee3898","resolution":{"observed_at":"2026-08-06T14:05:39.056971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:44.042551Z","title":"2025 , eprint=","venue":null,"work_id":"167ffe44-356f-43e5-aeb1-c928f207a7e8","year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.111242Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:4a38c8b4557f41ce7b48066e684e2b69132a9cec3b71c75183cc14a4943cc3dd","observation_id":"d8db0919-2b11-47cf-9b1d-1aad27c1d093","resolution":{"observed_at":"2026-08-06T14:05:44.115273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:39.163789Z","title":"Transactions on Machine Learning Research , issn=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.163789Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:2b239137dd93d57ab775cb766094a6f6a24dcfe17be30923d15c2e814ec1324d","observation_id":"21498f79-42eb-4369-bd65-0d088b4bcf55","resolution":{"observed_at":"2026-08-06T14:05:39.163789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06707","last_updated":"2024-10-09T09:20:24Z","snapshot_observed_at":"2026-07-06T19:30:17.275798Z","submitted_at":"2024-10-09T09:20:24Z","title":"Calibrating Verbalized Probabilities for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06707","snapshot_observed_at":"2026-08-06T14:05:39.202100Z","title":"2024 , archivePrefix =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.202100Z"},"links":{"cited_paper":"/paper/2410.06707","citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:a3cb961a3a453d1f1690470d1280bf91ddf9624ab34dc617c29155cc6456ff44","observation_id":"d54ca5b8-118b-40d5-851d-12a2ad92a030","resolution":{"observed_at":"2026-08-06T14:05:39.202100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:43.837258Z","title":"IEEE Transactions on Software Engineering , year =","venue":null,"work_id":"46b3f694-023b-4702-ab10-d183f7bcc072","year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.244339Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:9ae56cacccdba0c1c0bad43f535ea1d99510d82cd300c1f8a701b49dd21b2cce","observation_id":"8483de6d-16eb-4114-8f3c-f00ff81c13e3","resolution":{"observed_at":"2026-08-06T14:05:43.916227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:43.684718Z","title":"The Eleventh International Conference on Learning Representations (ICLR 2023) , year=","venue":null,"work_id":"83980fd5-474d-4274-97a3-4d3c01338878","year":2023},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.260749Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:27fb4bc173e75b5803a5eb2c844653424643e38ed34b40b5c3018ae1f6db26bc","observation_id":"1ffeb2e8-126d-4899-9415-470b8ae2a15c","resolution":{"observed_at":"2026-08-06T14:05:43.730775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:39.312295Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.312295Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:c1e88b90acc3b8fa8ed7d8d942ee2117e80e83bba862f52126182efe8506b853","observation_id":"0e39d061-dbc2-4868-b125-d5a1189a4618","resolution":{"observed_at":"2026-08-06T14:05:39.312295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T14:05:39.330738Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.330738Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:0c4aaba2e8f40e89513a5709e70a2c7689459d9ce907f7a4996b245dad0ad833","observation_id":"c70988a7-752a-48df-8e71-efbbe0ed9fe3","resolution":{"observed_at":"2026-08-06T14:05:39.330738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:39.408396Z","title":"Journal of Machine Learning Research , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.408396Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:2db3f8cc604e641b3dd783fa29c4baaad8e208e0241ca6b5361204d53b8c087a","observation_id":"37e4596c-face-48b6-bc6b-c340f95d6986","resolution":{"observed_at":"2026-08-06T14:05:39.408396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:43.484374Z","title":"Proceedings of the 38th International Conference on Neural Information Processing Systems , articleno =","venue":null,"work_id":"aba1885b-3f4b-4e2b-916d-1c3e940d684c","year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.484689Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:2537885fa2cd8158101141b088e88ad174a4e233adda024280b1afc1c6d0a4ed","observation_id":"e2e800fa-b6f8-40d2-b683-36cc8ff90bdb","resolution":{"observed_at":"2026-08-06T14:05:43.546227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:43.322323Z","title":"BingoGuard:","venue":null,"work_id":"f28473c6-ea56-42ba-b5e6-bf1fc4481191","year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.551490Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:2af793f5de1c7e55a9e5b0e35fd621a1b03bbbdd52277cca54c0145df0db0ac1","observation_id":"7dc4f51d-b218-48ed-b037-d87c76c0ddbe","resolution":{"observed_at":"2026-08-06T14:05:43.390257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15174","last_updated":"2026-04-21T22:25:28Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-18T17:30:36Z","title":"SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models","version":3},"cited_work":{"arxiv_id":"2509.15174","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15174","snapshot_observed_at":"2026-08-06T14:05:42.269500Z","title":"SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models","venue":"cs.CL","work_id":"81e7d026-8e10-449f-9af9-7673adaa0407","year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.618195Z"},"links":{"cited_paper":"/paper/2509.15174","citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:7760fb5c531035c8b108bdb33f37bf6227db477ba314b1ce9d2bb9352bdae63d","observation_id":"b7e78a0a-5396-4e4a-97ee-a02988d68451","resolution":{"observed_at":"2026-08-06T14:05:42.357608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:43.195511Z","title":"arXiv e-prints , pages=","venue":null,"work_id":"87a30bc3-74b3-493d-91b8-219865adfc3c","year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.720053Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:d3057c716f53bb0c7bbde2a7befc007a5224fd3848d0c0a8b4d45054f9425104","observation_id":"71bfb71e-37b6-4834-ac8a-7c3b94e6a197","resolution":{"observed_at":"2026-08-06T14:05:43.243107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:43.053865Z","title":"Journal of classification , volume=","venue":null,"work_id":"b9667762-1ed3-48b0-b182-ee0168452919","year":2020},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.796050Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:a42362b42a03b32c54449dda16cd77200a22fa7c69788275069d21ae87d01b9d","observation_id":"92c313d1-b75d-45ac-b315-01a4fc31fd31","resolution":{"observed_at":"2026-08-06T14:05:43.113941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:42.860295Z","title":"Genome Biology , volume=","venue":null,"work_id":"4885335d-6397-4ecf-a5bf-d0770b10674f","year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.872590Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:a756dd38f94f60147e887e6ece927cc3e8d9627896aa6a227dd231833ee6398d","observation_id":"7c47c8ed-00b2-41b4-a9cc-40c6a6c7ab16","resolution":{"observed_at":"2026-08-06T14:05:42.919907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:39.938459Z","title":"Proceedings of the 33rd ACM International Conference on the Foundations of Software Engineering , pages =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:39.938459Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:5fb1ef524ffd4a004309eb0a832617e4aca04eb936d0e6be80398451986225d6","observation_id":"22dd0a2b-96f2-41d1-87cd-453080fe5b4d","resolution":{"observed_at":"2026-08-06T14:05:39.938459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:40.050280Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.050280Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:5df79385a76cfc86ce104378dbdbdda57fbfec98c1e56fbb7da8a4ec6ae6e7a7","observation_id":"8ecfb3a6-3148-4077-bbea-d14d1054e9b8","resolution":{"observed_at":"2026-08-06T14:05:40.050280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:40.099071Z","title":"Proceedings of the third International Workshop on Machine Learning in Systems Biology , pages =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.099071Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:b330f3be7dbfe223d7e1fa00136148b71042690b1f4d531ba0eeadba772666a8","observation_id":"9f679a33-70be-4c48-81cc-a05595cbaf0a","resolution":{"observed_at":"2026-08-06T14:05:40.099071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:42.685691Z","title":"Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining , year =","venue":null,"work_id":"c000021d-f648-4863-a9f9-133415478b70","year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.173527Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:c54f63e09f088c950bc7dc4eb6973187136f0b7c67eda6e079bd059263a20c16","observation_id":"65764544-f0b3-448a-be91-daaf472f6bc6","resolution":{"observed_at":"2026-08-06T14:05:42.739886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:40.282309Z","title":"I Can't Believe It's Not Better: Failure Modes in the Age of Foundation Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.282309Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:1d21f0f9e866eae038ebdf1b50d7bf6df741310a630de7262eb5c1738c201510","observation_id":"02dcc27d-ea26-471e-9c6c-d554679344e9","resolution":{"observed_at":"2026-08-06T14:05:40.282309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:40.444848Z","title":"arXiv preprint arXiv:2506.01734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.444848Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:ec9b43bc7345f9dcec8ef57954b3daafdb9e52dd201801e1228adce960f82e3d","observation_id":"db888785-34b8-4ad5-b510-cc87ad917766","resolution":{"observed_at":"2026-08-06T14:05:40.444848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:42.521829Z","title":"Advances in Neural Information Processing Systems (NeurIPS 2015) , year =","venue":null,"work_id":"aa1511a4-8690-446e-b279-4b3c1e402a63","year":2015},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.534443Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:80834837a23af987d2bb8ea5796b035c26d4a1f845cf297ed62d564ff8d39d9e","observation_id":"d99f4ffe-c164-4358-9fee-cf9e63bcdb3f","resolution":{"observed_at":"2026-08-06T14:05:42.607419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06588","last_updated":"2022-06-14T04:25:26Z","snapshot_observed_at":"2026-07-06T13:20:29.949578Z","submitted_at":"2022-06-14T04:25:26Z","title":"Shopping Queries Dataset: A Large-Scale ESCI Benchmark for Improving Product Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.06588","snapshot_observed_at":"2026-08-06T14:05:40.626084Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.626084Z"},"links":{"cited_paper":"/paper/2206.06588","citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:452e731c4dae1f865b314972dc2c98bab385c9b091997a662d79652d5f93cc7c","observation_id":"05d2a915-b4d7-4299-83f2-859488b06c60","resolution":{"observed_at":"2026-08-06T14:05:40.626084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:40.784413Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.784413Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:fa0fceb39ffb7e05d251f88b4f2ef6e6c8832803f284c51ae27f39836062cf5a","observation_id":"6c5ccd92-3062-4f97-b229-241f5a76e48f","resolution":{"observed_at":"2026-08-06T14:05:40.784413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:40.854578Z","title":"arXiv preprint arXiv:2509.13813 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:40.854578Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:dfbdee91e76f951128721ea16c2f5090d3bb54f3a8c05400cfa5d53ae3ffc50a","observation_id":"104a98c7-f521-48ee-a043-2816272ac1bb","resolution":{"observed_at":"2026-08-06T14:05:40.854578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:41.018426Z","title":"M onte C arlo Temperature: a robust sampling strategy for LLM ' s uncertainty quantification methods","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:41.018426Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:829caf5bc25c957a16dd348de98e3b2592b0bcec32f316331070fb192f9179fa","observation_id":"e46d0c1e-5bda-41ad-a4b4-31474d59b214","resolution":{"observed_at":"2026-08-06T14:05:41.018426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:41.097460Z","title":"Scikit-learn: Machine Learning in Python , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:41.097460Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:6a378414c895f534b7aeb38dd3a9a6801671462a6fc64586a66d887af58cfa1c","observation_id":"7c6fc369-868a-4849-aa51-723192ef9d2a","resolution":{"observed_at":"2026-08-06T14:05:41.097460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:05:41.210502Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T14:05:41.210502Z"},"links":{"citing_paper":"/paper/2608.04899"},"observation_digest":"sha256:ea1ed4c6af6394a8b6e9ae1b65ea6241aefe6651598dc0c11b92b96f206bbd35","observation_id":"e9aff573-6c02-4c52-92a0-8b2142e1114a","resolution":{"observed_at":"2026-08-06T14:05:41.210502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04899","last_updated":"2026-08-05T14:24:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T11:09:56.670685Z","submitted_at":"2026-08-05T14:24:34Z","title":"Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.04899."}