{"as_of":"2026-08-07T03:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cefb7bef93a58f4672b9e8288cf40a00c7a52d1a80427324310d51ea35bc6fd0","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:50:44.634425Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.06959/citation-record","integrity":"/paper/2606.06959/integrity","json":"/paper/2606.06959/citation-record.json","paper":"/paper/2606.06959"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"A survey of large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:7d58b5bb081c48c4e81866a0e597bbe6ca4c1270a5bfc97505e0300f28375d75","observation_id":"12ef64a5-8cd3-4098-9630-d020e43a3524","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03799","last_updated":"2026-06-03T02:05:23Z","snapshot_observed_at":"2026-07-06T20:32:00.585460Z","submitted_at":"2025-02-06T06:02:20Z","title":"Enhancing Hallucination Detection through Noise Injection","version":4},"cited_work":{"arxiv_id":"2502.03799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03799","snapshot_observed_at":"2026-07-02T17:57:15.335498Z","title":"Enhancing hallucination detection through noise injection.arXiv preprint arXiv:2502.03799","venue":"cs.CL","work_id":"8d40fd2d-1f7e-4573-aa25-83ed024b8b95","year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2502.03799","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:db6ca448551751669b0b652e8636e084173b0193c4d1f5a91eb4943c1d0b2351","observation_id":"ae569641-29f8-48aa-92fc-b0974b8299d9","resolution":{"observed_at":"2026-07-02T17:57:15.336979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Steer LLM latents for hallucination detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:3a7fb07c0d39f42aed775585c70cf55c8d9a604c64433380264ddc65624302c6","observation_id":"0768c8de-16cf-4d6f-98e7-9ad885692c69","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension.ACL, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:623d57ec9c2e283f9beea62e114d552ace0b734ab438582dc30e9734e613d524","observation_id":"28a463ae-fc3d-4f21-beaa-e1b1fb37770f","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Truthfulqa: Measuring how models mimic human falsehoods.ACL, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:62731bdf1f166da61ceae459b8a755e626013516c121459d12958ecbbcc2b70d","observation_id":"0ad61245-1ac0-4264-8e51-f0e4f1915a70","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"don’t forget the teachers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:7404b83d6862ee7eecaf70130fb25a39e9058ce202eaf8e4e5b1f110696519dc","observation_id":"0e610ddc-5ad7-498e-a2da-65a882d8d814","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"The clinicians’ guide to large language models: A general perspective with a focus on hallucinations.Interactive Journal of Medical Research, 14:e59823, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:560ce8169bf7be28ee0ddd1e1c8bc210a58a8be792d80242707dc638c65ecac0","observation_id":"762b1606-dac0-46ac-aebe-5c54c919de24","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15548","last_updated":"2023-11-27T05:27:13Z","snapshot_observed_at":"2026-08-04T04:38:24.491444Z","submitted_at":"2023-11-27T05:27:13Z","title":"Deficiency of Large Language Models in Finance: An Empirical Examination of Hallucination","version":1},"cited_work":{"arxiv_id":"2311.15548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.15548","snapshot_observed_at":"2026-07-03T17:28:44.633297Z","title":"arXiv preprint arXiv:2311.15548 , year=","venue":null,"work_id":"45aa9a25-2f25-45c8-800b-f7b79fbc5a22","year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2311.15548","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:3ecdd2f88d4fa03ae36ecac1c23299c10a53923ca7b382e014ac9b30615f84cc","observation_id":"cbc2342e-44d4-493e-87f6-691b48ca4d93","resolution":{"observed_at":"2026-07-02T17:57:15.331643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"On faithfulness and factuality in abstractive summarization","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:19fc762b307661e2913a13602ff0f17cf0530e7cbd38b78b29d53824aca3b357","observation_id":"27589b21-22f3-4743-b115-18e3018cd67a","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:b1c27f1ba565d54a26ce3fc2c3caa7ba41887bb37b3aae1364a79d6d2d7f18e5","observation_id":"038abfac-3fa2-4083-951f-126ad6b6519e","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Llms will always hallucinate, and we need to live with this","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:535dd6839aa75d15afaecdccc2eafea5a4ba8980554cc80229ea5b9df0c11f63","observation_id":"4d8e3d82-5386-4d92-802a-ce04646000ce","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":"2509.04664","doi":"10.48550/arxiv.2509.04664","metadata_source":"pith","pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why Language Models Hallucinate","venue":"cs.CL","work_id":"6bfb3eed-1270-492c-8fbe-a5671f3f779c","year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:fe7c5ca33bbfb95033fde0904841dd546865f59c7e94e5d2dbdc06ef5e956874","observation_id":"90e6ba6b-4e22-474d-bd28-78c8d5667152","resolution":{"observed_at":"2026-07-02T17:57:15.349053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:d3b6f5635d213e448ef715136d8ecc4040f6565e5fbd75f507ffde980085ebcf","observation_id":"4f82083c-d2a3-495c-b3fc-5abb37b2d394","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"On the limits of language generation: Trade-offs between hallucination and mode-collapse","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:4c4941358792951880b294aef3442dd1861a69ccc83c62c9af3d72ae1c39ab9a","observation_id":"59324628-e51a-4aa6-a2ab-b799f6685579","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15558","last_updated":"2023-03-07T22:05:28Z","snapshot_observed_at":"2026-08-04T17:12:45.959371Z","submitted_at":"2022-09-30T16:17:11Z","title":"Out-of-Distribution Detection and Selective Generation for Conditional Language Models","version":2},"cited_work":{"arxiv_id":"2209.15558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.15558","snapshot_observed_at":"2026-07-02T17:57:15.338058Z","title":"arXiv preprint arXiv:2209.15558 , year=","venue":null,"work_id":"9adb8c44-5fc6-4ba7-9b1f-5520ba5b37a4","year":2022},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2209.15558","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:4e66a865083e24ca141b67cd8576b98fe932a840793dc48cbebff220e56c96dc","observation_id":"aebe6ada-de61-4f7d-9d4a-02c01bb56323","resolution":{"observed_at":"2026-07-02T17:57:15.340185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Halueval: A large-scale hallucination evaluation benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:ab80060735951a0d5b2a963d1a95f7c82f36ca855667eea5f92b02a764a29ebe","observation_id":"487a8628-a48b-4e63-9a6c-ed5bb161a06c","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"SelfcheckGPT: Zero-resource black-box hallucination detection for generative large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:86192f3da72e3bca7ac37cb808591df7756d4a093b4e1435b1873efa8e6291fc","observation_id":"ca9ca650-5dbe-4366-81ea-1a31069124a0","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Detecting hallucinations in large language models using semantic entropy.Nature, 630:625 – 630, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:ea23d8b2c25eccfd25db26b3a3111885e327166ea7e48fb266503a1211acb9dd","observation_id":"80ffcf4a-4bc5-4126-9cfb-24ae5eaab96e","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Trans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:06cf1f875fe0aa0839b10c252e45c772763731fbc97da7c924775e96eff8937e","observation_id":"4da72157-038e-4a07-81eb-52c149a08869","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Siren’s song in the AI ocean: A survey on hallucination in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:3ad3abf4b745d5bbdaa11365a3606873ce601609037d648c13795e33dc1b4b72","observation_id":"b86e3a0e-7ff0-4755-8b31-861c01757a2a","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Lin, Jacob Hilton, and Owain Evans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:9d47e0a5d5fade4c6056fbe9233b268d1c5019a108bc5cc70188ee0af7bbba23","observation_id":"2c83b097-c7f4-4e52-9e4a-7ecb9a50562c","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Generating with confidence: Uncertainty quan- tification for black-box large language models.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:5c2e8b38787e92b6a6e5c7bc915cad9fc0666e480adac1d2e0dc93ecf04afc09","observation_id":"eb5ed7d9-7a7c-4227-ba1a-1d68e2c75352","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Out-of-distribution detection and selective generation for conditional language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:d88b234b40c6ffe3c44fbd607310e37e3ec326476c369838c098e47a2769af43","observation_id":"c434c7ca-fdb3-4549-bd07-ac41fb781a4b","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Uncertainty estimation in autoregressive structured prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:d5b5c08672f020055355c0895174d7a359a58259dab529696fdc88c1db1af593","observation_id":"09a97ce3-6ba3-4152-af13-d48becd51d0f","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Shifting attention to relevance: Towards the predictive uncertainty quantification of free-form large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:4c2e02e7419ac0dada64d0f3fb45115be2ee647e30766e6a461300c9e854f21b","observation_id":"4e02302a-9c5d-4fce-ab4c-4d8f34680236","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"INSIDE: LLMs’ internal states retain the power of hallucination detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:1e4a8e485bb3c37de9f0b227abe65491575803f174ecd20a6d84b071b1818cc6","observation_id":"712823a5-b9fc-4364-8915-879a4b0fe4e8","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Discovering latent knowledge in language models without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:ac29d4d7c952c4f70c0376699a00b53331f33d827428e28f4602b8acd8193c54","observation_id":"65871b73-c798-4c4c-8123-d9285b9c4b56","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"The internal state of an LLM knows when it’s lying","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:0bac73d916f4ca3610d790417a3a9dbe3b34b8ff78a59aeffa25399c8bd9d12b","observation_id":"38dbcfc7-42d6-482d-a017-6cd4a6b4694b","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01563","last_updated":"2024-04-04T11:32:03Z","snapshot_observed_at":"2026-07-06T18:09:00.688840Z","submitted_at":"2024-04-04T11:32:03Z","title":"Mitigating LLM Hallucinations via Conformal Abstention","version":1},"cited_work":{"arxiv_id":"2405.01563","doi":"10.48550/arxiv.2405.01563","metadata_source":"pith","pith_arxiv_id":"2405.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mitigating LLM hallucinations via conformal abstention, 4 2024","venue":"cs.LG","work_id":"b776d949-6f20-4359-bee3-56d21bd58524","year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2405.01563","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:8f9ab016a16440cc7544f66442d1d23ded1d292938277d1713575d23af0d89f8","observation_id":"e9f9f690-79b0-4913-8ddc-6a3e47c41999","resolution":{"observed_at":"2026-07-02T17:57:15.334419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"A framework to assess clinical safety and hallucination rates of LLMs for medical text summarisation.npj Digital Medicine, 8(1):274, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:09bba77f642d090910e73932ca4d6a619b246ad88cbb4525608d6700a3deaeb2","observation_id":"73223825-80cf-4629-9b56-8d404c32bf96","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"RedeEP: Detecting hallucination in retrieval-augmented generation via mechanistic interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:44e16b7be8bc3d7c8b474420789afcd561fcee751150460d866f4003cee03a00","observation_id":"75f553c5-6613-42d3-9f34-79d3abf88a3a","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:57:15.341308Z","title":"Spectral guardrails for agents in the wild: Detecting tool use hallucinations via attention topology.arXiv preprint arXiv:2602.08082, 2026","venue":null,"work_id":"7aa56ae5-ff12-432a-a8dd-c64b87787672","year":2026},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:cecbd684d7562156d39a6104d9d37f72ce2df119ea866b038dcbec164ff2b3a4","observation_id":"de685675-23b3-4e20-9e8f-3a55dbc43165","resolution":{"observed_at":"2026-07-02T17:57:15.343268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"The illusion of progress: Re-evaluating hallucination detection in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:868eb77c3098689d9915715345693ebd9c8012316a0cbb6f9204c600d194ba0c","observation_id":"04a7f3a5-72d1-42a5-89cf-291c1ca7f88d","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"HalluLens: LLM hallucination benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:6c2c675a33c822bfbdab34ca740b23787a4de67b995bc784493fcbc7216c4436","observation_id":"61ca33cd-fdc7-4bca-9997-1b046b1e0720","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Hallumix: A task-agnostic, multi-domain benchmark for real-world hallucination detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:2259ac61bc973c82c836c2d90bd6df5765227789c849e68c9a6b99f82f97b4df","observation_id":"dfc11c2d-7961-42a6-8f4d-49d85d66385c","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"ICR probe: Tracking hidden state dynamics for reliable hallucination detection in LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:299b31c6b216ed991a60473bbc24a7b992812353e3bcba5ec69f7dcc2c8abb6b","observation_id":"694577d0-c3ed-4591-8943-5e90ea46e41d","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Evaluating evaluation metrics — the mirage of hallucination detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:e2b7ca07b1bfa28b2a271fe522dfa5743a7f7deeda5b90e141adcafc35af8bf4","observation_id":"ab6f41d8-1648-4f5a-bf28-d55df6c52ffd","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"HalluCounter: Reference-free LLM hallucination detection in the wild! In Kentaro Inui, Sakriani Sakti, Haofen Wang, Derek F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:552bc72477cbba5279de26d15cafa365179c25bbe563a9d0421df63280ddb72c","observation_id":"bcc13de4-7382-4789-9a16-4a84be4e470c","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Haloscope: Harnessing unlabeled LLM generations for hallucination detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:aa253d693d322ad4af9d240d583192e788ea05d37ed865da6a411a874dbad394","observation_id":"92e914dd-c86a-4d55-95c6-05c565682808","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Beyond in-domain detection: Spikescore for cross-domain hallucination detection","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:a21662006272a953465f2d8ed0f46222c9ab99a77205cb6c2af15c2e538834fe","observation_id":"7e049d3b-6fcc-4143-b84b-00c576056d55","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Halluentity: Benchmarking and understanding entity-level hallucination detection.Transactions on Machine Learning Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:6f56714479ca08f9bbc40acf90a66e22c0398a16a88ba64002661fcb7cacb196","observation_id":"fc985e14-673c-4522-9984-7aac7c98a203","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"FActscore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:b4556271c5aa1fdae6744ca47b069ee15f6a7f6773ad85df695f8325ddd55d4d","observation_id":"e574ae69-ba07-406f-8f14-aef206cff43b","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:b935b6da9d8754a6229d9ef5a74783be7411305445704242cef4d927f5711d86","observation_id":"f59cd2c7-49ed-4dcf-a8a5-b44d043e0cd6","resolution":{"observed_at":"2026-07-02T17:57:15.346352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"CommonsenseQA: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:e37886d4141ae61d7d180f00d89b4c1e459677b67066c037ef00101171872139","observation_id":"ab38d65a-3c1d-411c-9604-07b331761a3e","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Know what you don’t know: Unanswerable questions for SQuAD","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:710efea48d33bed7ec70ec2aee32ad3839d488c613ab522aa09882b2b11010bc","observation_id":"8995dfe4-0795-4d72-8a87-e73ede5b0f4a","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:119f1cc89e0e70cbeab2e080aa53834af09f262d99fbbd5855ae0b6ad56d6348","observation_id":"34e12fe4-348b-4799-95eb-8f25fd179c00","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:2413dc8fb3eb42952474138c6b2b26ba27658b1215b04cd3d1cff8a4618cb790","observation_id":"1fbddeb3-ed2a-4425-bcbc-0393bf027db5","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"RAGTruth: A hallucination corpus for developing trustworthy retrieval- augmented language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:96aeb99ac83fda171cadc06186cac696093f4854164021f1bb772b254f154877","observation_id":"377d4da5-8b7d-4e50-ac78-aa9d7175ce7f","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Cohen, and Mirella Lapata","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:ebc7befe62c76223fd0aefe383d577753502a8930f4679794f44e75122c1e3da","observation_id":"7ae2b247-79cb-4dad-b3e2-537b48256c3f","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:7213f24c5ea105d70c64b2b31351ea29e4c7572f5be24b57015ea7a16251de0a","observation_id":"d79f4e3b-3426-46c2-a0f3-71490658413e","resolution":{"observed_at":"2026-07-02T17:57:15.323643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:ff7242114c1a4e896a0ad8599b3338ceb56030ec6ec4c5352cc7342988385599","observation_id":"3788e0a9-4c4b-4a7c-bcfd-2cb910fac57d","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:d58dddfe63880e1e9e8d1a3020dc706540e89abb78c804ec0ab93121eb346212","observation_id":"25efa473-0b0c-4f83-87ce-46038aee1416","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"TheoremQA: A theorem-driven question answering dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:17bc9ac9055cd99f52ebc187e23d746e62cd598f2d70c68dde855b80d245dea2","observation_id":"aba88819-8336-4d4d-bd7e-2cb0064bd9d7","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:77c0b6840c7cd6289b36d3f59c0d641583d20dc8226785b80b6ff70b4e4127de","observation_id":"3ed483a7-2254-43b4-8470-8cd7cefa40fa","resolution":{"observed_at":"2026-07-02T17:57:15.325993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:0a0b48125f3a8d599f3a055227e20fc3c983a06bd1fff49f6e5d2493adf25e24","observation_id":"32573af4-6ef0-422d-9113-a9304ea9ad29","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"xLAM: A family of large action models to empower 13 AI agent systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:63f943ade3d1aeae4f4d368dcb84509309a82a4abbf0d2bae51e5538a429ce04","observation_id":"9532453b-e632-4281-bfe4-a08b68257ab6","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"The belebele benchmark: a parallel reading comprehension dataset in 122 language variants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:f03ca53305bbd809cbc59c9cab06979cdd47f6ef619c1c7654da033c0fb68760","observation_id":"ff9b34ec-5dfa-4b1e-9aae-9401300456ae","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Wong, and Rui Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:4264328db5695ccbc818330b1108b68ea0768b1e9e752d58e2001d3f1f53afb7","observation_id":"4635a291-f871-4801-8f8d-2352aa3714ae","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:2b825f82b0a87a6a4376fa9fbd6a09fc78e82a6d061358d5f66cf97776cfcae6","observation_id":"7309c510-6b02-4892-9795-7a4570def759","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":"2207.05221","doi":"10.1145/3618260.3649777","metadata_source":"pith","pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models (Mostly) Know What They Know","venue":"cs.CL","work_id":"8ca58a10-da41-4f70-baae-7e449512e345","year":2022},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:a1d13c3b28b43f1451117c6d37e066734fc09f7a90c8c34f06c852857610c48b","observation_id":"24bf2e3e-e3a0-4f08-ab88-0552481fb536","resolution":{"observed_at":"2026-07-02T17:57:15.328483Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Unsupervised real-time hallucination detection based on the internal states of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:b8fe75a416d260b8a46327b04dd59bd3cf852f6aa3afe294dfc377a9e7c8f377","observation_id":"32cc776a-998e-4073-ab73-d5923541d287","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Semantic entropy probes: Robust and cheap hallucination detection in LLMs, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:5978a3e8d035cc1a659534d4a7173ad8d92884d93a00d734a35966522bca5346","observation_id":"f5c48028-d6ae-43a9-a115-6edb66eba6f1","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"Prompt-guided internal states for hallucination detection of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:96cbb132488b3fb40e3626c1af3c4159a324c18ff949b25840a6d76210184f8f","observation_id":"dff60981-dad6-4534-a7ea-0338c08650a3","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:301a90715b54535ea326ef6edf27e41dab4c70ffced7fb7323b6895c19050f6b","observation_id":"3f9436a0-44e0-45b9-8a8b-f3048964ebdc","resolution":{"observed_at":"2026-07-02T17:57:15.317419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:bf391b6f7d8108f89f81ce8457a38dd88272aa5e930cd05688c71901e2ca7cb5","observation_id":"46f7776a-0ffd-47c8-84ea-57fe4facc54a","resolution":{"observed_at":"2026-07-02T17:57:15.320294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:dd5838526448e3cd5da0bdeefd586c763e1333d2fb198b80e97c49750d2a13c7","observation_id":"97e45cb9-33fc-498f-9007-43ff085b9cb3","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:81be1d3a4af74af129e5266c9d6869afe4512f203bdf9b50beedb39df5e0825a","observation_id":"ffad3e46-2e45-41e8-89d9-42b0edd6f29b","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:50:44.634425Z","title":"reasoning","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T21:50:44.634425Z"},"links":{"citing_paper":"/paper/2606.06959"},"observation_digest":"sha256:f64a45c7125d250929f52fafb5a5a6617a73f0940d91d82aca37080bc79f2521","observation_id":"d21aad8e-fb3a-41ae-9988-bc3f1f61d84b","resolution":{"observed_at":"2026-06-27T21:50:44.634425Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06959","last_updated":"2026-06-05T06:38:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T23:25:19.807771Z","submitted_at":"2026-06-05T06:38:40Z","title":"OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":55,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2606.06959."}