{"as_of":"2026-08-18T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00950eb16c1072c5c0b4439e1fb4aa96bfcabf7ce8836118cdaf405eb278afaa","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T20:31:20.017866Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:47:41.319887Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T14:47:41.656143Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17007","snapshot_observed_at":"2026-08-03T01:54:05.218315Z","title":"arXiv preprint arXiv:2605.17007 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20219","last_updated":"2026-07-31T07:14:16Z","snapshot_observed_at":"2026-08-18T02:02:04.202179Z","submitted_at":"2026-07-22T14:37:25Z","title":"HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T01:54:05.218315Z"},"links":{"cited_paper":"/paper/2605.17007","citing_paper":"/paper/2607.20219"},"observation_digest":"sha256:a9c597b5174eb0d257cd571424327a9a9315383c605fe000fca6bd23fe9d3060","observation_id":"aa867811-6cb4-460f-a4e5-cced2d308534","resolution":{"observed_at":"2026-08-03T01:54:05.218315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":"2605.17007","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17007","snapshot_observed_at":"2026-08-15T14:47:41.656143Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","venue":"cs.CL","work_id":"871c815c-206e-43a6-bd0c-d296e8c15f7d","year":2026},"citing_paper":{"arxiv_id":"2608.03966","last_updated":"2026-08-13T21:05:09Z","snapshot_observed_at":"2026-08-18T10:09:38.055549Z","submitted_at":"2026-08-04T17:33:38Z","title":"HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T14:47:41.319887Z"},"links":{"cited_paper":"/paper/2605.17007","citing_paper":"/paper/2608.03966"},"observation_digest":"sha256:39071a5f0ae94b0c706b5b5e553e718774f2bb8689b3265ecf9d1f6cf6c99c07","observation_id":"376be2f7-2ebf-42f3-a560-69c2d37534d2","resolution":{"observed_at":"2026-08-15T14:47:41.661449Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.17007/citation-record","integrity":"/paper/2605.17007/integrity","json":"/paper/2605.17007/citation-record.json","paper":"/paper/2605.17007"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On faithfulness and factuality in ab- stractive summarization","venue":null,"work_id":"94ac1ebe-7b95-46fd-9885-74d200b97228","year":2020},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:457b32c689b6b90f849d51546ed96f255b501d3e726a8b54cc9be14da0e222f8","observation_id":"ee1713f0-de1a-4a51-ae93-0f7774c7255f","resolution":{"observed_at":"2026-05-19T20:32:46.010261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on hallucination in large lan- guage models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":"49052ee6-244e-446d-ac81-4b95ec9bfd9c","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:25b3b2eadbf2f27da8a6b881499cfcf6034e964bb2896f35c70f9d908f809d44","observation_id":"0e6f4f07-d000-4691-b095-07c8c1432a89","resolution":{"observed_at":"2026-05-19T20:32:46.008460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arahallueval: A fine-grained hallucination evaluation framework for arabic llms","venue":null,"work_id":"3c613ecf-a411-4021-9879-f27cdca675de","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:3b7bf6c84cfbb234cabf5ef6b1f5f8dc2130244ed8de5b6383162698dba3909d","observation_id":"7d517dd1-47c4-4289-adcb-c391a79f178f","resolution":{"observed_at":"2026-05-19T20:32:46.006561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Survey of hallucination in natural language generation","venue":null,"work_id":"c9734f37-16ee-4466-bd12-07397e8a479e","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:d11ca4c04ac5a44e72aca416e9da534f049c1d88be43078d1d3195a0ed7e3a23","observation_id":"3bfb508f-7658-48e4-a9fd-daa32f797051","resolution":{"observed_at":"2026-05-19T20:32:46.004803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2404.12041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A sur- vey of automatic hallucination evaluation on natural language generation","venue":null,"work_id":"3b38c85e-2c5c-4fdb-88b3-887e9258f940","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:b9707e5d7522b9723ae383605e6bdff7e3bfffd608f804250325a7acdb41d7a6","observation_id":"108dd1fb-4c12-4896-ab06-e2f25628da6e","resolution":{"observed_at":"2026-05-19T20:32:45.398882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06265","doi":"10.48550/arxiv.2510.06265","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language models hallucination: A comprehen- sive survey","venue":"ArXiv.org","work_id":"2f7f0af1-9a86-47d0-9963-13cfcf3058ee","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:64ef01160c440cc8bd3553ecadd6640bbb095ba5f9df88852f9569a2593b8516","observation_id":"35812170-7057-4218-88ab-839f62a898d6","resolution":{"observed_at":"2026-05-19T20:32:45.396206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-06T22:38:07.156715+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-06T22:38:07.156715+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15390","last_updated":"2024-07-22T05:35:17Z","snapshot_observed_at":"2026-08-18T04:40:39.317796Z","submitted_at":"2024-07-22T05:35:17Z","title":"ALLaM: Large Language Models for Arabic and English","version":1},"cited_work":{"arxiv_id":"2407.15390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15390","snapshot_observed_at":"2026-07-04T19:50:11.181522Z","title":"ALLaM: Large language models for arabic and english","venue":null,"work_id":"89baffd4-01b1-44f7-90fa-5eaa141bf2fb","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2407.15390","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:e6bdf9c4f6937bf3ac05330df8a626da3f7e4827603375f195e63ea642b5ba47","observation_id":"f77be92e-deb7-487a-b3c0-821ec7192995","resolution":{"observed_at":"2026-05-19T20:32:45.393536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16149","last_updated":"2023-09-29T11:51:51Z","snapshot_observed_at":"2026-08-18T05:52:48.588565Z","submitted_at":"2023-08-30T17:07:17Z","title":"Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16149","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.16149","snapshot_observed_at":"2026-07-04T10:29:45.228471Z","title":"Jais and jais-chat: Arabic-centric foundation and instruction-tuned open gener- ative large language models","venue":null,"work_id":"83df034a-976c-49c2-8c27-27c38e37f16e","year":2019},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2308.16149","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:c5d49231a0b79e808900c79af893dd720c68f9e5238c6caef66c83860a59dd94","observation_id":"7008bd6d-bab8-4001-bf65-c191ed138861","resolution":{"observed_at":"2026-05-19T20:32:45.407453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13944","last_updated":"2025-01-18T05:35:32Z","snapshot_observed_at":"2026-08-17T07:06:10.518360Z","submitted_at":"2025-01-18T05:35:32Z","title":"Fanar: An Arabic-Centric Multimodal Generative AI Platform","version":1},"cited_work":{"arxiv_id":"2501.13944","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13944","snapshot_observed_at":"2026-07-02T02:56:28.952866Z","title":"Fanar: An arabic-centric multimodal generative ai platform","venue":null,"work_id":"4fba5f62-9db8-49d2-ab65-37d1dd095291","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2501.13944","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:0e1c3fc0ee4c56bb47cdbb98d2889b2a159e9b50a266e8c2049d5394ffbafa27","observation_id":"45a8a431-084d-4c3a-ac63-156a3986a408","resolution":{"observed_at":"2026-05-19T20:32:45.404492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20238","last_updated":"2025-02-24T13:42:28Z","snapshot_observed_at":"2026-08-18T02:35:41.298808Z","submitted_at":"2024-10-26T17:48:20Z","title":"A Survey of Large Language Models for Arabic Language and its Dialects","version":2},"cited_work":{"arxiv_id":"2410.20238","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20238","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of large language models for ara- bic language and its dialects","venue":null,"work_id":"a58db3da-60df-4f33-b6f8-37dcab899fd6","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2410.20238","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:bde942d113516d2f8add0a1edefeab0cc19a7f7987cf45623006de96b020eee0","observation_id":"e68b2474-68db-4288-b396-c2ce47cf277f","resolution":{"observed_at":"2026-05-20T03:06:11.362819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T12:55:44.137075Z","title":"Evaluating ara- bic large language models: A survey of bench- marks, methods, and gaps","venue":null,"work_id":"480c622c-ddc4-4084-9f30-77315ab11d6b","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:1c0af229450ca67c13ee93bb9c6111242d96355e46dd40eb63fb31c58029f3ea","observation_id":"088dd01e-ee3d-4d35-a82d-d45eeb4446c8","resolution":{"observed_at":"2026-05-19T20:32:45.387652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arabic natural language processing: Challenges and solutions","venue":null,"work_id":"bf3b4c5c-b68a-43e9-a5ad-7bad5a1cf224","year":2009},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:2d48ed36387c423ea54e78bf70f403940683aca6478eb00a2cf6dfb7b643e82e","observation_id":"a2f8ef85-b251-4744-b345-e0ce56ab6cf1","resolution":{"observed_at":"2026-05-19T20:32:45.993415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c4efa64d-e948-4cd6-85cd-f1f34e52b8e8","year":2010},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:dbc415fd8f3708a977eef09f17cad0ad819b03cdaef858f14087ae8c034f456f","observation_id":"fa137c4c-29f5-405b-a223-7f7c7c73a60c","resolution":{"observed_at":"2026-05-19T20:32:45.995389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Halwasa: Quantify and analyze halluci- nations in large language models: Arabic as a case study","venue":null,"work_id":"88db0438-bb8d-464c-b838-273e1a0e17ea","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:a5cfd58e8712e43fc589c839129f475ccc62bf89365b75dfedad4c03dca42590","observation_id":"52f550ee-f6e0-45c0-9f34-c3ea298bd781","resolution":{"observed_at":"2026-05-19T20:32:45.991633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07833","last_updated":"2025-03-10T20:24:07Z","snapshot_observed_at":"2026-08-16T14:05:08.588042Z","submitted_at":"2025-03-10T20:24:07Z","title":"HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations","version":1},"cited_work":{"arxiv_id":"2503.07833","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07833","snapshot_observed_at":"2026-07-10T18:27:31.284673Z","title":"RoboClaw: Agentic robotic framework for scalable and long-horizon task execution with VLMs","venue":"cs.CL","work_id":"36ef1eeb-cde8-45cc-befc-f492442bef8c","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2503.07833","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:3786ed0d34d450ce80c6dd9b6d5c2fca7a0abd7efc2e0efdb931878bc0f99aca","observation_id":"c8ef8c2d-32c9-4c8d-8b7a-c92dc04dbc7d","resolution":{"observed_at":"2026-05-19T20:32:45.422579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aftina: enhanc- ing stability and preventing hallucination in ai- based islamic fatwa generation using llms and rag","venue":null,"work_id":"99ffdfa3-3a84-4ca8-b050-c60ff6262ade","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:9d6d927ff2f144ed70d65581d0c46a7f4a5416d93e695cef1f51aad2d9fcbad5","observation_id":"4284bdd8-4407-484c-9fb7-0cd5b53c122f","resolution":{"observed_at":"2026-05-19T20:32:46.000676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Islamiceval2025: The first shared task of capturing llms hallucination in islamic content","venue":null,"work_id":"9f115c34-4ff5-47a2-a449-5d636b9b421b","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:38465e45bf7dd4babd7f20367adcbeb82d4f6c7e0d5b669f2d2b7ea4b5115fa2","observation_id":"e66ab6ac-9dcf-47de-a318-875b8627cc5f","resolution":{"observed_at":"2026-05-19T20:32:45.987956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11747","last_updated":"2023-10-23T01:49:32Z","snapshot_observed_at":"2026-08-16T15:31:40.033124Z","submitted_at":"2023-05-19T15:36:27Z","title":"HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.11747","doi":"10.48550/arxiv.2305.11747","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2305.11747 (2023)","venue":"arXiv (Cornell University)","work_id":"2cf6bc2d-aed3-4a58-879e-daf0de687940","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2305.11747","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:117ea661621873549a393871b11c2db4d44b81213db160e8342e25897a729d4f","observation_id":"e244d198-3317-4186-b063-28b3a535b664","resolution":{"observed_at":"2026-05-19T20:32:45.413600Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analyzing llm behavior in dialogue sum- marization: Unveiling circumstantial hallucina- tion trends","venue":null,"work_id":"ebe02e45-aa0f-4222-ba19-7c987708e4da","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:fc2f9e37afb38d6546a5a7e37e7aa438d80c247db34241bcc4e6905c739fe34b","observation_id":"9f6835c7-52c9-4767-84e8-c9248efd34ee","resolution":{"observed_at":"2026-05-19T20:32:45.986276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03368","last_updated":"2023-10-25T07:49:37Z","snapshot_observed_at":"2026-08-16T16:17:38.527206Z","submitted_at":"2023-10-05T07:57:09Z","title":"Evaluating Hallucinations in Chinese Large Language Models","version":4},"cited_work":{"arxiv_id":"2310.03368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03368","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating hallucinations in chinese large language models","venue":null,"work_id":"27f57922-254f-4edb-9365-44ba354e34b2","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2310.03368","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:a9de66d775c1643e6c1ded8dfe5b20d27e510630a658dcbe5765381ffee1767c","observation_id":"765d1820-4d41-431a-975f-1118eabfb459","resolution":{"observed_at":"2026-05-19T20:32:45.384974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uhgeval: Benchmarking the hallucina- tion of chinese large language models via uncon- strained generation","venue":null,"work_id":"87c97835-e35c-4b6a-ab6e-337988b10136","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:210bab77bb06b577d0dc77764879bd3ccf28670d1e5c9096312b4d7729a33f5e","observation_id":"fcce44a8-d1c1-457a-9085-c44a0e70c1d4","resolution":{"observed_at":"2026-05-19T20:32:45.982696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C-faith: A chinese fine-grained benchmark for automated halluci- nation evaluation","venue":null,"work_id":"83afec48-52d8-4378-8627-062c1bef44c5","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:34a3b1d82185b6b9ea7c49b2425dedbcb50234a6995b186b81f978f7643478ec","observation_id":"45e0857c-6403-4820-ae6a-321d78502b29","resolution":{"observed_at":"2026-05-19T20:32:45.980962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.10612","doi":"10.48550/arxiv.2402.10612","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retrieve only when it needs: Adap- tive retrieval augmentation for hallucination mitigation in large language models","venue":"arXiv (Cornell University)","work_id":"e21c5eb6-a9bb-4c79-9ba3-0b51c248a9df","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:85ad0780c9535c6fe9cfc2033ba2497dba56a48ef061de634d3d7ebf0febafef","observation_id":"e822f75a-c0eb-41d2-83d6-e060f18f6d17","resolution":{"observed_at":"2026-05-19T20:32:45.416655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring rag solu- tions to reduce hallucinations in llms","venue":null,"work_id":"fd013e20-cc99-479c-9a47-19ec6fd2840e","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:0d6d98f350f29d5a6ecb68e3fef212e5404378db99e6cdb9b0438541441b15ea","observation_id":"732f6da4-14ad-472f-b31c-39a3f6efdcf3","resolution":{"observed_at":"2026-05-19T20:32:45.984339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting hallucinations in large language models using semantic entropy","venue":null,"work_id":"d2341cfc-57de-4506-bd77-6c7b6529829e","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:ad5c2ed72c46b66cf1d8f0b03df2e849b0c293d7c0779785039fe24392df30b9","observation_id":"32431627-2742-4a0c-8a81-000a72677b30","resolution":{"observed_at":"2026-05-19T20:32:45.989848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"En- hancing uncertainty-based hallucination detec- tion with stronger focus","venue":null,"work_id":"bde4bd5c-5e90-41de-9fce-91a255b2e633","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:883832a64e69a6f823e0d7ed813b665470a54799b0f4aaa285780a4baac8c99d","observation_id":"05e7868a-31f7-48fa-8916-8205e410034e","resolution":{"observed_at":"2026-05-19T20:32:46.002530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting and mitigating hallucinations in machine translation: Model internal workings alone do well, sentence similarity even better","venue":null,"work_id":"c9eb0d28-a01d-450f-a732-c05e4d5c54a6","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:c2f092e10f089209a8897c5246bfcb5954db0a0c202cbae0c44bb629380e0619","observation_id":"fb2d3bcd-8392-4535-b3a3-ca96d6c546d0","resolution":{"observed_at":"2026-05-19T20:32:45.975266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging graph structures to de- tect hallucinations in large language models","venue":null,"work_id":"c1a2508f-87b3-46d4-a1c9-e5bea66eb207","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:2df2299ce72d3821d6abc5163ff3f71a33274d20509dd148732cb01586a63300","observation_id":"d8485e3d-3a11-4ee5-a43e-0d9518e2f22c","resolution":{"observed_at":"2026-05-19T20:32:45.977511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Halugnn: Hallucination detection in large language models using graph neural network","venue":null,"work_id":"cab1ccd7-2d06-4951-9654-50c57146fc4c","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:8955a8fa6c8b9db34a757027290603cff9ab9b8f1aeeadc4f28a73fa015a783b","observation_id":"9dea6609-a06f-45f6-bf2d-38569e678140","resolution":{"observed_at":"2026-05-19T20:32:45.969895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallushift: Measuring distribution shifts towards hallucination detection in llms","venue":null,"work_id":"ee5ffa4d-c5b3-48b4-b9be-066bbdb76620","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:9ded11588571ddf6b9e3f532f80ecf456cf733fe4f5a01e4494a5b4023d2e640","observation_id":"915cc98f-6616-4985-9cd7-50b99aeb8595","resolution":{"observed_at":"2026-05-19T20:32:46.024604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Selfcheck- gpt: Zero-resource black-box hallucination de- tection for generative large language models","venue":null,"work_id":"f26a9443-68cd-4865-b4f3-c96a8b878db4","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:e380e1fd21c75ad5f72a77989e1b51fdf405c16f5e4411bf55b78fb98c07a9f4","observation_id":"344b517f-b600-4b25-8dd4-66fd0219f26f","resolution":{"observed_at":"2026-05-19T20:32:45.968141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sac3: reliable hallucination detection in black- box language models via semantic-aware cross- check consistency","venue":null,"work_id":"e32a6ca9-574e-4b76-92a6-b385fb8cee98","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:a7e23a23ebbc4b0e38a81d1942e931d01f3709a0d94b8f99164d84af3ff0331c","observation_id":"6dcab520-1454-4c62-bed1-9e2c31e52141","resolution":{"observed_at":"2026-05-19T20:32:45.971702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai- generated news articles based on large language models","venue":null,"work_id":"69866cd8-ce71-4e9c-b379-257c9b60e813","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:8d3373bf9ade14b3bca520917ef1516dbfd2103c2b6a188e19c78f2af0b8637b","observation_id":"4bab83ab-45ee-4848-829b-7c2ecc20ba49","resolution":{"observed_at":"2026-05-19T20:32:45.979226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self- expertise: knowledge-based instruction dataset augmentation for a legal expert language model","venue":null,"work_id":"01eaccb0-83b9-429f-ba8d-bcb4a2c33584","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:a516149c27df96b9bd0d9beb729d0cce7830f12a2aaa96f862eaea6141e81ae5","observation_id":"ee8fde59-8d33-4e06-a247-8251f52e8388","resolution":{"observed_at":"2026-05-19T20:32:45.966303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on rag with llms","venue":null,"work_id":"b6a8228d-0bcd-4707-b695-22420c798d41","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:74c9fbe23de52b428c6083e886c139f6097416d8be1ec888390bec06a31a402c","observation_id":"8fcd387a-6c98-440b-898b-bd3952538b60","resolution":{"observed_at":"2026-05-19T20:32:45.973404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain- of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"c646fec9-22ad-4bfb-9f01-bf25f0cb2651","year":2022},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:6ca8688927ea05da3f2bee04669c527105dbd3e3325764d0d0d559d7b3faa06f","observation_id":"9eb4c08a-852f-4144-9344-6876065e7ad8","resolution":{"observed_at":"2026-05-19T20:32:45.997193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain- of-verification reduces hallucination in large lan- guage models","venue":null,"work_id":"d698f3ae-3a22-489f-97b6-ff74ba528cb9","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:70740cd67b58cfe0d4a820f155ee56b7fe4ddda795d60dc9b47a32cea03fd725","observation_id":"4bc90e49-ac48-4db5-b679-254a5ab2acd8","resolution":{"observed_at":"2026-05-19T20:32:45.962495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11267","last_updated":"2024-06-17T07:16:07Z","snapshot_observed_at":"2026-08-16T13:42:23.547920Z","submitted_at":"2024-06-17T07:16:07Z","title":"Mitigating Large Language Model Hallucination with Faithful Finetuning","version":1},"cited_work":{"arxiv_id":"2406.11267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11267","snapshot_observed_at":"2026-07-03T17:28:44.635985Z","title":"Mitigating large language model hallu- cinationwithfaithfulfinetuning","venue":null,"work_id":"d886b6e7-1713-4239-b267-5bafc9d8f65f","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2406.11267","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:b6249959a6eb2e996b89e9eca9a5b089d4d15e9ce5b31c770bd5ca7d20974d44","observation_id":"da7a8fee-6ddd-4625-89c9-ec350d4eaa90","resolution":{"observed_at":"2026-05-19T20:32:45.431359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":"2309.03883","doi":"10.48550/arxiv.2309.03883","metadata_source":"pith","pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","venue":"cs.CL","work_id":"0f1b9a7a-0623-4efc-bed3-6dd997054681","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:f54bd52fd109ece568a61a3c24a014ce9e7d1314d82584f6f33c36e915a6f115","observation_id":"a2be840f-0364-4a9b-8c33-d35a1f38f977","resolution":{"observed_at":"2026-05-19T20:32:45.419449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feqa: A ques- tion answering evaluation framework for faith- fulness assessment in abstractive summariza- tion","venue":null,"work_id":"a420da22-6096-45d0-9410-964518b571e6","year":2020},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:c8092902b9c27aac8623e7c494864a438f81504b970616171098679dddff2842","observation_id":"80be3781-54ac-46db-9c66-78c9bffd56bc","resolution":{"observed_at":"2026-05-19T20:32:45.960680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating the factual consistency of abstractive text summarization","venue":null,"work_id":"150fb6ac-9d2d-4d22-8e63-daf1dd2f8875","year":2020},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:f887ef7129c4c9de64b9763aef757141c720d10f3a8139bc0a7eb93e280b889c","observation_id":"3493b1ca-a1f0-4307-b9c2-6b0ae8d5f3a8","resolution":{"observed_at":"2026-05-19T20:32:45.964306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Factscore: Fine-grained atomic evalu- ation of factual precision in long form text gen- eration","venue":null,"work_id":"2c953761-7bc8-423f-ab5d-be50f337bb5c","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:824f2e7620dd4e955aa57604969ba1603719212eb0c8451d85e14c935efd414e","observation_id":"9795a8df-c8a7-4829-b5a5-a710bb42fcd2","resolution":{"observed_at":"2026-05-19T20:32:45.998948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How reliable are automatic eval- uation methods for instruction-tuned llms?","venue":null,"work_id":"08380d06-73c9-402a-a11e-b840e6fb5b36","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:4e37c13c133a4d9346d11fa3b780068bc4e65449192fda3593057bd7e0b7c4cb","observation_id":"cec35b2f-6dfc-457a-8da9-9672e421a43d","resolution":{"observed_at":"2026-05-19T20:32:46.012052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truthfulqa: Measuring how models mimic human false- hoods","venue":null,"work_id":"646f2858-af33-484f-bf93-a09dc9cb3253","year":2022},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:e1ee5c2dde92cbf0fd943035492d0c1a1ba23459c2d0fe4836d260a3ff787590","observation_id":"c8fa316e-4275-4c73-af19-1907bff5e92e","resolution":{"observed_at":"2026-05-19T20:32:46.046200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freshllms: Refreshing large language models with search engine augmentation","venue":null,"work_id":"e23b24dc-cf47-436f-861f-1887f12b5b21","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:78f93943758001b79fff35d1f6dadd5a75f1041dd20a5ac57d471a02084a2cf1","observation_id":"50996ebd-c92f-4f9b-bf00-ef85b2626835","resolution":{"observed_at":"2026-05-19T20:32:46.048077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Assessing the factual accuracy of generated text","venue":null,"work_id":"51fe51b2-e895-4c0a-8f11-b068a97dc682","year":2019},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:d7a5a327356df995033040f96e57d265893ff03dc8964275480462a9d8676caa","observation_id":"8b55cd7f-f84b-48a9-9cba-e2c77c9beaab","resolution":{"observed_at":"2026-05-19T20:32:46.037179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generativeaiforislamictexts: Theeman framework for mitigating gpt hallucinations","venue":null,"work_id":"72aac2d0-4468-443e-b3b7-afd8f11f71ce","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:83b330e0372acb6d27df0185aea3cfff22cd5fb1871229c85456c921ca3d91ef","observation_id":"1f16aa9a-a40c-42ca-84b3-35d368f2d36d","resolution":{"observed_at":"2026-05-19T20:32:46.039013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating llm hal- lucinations in quranic content: An agentic ap- proach using deployable language models","venue":null,"work_id":"67c43242-093f-4e45-9b98-7a2b2823c82d","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:97536a693f8d5474fc5ae124650227cd3e0a076d6f36c5a06e42d544b2bd8aaa","observation_id":"111d5b67-34b1-4a61-8fed-4a6cfd66c4f5","resolution":{"observed_at":"2026-05-19T20:32:46.040806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11975","last_updated":"2025-04-28T06:19:32Z","snapshot_observed_at":"2026-08-16T12:39:24.987755Z","submitted_at":"2025-04-16T11:15:26Z","title":"SemEval-2025 Task 3: Mu-SHROOM, the Multilingual Shared Task on Hallucinations and Related Observable Overgeneration Mistakes","version":2},"cited_work":{"arxiv_id":"2504.11975","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11975","snapshot_observed_at":"2026-07-10T18:27:31.342618Z","title":"Semeval-2025 task 3: Mu-shroom, the multilingual shared task on hallucinations and related observable overgeneration mistakes","venue":"cs.CL","work_id":"ec8801f0-93af-4623-befc-4e07a837a5c2","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2504.11975","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:07f3b147069c49f72afaf39273c60ca27793f0151564c5d1b4f13903bebd97bc","observation_id":"112953d5-8999-4a6e-8327-c6b27314b492","resolution":{"observed_at":"2026-05-19T20:32:45.390226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Halomi: A manually anno- tated benchmark for multilingual hallucination and omission detection in machine translation","venue":null,"work_id":"2a99800a-ae39-466d-8219-c98485b0adc8","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:59024b448e33922f6253ab3ec0553702785b72d1ed34a93387f8e42a400ab541","observation_id":"ed6af985-1c9e-4b1f-9015-3dbe75261a1c","resolution":{"observed_at":"2026-05-19T20:32:46.049786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16541","last_updated":"2025-03-26T23:53:56Z","snapshot_observed_at":"2026-08-16T12:48:47.198039Z","submitted_at":"2025-03-19T01:46:09Z","title":"Poly-FEVER: A Multilingual Fact Verification Benchmark for Hallucination Detection in Large Language Models","version":2},"cited_work":{"arxiv_id":"2503.16541","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16541","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Poly-fever: A multi- lingualfactverificationbenchmarkforhallucina- tion detection in large language models","venue":null,"work_id":"a2f3e0e3-3ee9-4e82-b6a7-6bc6aef45dba","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2503.16541","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:e8b76cf31fb14aa803096939b98ccb101d1e22cbcaccc624129a79c857d697cd","observation_id":"6ed730fe-c1c8-41ec-81ea-d1f6ad11c87c","resolution":{"observed_at":"2026-05-19T20:32:45.428432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hot- potqa: A dataset for diverse, explainable multi- hop question answering","venue":null,"work_id":"3838e66b-6db2-4cb9-9991-06cd2335abe3","year":2018},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:f9991c6f5e2f8a3364dbca1bfe8e51cf492117e861972218707c1aebc1fc6d59","observation_id":"a71aa15b-e1ec-4b42-bc2d-a1b438c8d02f","resolution":{"observed_at":"2026-05-19T20:32:46.029774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Triviaqa: A large scale distantly super- vised challenge dataset for reading comprehen- sion","venue":null,"work_id":"c0d4838a-9039-46ac-aea6-8a7084a9e260","year":2017},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:ba01db009354bf880cfccd79c5c992e5d44152598c4b52078308df615f761aba","observation_id":"16475eef-9b6b-49f9-a441-84d848b51268","resolution":{"observed_at":"2026-05-19T20:32:46.031635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medhallu: A comprehen- sive benchmark for detecting medical hallucina- tions in large language models","venue":null,"work_id":"fb077c4d-7bb0-49da-8595-fa025ad7b414","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:485a37c72e84aa7de69c607d70be1db472246df7ec534f8c845f810754335297","observation_id":"52f2babf-f010-475f-a35c-a432d35dbf70","resolution":{"observed_at":"2026-05-19T20:32:46.033725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defan: Definitive answer dataset for llm hallucination evaluation","venue":null,"work_id":"a2808c2c-b027-4783-a7a8-2f79d2c3ecf4","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:30c6af67c41f183763af69a85c95caa04e97337877ec290c8774ba69ccc584e6","observation_id":"77476ed3-a272-4f28-b306-c70fd2f09690","resolution":{"observed_at":"2026-05-19T20:32:46.035447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Naseej launches its innovative arabic ai language model “noon","venue":null,"work_id":"5ab4c6af-e0d9-4419-b159-42227dedcda0","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:0b2e593547480a97c64f740fc411303e95b0721bd84f4fa06c5021904e3d1911","observation_id":"82dba318-3575-4609-bf53-d8c0cc031e17","resolution":{"observed_at":"2026-05-19T20:32:46.026395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing claude sonnet 4.5","venue":null,"work_id":"39d1d9f3-3cc3-45cf-a368-d26a305924f1","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:0c3b7f0d1da9d16a90676ef01f0f9ed50c038b0a5dee4839633375fa9286eeca","observation_id":"29b5d582-a1e3-40b0-a1d5-a4903d8d0e0a","resolution":{"observed_at":"2026-05-19T20:32:46.028020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:3745b2cf48d93a97c32de75cb5b5dd55c15539023fbee79ec34ab0523b94bdab","observation_id":"50ba481a-9c98-4ea7-a466-81b453853f01","resolution":{"observed_at":"2026-05-19T20:32:45.433934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[Online]","venue":null,"work_id":"446fa875-aace-4014-b426-f6fc69a0198d","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:487a98f4ff489d43bc660af9c348c0bc4fb26e339a3f3d1a0f72d00612378afb","observation_id":"0fa784af-b4e4-439f-8aac-f74c763ccd72","resolution":{"observed_at":"2026-05-19T20:32:46.042683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:21fa2f7c543f0fcaf40845c1ce95475eccf0ccfa8d7d27bbeecc73ed0be32d2d","observation_id":"3a169845-6b2f-4138-b956-fd2368894682","resolution":{"observed_at":"2026-05-19T20:32:45.401489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:29c0d02dc044321d097488afc4956f09a539559500b9f2742ed635423439c240","observation_id":"c0031f15-fee3-425e-aa18-f2d29992e9be","resolution":{"observed_at":"2026-05-19T20:32:45.425340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-4-maverick- 17b-128e-instruct-fp8","venue":null,"work_id":"4dd81a18-010c-4284-88c2-91694738750a","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:6f215d052bc4c1036f0f766f3d1d96621c31deb8e4c67392e7d5791e25b64ccd","observation_id":"066260b9-1c48-4b2d-869a-edb5f4840def","resolution":{"observed_at":"2026-05-19T20:32:46.017577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3-next- 80b-a3b-instruct","venue":null,"work_id":"ffc80919-e494-4b77-84ef-7ef77098615e","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:9357bec91eeff9bbabc432c9526fa0b4a30cd667c67ef5cf755f77078ac7463f","observation_id":"b6a81e73-62c6-41fa-ba3e-6c588ff67bca","resolution":{"observed_at":"2026-05-19T20:32:46.019311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3-235b-a22b-instruct-2507-fp8","venue":null,"work_id":"957c451b-17ca-49cf-9a2d-3f96f19804ba","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:9dfb193cfce574788d9ed6c668872855253a087f04b7a8868b92ae26e52e093a","observation_id":"dc8e0658-9aad-4438-8202-da09e65ad465","resolution":{"observed_at":"2026-05-19T20:32:46.020921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System card: Claude opus 4 and claude sonnet 4","venue":null,"work_id":"d972f209-0665-4576-bea6-f40314c63453","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:b412e3b4f4136815c5bd58efad7f169dcdafeb3c3d8211c9cfa5bd714d0bdc9b","observation_id":"23745810-8085-4d9d-a51b-68c60228742a","resolution":{"observed_at":"2026-05-19T20:32:46.013805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:004038fa364cff9d142426e52b176edeb1485eda505b22848d447a48261ab52a","observation_id":"9f7e693e-a8f3-4b50-b1a6-9efe2974ab9a","resolution":{"observed_at":"2026-05-19T20:32:45.410606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":"23466eb2-1de2-4072-80bf-f5d5d6618bf0","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:2edf68d0d21c8972007f496d3608e0e9ad857837b83b92738020a1b043a37d1a","observation_id":"833ce9a3-d8ec-4e64-af6d-0e093ef7b48d","resolution":{"observed_at":"2026-05-19T20:32:46.015758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The double-edged sword of anthro- pomorphism in llms","venue":null,"work_id":"ca31d516-4e1a-40fb-9c9e-32be6383868c","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:44fb029f508ab74ae04d51d09c7ed67dbec5f583c7d4aa3ba1a9779fb6564308","observation_id":"5ca92cf6-8b2b-4d57-9b75-5b8505d8f55e","resolution":{"observed_at":"2026-05-19T20:32:46.022652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Breaking the illusion: Revisiting llm anthropomorphism","venue":null,"work_id":"a974371a-d605-46bb-890f-47df3b0b0b17","year":2025},"citing_paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T20:31:20.017866Z"},"links":{"citing_paper":"/paper/2605.17007"},"observation_digest":"sha256:48f4d018ef44f3d9719902c756ec0db8817b2b84f17832da1805d81e06858b54","observation_id":"eb2336b8-516e-4607-a6d2-847058e4d86a","resolution":{"observed_at":"2026-05-19T20:32:46.044418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17007","last_updated":"2026-05-16T14:08:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T14:08:15Z","title":"HalluScore: Large Language Model Hallucination Question Answering Benchmark"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":17,"verified_fuzzy":49},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 2 inbound Pith citation observations for arXiv:2605.17007."}