{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:RCXQFK7UAZ6URMJ7RTMCAO72IC","short_pith_number":"pith:RCXQFK7U","schema_version":"1.0","canonical_sha256":"88af02abf4067d48b13f8cd8203bfa40919638fdb72d584eb306fdb6c64b315e","source":{"kind":"arxiv","id":"2405.20362","version":1},"attestation_state":"computed","paper":{"title":"Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CY"],"primary_cat":"cs.CL","authors_text":"Christopher D. Manning, Daniel E. Ho, Faiz Surani, Matthew Dahl, Mirac Suzgun, Varun Magesh","submitted_at":"2024-05-30T17:56:05Z","abstract_excerpt":"Legal practice has witnessed a sharp rise in products incorporating artificial intelligence (AI). Such tools are designed to assist with a wide range of core legal tasks, from search and summarization of caselaw to document drafting. But the large language models used in these tools are prone to \"hallucinate,\" or make up false information, making their use risky in high-stakes domains. Recently, certain legal research providers have touted methods such as retrieval-augmented generation (RAG) as \"eliminating\" (Casetext, 2023) or \"avoid[ing]\" hallucinations (Thomson Reuters, 2023), or guaranteei"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.20362","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-05-30T17:56:05Z","cross_cats_sorted":["cs.CY"],"title_canon_sha256":"7613732f1f323a58dfc920ab369998a5974b6ae9f7eec8128154bca8efdb143f","abstract_canon_sha256":"adeb9603e8aa052001de4d9dc303fffbad98bdb071a1cd50a001824468717402"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:25:36.459547Z","signature_b64":"PappUV7fAodzQgApfmeTS8VfaoaoV/45KKwDdOExdzRTgJN9A6Rz7ATD+eTRcAT/scghVx4xmWvLIX3cR4PSDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"88af02abf4067d48b13f8cd8203bfa40919638fdb72d584eb306fdb6c64b315e","last_reissued_at":"2026-07-05T08:25:36.459075Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:25:36.459075Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CY"],"primary_cat":"cs.CL","authors_text":"Christopher D. Manning, Daniel E. Ho, Faiz Surani, Matthew Dahl, Mirac Suzgun, Varun Magesh","submitted_at":"2024-05-30T17:56:05Z","abstract_excerpt":"Legal practice has witnessed a sharp rise in products incorporating artificial intelligence (AI). Such tools are designed to assist with a wide range of core legal tasks, from search and summarization of caselaw to document drafting. But the large language models used in these tools are prone to \"hallucinate,\" or make up false information, making their use risky in high-stakes domains. Recently, certain legal research providers have touted methods such as retrieval-augmented generation (RAG) as \"eliminating\" (Casetext, 2023) or \"avoid[ing]\" hallucinations (Thomson Reuters, 2023), or guaranteei"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.20362","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.20362/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.20362","created_at":"2026-07-05T08:25:36.459137+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.20362v1","created_at":"2026-07-05T08:25:36.459137+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.20362","created_at":"2026-07-05T08:25:36.459137+00:00"},{"alias_kind":"pith_short_12","alias_value":"RCXQFK7UAZ6U","created_at":"2026-07-05T08:25:36.459137+00:00"},{"alias_kind":"pith_short_16","alias_value":"RCXQFK7UAZ6URMJ7","created_at":"2026-07-05T08:25:36.459137+00:00"},{"alias_kind":"pith_short_8","alias_value":"RCXQFK7U","created_at":"2026-07-05T08:25:36.459137+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24585","citing_title":"LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28358","citing_title":"How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00898","citing_title":"Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2412.02904","citing_title":"Enhancing Trust in Large Language Models via Uncertainty-Calibrated Fine-Tuning","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21102","citing_title":"ACL-Verbatim: hallucination-free question answering for research","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12012","citing_title":"LegalCheck: Retrieval- and Context-Augmented Generation for Drafting Municipal Legal Advice Letters","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2509.09438","citing_title":"GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2511.10899","citing_title":"From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12012","citing_title":"LegalCheck: Retrieval- and Context-Augmented Generation for Drafting Municipal Legal Advice Letters","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11330","citing_title":"Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23730","citing_title":"Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19895","citing_title":"Learning When Not to Decide: A Framework for Overcoming Factual Presumptuousness in AI Adjudication","ref_index":27,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC","json":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC.json","graph_json":"https://pith.science/api/pith-number/RCXQFK7UAZ6URMJ7RTMCAO72IC/graph.json","events_json":"https://pith.science/api/pith-number/RCXQFK7UAZ6URMJ7RTMCAO72IC/events.json","paper":"https://pith.science/paper/RCXQFK7U"},"agent_actions":{"view_html":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC","download_json":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC.json","view_paper":"https://pith.science/paper/RCXQFK7U","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.20362&json=true","fetch_graph":"https://pith.science/api/pith-number/RCXQFK7UAZ6URMJ7RTMCAO72IC/graph.json","fetch_events":"https://pith.science/api/pith-number/RCXQFK7UAZ6URMJ7RTMCAO72IC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC/action/storage_attestation","attest_author":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC/action/author_attestation","sign_citation":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC/action/citation_signature","submit_replication":"https://pith.science/pith/RCXQFK7UAZ6URMJ7RTMCAO72IC/action/replication_record"}},"created_at":"2026-07-05T08:25:36.459137+00:00","updated_at":"2026-07-05T08:25:36.459137+00:00"}