{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:DK5FBX4YCFJ6G2TWFSB26HL7AP","short_pith_number":"pith:DK5FBX4Y","schema_version":"1.0","canonical_sha256":"1aba50df981153e36a762c83af1d7f03fb6f739d7c1f27ab15769ebac2161653","source":{"kind":"arxiv","id":"2311.09476","version":2},"attestation_state":"computed","paper":{"title":"ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.IR"],"primary_cat":"cs.CL","authors_text":"Christopher Potts, Jon Saad-Falcon, Matei Zaharia, Omar Khattab","submitted_at":"2023-11-16T00:39:39Z","abstract_excerpt":"Evaluating retrieval-augmented generation (RAG) systems traditionally relies on hand annotations for input queries, passages to retrieve, and responses to generate. We introduce ARES, an Automated RAG Evaluation System, for evaluating RAG systems along the dimensions of context relevance, answer faithfulness, and answer relevance. By creating its own synthetic training data, ARES finetunes lightweight LM judges to assess the quality of individual RAG components. To mitigate potential prediction errors, ARES utilizes a small set of human-annotated datapoints for prediction-powered inference (PP"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.09476","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-11-16T00:39:39Z","cross_cats_sorted":["cs.AI","cs.IR"],"title_canon_sha256":"c073176ea0a6ef0197234f80d2f652b45562c20de76036962ed925ba2aa4e0f1","abstract_canon_sha256":"1e819053b3af60267520c5efed060e8a7552da60bd876925b37ac2fad31f9d0c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:02:48.009584Z","signature_b64":"8INLj2u9RijAeS3S8DT3TDAeWD9uUSqWpx/V06pn640qGZJupZKR1s9wM2ecBih2L2huU6oMnRZnn8QEYkG4CQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1aba50df981153e36a762c83af1d7f03fb6f739d7c1f27ab15769ebac2161653","last_reissued_at":"2026-07-05T08:02:48.009104Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:02:48.009104Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.IR"],"primary_cat":"cs.CL","authors_text":"Christopher Potts, Jon Saad-Falcon, Matei Zaharia, Omar Khattab","submitted_at":"2023-11-16T00:39:39Z","abstract_excerpt":"Evaluating retrieval-augmented generation (RAG) systems traditionally relies on hand annotations for input queries, passages to retrieve, and responses to generate. We introduce ARES, an Automated RAG Evaluation System, for evaluating RAG systems along the dimensions of context relevance, answer faithfulness, and answer relevance. By creating its own synthetic training data, ARES finetunes lightweight LM judges to assess the quality of individual RAG components. To mitigate potential prediction errors, ARES utilizes a small set of human-annotated datapoints for prediction-powered inference (PP"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.09476","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.09476/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.09476","created_at":"2026-07-05T08:02:48.009155+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.09476v2","created_at":"2026-07-05T08:02:48.009155+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.09476","created_at":"2026-07-05T08:02:48.009155+00:00"},{"alias_kind":"pith_short_12","alias_value":"DK5FBX4YCFJ6","created_at":"2026-07-05T08:02:48.009155+00:00"},{"alias_kind":"pith_short_16","alias_value":"DK5FBX4YCFJ6G2TW","created_at":"2026-07-05T08:02:48.009155+00:00"},{"alias_kind":"pith_short_8","alias_value":"DK5FBX4Y","created_at":"2026-07-05T08:02:48.009155+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08700","citing_title":"Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2606.06748","citing_title":"Evidence Graph Consistency in Retrieval-Augmented Generation: A Model-Dependent Analysis of Hallucination Detection","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04435","citing_title":"Cascading Hallucination in Agentic RAG: The CHARM Framework for Detection and Mitigation","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06748","citing_title":"Evidence Graph Consistency in Retrieval-Augmented Generation: A Model-Dependent Analysis of Hallucination Detection","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00093","citing_title":"Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27494","citing_title":"Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2312.10997","citing_title":"Retrieval-Augmented Generation for Large Language Models: A Survey","ref_index":165,"is_internal_anchor":false},{"citing_arxiv_id":"2404.10981","citing_title":"A Survey on Retrieval-Augmented Text Generation for Large Language Models","ref_index":120,"is_internal_anchor":false},{"citing_arxiv_id":"2504.07738","citing_title":"Automated Construction of a Knowledge Graph of Nuclear Fusion Energy for Effective Elicitation and Retrieval of Information","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16310","citing_title":"RAG-DIVE: A Dynamic Approach for Multi-Turn Dialogue Evaluation in Retrieval-Augmented Generation","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2401.15391","citing_title":"MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2412.05579","citing_title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","ref_index":194,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00957","citing_title":"\"I Don't Know\" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18234","citing_title":"Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05245","citing_title":"AdaGATE: Adaptive Gap-Aware Token-Efficient Evidence Assembly for Multi-Hop Retrieval-Augmented Generation","ref_index":25,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP","json":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP.json","graph_json":"https://pith.science/api/pith-number/DK5FBX4YCFJ6G2TWFSB26HL7AP/graph.json","events_json":"https://pith.science/api/pith-number/DK5FBX4YCFJ6G2TWFSB26HL7AP/events.json","paper":"https://pith.science/paper/DK5FBX4Y"},"agent_actions":{"view_html":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP","download_json":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP.json","view_paper":"https://pith.science/paper/DK5FBX4Y","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.09476&json=true","fetch_graph":"https://pith.science/api/pith-number/DK5FBX4YCFJ6G2TWFSB26HL7AP/graph.json","fetch_events":"https://pith.science/api/pith-number/DK5FBX4YCFJ6G2TWFSB26HL7AP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP/action/storage_attestation","attest_author":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP/action/author_attestation","sign_citation":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP/action/citation_signature","submit_replication":"https://pith.science/pith/DK5FBX4YCFJ6G2TWFSB26HL7AP/action/replication_record"}},"created_at":"2026-07-05T08:02:48.009155+00:00","updated_at":"2026-07-05T08:02:48.009155+00:00"}