{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:OXEKTXIBSJLUUTXPRPBWUE4OHH","short_pith_number":"pith:OXEKTXIB","schema_version":"1.0","canonical_sha256":"75c8a9dd0192574a4eef8bc36a138e39f5622e72188f94fa79bbb1844f795402","source":{"kind":"arxiv","id":"2503.13335","version":1},"attestation_state":"computed","paper":{"title":"Reliable and Efficient Amortized Model-based Evaluation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","stat.AP"],"primary_cat":"cs.CL","authors_text":"Bo Li, Percy Liang, Sang Truong, Sanmi Koyejo, Yuheng Tu","submitted_at":"2025-03-17T16:15:02Z","abstract_excerpt":"Comprehensive evaluations of language models (LM) during both development and deployment phases are necessary because these models possess numerous capabilities (e.g., mathematical reasoning, legal support, or medical diagnostic) as well as safety risks (e.g., racial bias, toxicity, or misinformation). The average score across a wide range of benchmarks provides a signal that helps guide the use of these LMs in practice. Currently, holistic evaluations are costly due to the large volume of benchmark questions, making frequent evaluations impractical. A popular attempt to lower the cost is to c"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.13335","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-03-17T16:15:02Z","cross_cats_sorted":["cs.AI","cs.LG","stat.AP"],"title_canon_sha256":"af0cf2fbd448034b04844e7f13adb4aa3180700a3186c237b7a5fb76defe550c","abstract_canon_sha256":"2ef3137a434c6f5f7a703eafd1cf158874d9e8b4fb96b2a15a4267d175bfc461"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:32:58.539112Z","signature_b64":"gmboxXcuA4qRa7JGJa6FB6EjcyuMDzYvbRzn6nVtQU33s1Jl+fH5hkX6jSGiUk8xQDWu4f0IoYmlnVWg4TW9Bg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"75c8a9dd0192574a4eef8bc36a138e39f5622e72188f94fa79bbb1844f795402","last_reissued_at":"2026-07-05T10:32:58.538259Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:32:58.538259Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Reliable and Efficient Amortized Model-based Evaluation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","stat.AP"],"primary_cat":"cs.CL","authors_text":"Bo Li, Percy Liang, Sang Truong, Sanmi Koyejo, Yuheng Tu","submitted_at":"2025-03-17T16:15:02Z","abstract_excerpt":"Comprehensive evaluations of language models (LM) during both development and deployment phases are necessary because these models possess numerous capabilities (e.g., mathematical reasoning, legal support, or medical diagnostic) as well as safety risks (e.g., racial bias, toxicity, or misinformation). The average score across a wide range of benchmarks provides a signal that helps guide the use of these LMs in practice. Currently, holistic evaluations are costly due to the large volume of benchmark questions, making frequent evaluations impractical. A popular attempt to lower the cost is to c"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.13335","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.13335/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.13335","created_at":"2026-07-05T10:32:58.538391+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.13335v1","created_at":"2026-07-05T10:32:58.538391+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.13335","created_at":"2026-07-05T10:32:58.538391+00:00"},{"alias_kind":"pith_short_12","alias_value":"OXEKTXIBSJLU","created_at":"2026-07-05T10:32:58.538391+00:00"},{"alias_kind":"pith_short_16","alias_value":"OXEKTXIBSJLUUTXP","created_at":"2026-07-05T10:32:58.538391+00:00"},{"alias_kind":"pith_short_8","alias_value":"OXEKTXIB","created_at":"2026-07-05T10:32:58.538391+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.21937","citing_title":"Latent Confidence Alignment for LLM Self-Assessment","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01152","citing_title":"AGC-Bench: Measuring Artificial General Creativity","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12702","citing_title":"Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10154","citing_title":"Quality Is Not a Safety Proxy Under Quantization","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01152","citing_title":"AGC-Bench: Measuring Artificial General Creativity","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07616","citing_title":"Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01400","citing_title":"Consistent and Distinctive: LLM Benchmark Efficiency via Maximum Independent Set Prompt Selection on Similarity Graphs","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17173","citing_title":"Why Do Safety Guardrails Degrade Across Languages?","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11205","citing_title":"The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06213","citing_title":"Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12843","citing_title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","ref_index":17,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH","json":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH.json","graph_json":"https://pith.science/api/pith-number/OXEKTXIBSJLUUTXPRPBWUE4OHH/graph.json","events_json":"https://pith.science/api/pith-number/OXEKTXIBSJLUUTXPRPBWUE4OHH/events.json","paper":"https://pith.science/paper/OXEKTXIB"},"agent_actions":{"view_html":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH","download_json":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH.json","view_paper":"https://pith.science/paper/OXEKTXIB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.13335&json=true","fetch_graph":"https://pith.science/api/pith-number/OXEKTXIBSJLUUTXPRPBWUE4OHH/graph.json","fetch_events":"https://pith.science/api/pith-number/OXEKTXIBSJLUUTXPRPBWUE4OHH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH/action/storage_attestation","attest_author":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH/action/author_attestation","sign_citation":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH/action/citation_signature","submit_replication":"https://pith.science/pith/OXEKTXIBSJLUUTXPRPBWUE4OHH/action/replication_record"}},"created_at":"2026-07-05T10:32:58.538391+00:00","updated_at":"2026-07-05T10:32:58.538391+00:00"}