{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:6GK2DY56XISUWB6JVOTS4WTZRI","short_pith_number":"pith:6GK2DY56","schema_version":"1.0","canonical_sha256":"f195a1e3beba254b07c9aba72e5a798a262d4cf82aad5e3126092f5074639c08","source":{"kind":"arxiv","id":"2503.05061","version":3},"attestation_state":"computed","paper":{"title":"No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Charles Lovering, Chris Tanner, Michael Krumdick, Seth Ebner, Varshini Reddy","submitted_at":"2025-03-07T00:42:08Z","abstract_excerpt":"Reliable evaluation of large language models (LLMs) is critical as their deployment rapidly expands, particularly in high-stakes domains such as business and finance. The LLM-as-a-Judge framework, which uses prompted LLMs to evaluate response quality, is appealing due to its scalability, low cost, and strong correlations with human stylistic preferences. However, it remains unclear how accurately these methods can assess response quality in domains where correctness matters more than style. To address this gap, we introduce the Business and Finance Fundamentals Benchmark (BFF-Bench), a dataset"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.05061","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-03-07T00:42:08Z","cross_cats_sorted":[],"title_canon_sha256":"2f65519053e3530a5c00ac432ec8f0546cc0356daece3150e14e8ecea29ad9a2","abstract_canon_sha256":"390e87ca7ce89df24246429ebdea2c4b8ad106bd30fec7c6219df38602184d9c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-12T01:24:11.693989Z","signature_b64":"iJh2N+VpqgqZC9amAN7N9OQQNmWECTMDgE8Esz9zyjg3uoybFedqGevk2802/V8h2mWZBaWUMdZecxTzLABuDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f195a1e3beba254b07c9aba72e5a798a262d4cf82aad5e3126092f5074639c08","last_reissued_at":"2026-08-12T01:24:11.691919Z","signature_status":"signed_v1","first_computed_at":"2026-08-12T01:24:11.691919Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Charles Lovering, Chris Tanner, Michael Krumdick, Seth Ebner, Varshini Reddy","submitted_at":"2025-03-07T00:42:08Z","abstract_excerpt":"Reliable evaluation of large language models (LLMs) is critical as their deployment rapidly expands, particularly in high-stakes domains such as business and finance. The LLM-as-a-Judge framework, which uses prompted LLMs to evaluate response quality, is appealing due to its scalability, low cost, and strong correlations with human stylistic preferences. However, it remains unclear how accurately these methods can assess response quality in domains where correctness matters more than style. To address this gap, we introduce the Business and Finance Fundamentals Benchmark (BFF-Bench), a dataset"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.05061","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.05061/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.05061","created_at":"2026-08-12T01:24:11.696042+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.05061v3","created_at":"2026-08-12T01:24:11.696042+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.05061","created_at":"2026-08-12T01:24:11.696042+00:00"},{"alias_kind":"pith_short_12","alias_value":"6GK2DY56XISU","created_at":"2026-08-12T01:24:11.696042+00:00"},{"alias_kind":"pith_short_16","alias_value":"6GK2DY56XISUWB6J","created_at":"2026-08-12T01:24:11.696042+00:00"},{"alias_kind":"pith_short_8","alias_value":"6GK2DY56","created_at":"2026-08-12T01:24:11.696042+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":12,"sample":[{"citing_arxiv_id":"2606.21943","citing_title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","ref_index":93,"is_internal_anchor":true},{"citing_arxiv_id":"2606.18648","citing_title":"Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark","ref_index":36,"is_internal_anchor":true},{"citing_arxiv_id":"2606.06871","citing_title":"Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring","ref_index":17,"is_internal_anchor":true},{"citing_arxiv_id":"2605.20745","citing_title":"The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2605.18805","citing_title":"RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents","ref_index":33,"is_internal_anchor":true},{"citing_arxiv_id":"2509.23542","citing_title":"On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization","ref_index":19,"is_internal_anchor":true},{"citing_arxiv_id":"2510.02837","citing_title":"Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"2512.19728","citing_title":"Hard Negative Sample-Augmented DPO Post-Training for Small Language Models","ref_index":7,"is_internal_anchor":true},{"citing_arxiv_id":"2604.08559","citing_title":"Medical Reasoning with Large Language Models: A Survey and MR-Bench","ref_index":126,"is_internal_anchor":true},{"citing_arxiv_id":"2604.18487","citing_title":"Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety","ref_index":42,"is_internal_anchor":true},{"citing_arxiv_id":"2604.06820","citing_title":"When Direct Prediction Fails: Evidence from LLM-Based Misinformation Risk Evaluation","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2604.17650","citing_title":"Measuring Distribution Shift in User Prompts and Its Effects on LLM Performance","ref_index":93,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI","json":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI.json","graph_json":"https://pith.science/api/pith-number/6GK2DY56XISUWB6JVOTS4WTZRI/graph.json","events_json":"https://pith.science/api/pith-number/6GK2DY56XISUWB6JVOTS4WTZRI/events.json","paper":"https://pith.science/paper/6GK2DY56"},"agent_actions":{"view_html":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI","download_json":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI.json","view_paper":"https://pith.science/paper/6GK2DY56","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.05061&json=true","fetch_graph":"https://pith.science/api/pith-number/6GK2DY56XISUWB6JVOTS4WTZRI/graph.json","fetch_events":"https://pith.science/api/pith-number/6GK2DY56XISUWB6JVOTS4WTZRI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI/action/storage_attestation","attest_author":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI/action/author_attestation","sign_citation":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI/action/citation_signature","submit_replication":"https://pith.science/pith/6GK2DY56XISUWB6JVOTS4WTZRI/action/replication_record"}},"created_at":"2026-08-12T01:24:11.696042+00:00","updated_at":"2026-08-12T01:24:11.696042+00:00"}