{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:WAY4M3XJGGRKTETXPZGWE5BGMD","short_pith_number":"pith:WAY4M3XJ","schema_version":"1.0","canonical_sha256":"b031c66ee931a2a992777e4d62742660c48391fb5eb58a2087805ab161ffc7aa","source":{"kind":"arxiv","id":"2508.03686","version":1},"attestation_state":"computed","paper":{"title":"CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Chengqi Lyu, Derek F. Wong, Hongwei Liu, Junnan Liu, Kai Chen, Linchen Xiao, Shudong Liu, Songyang Gao, Songyang Zhang, Wenwei Zhang, Yuzhe Gu","submitted_at":"2025-08-05T17:55:24Z","abstract_excerpt":"Answer verification is crucial not only for evaluating large language models (LLMs) by matching their unstructured outputs against standard answers, but also serves as the reward model to guide LLM optimization. Most evaluation frameworks rely on regularized matching or employ general LLMs for answer verification, which demands extensive, repetitive customization for regex rules or evaluation prompts. Two fundamental limitations persist in current methodologies: 1) the absence of comprehensive benchmarks that systematically evaluate verification capabilities across different LLMs; and 2) the n"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.03686","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-08-05T17:55:24Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"a4d5b066035b4f590e2849701a5ff4157f66c005c4fbb6dc3291ec796dfb91da","abstract_canon_sha256":"1fdb86b8242b4e9c961d6fd8876fad2b163d2523f268a5e11ccf43f203ae8498"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:49:01.206049Z","signature_b64":"CU/Y2qFbsfy77JcNPmU+LKWaW3ErglaD23kKRBigKPZKPrSdq5jvdHF1hflQl2Gg3OZxIdoP1bpiVgR9nGekBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b031c66ee931a2a992777e4d62742660c48391fb5eb58a2087805ab161ffc7aa","last_reissued_at":"2026-07-05T11:49:01.205628Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:49:01.205628Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Chengqi Lyu, Derek F. Wong, Hongwei Liu, Junnan Liu, Kai Chen, Linchen Xiao, Shudong Liu, Songyang Gao, Songyang Zhang, Wenwei Zhang, Yuzhe Gu","submitted_at":"2025-08-05T17:55:24Z","abstract_excerpt":"Answer verification is crucial not only for evaluating large language models (LLMs) by matching their unstructured outputs against standard answers, but also serves as the reward model to guide LLM optimization. Most evaluation frameworks rely on regularized matching or employ general LLMs for answer verification, which demands extensive, repetitive customization for regex rules or evaluation prompts. Two fundamental limitations persist in current methodologies: 1) the absence of comprehensive benchmarks that systematically evaluate verification capabilities across different LLMs; and 2) the n"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.03686","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.03686/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.03686","created_at":"2026-07-05T11:49:01.205685+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.03686v1","created_at":"2026-07-05T11:49:01.205685+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.03686","created_at":"2026-07-05T11:49:01.205685+00:00"},{"alias_kind":"pith_short_12","alias_value":"WAY4M3XJGGRK","created_at":"2026-07-05T11:49:01.205685+00:00"},{"alias_kind":"pith_short_16","alias_value":"WAY4M3XJGGRKTETX","created_at":"2026-07-05T11:49:01.205685+00:00"},{"alias_kind":"pith_short_8","alias_value":"WAY4M3XJ","created_at":"2026-07-05T11:49:01.205685+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":176,"is_internal_anchor":false},{"citing_arxiv_id":"2510.04265","citing_title":"Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2601.13606","citing_title":"ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27393","citing_title":"MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD","json":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD.json","graph_json":"https://pith.science/api/pith-number/WAY4M3XJGGRKTETXPZGWE5BGMD/graph.json","events_json":"https://pith.science/api/pith-number/WAY4M3XJGGRKTETXPZGWE5BGMD/events.json","paper":"https://pith.science/paper/WAY4M3XJ"},"agent_actions":{"view_html":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD","download_json":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD.json","view_paper":"https://pith.science/paper/WAY4M3XJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.03686&json=true","fetch_graph":"https://pith.science/api/pith-number/WAY4M3XJGGRKTETXPZGWE5BGMD/graph.json","fetch_events":"https://pith.science/api/pith-number/WAY4M3XJGGRKTETXPZGWE5BGMD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD/action/storage_attestation","attest_author":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD/action/author_attestation","sign_citation":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD/action/citation_signature","submit_replication":"https://pith.science/pith/WAY4M3XJGGRKTETXPZGWE5BGMD/action/replication_record"}},"created_at":"2026-07-05T11:49:01.205685+00:00","updated_at":"2026-07-05T11:49:01.205685+00:00"}