{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:HXUPPZLREBVUIX6QWSD6GW3NQT","short_pith_number":"pith:HXUPPZLR","schema_version":"1.0","canonical_sha256":"3de8f7e571206b445fd0b487e35b6d84ced76c0707fda794b0c8a3ba6f90f158","source":{"kind":"arxiv","id":"2506.04734","version":2},"attestation_state":"computed","paper":{"title":"Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"Change Jia, Guangxiang Zhao, Jinzhu Wu, Linglin Zhang, Lin Sun, Sai-er Hu, Weihong Lin, Xiangzheng Zhang, Xiaoqi Jian, Yongfu Zhu, Yuhan Wu","submitted_at":"2025-06-05T08:09:11Z","abstract_excerpt":"Reasoning models represented by the Deepseek-R1-Distill series have been widely adopted by the open-source community due to their strong performance in mathematics, science, programming, and other domains. However, our study reveals that their benchmark evaluation results are subject to significant fluctuations caused by various factors. Subtle differences in evaluation conditions can lead to substantial variations in results. Similar phenomena are observed in other open-source inference models fine-tuned based on the Deepseek-R1-Distill series, as well as in the QwQ-32B model, making their cl"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.04734","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-06-05T08:09:11Z","cross_cats_sorted":["cs.CL","cs.LG"],"title_canon_sha256":"6dc140b0ebab843406668e941e20172a06c32f278b3deaa39d09ee40fd043f4b","abstract_canon_sha256":"198682e419f5ffeb3a66fc53f798d6cb9a7c1d00d9e8730c31e92eb7cb90e895"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:20:54.980708Z","signature_b64":"zDS3JR4yeIiq0abwYkBQ1B9wcpPJOozbLPUe99vFYwyavqF/pUuhR6cemeJL/7Q3uUIRbLUkgA4Ln5rVL/1fBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3de8f7e571206b445fd0b487e35b6d84ced76c0707fda794b0c8a3ba6f90f158","last_reissued_at":"2026-07-05T11:20:54.980177Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:20:54.980177Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"Change Jia, Guangxiang Zhao, Jinzhu Wu, Linglin Zhang, Lin Sun, Sai-er Hu, Weihong Lin, Xiangzheng Zhang, Xiaoqi Jian, Yongfu Zhu, Yuhan Wu","submitted_at":"2025-06-05T08:09:11Z","abstract_excerpt":"Reasoning models represented by the Deepseek-R1-Distill series have been widely adopted by the open-source community due to their strong performance in mathematics, science, programming, and other domains. However, our study reveals that their benchmark evaluation results are subject to significant fluctuations caused by various factors. Subtle differences in evaluation conditions can lead to substantial variations in results. Similar phenomena are observed in other open-source inference models fine-tuned based on the Deepseek-R1-Distill series, as well as in the QwQ-32B model, making their cl"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.04734","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.04734/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.04734","created_at":"2026-07-05T11:20:54.980241+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.04734v2","created_at":"2026-07-05T11:20:54.980241+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.04734","created_at":"2026-07-05T11:20:54.980241+00:00"},{"alias_kind":"pith_short_12","alias_value":"HXUPPZLREBVU","created_at":"2026-07-05T11:20:54.980241+00:00"},{"alias_kind":"pith_short_16","alias_value":"HXUPPZLREBVUIX6Q","created_at":"2026-07-05T11:20:54.980241+00:00"},{"alias_kind":"pith_short_8","alias_value":"HXUPPZLR","created_at":"2026-07-05T11:20:54.980241+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09078","citing_title":"The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2509.21882","citing_title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","ref_index":33,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT","json":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT.json","graph_json":"https://pith.science/api/pith-number/HXUPPZLREBVUIX6QWSD6GW3NQT/graph.json","events_json":"https://pith.science/api/pith-number/HXUPPZLREBVUIX6QWSD6GW3NQT/events.json","paper":"https://pith.science/paper/HXUPPZLR"},"agent_actions":{"view_html":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT","download_json":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT.json","view_paper":"https://pith.science/paper/HXUPPZLR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.04734&json=true","fetch_graph":"https://pith.science/api/pith-number/HXUPPZLREBVUIX6QWSD6GW3NQT/graph.json","fetch_events":"https://pith.science/api/pith-number/HXUPPZLREBVUIX6QWSD6GW3NQT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT/action/storage_attestation","attest_author":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT/action/author_attestation","sign_citation":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT/action/citation_signature","submit_replication":"https://pith.science/pith/HXUPPZLREBVUIX6QWSD6GW3NQT/action/replication_record"}},"created_at":"2026-07-05T11:20:54.980241+00:00","updated_at":"2026-07-05T11:20:54.980241+00:00"}