{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:MMMGG5QTOVSXVJGNVOJDQWSZ5R","short_pith_number":"pith:MMMGG5QT","schema_version":"1.0","canonical_sha256":"631863761375657aa4cdab92385a59ec7c995814868f97f1eb9fbfefbb949528","source":{"kind":"arxiv","id":"2502.15631","version":1},"attestation_state":"computed","paper":{"title":"The Relationship Between Reasoning and Performance in Large Language Models -- o3 (mini) Thinks Harder, Not Longer","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Andres Algaba, Marthe Ballon, Vincent Ginis","submitted_at":"2025-02-21T17:59:13Z","abstract_excerpt":"Large language models have demonstrated remarkable progress in mathematical reasoning, leveraging chain-of-thought and test-time compute scaling. However, many open questions remain regarding the interplay between reasoning token usage and accuracy gains. In particular, when comparing models across generations, it is unclear whether improved performance results from longer reasoning chains or more efficient reasoning. We systematically analyze chain-of-thought length across o1-mini and o3-mini variants on the Omni-MATH benchmark, finding that o3-mini (m) achieves superior accuracy without requ"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.15631","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.LG","submitted_at":"2025-02-21T17:59:13Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"25ce539691ad63d0aeff3754565bfc629a4fb643f6de292f623ff83dd9a916e6","abstract_canon_sha256":"ffad8c1fde741cf4acd576ec3bd99c33795dc317de2f02d12d24679594fa0935"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:18:04.866693Z","signature_b64":"9knTdyQtFOx6kWIsvvjTjFQO6lZrGUOooMCfeC/zI+guPJWf7JpD1jz0Yjahj+FMi08EUwvyMLy6B06SzgaEDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"631863761375657aa4cdab92385a59ec7c995814868f97f1eb9fbfefbb949528","last_reissued_at":"2026-07-05T10:18:04.866245Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:18:04.866245Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The Relationship Between Reasoning and Performance in Large Language Models -- o3 (mini) Thinks Harder, Not Longer","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Andres Algaba, Marthe Ballon, Vincent Ginis","submitted_at":"2025-02-21T17:59:13Z","abstract_excerpt":"Large language models have demonstrated remarkable progress in mathematical reasoning, leveraging chain-of-thought and test-time compute scaling. However, many open questions remain regarding the interplay between reasoning token usage and accuracy gains. In particular, when comparing models across generations, it is unclear whether improved performance results from longer reasoning chains or more efficient reasoning. We systematically analyze chain-of-thought length across o1-mini and o3-mini variants on the Omni-MATH benchmark, finding that o3-mini (m) achieves superior accuracy without requ"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.15631","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.15631/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.15631","created_at":"2026-07-05T10:18:04.866298+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.15631v1","created_at":"2026-07-05T10:18:04.866298+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.15631","created_at":"2026-07-05T10:18:04.866298+00:00"},{"alias_kind":"pith_short_12","alias_value":"MMMGG5QTOVSX","created_at":"2026-07-05T10:18:04.866298+00:00"},{"alias_kind":"pith_short_16","alias_value":"MMMGG5QTOVSXVJGN","created_at":"2026-07-05T10:18:04.866298+00:00"},{"alias_kind":"pith_short_8","alias_value":"MMMGG5QT","created_at":"2026-07-05T10:18:04.866298+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":6,"sample":[{"citing_arxiv_id":"2606.11337","citing_title":"Can AI Agents Synthesize Scientific Conclusions?","ref_index":18,"is_internal_anchor":true},{"citing_arxiv_id":"2606.02282","citing_title":"POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems","ref_index":32,"is_internal_anchor":true},{"citing_arxiv_id":"2601.15232","citing_title":"When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling","ref_index":7,"is_internal_anchor":true},{"citing_arxiv_id":"2506.06941","citing_title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","ref_index":34,"is_internal_anchor":true},{"citing_arxiv_id":"2503.09567","citing_title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","ref_index":32,"is_internal_anchor":true},{"citing_arxiv_id":"2605.00817","citing_title":"When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models","ref_index":28,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R","json":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R.json","graph_json":"https://pith.science/api/pith-number/MMMGG5QTOVSXVJGNVOJDQWSZ5R/graph.json","events_json":"https://pith.science/api/pith-number/MMMGG5QTOVSXVJGNVOJDQWSZ5R/events.json","paper":"https://pith.science/paper/MMMGG5QT"},"agent_actions":{"view_html":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R","download_json":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R.json","view_paper":"https://pith.science/paper/MMMGG5QT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.15631&json=true","fetch_graph":"https://pith.science/api/pith-number/MMMGG5QTOVSXVJGNVOJDQWSZ5R/graph.json","fetch_events":"https://pith.science/api/pith-number/MMMGG5QTOVSXVJGNVOJDQWSZ5R/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R/action/storage_attestation","attest_author":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R/action/author_attestation","sign_citation":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R/action/citation_signature","submit_replication":"https://pith.science/pith/MMMGG5QTOVSXVJGNVOJDQWSZ5R/action/replication_record"}},"created_at":"2026-07-05T10:18:04.866298+00:00","updated_at":"2026-07-05T10:18:04.866298+00:00"}