{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:W3AK36ZL7XAB3KYMMIOBI4XGLR","short_pith_number":"pith:W3AK36ZL","schema_version":"1.0","canonical_sha256":"b6c0adfb2bfdc01dab0c621c1472e65c78f0b47e245c5c8278c0e14aeda4289b","source":{"kind":"arxiv","id":"2410.23123","version":2},"attestation_state":"computed","paper":{"title":"On Memorization of Large Language Models in Logical Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Badih Ghazi, Bill Yuchen Lin, Bo Li, Chiyuan Zhang, Chulin Xie, Da Yu, Ravi Kumar, Xinyun Chen, Yangsibo Huang","submitted_at":"2024-10-30T15:31:54Z","abstract_excerpt":"Large language models (LLMs) achieve good performance on challenging reasoning benchmarks, yet could also make basic reasoning mistakes. This contrasting behavior is puzzling when it comes to understanding the mechanisms behind LLMs' reasoning capabilities. One hypothesis is that the increasingly high and nearly saturated performance on common reasoning benchmarks could be due to the memorization of similar problems. In this paper, we systematically investigate this hypothesis with a quantitative measurement of memorization in reasoning tasks, using a dynamically generated logical reasoning be"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.23123","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-10-30T15:31:54Z","cross_cats_sorted":[],"title_canon_sha256":"4f66fab8a0c93e674de0d64511213fbcff35081acb44015f50ce35197cbc5594","abstract_canon_sha256":"0d0100dbd5983ac70ae965836b1c77ea77d7cf91eae57eb24647433f4722bbd7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:23:24.791406Z","signature_b64":"sXxmu+krwsOxUVLggb8F6yEpSQUm9FeE7fg4QCIhPzu0uP718vaiva81H+UYbbeJLi1yl0lM/YZzENISIfmXDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b6c0adfb2bfdc01dab0c621c1472e65c78f0b47e245c5c8278c0e14aeda4289b","last_reissued_at":"2026-07-05T10:23:24.790743Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:23:24.790743Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"On Memorization of Large Language Models in Logical Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Badih Ghazi, Bill Yuchen Lin, Bo Li, Chiyuan Zhang, Chulin Xie, Da Yu, Ravi Kumar, Xinyun Chen, Yangsibo Huang","submitted_at":"2024-10-30T15:31:54Z","abstract_excerpt":"Large language models (LLMs) achieve good performance on challenging reasoning benchmarks, yet could also make basic reasoning mistakes. This contrasting behavior is puzzling when it comes to understanding the mechanisms behind LLMs' reasoning capabilities. One hypothesis is that the increasingly high and nearly saturated performance on common reasoning benchmarks could be due to the memorization of similar problems. In this paper, we systematically investigate this hypothesis with a quantitative measurement of memorization in reasoning tasks, using a dynamically generated logical reasoning be"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.23123","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.23123/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.23123","created_at":"2026-07-05T10:23:24.790812+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.23123v2","created_at":"2026-07-05T10:23:24.790812+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.23123","created_at":"2026-07-05T10:23:24.790812+00:00"},{"alias_kind":"pith_short_12","alias_value":"W3AK36ZL7XAB","created_at":"2026-07-05T10:23:24.790812+00:00"},{"alias_kind":"pith_short_16","alias_value":"W3AK36ZL7XAB3KYM","created_at":"2026-07-05T10:23:24.790812+00:00"},{"alias_kind":"pith_short_8","alias_value":"W3AK36ZL","created_at":"2026-07-05T10:23:24.790812+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.03685","citing_title":"A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29303","citing_title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01075","citing_title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2507.01679","citing_title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2508.11548","citing_title":"Copyright Protection for Large Language Models: A Survey of Methods, Challenges, and Trends","ref_index":154,"is_internal_anchor":false},{"citing_arxiv_id":"2509.00084","citing_title":"Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2508.17784","citing_title":"Proximal Supervised Fine-Tuning","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2509.23330","citing_title":"Structured In-context Environment Scaling for Large Language Model Reasoning","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2510.18184","citing_title":"ActivationReasoning: Logical Reasoning in Latent Activation Spaces","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2511.00066","citing_title":"Sharpness-Guided Group Relative Policy Optimization via Probability Shaping","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14164","citing_title":"Unsteady Metrics and Benchmarking Cultures of AI Model Builders","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20531","citing_title":"Effects of Cross-lingual Evidence in Multilingual Medical Question Answering","ref_index":40,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR","json":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR.json","graph_json":"https://pith.science/api/pith-number/W3AK36ZL7XAB3KYMMIOBI4XGLR/graph.json","events_json":"https://pith.science/api/pith-number/W3AK36ZL7XAB3KYMMIOBI4XGLR/events.json","paper":"https://pith.science/paper/W3AK36ZL"},"agent_actions":{"view_html":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR","download_json":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR.json","view_paper":"https://pith.science/paper/W3AK36ZL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.23123&json=true","fetch_graph":"https://pith.science/api/pith-number/W3AK36ZL7XAB3KYMMIOBI4XGLR/graph.json","fetch_events":"https://pith.science/api/pith-number/W3AK36ZL7XAB3KYMMIOBI4XGLR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR/action/storage_attestation","attest_author":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR/action/author_attestation","sign_citation":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR/action/citation_signature","submit_replication":"https://pith.science/pith/W3AK36ZL7XAB3KYMMIOBI4XGLR/action/replication_record"}},"created_at":"2026-07-05T10:23:24.790812+00:00","updated_at":"2026-07-05T10:23:24.790812+00:00"}