{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:5LKNQQHX656RS2VVLPUAYPTJM4","short_pith_number":"pith:5LKNQQHX","schema_version":"1.0","canonical_sha256":"ead4d840f7f77d196ab55be80c3e696738c9c6788307646fa34085c2cd0e338b","source":{"kind":"arxiv","id":"2503.23145","version":2},"attestation_state":"computed","paper":{"title":"CodeARC: Benchmarking Reasoning Capabilities of LLM Agents for Inductive Program Synthesis","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.PL","authors_text":"Alex Aiken, Anjiang Wei, Jiannan Cao, Kai Yan, Ke Wang, Naveen Kannan, Tarun Suresh, Thiago S. F. X. Teixeira, Yuheng Wu","submitted_at":"2025-03-29T16:50:39Z","abstract_excerpt":"Inductive program synthesis, or programming by example, requires synthesizing functions from input-output examples that generalize to unseen inputs. While large language model agents have shown promise in programming tasks guided by natural language, their ability to perform inductive program synthesis is underexplored. Existing evaluation protocols rely on static sets of examples and held-out tests, offering no feedback when synthesized functions are incorrect and failing to reflect real-world scenarios such as reverse engineering. We propose CodeARC, the Code Abstraction and Reasoning Challe"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.23145","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.PL","submitted_at":"2025-03-29T16:50:39Z","cross_cats_sorted":["cs.AI","cs.CL","cs.LG"],"title_canon_sha256":"d64c637e507ecec60e28f76e4ba0e796eac5d2dda907266442ebd5c3d2dc16ac","abstract_canon_sha256":"b06512758fd25cef87ceae8b7a43adb44c980c82964446ae4eaadf29b00d269d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:50:34.187471Z","signature_b64":"9VYR0HxaQq1vG8XjmJSNa1Zs1WrdC/w80xptCXMjYL/0FguqmEYFBZXmYrMN+jtHiIkAdFYEd15tYdnrFdIXBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ead4d840f7f77d196ab55be80c3e696738c9c6788307646fa34085c2cd0e338b","last_reissued_at":"2026-07-05T11:50:34.187066Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:50:34.187066Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CodeARC: Benchmarking Reasoning Capabilities of LLM Agents for Inductive Program Synthesis","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.PL","authors_text":"Alex Aiken, Anjiang Wei, Jiannan Cao, Kai Yan, Ke Wang, Naveen Kannan, Tarun Suresh, Thiago S. F. X. Teixeira, Yuheng Wu","submitted_at":"2025-03-29T16:50:39Z","abstract_excerpt":"Inductive program synthesis, or programming by example, requires synthesizing functions from input-output examples that generalize to unseen inputs. While large language model agents have shown promise in programming tasks guided by natural language, their ability to perform inductive program synthesis is underexplored. Existing evaluation protocols rely on static sets of examples and held-out tests, offering no feedback when synthesized functions are incorrect and failing to reflect real-world scenarios such as reverse engineering. We propose CodeARC, the Code Abstraction and Reasoning Challe"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.23145","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.23145/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.23145","created_at":"2026-07-05T11:50:34.187119+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.23145v2","created_at":"2026-07-05T11:50:34.187119+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.23145","created_at":"2026-07-05T11:50:34.187119+00:00"},{"alias_kind":"pith_short_12","alias_value":"5LKNQQHX656R","created_at":"2026-07-05T11:50:34.187119+00:00"},{"alias_kind":"pith_short_16","alias_value":"5LKNQQHX656RS2VV","created_at":"2026-07-05T11:50:34.187119+00:00"},{"alias_kind":"pith_short_8","alias_value":"5LKNQQHX","created_at":"2026-07-05T11:50:34.187119+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11470","citing_title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","ref_index":253,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03546","citing_title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","ref_index":16,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4","json":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4.json","graph_json":"https://pith.science/api/pith-number/5LKNQQHX656RS2VVLPUAYPTJM4/graph.json","events_json":"https://pith.science/api/pith-number/5LKNQQHX656RS2VVLPUAYPTJM4/events.json","paper":"https://pith.science/paper/5LKNQQHX"},"agent_actions":{"view_html":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4","download_json":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4.json","view_paper":"https://pith.science/paper/5LKNQQHX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.23145&json=true","fetch_graph":"https://pith.science/api/pith-number/5LKNQQHX656RS2VVLPUAYPTJM4/graph.json","fetch_events":"https://pith.science/api/pith-number/5LKNQQHX656RS2VVLPUAYPTJM4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4/action/storage_attestation","attest_author":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4/action/author_attestation","sign_citation":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4/action/citation_signature","submit_replication":"https://pith.science/pith/5LKNQQHX656RS2VVLPUAYPTJM4/action/replication_record"}},"created_at":"2026-07-05T11:50:34.187119+00:00","updated_at":"2026-07-05T11:50:34.187119+00:00"}