{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:AQJGAKPNJGT4ZRKTEZUO7SOSJM","short_pith_number":"pith:AQJGAKPN","schema_version":"1.0","canonical_sha256":"04126029ed49a7ccc5532668efc9d24b10cd6d3a25e7b61f6b10a82381690837","source":{"kind":"arxiv","id":"2403.08604","version":3},"attestation_state":"computed","paper":{"title":"Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.SE"],"primary_cat":"cs.CL","authors_text":"Binyuan Hui, Bowen Li, Chao Peng, Chen Qian, Dahua Lin, He Du, Jinyang Li, John Yang, Kai Chen, Lin Shi, Ping Yang, Qicheng Zhang, Shunyu Yao, Wenhan Wu, Zhiyin Yu, Ziwei Tang","submitted_at":"2024-03-13T15:13:44Z","abstract_excerpt":"Recent advancements in large language models (LLMs) have significantly enhanced their coding capabilities. However, existing benchmarks predominantly focused on simplified or isolated aspects of coding, such as single-file code generation or repository issue debugging, falling short of measuring the full spectrum of challenges raised by real-world programming activities. In this case study, we explore the performance of LLMs across the entire software development lifecycle with DevEval, encompassing stages including software design, environment setup, implementation, acceptance testing, and un"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.08604","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-03-13T15:13:44Z","cross_cats_sorted":["cs.SE"],"title_canon_sha256":"b6e5e3707a99220bb52ceb8718ad7527026b810aa317584931a361c09f97fde0","abstract_canon_sha256":"ad8b070ac65cd5ded35390ca32b0a65f6d0012c3d2b90f04d289f48270c8c55d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:49:03.284876Z","signature_b64":"1tBbqE+J25xXY0jj6Im2+YMwlCq2N+QKIsVGLOy3HPSYE4iuEeWgacHgwpdWPAX6QgvvegxUwAh6/Kt4pHZZDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"04126029ed49a7ccc5532668efc9d24b10cd6d3a25e7b61f6b10a82381690837","last_reissued_at":"2026-07-05T09:49:03.284353Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:49:03.284353Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.SE"],"primary_cat":"cs.CL","authors_text":"Binyuan Hui, Bowen Li, Chao Peng, Chen Qian, Dahua Lin, He Du, Jinyang Li, John Yang, Kai Chen, Lin Shi, Ping Yang, Qicheng Zhang, Shunyu Yao, Wenhan Wu, Zhiyin Yu, Ziwei Tang","submitted_at":"2024-03-13T15:13:44Z","abstract_excerpt":"Recent advancements in large language models (LLMs) have significantly enhanced their coding capabilities. However, existing benchmarks predominantly focused on simplified or isolated aspects of coding, such as single-file code generation or repository issue debugging, falling short of measuring the full spectrum of challenges raised by real-world programming activities. In this case study, we explore the performance of LLMs across the entire software development lifecycle with DevEval, encompassing stages including software design, environment setup, implementation, acceptance testing, and un"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.08604","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.08604/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.08604","created_at":"2026-07-05T09:49:03.284421+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.08604v3","created_at":"2026-07-05T09:49:03.284421+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.08604","created_at":"2026-07-05T09:49:03.284421+00:00"},{"alias_kind":"pith_short_12","alias_value":"AQJGAKPNJGT4","created_at":"2026-07-05T09:49:03.284421+00:00"},{"alias_kind":"pith_short_16","alias_value":"AQJGAKPNJGT4ZRKT","created_at":"2026-07-05T09:49:03.284421+00:00"},{"alias_kind":"pith_short_8","alias_value":"AQJGAKPN","created_at":"2026-07-05T09:49:03.284421+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22678","citing_title":"RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22678","citing_title":"RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29277","citing_title":"Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2502.06556","citing_title":"MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19901","citing_title":"Can LLMs Produce Better Object-Oriented Designs than Human-Involved Development?","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04009","citing_title":"Benchmarking and Evaluating VLMs for Software Architecture Diagram Understanding","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2404.07972","citing_title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05700","citing_title":"An Empirical Study of Proactive Coding Assistants in Real-World Software Development","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07073","citing_title":"TeamBench: Evaluating Agent Coordination under Enforced Role Separation","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM","json":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM.json","graph_json":"https://pith.science/api/pith-number/AQJGAKPNJGT4ZRKTEZUO7SOSJM/graph.json","events_json":"https://pith.science/api/pith-number/AQJGAKPNJGT4ZRKTEZUO7SOSJM/events.json","paper":"https://pith.science/paper/AQJGAKPN"},"agent_actions":{"view_html":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM","download_json":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM.json","view_paper":"https://pith.science/paper/AQJGAKPN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.08604&json=true","fetch_graph":"https://pith.science/api/pith-number/AQJGAKPNJGT4ZRKTEZUO7SOSJM/graph.json","fetch_events":"https://pith.science/api/pith-number/AQJGAKPNJGT4ZRKTEZUO7SOSJM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM/action/storage_attestation","attest_author":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM/action/author_attestation","sign_citation":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM/action/citation_signature","submit_replication":"https://pith.science/pith/AQJGAKPNJGT4ZRKTEZUO7SOSJM/action/replication_record"}},"created_at":"2026-07-05T09:49:03.284421+00:00","updated_at":"2026-07-05T09:49:03.284421+00:00"}