{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:WGBIFC4UA4HYM4MUVLWOZP2OA7","short_pith_number":"pith:WGBIFC4U","schema_version":"1.0","canonical_sha256":"b182828b94070f867194aaececbf4e07d6b9706ef55de5b159f24543121244d4","source":{"kind":"arxiv","id":"2401.16185","version":4},"attestation_state":"computed","paper":{"title":"LLM4Vuln: A Unified Evaluation Framework for Decoupling and Enhancing LLMs' Vulnerability Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.SE"],"primary_cat":"cs.CR","authors_text":"Daoyuan Wu, Han Liu, Lyuye Zhang, Wei Ma, Yang Liu, Yingjiu Li, Yue Xue, Yuqiang Sun","submitted_at":"2024-01-29T14:32:27Z","abstract_excerpt":"Large language models (LLMs) have demonstrated significant potential in various tasks, including those requiring human-level intelligence, such as vulnerability detection. However, recent efforts to use LLMs for vulnerability detection remain preliminary, as they lack a deep understanding of whether a subject LLM's vulnerability reasoning capability stems from the model itself or from external aids such as knowledge retrieval and tooling support.\n  In this paper, we aim to decouple LLMs' vulnerability reasoning from other capabilities, such as vulnerability knowledge adoption, context informat"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2401.16185","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CR","submitted_at":"2024-01-29T14:32:27Z","cross_cats_sorted":["cs.AI","cs.SE"],"title_canon_sha256":"f560b970c4a3587bf5f4e0d2d40d3ac260ea984b94cd8927bc7aa0bdf41cc7f9","abstract_canon_sha256":"f6b1c5587e94790849325e11d08cbf2543673886bfb9e3382e44cd563bc4afe1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:17:31.860545Z","signature_b64":"1k36JJ0fQPmDbtLASgU257arnSbxY3hScPzNYi8m1uaBjyqI9XRXYRZ1PQaR7GCQ1QbnM/3QakGm5U7EHzc0AQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b182828b94070f867194aaececbf4e07d6b9706ef55de5b159f24543121244d4","last_reissued_at":"2026-07-05T11:17:31.860067Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:17:31.860067Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LLM4Vuln: A Unified Evaluation Framework for Decoupling and Enhancing LLMs' Vulnerability Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.SE"],"primary_cat":"cs.CR","authors_text":"Daoyuan Wu, Han Liu, Lyuye Zhang, Wei Ma, Yang Liu, Yingjiu Li, Yue Xue, Yuqiang Sun","submitted_at":"2024-01-29T14:32:27Z","abstract_excerpt":"Large language models (LLMs) have demonstrated significant potential in various tasks, including those requiring human-level intelligence, such as vulnerability detection. However, recent efforts to use LLMs for vulnerability detection remain preliminary, as they lack a deep understanding of whether a subject LLM's vulnerability reasoning capability stems from the model itself or from external aids such as knowledge retrieval and tooling support.\n  In this paper, we aim to decouple LLMs' vulnerability reasoning from other capabilities, such as vulnerability knowledge adoption, context informat"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2401.16185","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2401.16185/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2401.16185","created_at":"2026-07-05T11:17:31.860124+00:00"},{"alias_kind":"arxiv_version","alias_value":"2401.16185v4","created_at":"2026-07-05T11:17:31.860124+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2401.16185","created_at":"2026-07-05T11:17:31.860124+00:00"},{"alias_kind":"pith_short_12","alias_value":"WGBIFC4UA4HY","created_at":"2026-07-05T11:17:31.860124+00:00"},{"alias_kind":"pith_short_16","alias_value":"WGBIFC4UA4HYM4MU","created_at":"2026-07-05T11:17:31.860124+00:00"},{"alias_kind":"pith_short_8","alias_value":"WGBIFC4U","created_at":"2026-07-05T11:17:31.860124+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":17,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.20502","citing_title":"Calibration Without Comprehension: Diagnosing the Limits of Fine-Tuning LLMs for Vulnerability Detection in Systems Software","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07363","citing_title":"On the Shoulders of Giants: Empowering Automated Smart Contract Auditing via the GiAnt Corpus","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04739","citing_title":"Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03128","citing_title":"Decoupled Smart Contract Audits: Lightweight LLM Framework via Distillation and Aggregation","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00047","citing_title":"Comprehensive AI governance requires addressing non-model gains","ref_index":86,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30587","citing_title":"Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2601.22655","citing_title":"Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21779","citing_title":"FuzzingBrain V2: A Multi-Agent LLM System for Automated Vulnerability Discovery and Reproduction","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21824","citing_title":"Quality-Assured Fuzz Harness Generation via the Four Principles Framework","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20368","citing_title":"Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2510.04056","citing_title":"QuiLL: An LLM-Based Vulnerability Assessment Framework for the Wild","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2409.02977","citing_title":"Large Language Model-Based Agents for Software Engineering: A Survey","ref_index":140,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02548","citing_title":"From Theory to Practice: Code Generation Using LLMs for CAPEC and CWE Frameworks","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11188","citing_title":"Adversarial SQL Injection Generation with LLM-Based Architectures","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01885","citing_title":"QASecClaw: A Multi-Agent LLM Approach for False Positive Reduction in Static Application Security Testing","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05753","citing_title":"An End-to-End Approach for Fixing Concurrency Bugs via SHB-Based Context Extractor","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19031","citing_title":"SAGE: Signal-Amplified Guided Embeddings for LLM-based Vulnerability Detection","ref_index":54,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7","json":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7.json","graph_json":"https://pith.science/api/pith-number/WGBIFC4UA4HYM4MUVLWOZP2OA7/graph.json","events_json":"https://pith.science/api/pith-number/WGBIFC4UA4HYM4MUVLWOZP2OA7/events.json","paper":"https://pith.science/paper/WGBIFC4U"},"agent_actions":{"view_html":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7","download_json":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7.json","view_paper":"https://pith.science/paper/WGBIFC4U","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2401.16185&json=true","fetch_graph":"https://pith.science/api/pith-number/WGBIFC4UA4HYM4MUVLWOZP2OA7/graph.json","fetch_events":"https://pith.science/api/pith-number/WGBIFC4UA4HYM4MUVLWOZP2OA7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7/action/storage_attestation","attest_author":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7/action/author_attestation","sign_citation":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7/action/citation_signature","submit_replication":"https://pith.science/pith/WGBIFC4UA4HYM4MUVLWOZP2OA7/action/replication_record"}},"created_at":"2026-07-05T11:17:31.860124+00:00","updated_at":"2026-07-05T11:17:31.860124+00:00"}