Empirical evaluation of three LLMs finds prevalent overconfidence in insecure code generation, with security calibration outperforming functional calibration but both degrading in repository-level settings.
Sallm: Security assessment of generated code,
3 Pith papers cite this work, alongside 13 external citations. Polarity classification is still indexing.
years
2026 3representative citing papers
Plainbook makes data-science notebooks natural-language-first by preserving cell descriptions, generating code via AI, enforcing linear execution via a checkpointing kernel, and adding value-centered cell and global tests.
In real-world repositories, AI-assisted and human-written code differ only modestly on code-level metrics, while commit size, stability, duplication, and language-specific security show clearer patterns.
citing papers explorer
-
An Empirical Study of Security Calibration in Large Language Models for Code
Empirical evaluation of three LLMs finds prevalent overconfidence in insecure code generation, with security calibration outperforming functional calibration but both degrading in repository-level settings.
-
Plainbook: Data Science, in Plain Language
Plainbook makes data-science notebooks natural-language-first by preserving cell descriptions, generating code via AI, enforcing linear execution via a checkpointing kernel, and adding value-centered cell and global tests.
-
A Large-Scale Comprehensive Measurement of AI-Generated Code in Real-World Repositories
In real-world repositories, AI-assisted and human-written code differ only modestly on code-level metrics, while commit size, stability, duplication, and language-specific security show clearer patterns.