{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NY7F2D2LU55OXI76BFS5KRPQR2","short_pith_number":"pith:NY7F2D2L","schema_version":"1.0","canonical_sha256":"6e3e5d0f4ba77aeba3fe0965d545f08e8eb9727da8fb25e06e688ccd3b47a3c2","source":{"kind":"arxiv","id":"2504.15585","version":4},"attestation_state":"computed","paper":{"title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.CR","authors_text":"Bhavya Kailkhura, Bo An, Chenghao Li, Chengwei Liu, Chenlong Yin, Chongye Guo, Cong Wu, Dacheng Tao, Donghai Hong, Dongrui Liu, Dongxia Wang, Fanci Meng, Fan Zhang, Felix Juefei-Xu, Guancheng Wan, Guibin Zhang, Guowen Xu, Hanjun Luo, Haolang Lu, Hao Wu, Heng Chang, Hongwei Li, Hui Xiong, Jen-tse Huang, Jiahao Wu, Jiaheng Zhang, Jiaming Ji, Jiawei Li, Jie Zhang, Jindong Gu, Jing Chen, Jingyi Wang, Jinhu Fu, Joey Tianyi Zhou, Junfeng Fang, Junlin Wu, Jun Sun, Junyuan Mao, Kai Wang, Ke Tang, Kun Wang, Lei Bai, Liang Lin, Liang Pang, Lingjuan Lyu, Luu Anh Tuan, Miao Yu, Minghe Wang, Mohit Bansal, Ningyu Zhang, Philip S. Yu, Qiankun Li, Qing Guo, Qing Li, Qingsong Wen, Qiufeng Wang, Shicheng Xu, Shiqian Zhao, Shirui Pan, Tianlin Li, Tianlong Chen, Tianwei Zhang, Weifei Jin, Weisong Sun, Wei Wang, Wenjie Qu, Wenke Huang, Wenxuan Wang, Wenyuan Xu, Xiang Wang, Xiaofeng Wang, Xiaojun Jia, Xiaolong Jin, Xiao Wang, Xinfeng Li, Xingjun Ma, Xinye Cao, Xinyu Deng, Xinyun Zhou, Xuming Hu, Yalan Qin, Yang Liu, Yanhui Li, Yanwei Yue, Yaodong Yang, Yibo Yan, Yi Ding, Yifan Jiang, Yifan Zhang, Yihao Huang, Yiming Li, Yingxin Lai, Yi Yu, Yizhou Sun, Yue Liu, Yufei Guo, Yu-Gang Jiang, Yuval Elovici, Yu Wang, Zhaoxin Fan, Zhenhong Zhou, Zhihao Xu, Zitong Yu","submitted_at":"2025-04-22T05:02:49Z","abstract_excerpt":"The remarkable success of Large Language Models (LLMs) has illuminated a promising pathway toward achieving Artificial General Intelligence for both academic and industrial communities, owing to their unprecedented performance across various applications. As LLMs continue to gain prominence in both research and commercial domains, their security and safety implications have become a growing concern, not only for researchers and corporations but also for every nation. Currently, existing surveys on LLM safety primarily focus on specific stages of the LLM lifecycle, e.g., deployment phase or fin"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.15585","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CR","submitted_at":"2025-04-22T05:02:49Z","cross_cats_sorted":["cs.AI","cs.CL","cs.LG"],"title_canon_sha256":"d5dc61c7495c53cc9374901a158ecf770eb4716f1fa689c441f944209829a6f6","abstract_canon_sha256":"cf3c65baeb70e3fc6588cb6896419ad1a3fd192a690792e3ca173a62436f44fe"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:18:20.954884Z","signature_b64":"5k81be8qnfLh3riHgFuYowgXLUlgjay/lEmnxokriCiQ24Bw4+YA0pVSNYCsyvPCXfImUEUlzZWgEW9kEvL5CQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6e3e5d0f4ba77aeba3fe0965d545f08e8eb9727da8fb25e06e688ccd3b47a3c2","last_reissued_at":"2026-07-05T11:18:20.954243Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:18:20.954243Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.CR","authors_text":"Bhavya Kailkhura, Bo An, Chenghao Li, Chengwei Liu, Chenlong Yin, Chongye Guo, Cong Wu, Dacheng Tao, Donghai Hong, Dongrui Liu, Dongxia Wang, Fanci Meng, Fan Zhang, Felix Juefei-Xu, Guancheng Wan, Guibin Zhang, Guowen Xu, Hanjun Luo, Haolang Lu, Hao Wu, Heng Chang, Hongwei Li, Hui Xiong, Jen-tse Huang, Jiahao Wu, Jiaheng Zhang, Jiaming Ji, Jiawei Li, Jie Zhang, Jindong Gu, Jing Chen, Jingyi Wang, Jinhu Fu, Joey Tianyi Zhou, Junfeng Fang, Junlin Wu, Jun Sun, Junyuan Mao, Kai Wang, Ke Tang, Kun Wang, Lei Bai, Liang Lin, Liang Pang, Lingjuan Lyu, Luu Anh Tuan, Miao Yu, Minghe Wang, Mohit Bansal, Ningyu Zhang, Philip S. Yu, Qiankun Li, Qing Guo, Qing Li, Qingsong Wen, Qiufeng Wang, Shicheng Xu, Shiqian Zhao, Shirui Pan, Tianlin Li, Tianlong Chen, Tianwei Zhang, Weifei Jin, Weisong Sun, Wei Wang, Wenjie Qu, Wenke Huang, Wenxuan Wang, Wenyuan Xu, Xiang Wang, Xiaofeng Wang, Xiaojun Jia, Xiaolong Jin, Xiao Wang, Xinfeng Li, Xingjun Ma, Xinye Cao, Xinyu Deng, Xinyun Zhou, Xuming Hu, Yalan Qin, Yang Liu, Yanhui Li, Yanwei Yue, Yaodong Yang, Yibo Yan, Yi Ding, Yifan Jiang, Yifan Zhang, Yihao Huang, Yiming Li, Yingxin Lai, Yi Yu, Yizhou Sun, Yue Liu, Yufei Guo, Yu-Gang Jiang, Yuval Elovici, Yu Wang, Zhaoxin Fan, Zhenhong Zhou, Zhihao Xu, Zitong Yu","submitted_at":"2025-04-22T05:02:49Z","abstract_excerpt":"The remarkable success of Large Language Models (LLMs) has illuminated a promising pathway toward achieving Artificial General Intelligence for both academic and industrial communities, owing to their unprecedented performance across various applications. As LLMs continue to gain prominence in both research and commercial domains, their security and safety implications have become a growing concern, not only for researchers and corporations but also for every nation. Currently, existing surveys on LLM safety primarily focus on specific stages of the LLM lifecycle, e.g., deployment phase or fin"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.15585","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.15585/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.15585","created_at":"2026-07-05T11:18:20.954340+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.15585v4","created_at":"2026-07-05T11:18:20.954340+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.15585","created_at":"2026-07-05T11:18:20.954340+00:00"},{"alias_kind":"pith_short_12","alias_value":"NY7F2D2LU55O","created_at":"2026-07-05T11:18:20.954340+00:00"},{"alias_kind":"pith_short_16","alias_value":"NY7F2D2LU55OXI76","created_at":"2026-07-05T11:18:20.954340+00:00"},{"alias_kind":"pith_short_8","alias_value":"NY7F2D2L","created_at":"2026-07-05T11:18:20.954340+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":23,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25442","citing_title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12474","citing_title":"SAIGuard: Communication-State Simulation for Proactive Defense of LLM Multi-Agent Systems","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05660","citing_title":"Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02282","citing_title":"POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26106","citing_title":"Reducing Conversational Escalation in Large Language Model Dialogue with Nonviolent Communication Constraints","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29239","citing_title":"Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25603","citing_title":"Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29396","citing_title":"Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10749","citing_title":"Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Evaluation","ref_index":182,"is_internal_anchor":false},{"citing_arxiv_id":"2511.12710","citing_title":"Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20266","citing_title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20641","citing_title":"Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16282","citing_title":"Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2509.26100","citing_title":"AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16321","citing_title":"LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review","ref_index":63,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11679","citing_title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12529","citing_title":"BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11679","citing_title":"Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27861","citing_title":"TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01899","citing_title":"Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19083","citing_title":"ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety","ref_index":178,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11934","citing_title":"BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11309","citing_title":"The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2","json":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2.json","graph_json":"https://pith.science/api/pith-number/NY7F2D2LU55OXI76BFS5KRPQR2/graph.json","events_json":"https://pith.science/api/pith-number/NY7F2D2LU55OXI76BFS5KRPQR2/events.json","paper":"https://pith.science/paper/NY7F2D2L"},"agent_actions":{"view_html":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2","download_json":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2.json","view_paper":"https://pith.science/paper/NY7F2D2L","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.15585&json=true","fetch_graph":"https://pith.science/api/pith-number/NY7F2D2LU55OXI76BFS5KRPQR2/graph.json","fetch_events":"https://pith.science/api/pith-number/NY7F2D2LU55OXI76BFS5KRPQR2/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2/action/storage_attestation","attest_author":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2/action/author_attestation","sign_citation":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2/action/citation_signature","submit_replication":"https://pith.science/pith/NY7F2D2LU55OXI76BFS5KRPQR2/action/replication_record"}},"created_at":"2026-07-05T11:18:20.954340+00:00","updated_at":"2026-07-05T11:18:20.954340+00:00"}