{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:WTS25IJJGMGJAFJOO6MWK7B5QE","short_pith_number":"pith:WTS25IJJ","schema_version":"1.0","canonical_sha256":"b4e5aea129330c90152e7799657c3d810848a3886ee0a86d3fd955117bd6c140","source":{"kind":"arxiv","id":"2502.13141","version":1},"attestation_state":"computed","paper":{"title":"UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Huawei Lin, Tan Yu, Tong Geng, Weijie Zhao, Yingjie Lao","submitted_at":"2025-02-18T18:59:00Z","abstract_excerpt":"Large Language Models (LLMs) are vulnerable to attacks like prompt injection, backdoor attacks, and adversarial attacks, which manipulate prompts or models to generate harmful outputs. In this paper, departing from traditional deep learning attack paradigms, we explore their intrinsic relationship and collectively term them Prompt Trigger Attacks (PTA). This raises a key question: Can we determine if a prompt is benign or poisoned? To address this, we propose UniGuardian, the first unified defense mechanism designed to detect prompt injection, backdoor attacks, and adversarial attacks in LLMs."},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.13141","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-02-18T18:59:00Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"d1fc827d7cc033b4530c226a5b4d17c183c5ecf25bcc92a9f4a24cf08069a062","abstract_canon_sha256":"c74cd67a99c7b988fa2431332cd582a846978c9cf0119a220256e3d8e9ca8eef"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:16:30.159173Z","signature_b64":"rNyix+zHoCPkoQvFwyyiFYmGp5umWsMkPtXGXjYm3pzkotKV+mJzBFK3qsR9IyhgAUDLofj5jq108rMGYT6MBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b4e5aea129330c90152e7799657c3d810848a3886ee0a86d3fd955117bd6c140","last_reissued_at":"2026-07-05T10:16:30.158688Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:16:30.158688Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Huawei Lin, Tan Yu, Tong Geng, Weijie Zhao, Yingjie Lao","submitted_at":"2025-02-18T18:59:00Z","abstract_excerpt":"Large Language Models (LLMs) are vulnerable to attacks like prompt injection, backdoor attacks, and adversarial attacks, which manipulate prompts or models to generate harmful outputs. In this paper, departing from traditional deep learning attack paradigms, we explore their intrinsic relationship and collectively term them Prompt Trigger Attacks (PTA). This raises a key question: Can we determine if a prompt is benign or poisoned? To address this, we propose UniGuardian, the first unified defense mechanism designed to detect prompt injection, backdoor attacks, and adversarial attacks in LLMs."},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.13141","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.13141/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.13141","created_at":"2026-07-05T10:16:30.158745+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.13141v1","created_at":"2026-07-05T10:16:30.158745+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.13141","created_at":"2026-07-05T10:16:30.158745+00:00"},{"alias_kind":"pith_short_12","alias_value":"WTS25IJJGMGJ","created_at":"2026-07-05T10:16:30.158745+00:00"},{"alias_kind":"pith_short_16","alias_value":"WTS25IJJGMGJAFJO","created_at":"2026-07-05T10:16:30.158745+00:00"},{"alias_kind":"pith_short_8","alias_value":"WTS25IJJ","created_at":"2026-07-05T10:16:30.158745+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27027","citing_title":"ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19159","citing_title":"On the Geometric Limits of Transformer Defenses against Obfuscation Attacks: Latent Embedding Collapse & Performance Robustness Gap","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14604","citing_title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","ref_index":79,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE","json":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE.json","graph_json":"https://pith.science/api/pith-number/WTS25IJJGMGJAFJOO6MWK7B5QE/graph.json","events_json":"https://pith.science/api/pith-number/WTS25IJJGMGJAFJOO6MWK7B5QE/events.json","paper":"https://pith.science/paper/WTS25IJJ"},"agent_actions":{"view_html":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE","download_json":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE.json","view_paper":"https://pith.science/paper/WTS25IJJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.13141&json=true","fetch_graph":"https://pith.science/api/pith-number/WTS25IJJGMGJAFJOO6MWK7B5QE/graph.json","fetch_events":"https://pith.science/api/pith-number/WTS25IJJGMGJAFJOO6MWK7B5QE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE/action/storage_attestation","attest_author":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE/action/author_attestation","sign_citation":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE/action/citation_signature","submit_replication":"https://pith.science/pith/WTS25IJJGMGJAFJOO6MWK7B5QE/action/replication_record"}},"created_at":"2026-07-05T10:16:30.158745+00:00","updated_at":"2026-07-05T10:16:30.158745+00:00"}