{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:Q2DUIM7XPNPDD62LMAH6D443YA","short_pith_number":"pith:Q2DUIM7X","schema_version":"1.0","canonical_sha256":"86874433f77b5e31fb4b600fe1f39bc00054bf51987d736650fb6687b6b7fca6","source":{"kind":"arxiv","id":"2401.12242","version":1},"attestation_state":"computed","paper":{"title":"BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CR","authors_text":"Bhaskar Ramasubramanian, Bo Li, Fengqing Jiang, Radha Poovendran, Zhen Xiang, Zidi Xiong","submitted_at":"2024-01-20T04:53:35Z","abstract_excerpt":"Large language models (LLMs) are shown to benefit from chain-of-thought (COT) prompting, particularly when tackling tasks that require systematic reasoning processes. On the other hand, COT prompting also poses new vulnerabilities in the form of backdoor attacks, wherein the model will output unintended malicious content under specific backdoor-triggered conditions during inference. Traditional methods for launching backdoor attacks involve either contaminating the training dataset with backdoored instances or directly manipulating the model parameters during deployment. However, these approac"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2401.12242","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CR","submitted_at":"2024-01-20T04:53:35Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"f7580bfe552bc8db765f4a0a27ae1e69172f6e108fc95c8dd8a8927d8c07249f","abstract_canon_sha256":"735cf937b2fb5a109d34a8c766f35fcd61887fb060143c20e320d252f4254394"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:36:27.719224Z","signature_b64":"n6soo7zT+f/cvIhX/8YpADSiaAYHwA7vxhECZkjpwwaAAm1R5A2Ix/VvZcSQGunvuea01CeoZ/XOuYvgI3OzAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"86874433f77b5e31fb4b600fe1f39bc00054bf51987d736650fb6687b6b7fca6","last_reissued_at":"2026-07-05T07:36:27.718721Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:36:27.718721Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CR","authors_text":"Bhaskar Ramasubramanian, Bo Li, Fengqing Jiang, Radha Poovendran, Zhen Xiang, Zidi Xiong","submitted_at":"2024-01-20T04:53:35Z","abstract_excerpt":"Large language models (LLMs) are shown to benefit from chain-of-thought (COT) prompting, particularly when tackling tasks that require systematic reasoning processes. On the other hand, COT prompting also poses new vulnerabilities in the form of backdoor attacks, wherein the model will output unintended malicious content under specific backdoor-triggered conditions during inference. Traditional methods for launching backdoor attacks involve either contaminating the training dataset with backdoored instances or directly manipulating the model parameters during deployment. However, these approac"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2401.12242","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2401.12242/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2401.12242","created_at":"2026-07-05T07:36:27.718782+00:00"},{"alias_kind":"arxiv_version","alias_value":"2401.12242v1","created_at":"2026-07-05T07:36:27.718782+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2401.12242","created_at":"2026-07-05T07:36:27.718782+00:00"},{"alias_kind":"pith_short_12","alias_value":"Q2DUIM7XPNPD","created_at":"2026-07-05T07:36:27.718782+00:00"},{"alias_kind":"pith_short_16","alias_value":"Q2DUIM7XPNPDD62L","created_at":"2026-07-05T07:36:27.718782+00:00"},{"alias_kind":"pith_short_8","alias_value":"Q2DUIM7X","created_at":"2026-07-05T07:36:27.718782+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.26795","citing_title":"What Does Chain-of-Thought Contribute at Probe Time? Evidence for Local Co-Occurrence Activation","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00654","citing_title":"The Invitation Trap: Proactive Availability Backdoor in LLMs via Conversational Induction","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2409.18169","citing_title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","ref_index":163,"is_internal_anchor":false},{"citing_arxiv_id":"2504.02181","citing_title":"A Survey of Scaling in Large Language Model Reasoning","ref_index":227,"is_internal_anchor":false},{"citing_arxiv_id":"2504.05605","citing_title":"ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20641","citing_title":"Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2508.03793","citing_title":"AttnTrace: Contextual Attribution of Prompt Injection and Knowledge Corruption","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2603.25412","citing_title":"Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25247","citing_title":"R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24162","citing_title":"Defusing the Trigger: Plug-and-Play Defense for Backdoored LLMs via Tail-Risk Intrinsic Geometric Smoothing","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21700","citing_title":"Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06840","citing_title":"MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06811","citing_title":"SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02255","citing_title":"On the Privacy of LLMs: An Ablation Study","ref_index":31,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA","json":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA.json","graph_json":"https://pith.science/api/pith-number/Q2DUIM7XPNPDD62LMAH6D443YA/graph.json","events_json":"https://pith.science/api/pith-number/Q2DUIM7XPNPDD62LMAH6D443YA/events.json","paper":"https://pith.science/paper/Q2DUIM7X"},"agent_actions":{"view_html":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA","download_json":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA.json","view_paper":"https://pith.science/paper/Q2DUIM7X","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2401.12242&json=true","fetch_graph":"https://pith.science/api/pith-number/Q2DUIM7XPNPDD62LMAH6D443YA/graph.json","fetch_events":"https://pith.science/api/pith-number/Q2DUIM7XPNPDD62LMAH6D443YA/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA/action/storage_attestation","attest_author":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA/action/author_attestation","sign_citation":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA/action/citation_signature","submit_replication":"https://pith.science/pith/Q2DUIM7XPNPDD62LMAH6D443YA/action/replication_record"}},"created_at":"2026-07-05T07:36:27.718782+00:00","updated_at":"2026-07-05T07:36:27.718782+00:00"}