{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:R24YHWGPIXP5XV2COOKVV22YOJ","short_pith_number":"pith:R24YHWGP","schema_version":"1.0","canonical_sha256":"8eb983d8cf45dfdbd74273955aeb5872661e24a8c6535a354bff542874ce365d","source":{"kind":"arxiv","id":"2312.00029","version":3},"attestation_state":"computed","paper":{"title":"Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CR","authors_text":"Abraham Sanders, Bingsheng Yao, Dakuo Wang, Matthew Pisano, Mei Si, Peter Ly, Tomek Strzalkowski","submitted_at":"2023-11-16T07:31:18Z","abstract_excerpt":"Research into AI alignment has grown considerably since the recent introduction of increasingly capable Large Language Models (LLMs). Unfortunately, modern methods of alignment still fail to fully prevent harmful responses when models are deliberately attacked. Such vulnerabilities can lead to LLMs being manipulated into generating hazardous content: from instructions for creating dangerous materials to inciting violence or endorsing unethical behaviors. To help mitigate this issue, we introduce Bergeron: a framework designed to improve the robustness of LLMs against attacks without any additi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2312.00029","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CR","submitted_at":"2023-11-16T07:31:18Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"98b03f076f9bb97d4d6f5e9fe9e2a7dc185ccaa82a84ec6e53cc37652417edf0","abstract_canon_sha256":"29c11d0a6c7834df2fa4337bb9cf60c2506939a4daf79d4fa738558024b9f0eb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:56:15.434765Z","signature_b64":"2vDvo/fOGEVasp0FsuBaTzLJF8gKeq/6T6kNkhbUwBgyMERIhrQb0dIbgXCp9Bl1IUJITMxrwCzuj9sEPC/EAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8eb983d8cf45dfdbd74273955aeb5872661e24a8c6535a354bff542874ce365d","last_reissued_at":"2026-07-05T08:56:15.434381Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:56:15.434381Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CR","authors_text":"Abraham Sanders, Bingsheng Yao, Dakuo Wang, Matthew Pisano, Mei Si, Peter Ly, Tomek Strzalkowski","submitted_at":"2023-11-16T07:31:18Z","abstract_excerpt":"Research into AI alignment has grown considerably since the recent introduction of increasingly capable Large Language Models (LLMs). Unfortunately, modern methods of alignment still fail to fully prevent harmful responses when models are deliberately attacked. Such vulnerabilities can lead to LLMs being manipulated into generating hazardous content: from instructions for creating dangerous materials to inciting violence or endorsing unethical behaviors. To help mitigate this issue, we introduce Bergeron: a framework designed to improve the robustness of LLMs against attacks without any additi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2312.00029","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2312.00029/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2312.00029","created_at":"2026-07-05T08:56:15.434437+00:00"},{"alias_kind":"arxiv_version","alias_value":"2312.00029v3","created_at":"2026-07-05T08:56:15.434437+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2312.00029","created_at":"2026-07-05T08:56:15.434437+00:00"},{"alias_kind":"pith_short_12","alias_value":"R24YHWGPIXP5","created_at":"2026-07-05T08:56:15.434437+00:00"},{"alias_kind":"pith_short_16","alias_value":"R24YHWGPIXP5XV2C","created_at":"2026-07-05T08:56:15.434437+00:00"},{"alias_kind":"pith_short_8","alias_value":"R24YHWGP","created_at":"2026-07-05T08:56:15.434437+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01277","citing_title":"Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2409.18169","citing_title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","ref_index":119,"is_internal_anchor":false},{"citing_arxiv_id":"2508.04204","citing_title":"ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07655","citing_title":"Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs","ref_index":60,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ","json":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ.json","graph_json":"https://pith.science/api/pith-number/R24YHWGPIXP5XV2COOKVV22YOJ/graph.json","events_json":"https://pith.science/api/pith-number/R24YHWGPIXP5XV2COOKVV22YOJ/events.json","paper":"https://pith.science/paper/R24YHWGP"},"agent_actions":{"view_html":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ","download_json":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ.json","view_paper":"https://pith.science/paper/R24YHWGP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2312.00029&json=true","fetch_graph":"https://pith.science/api/pith-number/R24YHWGPIXP5XV2COOKVV22YOJ/graph.json","fetch_events":"https://pith.science/api/pith-number/R24YHWGPIXP5XV2COOKVV22YOJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ/action/storage_attestation","attest_author":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ/action/author_attestation","sign_citation":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ/action/citation_signature","submit_replication":"https://pith.science/pith/R24YHWGPIXP5XV2COOKVV22YOJ/action/replication_record"}},"created_at":"2026-07-05T08:56:15.434437+00:00","updated_at":"2026-07-05T08:56:15.434437+00:00"}