{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:TQU67CX6RYKIZAYKO3UDYVGVFC","short_pith_number":"pith:TQU67CX6","schema_version":"1.0","canonical_sha256":"9c29ef8afe8e148c830a76e83c54d528ae6501df5c142fa8c6b48c1a5d2a04e9","source":{"kind":"arxiv","id":"2407.05557","version":1},"attestation_state":"computed","paper":{"title":"$R^2$-Guard: Robust Reasoning Enabled LLM Guardrail via Knowledge-Enhanced Logical Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Bo Li, Mintong Kang","submitted_at":"2024-07-08T02:15:29Z","abstract_excerpt":"As LLMs become increasingly prevalent across various applications, it is critical to establish safety guardrails to moderate input/output content of LLMs. Existing guardrail models treat various safety categories independently and fail to explicitly capture the intercorrelations among them. This has led to limitations such as ineffectiveness due to inadequate training on long-tail data from correlated safety categories, susceptibility to jailbreaking attacks, and inflexibility regarding new safety categories. To address these limitations, we propose $R^2$-Guard, a robust reasoning enabled LLM "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.05557","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2024-07-08T02:15:29Z","cross_cats_sorted":[],"title_canon_sha256":"01a93931359a955e7a2c41d9af8f63fd07af413683b56efe0a516e2e64810662","abstract_canon_sha256":"ecb7a560689c104369915e898914acca07df250990d5cd213ea63384e8d12979"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:41:15.167124Z","signature_b64":"iFgmjfApezkS/wETq+TSOgJC5FPNmxu/kuqDRv8gqAjPuGcTXWRdqngFnVvdDAfacHlZux+S28HkPtTo+dArAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9c29ef8afe8e148c830a76e83c54d528ae6501df5c142fa8c6b48c1a5d2a04e9","last_reissued_at":"2026-07-05T08:41:15.166579Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:41:15.166579Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"$R^2$-Guard: Robust Reasoning Enabled LLM Guardrail via Knowledge-Enhanced Logical Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Bo Li, Mintong Kang","submitted_at":"2024-07-08T02:15:29Z","abstract_excerpt":"As LLMs become increasingly prevalent across various applications, it is critical to establish safety guardrails to moderate input/output content of LLMs. Existing guardrail models treat various safety categories independently and fail to explicitly capture the intercorrelations among them. This has led to limitations such as ineffectiveness due to inadequate training on long-tail data from correlated safety categories, susceptibility to jailbreaking attacks, and inflexibility regarding new safety categories. To address these limitations, we propose $R^2$-Guard, a robust reasoning enabled LLM "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.05557","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.05557/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.05557","created_at":"2026-07-05T08:41:15.166653+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.05557v1","created_at":"2026-07-05T08:41:15.166653+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.05557","created_at":"2026-07-05T08:41:15.166653+00:00"},{"alias_kind":"pith_short_12","alias_value":"TQU67CX6RYKI","created_at":"2026-07-05T08:41:15.166653+00:00"},{"alias_kind":"pith_short_16","alias_value":"TQU67CX6RYKIZAYK","created_at":"2026-07-05T08:41:15.166653+00:00"},{"alias_kind":"pith_short_8","alias_value":"TQU67CX6","created_at":"2026-07-05T08:41:15.166653+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.01513","citing_title":"Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17329","citing_title":"LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2510.23883","citing_title":"Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges","ref_index":208,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02187","citing_title":"Rewriting the Response Path: Silent Tampering and Provider-Signed Defense in BYOK LLM Agents","ref_index":103,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC","json":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC.json","graph_json":"https://pith.science/api/pith-number/TQU67CX6RYKIZAYKO3UDYVGVFC/graph.json","events_json":"https://pith.science/api/pith-number/TQU67CX6RYKIZAYKO3UDYVGVFC/events.json","paper":"https://pith.science/paper/TQU67CX6"},"agent_actions":{"view_html":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC","download_json":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC.json","view_paper":"https://pith.science/paper/TQU67CX6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.05557&json=true","fetch_graph":"https://pith.science/api/pith-number/TQU67CX6RYKIZAYKO3UDYVGVFC/graph.json","fetch_events":"https://pith.science/api/pith-number/TQU67CX6RYKIZAYKO3UDYVGVFC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC/action/storage_attestation","attest_author":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC/action/author_attestation","sign_citation":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC/action/citation_signature","submit_replication":"https://pith.science/pith/TQU67CX6RYKIZAYKO3UDYVGVFC/action/replication_record"}},"created_at":"2026-07-05T08:41:15.166653+00:00","updated_at":"2026-07-05T08:41:15.166653+00:00"}