{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:6AYQ6KWSX7ICPYK64F3KPHEALA","short_pith_number":"pith:6AYQ6KWS","canonical_record":{"source":{"id":"2502.11555","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-02-17T08:40:30Z","cross_cats_sorted":[],"title_canon_sha256":"534148d9fbe43ce0c619aca9c28589147b53bab1c98b67910fac99f79c349233","abstract_canon_sha256":"923c8d16ddd3f49271af723458c038a8fd7687bf663e7711e25aa30568a02035"},"schema_version":"1.0"},"canonical_sha256":"f0310f2ad2bfd027e15ee176a79c8058298e2def7d39cbe51560a4e19f326295","source":{"kind":"arxiv","id":"2502.11555","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2502.11555","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"arxiv_version","alias_value":"2502.11555v1","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.11555","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"pith_short_12","alias_value":"6AYQ6KWSX7IC","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"pith_short_16","alias_value":"6AYQ6KWSX7ICPYK6","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"pith_short_8","alias_value":"6AYQ6KWS","created_at":"2026-07-05T10:15:30Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:6AYQ6KWSX7ICPYK64F3KPHEALA","target":"record","payload":{"canonical_record":{"source":{"id":"2502.11555","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-02-17T08:40:30Z","cross_cats_sorted":[],"title_canon_sha256":"534148d9fbe43ce0c619aca9c28589147b53bab1c98b67910fac99f79c349233","abstract_canon_sha256":"923c8d16ddd3f49271af723458c038a8fd7687bf663e7711e25aa30568a02035"},"schema_version":"1.0"},"canonical_sha256":"f0310f2ad2bfd027e15ee176a79c8058298e2def7d39cbe51560a4e19f326295","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:15:30.739984Z","signature_b64":"29u8tdiZ/gCzKYuaD6RpZxDF+r1jZGI5asl/ctNK2GQADgp59bcsFc6EpnU+1IOb2Fc1cSSZ/0kyl8TK3fGQCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f0310f2ad2bfd027e15ee176a79c8058298e2def7d39cbe51560a4e19f326295","last_reissued_at":"2026-07-05T10:15:30.739494Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:15:30.739494Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2502.11555","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:15:30Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"5m567ZKqCurtZ30qr6zOs6M30jGLkCe/iwl49wPoz6JNgrtev0goYvcvL3EcU8PzP/lELDJdgc0g8Cm+CgecCA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-04T19:28:48.605273Z"},"content_sha256":"da2dabaa4cc9b0cc3129ebd5c1eae27ce429239c98f88d3c6beff802c9ccd58d","schema_version":"1.0","event_id":"sha256:da2dabaa4cc9b0cc3129ebd5c1eae27ce429239c98f88d3c6beff802c9ccd58d"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:6AYQ6KWSX7ICPYK64F3KPHEALA","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Bo Zheng, Jiaheng Liu, Wenbo Su, Xiangyu Yue, Xiaoyong Zhu, Xingyuan Bu, Yanshi Li, Yilei Jiang, Yingshui Tan","submitted_at":"2025-02-17T08:40:30Z","abstract_excerpt":"Fine-tuning large language models (LLMs) based on human preferences, commonly achieved through reinforcement learning from human feedback (RLHF), has been effective in improving their performance. However, maintaining LLM safety throughout the fine-tuning process remains a significant challenge, as resolving conflicts between safety and helpfulness can be non-trivial. Typically, the safety alignment of LLM is trained on data with safety-related categories. However, our experiments find that naively increasing the scale of safety training data usually leads the LLMs to an ``overly safe'' state "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.11555","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.11555/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:15:30Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"0x/dil4CL9d5vf5ZjFmwdkcXiTVZLW7IkHk9eQSL94DUAov8OX6nMHWDJHr1rpONziOgGPQFcr3Ye2PlZh0EAg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-04T19:28:48.605814Z"},"content_sha256":"8bd95bdf30dc9879cc7afa5e0a9af9b59311d5619cc9bcd292359bf83338bced","schema_version":"1.0","event_id":"sha256:8bd95bdf30dc9879cc7afa5e0a9af9b59311d5619cc9bcd292359bf83338bced"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/6AYQ6KWSX7ICPYK64F3KPHEALA/bundle.json","state_url":"https://pith.science/pith/6AYQ6KWSX7ICPYK64F3KPHEALA/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/6AYQ6KWSX7ICPYK64F3KPHEALA/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-04T19:28:48Z","links":{"resolver":"https://pith.science/pith/6AYQ6KWSX7ICPYK64F3KPHEALA","bundle":"https://pith.science/pith/6AYQ6KWSX7ICPYK64F3KPHEALA/bundle.json","state":"https://pith.science/pith/6AYQ6KWSX7ICPYK64F3KPHEALA/state.json","well_known_bundle":"https://pith.science/.well-known/pith/6AYQ6KWSX7ICPYK64F3KPHEALA/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:6AYQ6KWSX7ICPYK64F3KPHEALA","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"923c8d16ddd3f49271af723458c038a8fd7687bf663e7711e25aa30568a02035","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-02-17T08:40:30Z","title_canon_sha256":"534148d9fbe43ce0c619aca9c28589147b53bab1c98b67910fac99f79c349233"},"schema_version":"1.0","source":{"id":"2502.11555","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2502.11555","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"arxiv_version","alias_value":"2502.11555v1","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.11555","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"pith_short_12","alias_value":"6AYQ6KWSX7IC","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"pith_short_16","alias_value":"6AYQ6KWSX7ICPYK6","created_at":"2026-07-05T10:15:30Z"},{"alias_kind":"pith_short_8","alias_value":"6AYQ6KWS","created_at":"2026-07-05T10:15:30Z"}],"graph_snapshots":[{"event_id":"sha256:8bd95bdf30dc9879cc7afa5e0a9af9b59311d5619cc9bcd292359bf83338bced","target":"graph","created_at":"2026-07-05T10:15:30Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2502.11555/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Fine-tuning large language models (LLMs) based on human preferences, commonly achieved through reinforcement learning from human feedback (RLHF), has been effective in improving their performance. However, maintaining LLM safety throughout the fine-tuning process remains a significant challenge, as resolving conflicts between safety and helpfulness can be non-trivial. Typically, the safety alignment of LLM is trained on data with safety-related categories. However, our experiments find that naively increasing the scale of safety training data usually leads the LLMs to an ``overly safe'' state ","authors_text":"Bo Zheng, Jiaheng Liu, Wenbo Su, Xiangyu Yue, Xiaoyong Zhu, Xingyuan Bu, Yanshi Li, Yilei Jiang, Yingshui Tan","cross_cats":[],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-02-17T08:40:30Z","title":"Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.11555","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:da2dabaa4cc9b0cc3129ebd5c1eae27ce429239c98f88d3c6beff802c9ccd58d","target":"record","created_at":"2026-07-05T10:15:30Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"923c8d16ddd3f49271af723458c038a8fd7687bf663e7711e25aa30568a02035","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-02-17T08:40:30Z","title_canon_sha256":"534148d9fbe43ce0c619aca9c28589147b53bab1c98b67910fac99f79c349233"},"schema_version":"1.0","source":{"id":"2502.11555","kind":"arxiv","version":1}},"canonical_sha256":"f0310f2ad2bfd027e15ee176a79c8058298e2def7d39cbe51560a4e19f326295","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"f0310f2ad2bfd027e15ee176a79c8058298e2def7d39cbe51560a4e19f326295","first_computed_at":"2026-07-05T10:15:30.739494Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:15:30.739494Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"29u8tdiZ/gCzKYuaD6RpZxDF+r1jZGI5asl/ctNK2GQADgp59bcsFc6EpnU+1IOb2Fc1cSSZ/0kyl8TK3fGQCw==","signature_status":"signed_v1","signed_at":"2026-07-05T10:15:30.739984Z","signed_message":"canonical_sha256_bytes"},"source_id":"2502.11555","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:da2dabaa4cc9b0cc3129ebd5c1eae27ce429239c98f88d3c6beff802c9ccd58d","sha256:8bd95bdf30dc9879cc7afa5e0a9af9b59311d5619cc9bcd292359bf83338bced"],"state_sha256":"aff9a633622b6694cad2c45249afa79fff0177c17ef1b1d3778d65f59ae95793"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"ycfIuH1gO/wfoNAyEz1wDm2Wwn6cekd598aYlCwwMjTJD/Bt4nqMeg5oljHgkavFHgeSGjEe2XGH+hEg3hDgBA==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-04T19:28:48.609679Z","bundle_sha256":"d1fb88e9b3479a2af938a1eff7f9a726b75956212f557e8663aa27e9522dd37c"}}