{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2024:L6TAOGU35W7OSWNFFWRNLZELMO","short_pith_number":"pith:L6TAOGU3","canonical_record":{"source":{"id":"2404.18870","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-04-29T17:00:53Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"a93febbe3013729431051373b52c78011b1c848a24650988794a15bc4bd38e38","abstract_canon_sha256":"b075a20920fe20c029db7c5608e94ec1ae5f0219db0d972befe33439933a3fc5"},"schema_version":"1.0"},"canonical_sha256":"5fa6071a9bedbee959a52da2d5e48b63a145631e5c90aa41a65b050d246942ed","source":{"kind":"arxiv","id":"2404.18870","version":2},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2404.18870","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"arxiv_version","alias_value":"2404.18870v2","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.18870","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"pith_short_12","alias_value":"L6TAOGU35W7O","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"pith_short_16","alias_value":"L6TAOGU35W7OSWNF","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"pith_short_8","alias_value":"L6TAOGU3","created_at":"2026-07-05T09:53:01Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2024:L6TAOGU35W7OSWNFFWRNLZELMO","target":"record","payload":{"canonical_record":{"source":{"id":"2404.18870","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-04-29T17:00:53Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"a93febbe3013729431051373b52c78011b1c848a24650988794a15bc4bd38e38","abstract_canon_sha256":"b075a20920fe20c029db7c5608e94ec1ae5f0219db0d972befe33439933a3fc5"},"schema_version":"1.0"},"canonical_sha256":"5fa6071a9bedbee959a52da2d5e48b63a145631e5c90aa41a65b050d246942ed","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:53:01.003391Z","signature_b64":"R0PsmQR+hVtzfam2xfx8kscRUQmnQpAuUOAO6fzvqPw4mvhYF90PdE98I4IPKKU0riOyGkClFhx8LO2hrX41DQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5fa6071a9bedbee959a52da2d5e48b63a145631e5c90aa41a65b050d246942ed","last_reissued_at":"2026-07-05T09:53:01.002962Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:53:01.002962Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2404.18870","source_version":2,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T09:53:01Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"bx5PYouHGhUm9MKsTpDIVDtNf0ZlMn5VNufGqSGqSAObpqBPvvdPM+sIeu6l4ZXfcDtaFljq1oKtgYRDbW1vDg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-06T04:41:20.206705Z"},"content_sha256":"b7ca4c3afe10f9c33b0e7e0e282030d67e389d2b5c30fc1a75fcc30861452700","schema_version":"1.0","event_id":"sha256:b7ca4c3afe10f9c33b0e7e0e282030d67e389d2b5c30fc1a75fcc30861452700"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2024:L6TAOGU35W7OSWNFFWRNLZELMO","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Aaron J. Li, Himabindu Lakkaraju, Satyapriya Krishna","submitted_at":"2024-04-29T17:00:53Z","abstract_excerpt":"The trustworthiness of Large Language Models (LLMs) refers to the extent to which their outputs are reliable, safe, and ethically aligned, and it has become a crucial consideration alongside their cognitive performance. In practice, Reinforcement Learning From Human Feedback (RLHF) has been widely used to align LLMs with labeled human preferences, but its assumed effect on model trustworthiness hasn't been rigorously evaluated. To bridge this knowledge gap, this study investigates how models aligned with general-purpose preference data perform across five trustworthiness verticals: toxicity, s"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.18870","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.18870/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T09:53:01Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"/gesNEEvrrOihL1YtCpLAtlIqeJLUQfgIcBvjPnNh9i0X/ycgv0I//FUdJLi/HHJWfXEmP29fh3Nt3uggzSRCQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-06T04:41:20.207220Z"},"content_sha256":"de37223bc2bcde185f04797c74650653c6604830b6ef64edcbe1438acd13afdf","schema_version":"1.0","event_id":"sha256:de37223bc2bcde185f04797c74650653c6604830b6ef64edcbe1438acd13afdf"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/L6TAOGU35W7OSWNFFWRNLZELMO/bundle.json","state_url":"https://pith.science/pith/L6TAOGU35W7OSWNFFWRNLZELMO/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/L6TAOGU35W7OSWNFFWRNLZELMO/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-06T04:41:20Z","links":{"resolver":"https://pith.science/pith/L6TAOGU35W7OSWNFFWRNLZELMO","bundle":"https://pith.science/pith/L6TAOGU35W7OSWNFFWRNLZELMO/bundle.json","state":"https://pith.science/pith/L6TAOGU35W7OSWNFFWRNLZELMO/state.json","well_known_bundle":"https://pith.science/.well-known/pith/L6TAOGU35W7OSWNFFWRNLZELMO/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:L6TAOGU35W7OSWNFFWRNLZELMO","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"b075a20920fe20c029db7c5608e94ec1ae5f0219db0d972befe33439933a3fc5","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-04-29T17:00:53Z","title_canon_sha256":"a93febbe3013729431051373b52c78011b1c848a24650988794a15bc4bd38e38"},"schema_version":"1.0","source":{"id":"2404.18870","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2404.18870","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"arxiv_version","alias_value":"2404.18870v2","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.18870","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"pith_short_12","alias_value":"L6TAOGU35W7O","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"pith_short_16","alias_value":"L6TAOGU35W7OSWNF","created_at":"2026-07-05T09:53:01Z"},{"alias_kind":"pith_short_8","alias_value":"L6TAOGU3","created_at":"2026-07-05T09:53:01Z"}],"graph_snapshots":[{"event_id":"sha256:de37223bc2bcde185f04797c74650653c6604830b6ef64edcbe1438acd13afdf","target":"graph","created_at":"2026-07-05T09:53:01Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2404.18870/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"The trustworthiness of Large Language Models (LLMs) refers to the extent to which their outputs are reliable, safe, and ethically aligned, and it has become a crucial consideration alongside their cognitive performance. In practice, Reinforcement Learning From Human Feedback (RLHF) has been widely used to align LLMs with labeled human preferences, but its assumed effect on model trustworthiness hasn't been rigorously evaluated. To bridge this knowledge gap, this study investigates how models aligned with general-purpose preference data perform across five trustworthiness verticals: toxicity, s","authors_text":"Aaron J. Li, Himabindu Lakkaraju, Satyapriya Krishna","cross_cats":["cs.AI"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-04-29T17:00:53Z","title":"More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.18870","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:b7ca4c3afe10f9c33b0e7e0e282030d67e389d2b5c30fc1a75fcc30861452700","target":"record","created_at":"2026-07-05T09:53:01Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"b075a20920fe20c029db7c5608e94ec1ae5f0219db0d972befe33439933a3fc5","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-04-29T17:00:53Z","title_canon_sha256":"a93febbe3013729431051373b52c78011b1c848a24650988794a15bc4bd38e38"},"schema_version":"1.0","source":{"id":"2404.18870","kind":"arxiv","version":2}},"canonical_sha256":"5fa6071a9bedbee959a52da2d5e48b63a145631e5c90aa41a65b050d246942ed","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"5fa6071a9bedbee959a52da2d5e48b63a145631e5c90aa41a65b050d246942ed","first_computed_at":"2026-07-05T09:53:01.002962Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T09:53:01.002962Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"R0PsmQR+hVtzfam2xfx8kscRUQmnQpAuUOAO6fzvqPw4mvhYF90PdE98I4IPKKU0riOyGkClFhx8LO2hrX41DQ==","signature_status":"signed_v1","signed_at":"2026-07-05T09:53:01.003391Z","signed_message":"canonical_sha256_bytes"},"source_id":"2404.18870","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:b7ca4c3afe10f9c33b0e7e0e282030d67e389d2b5c30fc1a75fcc30861452700","sha256:de37223bc2bcde185f04797c74650653c6604830b6ef64edcbe1438acd13afdf"],"state_sha256":"ed00667c056530707742243b8121f7f5e75b0f8caa0fc29b5a140d66f10e14ba"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"aYpLwLHIUXyYqxjAImTqop5gIJroRdgwZXZreBP+yK6M+tBkOFaKH/RwHkdSR8xMp19kuAXfDLcOYG6uRm+dDg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-06T04:41:20.217658Z","bundle_sha256":"f114ae72444661b5f6228e6e5d7577e60919e12514479674a9e5b72cab4d4f87"}}