{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2023:MVZXZHDD2IZBKKOKLSKRW4QKU6","short_pith_number":"pith:MVZXZHDD","canonical_record":{"source":{"id":"2311.14543","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-11-24T15:20:36Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"3a6733b9bc7172dc978b08aa1b21f4b57ced2f1adb03cbb660cbe9bce9d65d24","abstract_canon_sha256":"271d362d357e2bda6a883cecf5f8903fb29c1a7079a9c770b9e2069a126c5c5d"},"schema_version":"1.0"},"canonical_sha256":"65737c9c63d2321529ca5c951b720aa79981691f3ed8e685f8388dbf10c75f40","source":{"kind":"arxiv","id":"2311.14543","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2311.14543","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"arxiv_version","alias_value":"2311.14543v1","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.14543","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"pith_short_12","alias_value":"MVZXZHDD2IZB","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"pith_short_16","alias_value":"MVZXZHDD2IZBKKOK","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"pith_short_8","alias_value":"MVZXZHDD","created_at":"2026-07-05T07:16:20Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2023:MVZXZHDD2IZBKKOKLSKRW4QKU6","target":"record","payload":{"canonical_record":{"source":{"id":"2311.14543","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-11-24T15:20:36Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"3a6733b9bc7172dc978b08aa1b21f4b57ced2f1adb03cbb660cbe9bce9d65d24","abstract_canon_sha256":"271d362d357e2bda6a883cecf5f8903fb29c1a7079a9c770b9e2069a126c5c5d"},"schema_version":"1.0"},"canonical_sha256":"65737c9c63d2321529ca5c951b720aa79981691f3ed8e685f8388dbf10c75f40","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:16:20.149366Z","signature_b64":"4wiTOQLqVkCR+df3arP/l4lW2/gR2CjX13AhmBVfjN+0AXNmoKV+yeJ6I8WfweU7kXy3nnefHuJKiWRr3JOECg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"65737c9c63d2321529ca5c951b720aa79981691f3ed8e685f8388dbf10c75f40","last_reissued_at":"2026-07-05T07:16:20.148788Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:16:20.148788Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2311.14543","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T07:16:20Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"+yy6E5amvrczD8rrbXScQW7XhxOQRYLMpocrH2qYItZSjn5/9uUDQng4z5phCtKWR5VD9q1F312lQ/iHlmA3DQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-08T19:01:39.295331Z"},"content_sha256":"4d797ac5d56cb7ad51ea8515bea9959bc8729ab0b0797922628de46b7cb63c33","schema_version":"1.0","event_id":"sha256:4d797ac5d56cb7ad51ea8515bea9959bc8729ab0b0797922628de46b7cb63c33"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2023:MVZXZHDD2IZBKKOKLSKRW4QKU6","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Data-Efficient Alignment of Large Language Models with Human Feedback Through Natural Language","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Aishwarya Padmakumar, Devamanyu Hazarika, Di Jin, Mahdi Namazifar, Shikib Mehri, Sungjin Lee, Yang Liu","submitted_at":"2023-11-24T15:20:36Z","abstract_excerpt":"Learning from human feedback is a prominent technique to align the output of large language models (LLMs) with human expectations. Reinforcement learning from human feedback (RLHF) leverages human preference signals that are in the form of ranking of response pairs to perform this alignment. However, human preference on LLM outputs can come in much richer forms including natural language, which may provide detailed feedback on strengths and weaknesses of a given response. In this work we investigate data efficiency of modeling human feedback that is in natural language. Specifically, we fine-t"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.14543","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.14543/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T07:16:20Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"RY08TPmkcwE8ICie1QQ3GUnnlv/z7IhFhBxDQoPaobN2p3O4TWjCazhNpxa/m8awwheNQGnVWvYosc7tCuwaCQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-08T19:01:39.298090Z"},"content_sha256":"cd8c87d4b19b9478ee27e05a99a759ae44a17d1ad9d79eacfaf74243fd930a96","schema_version":"1.0","event_id":"sha256:cd8c87d4b19b9478ee27e05a99a759ae44a17d1ad9d79eacfaf74243fd930a96"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/MVZXZHDD2IZBKKOKLSKRW4QKU6/bundle.json","state_url":"https://pith.science/pith/MVZXZHDD2IZBKKOKLSKRW4QKU6/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/MVZXZHDD2IZBKKOKLSKRW4QKU6/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-08T19:01:39Z","links":{"resolver":"https://pith.science/pith/MVZXZHDD2IZBKKOKLSKRW4QKU6","bundle":"https://pith.science/pith/MVZXZHDD2IZBKKOKLSKRW4QKU6/bundle.json","state":"https://pith.science/pith/MVZXZHDD2IZBKKOKLSKRW4QKU6/state.json","well_known_bundle":"https://pith.science/.well-known/pith/MVZXZHDD2IZBKKOKLSKRW4QKU6/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2023:MVZXZHDD2IZBKKOKLSKRW4QKU6","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"271d362d357e2bda6a883cecf5f8903fb29c1a7079a9c770b9e2069a126c5c5d","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-11-24T15:20:36Z","title_canon_sha256":"3a6733b9bc7172dc978b08aa1b21f4b57ced2f1adb03cbb660cbe9bce9d65d24"},"schema_version":"1.0","source":{"id":"2311.14543","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2311.14543","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"arxiv_version","alias_value":"2311.14543v1","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.14543","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"pith_short_12","alias_value":"MVZXZHDD2IZB","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"pith_short_16","alias_value":"MVZXZHDD2IZBKKOK","created_at":"2026-07-05T07:16:20Z"},{"alias_kind":"pith_short_8","alias_value":"MVZXZHDD","created_at":"2026-07-05T07:16:20Z"}],"graph_snapshots":[{"event_id":"sha256:cd8c87d4b19b9478ee27e05a99a759ae44a17d1ad9d79eacfaf74243fd930a96","target":"graph","created_at":"2026-07-05T07:16:20Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2311.14543/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Learning from human feedback is a prominent technique to align the output of large language models (LLMs) with human expectations. Reinforcement learning from human feedback (RLHF) leverages human preference signals that are in the form of ranking of response pairs to perform this alignment. However, human preference on LLM outputs can come in much richer forms including natural language, which may provide detailed feedback on strengths and weaknesses of a given response. In this work we investigate data efficiency of modeling human feedback that is in natural language. Specifically, we fine-t","authors_text":"Aishwarya Padmakumar, Devamanyu Hazarika, Di Jin, Mahdi Namazifar, Shikib Mehri, Sungjin Lee, Yang Liu","cross_cats":["cs.AI"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-11-24T15:20:36Z","title":"Data-Efficient Alignment of Large Language Models with Human Feedback Through Natural Language"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.14543","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:4d797ac5d56cb7ad51ea8515bea9959bc8729ab0b0797922628de46b7cb63c33","target":"record","created_at":"2026-07-05T07:16:20Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"271d362d357e2bda6a883cecf5f8903fb29c1a7079a9c770b9e2069a126c5c5d","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-11-24T15:20:36Z","title_canon_sha256":"3a6733b9bc7172dc978b08aa1b21f4b57ced2f1adb03cbb660cbe9bce9d65d24"},"schema_version":"1.0","source":{"id":"2311.14543","kind":"arxiv","version":1}},"canonical_sha256":"65737c9c63d2321529ca5c951b720aa79981691f3ed8e685f8388dbf10c75f40","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"65737c9c63d2321529ca5c951b720aa79981691f3ed8e685f8388dbf10c75f40","first_computed_at":"2026-07-05T07:16:20.148788Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T07:16:20.148788Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"4wiTOQLqVkCR+df3arP/l4lW2/gR2CjX13AhmBVfjN+0AXNmoKV+yeJ6I8WfweU7kXy3nnefHuJKiWRr3JOECg==","signature_status":"signed_v1","signed_at":"2026-07-05T07:16:20.149366Z","signed_message":"canonical_sha256_bytes"},"source_id":"2311.14543","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:4d797ac5d56cb7ad51ea8515bea9959bc8729ab0b0797922628de46b7cb63c33","sha256:cd8c87d4b19b9478ee27e05a99a759ae44a17d1ad9d79eacfaf74243fd930a96"],"state_sha256":"8b13908d601287d2f9079561a20fa1f3988ec7eb2120797d254776eb4ba343d5"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"bBHoWaODbMFdnvcsGvCOnfdDEF4PtY4Ldse3RKFSc+z9S2jwO9yFgaagPLVWaLB7jBi/lCXIeqWvIy5P8JX9Dg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-08T19:01:39.311559Z","bundle_sha256":"7e55a2782aed35b1747ce17580dff6fb3f60f30419aae34c42303703e93cbf72"}}