{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:4BLI4QB2N4SPKCRVR4HZA7UADX","short_pith_number":"pith:4BLI4QB2","schema_version":"1.0","canonical_sha256":"e0568e403a6f24f50a358f0f907e801dd86d2ac535abadce9dea306b7e6f841a","source":{"kind":"arxiv","id":"2407.14622","version":1},"attestation_state":"computed","paper":{"title":"BOND: Aligning LLMs with Best-of-N Distillation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Abe Friesen, Alexandre Ram\\'e, Aliaksei Severyn, Am\\'elie H\\'eliou, Andrea Michi, Bobak Shariari, Danila Sinopalnikov, Geoffrey Cideron, Johan Ferret, L\\'eonard Hussenot, Matt Hoffman, Nikola Momchev, Nino Vieillard, Olivier Bachem, Pier Giuseppe Sessa, Piotr Stanczyk, Robert Dadashi, Sabela Ramos, Sarah Perrin, Sertan Girgin","submitted_at":"2024-07-19T18:38:25Z","abstract_excerpt":"Reinforcement learning from human feedback (RLHF) is a key driver of quality and safety in state-of-the-art large language models. Yet, a surprisingly simple and strong inference-time strategy is Best-of-N sampling that selects the best generation among N candidates. In this paper, we propose Best-of-N Distillation (BOND), a novel RLHF algorithm that seeks to emulate Best-of-N but without its significant computational overhead at inference time. Specifically, BOND is a distribution matching algorithm that forces the distribution of generations from the policy to get closer to the Best-of-N dis"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.14622","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-19T18:38:25Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"3f06d7f58bc9fdf81bfb8a085439620764ed1f76ffe881aab1bfd048e41b0e70","abstract_canon_sha256":"1b7b9b1e39666ede9e384d7855a5cca977645ecf46da487579b6ff6728a584dc"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:46:31.257897Z","signature_b64":"4s0aeZIsvibWpTg6Hh6VIzxMprkJoBVFAzZiohLU/30wgf9PcxKUHKbBOzkW8fQa+dkDNuq2orGIPH8u9vM8Bg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e0568e403a6f24f50a358f0f907e801dd86d2ac535abadce9dea306b7e6f841a","last_reissued_at":"2026-07-05T08:46:31.257351Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:46:31.257351Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"BOND: Aligning LLMs with Best-of-N Distillation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Abe Friesen, Alexandre Ram\\'e, Aliaksei Severyn, Am\\'elie H\\'eliou, Andrea Michi, Bobak Shariari, Danila Sinopalnikov, Geoffrey Cideron, Johan Ferret, L\\'eonard Hussenot, Matt Hoffman, Nikola Momchev, Nino Vieillard, Olivier Bachem, Pier Giuseppe Sessa, Piotr Stanczyk, Robert Dadashi, Sabela Ramos, Sarah Perrin, Sertan Girgin","submitted_at":"2024-07-19T18:38:25Z","abstract_excerpt":"Reinforcement learning from human feedback (RLHF) is a key driver of quality and safety in state-of-the-art large language models. Yet, a surprisingly simple and strong inference-time strategy is Best-of-N sampling that selects the best generation among N candidates. In this paper, we propose Best-of-N Distillation (BOND), a novel RLHF algorithm that seeks to emulate Best-of-N but without its significant computational overhead at inference time. Specifically, BOND is a distribution matching algorithm that forces the distribution of generations from the policy to get closer to the Best-of-N dis"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.14622","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.14622/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.14622","created_at":"2026-07-05T08:46:31.257420+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.14622v1","created_at":"2026-07-05T08:46:31.257420+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.14622","created_at":"2026-07-05T08:46:31.257420+00:00"},{"alias_kind":"pith_short_12","alias_value":"4BLI4QB2N4SP","created_at":"2026-07-05T08:46:31.257420+00:00"},{"alias_kind":"pith_short_16","alias_value":"4BLI4QB2N4SPKCRV","created_at":"2026-07-05T08:46:31.257420+00:00"},{"alias_kind":"pith_short_8","alias_value":"4BLI4QB2","created_at":"2026-07-05T08:46:31.257420+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.22389","citing_title":"Unified Data Selection for LLM Reasoning","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17295","citing_title":"DISA: Offline Importance Sampling for Distribution-Matching LLM-RL","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04559","citing_title":"Beyond Static Best-of-N: Bayesian List-wise Alignment for LLM-based Recommendation","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01194","citing_title":"VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07105","citing_title":"Theoretical Limits of Language Model Alignment","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20623","citing_title":"RSRCC: A Remote Sensing Regional Change Comprehension Benchmark Constructed via Retrieval-Augmented Best-of-N Ranking","ref_index":30,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX","json":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX.json","graph_json":"https://pith.science/api/pith-number/4BLI4QB2N4SPKCRVR4HZA7UADX/graph.json","events_json":"https://pith.science/api/pith-number/4BLI4QB2N4SPKCRVR4HZA7UADX/events.json","paper":"https://pith.science/paper/4BLI4QB2"},"agent_actions":{"view_html":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX","download_json":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX.json","view_paper":"https://pith.science/paper/4BLI4QB2","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.14622&json=true","fetch_graph":"https://pith.science/api/pith-number/4BLI4QB2N4SPKCRVR4HZA7UADX/graph.json","fetch_events":"https://pith.science/api/pith-number/4BLI4QB2N4SPKCRVR4HZA7UADX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX/action/storage_attestation","attest_author":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX/action/author_attestation","sign_citation":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX/action/citation_signature","submit_replication":"https://pith.science/pith/4BLI4QB2N4SPKCRVR4HZA7UADX/action/replication_record"}},"created_at":"2026-07-05T08:46:31.257420+00:00","updated_at":"2026-07-05T08:46:31.257420+00:00"}