{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:P7XNVAGUBCYSGQB2X276MP6WRB","short_pith_number":"pith:P7XNVAGU","schema_version":"1.0","canonical_sha256":"7feeda80d408b123403abebfe63fd6885f3a2dfcf938d97d367e78deddc20924","source":{"kind":"arxiv","id":"2406.16306","version":3},"attestation_state":"computed","paper":{"title":"Cascade Reward Sampling for Efficient Decoding-Time Alignment","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.LG","stat.ML"],"primary_cat":"cs.CL","authors_text":"Anamika Lochab, Ananth Grama, Bolian Li, Ruqi Zhang, Yifan Wang","submitted_at":"2024-06-24T04:08:35Z","abstract_excerpt":"Aligning large language models (LLMs) with human preferences is essential for their applications. Recently, decoding-time alignment has emerged as an effective plug-and-play technique that avoids fine-tuning model parameters. This approach retains the general utility of pretrained LLMs but often suffers from significant inefficiencies during decoding, primarily due to wasted token generation and excessive reward evaluations. To address these challenges, we introduce Cascade Reward Sampling (CARDS) to resolve both efficiency bottlenecks in decoding-time alignment. Specifically, we develop a seg"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.16306","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/publicdomain/zero/1.0/","primary_cat":"cs.CL","submitted_at":"2024-06-24T04:08:35Z","cross_cats_sorted":["cs.LG","stat.ML"],"title_canon_sha256":"c0c7e29ba11458aaf3998f060dfdd0c732090b05c232d09a12f5e09e868c2f03","abstract_canon_sha256":"1b6d5c5c696c9bd94332b4c9cd2ab44a0a47a26c9418d9be51247585107227c5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:47:12.380427Z","signature_b64":"CdMdMEoDRcdFBlbPZsGQYJ6mMzD9nzjyHMGL88RP5IWlBRh21Ksl5tyLw4eN6dHEkloVPsyNWIu5lqNuJ5SgDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7feeda80d408b123403abebfe63fd6885f3a2dfcf938d97d367e78deddc20924","last_reissued_at":"2026-07-05T11:47:12.379942Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:47:12.379942Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Cascade Reward Sampling for Efficient Decoding-Time Alignment","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.LG","stat.ML"],"primary_cat":"cs.CL","authors_text":"Anamika Lochab, Ananth Grama, Bolian Li, Ruqi Zhang, Yifan Wang","submitted_at":"2024-06-24T04:08:35Z","abstract_excerpt":"Aligning large language models (LLMs) with human preferences is essential for their applications. Recently, decoding-time alignment has emerged as an effective plug-and-play technique that avoids fine-tuning model parameters. This approach retains the general utility of pretrained LLMs but often suffers from significant inefficiencies during decoding, primarily due to wasted token generation and excessive reward evaluations. To address these challenges, we introduce Cascade Reward Sampling (CARDS) to resolve both efficiency bottlenecks in decoding-time alignment. Specifically, we develop a seg"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.16306","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.16306/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.16306","created_at":"2026-07-05T11:47:12.379999+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.16306v3","created_at":"2026-07-05T11:47:12.379999+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.16306","created_at":"2026-07-05T11:47:12.379999+00:00"},{"alias_kind":"pith_short_12","alias_value":"P7XNVAGUBCYS","created_at":"2026-07-05T11:47:12.379999+00:00"},{"alias_kind":"pith_short_16","alias_value":"P7XNVAGUBCYSGQB2","created_at":"2026-07-05T11:47:12.379999+00:00"},{"alias_kind":"pith_short_8","alias_value":"P7XNVAGU","created_at":"2026-07-05T11:47:12.379999+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01392","citing_title":"Multi-Objective Exploration and Preference Optimization via Mutual Information","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09635","citing_title":"Gradient-Guided Reward Optimization for Inference-time Alignment","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13875","citing_title":"Common-agency Games for Multi-Objective Test-Time Alignment","ref_index":208,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB","json":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB.json","graph_json":"https://pith.science/api/pith-number/P7XNVAGUBCYSGQB2X276MP6WRB/graph.json","events_json":"https://pith.science/api/pith-number/P7XNVAGUBCYSGQB2X276MP6WRB/events.json","paper":"https://pith.science/paper/P7XNVAGU"},"agent_actions":{"view_html":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB","download_json":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB.json","view_paper":"https://pith.science/paper/P7XNVAGU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.16306&json=true","fetch_graph":"https://pith.science/api/pith-number/P7XNVAGUBCYSGQB2X276MP6WRB/graph.json","fetch_events":"https://pith.science/api/pith-number/P7XNVAGUBCYSGQB2X276MP6WRB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB/action/storage_attestation","attest_author":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB/action/author_attestation","sign_citation":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB/action/citation_signature","submit_replication":"https://pith.science/pith/P7XNVAGUBCYSGQB2X276MP6WRB/action/replication_record"}},"created_at":"2026-07-05T11:47:12.379999+00:00","updated_at":"2026-07-05T11:47:12.379999+00:00"}