{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:RKU3JY4YQ73ERIT3X2RZDZLQ4A","short_pith_number":"pith:RKU3JY4Y","schema_version":"1.0","canonical_sha256":"8aa9b4e39887f648a27bbea391e570e02476ab0374d18f034844fd0ff57b486f","source":{"kind":"arxiv","id":"2410.18881","version":2},"attestation_state":"computed","paper":{"title":"Diff-Instruct++: Training One-step Text-to-image Generator Model to Align with Human Preferences","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Weijian Luo","submitted_at":"2024-10-24T16:17:18Z","abstract_excerpt":"One-step text-to-image generator models offer advantages such as swift inference efficiency, flexible architectures, and state-of-the-art generation performance. In this paper, we study the problem of aligning one-step generator models with human preferences for the first time. Inspired by the success of reinforcement learning using human feedback (RLHF), we formulate the alignment problem as maximizing expected human reward functions while adding an Integral Kullback-Leibler divergence term to prevent the generator from diverging. By overcoming technical challenges, we introduce Diff-Instruct"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.18881","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-10-24T16:17:18Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"457ba0670c3eb3a4cc0afdeb24d205d2f8ea91d8aee1fc31ff981cba8fb187bb","abstract_canon_sha256":"7ccf7f888879734ecc03eec65174e298caecc2b7fff325afd4ab49cf55d217c2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:16:30.110072Z","signature_b64":"vOtQqAaNKTaquGGe9IE6nYwofWcx8F6L7y9wv60SpVZUIMccwA8ZII23CxolXyO07GpgwJLTPka3qwzlUiOLAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8aa9b4e39887f648a27bbea391e570e02476ab0374d18f034844fd0ff57b486f","last_reissued_at":"2026-07-05T11:16:30.109509Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:16:30.109509Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Diff-Instruct++: Training One-step Text-to-image Generator Model to Align with Human Preferences","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Weijian Luo","submitted_at":"2024-10-24T16:17:18Z","abstract_excerpt":"One-step text-to-image generator models offer advantages such as swift inference efficiency, flexible architectures, and state-of-the-art generation performance. In this paper, we study the problem of aligning one-step generator models with human preferences for the first time. Inspired by the success of reinforcement learning using human feedback (RLHF), we formulate the alignment problem as maximizing expected human reward functions while adding an Integral Kullback-Leibler divergence term to prevent the generator from diverging. By overcoming technical challenges, we introduce Diff-Instruct"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.18881","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.18881/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.18881","created_at":"2026-07-05T11:16:30.109578+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.18881v2","created_at":"2026-07-05T11:16:30.109578+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.18881","created_at":"2026-07-05T11:16:30.109578+00:00"},{"alias_kind":"pith_short_12","alias_value":"RKU3JY4YQ73E","created_at":"2026-07-05T11:16:30.109578+00:00"},{"alias_kind":"pith_short_16","alias_value":"RKU3JY4YQ73ERIT3","created_at":"2026-07-05T11:16:30.109578+00:00"},{"alias_kind":"pith_short_8","alias_value":"RKU3JY4Y","created_at":"2026-07-05T11:16:30.109578+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.05204","citing_title":"D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25042","citing_title":"Unbiased Diffusion Variational Inversion via Principled Posterior Matching","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26108","citing_title":"Reinforcing Few-step Generators via Reward-Tilted Distribution Matching","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05204","citing_title":"D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2512.04677","citing_title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05204","citing_title":"D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models","ref_index":57,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A","json":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A.json","graph_json":"https://pith.science/api/pith-number/RKU3JY4YQ73ERIT3X2RZDZLQ4A/graph.json","events_json":"https://pith.science/api/pith-number/RKU3JY4YQ73ERIT3X2RZDZLQ4A/events.json","paper":"https://pith.science/paper/RKU3JY4Y"},"agent_actions":{"view_html":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A","download_json":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A.json","view_paper":"https://pith.science/paper/RKU3JY4Y","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.18881&json=true","fetch_graph":"https://pith.science/api/pith-number/RKU3JY4YQ73ERIT3X2RZDZLQ4A/graph.json","fetch_events":"https://pith.science/api/pith-number/RKU3JY4YQ73ERIT3X2RZDZLQ4A/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A/action/storage_attestation","attest_author":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A/action/author_attestation","sign_citation":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A/action/citation_signature","submit_replication":"https://pith.science/pith/RKU3JY4YQ73ERIT3X2RZDZLQ4A/action/replication_record"}},"created_at":"2026-07-05T11:16:30.109578+00:00","updated_at":"2026-07-05T11:16:30.109578+00:00"}