{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:WZ33RSHDXJ64YI5E2JDHFSLACW","short_pith_number":"pith:WZ33RSHD","schema_version":"1.0","canonical_sha256":"b677b8c8e3ba7dcc23a4d24672c96015a7d0529a51eef4856ed68cc0da0507f4","source":{"kind":"arxiv","id":"2409.04832","version":2},"attestation_state":"computed","paper":{"title":"Reward-Directed Score-Based Diffusion Models via q-Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","math.OC"],"primary_cat":"cs.LG","authors_text":"Jiale Zha, Xuefeng Gao, Xun Yu Zhou","submitted_at":"2024-09-07T13:55:45Z","abstract_excerpt":"We propose a new reinforcement learning (RL) formulation for training continuous-time score-based diffusion models for generative AI to generate samples that maximize reward functions while keeping the generated distributions close to the unknown target data distributions. Different from most existing studies, ours does not involve any pretrained model for the unknown score functions of the noise-perturbed data distributions, nor does it attempt to learn the score functions. Instead, we formulate the problem as entropy-regularized continuous-time RL and show that the optimal stochastic policy "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.04832","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-09-07T13:55:45Z","cross_cats_sorted":["cs.AI","math.OC"],"title_canon_sha256":"b40b8a8041d9263fb771767fbbd59dbba3da93acb53336aef501d31708f9f5a8","abstract_canon_sha256":"2f7927240eadb768fdc5c3cfd60c9442821827506164c990f109089ae2721a75"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:51:17.273157Z","signature_b64":"aSvWYaKCwDUimSuNv9KylhT5y8Xfpk5Jc2vAlgYecerfERFDOtpcTi/BPtL+KiQDkKdpIi6ANJKmhyg3F4IfDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b677b8c8e3ba7dcc23a4d24672c96015a7d0529a51eef4856ed68cc0da0507f4","last_reissued_at":"2026-07-05T11:51:17.272660Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:51:17.272660Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Reward-Directed Score-Based Diffusion Models via q-Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","math.OC"],"primary_cat":"cs.LG","authors_text":"Jiale Zha, Xuefeng Gao, Xun Yu Zhou","submitted_at":"2024-09-07T13:55:45Z","abstract_excerpt":"We propose a new reinforcement learning (RL) formulation for training continuous-time score-based diffusion models for generative AI to generate samples that maximize reward functions while keeping the generated distributions close to the unknown target data distributions. Different from most existing studies, ours does not involve any pretrained model for the unknown score functions of the noise-perturbed data distributions, nor does it attempt to learn the score functions. Instead, we formulate the problem as entropy-regularized continuous-time RL and show that the optimal stochastic policy "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.04832","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.04832/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.04832","created_at":"2026-07-05T11:51:17.272714+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.04832v2","created_at":"2026-07-05T11:51:17.272714+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.04832","created_at":"2026-07-05T11:51:17.272714+00:00"},{"alias_kind":"pith_short_12","alias_value":"WZ33RSHDXJ64","created_at":"2026-07-05T11:51:17.272714+00:00"},{"alias_kind":"pith_short_16","alias_value":"WZ33RSHDXJ64YI5E","created_at":"2026-07-05T11:51:17.272714+00:00"},{"alias_kind":"pith_short_8","alias_value":"WZ33RSHD","created_at":"2026-07-05T11:51:17.272714+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.02137","citing_title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07220","citing_title":"On the Robustness of Distribution Support under Diffusion Guidance","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2601.18681","citing_title":"ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07220","citing_title":"On the Robustness of Distribution Support under Diffusion Guidance","ref_index":58,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW","json":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW.json","graph_json":"https://pith.science/api/pith-number/WZ33RSHDXJ64YI5E2JDHFSLACW/graph.json","events_json":"https://pith.science/api/pith-number/WZ33RSHDXJ64YI5E2JDHFSLACW/events.json","paper":"https://pith.science/paper/WZ33RSHD"},"agent_actions":{"view_html":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW","download_json":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW.json","view_paper":"https://pith.science/paper/WZ33RSHD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.04832&json=true","fetch_graph":"https://pith.science/api/pith-number/WZ33RSHDXJ64YI5E2JDHFSLACW/graph.json","fetch_events":"https://pith.science/api/pith-number/WZ33RSHDXJ64YI5E2JDHFSLACW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW/action/storage_attestation","attest_author":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW/action/author_attestation","sign_citation":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW/action/citation_signature","submit_replication":"https://pith.science/pith/WZ33RSHDXJ64YI5E2JDHFSLACW/action/replication_record"}},"created_at":"2026-07-05T11:51:17.272714+00:00","updated_at":"2026-07-05T11:51:17.272714+00:00"}