{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:WZ33RSHDXJ64YI5E2JDHFSLACW","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"2f7927240eadb768fdc5c3cfd60c9442821827506164c990f109089ae2721a75","cross_cats_sorted":["cs.AI","math.OC"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-09-07T13:55:45Z","title_canon_sha256":"b40b8a8041d9263fb771767fbbd59dbba3da93acb53336aef501d31708f9f5a8"},"schema_version":"1.0","source":{"id":"2409.04832","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2409.04832","created_at":"2026-07-05T11:51:17Z"},{"alias_kind":"arxiv_version","alias_value":"2409.04832v2","created_at":"2026-07-05T11:51:17Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.04832","created_at":"2026-07-05T11:51:17Z"},{"alias_kind":"pith_short_12","alias_value":"WZ33RSHDXJ64","created_at":"2026-07-05T11:51:17Z"},{"alias_kind":"pith_short_16","alias_value":"WZ33RSHDXJ64YI5E","created_at":"2026-07-05T11:51:17Z"},{"alias_kind":"pith_short_8","alias_value":"WZ33RSHD","created_at":"2026-07-05T11:51:17Z"}],"graph_snapshots":[{"event_id":"sha256:ba59901e6e622b07be5747a9dd2512909b0485961f266a012c8277e1db810b05","target":"graph","created_at":"2026-07-05T11:51:17Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2409.04832/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"We propose a new reinforcement learning (RL) formulation for training continuous-time score-based diffusion models for generative AI to generate samples that maximize reward functions while keeping the generated distributions close to the unknown target data distributions. Different from most existing studies, ours does not involve any pretrained model for the unknown score functions of the noise-perturbed data distributions, nor does it attempt to learn the score functions. Instead, we formulate the problem as entropy-regularized continuous-time RL and show that the optimal stochastic policy ","authors_text":"Jiale Zha, Xuefeng Gao, Xun Yu Zhou","cross_cats":["cs.AI","math.OC"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-09-07T13:55:45Z","title":"Reward-Directed Score-Based Diffusion Models via q-Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.04832","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:83165f8d3de9cf15d900b680145d305010747146502a1118e1e8edb667665d6c","target":"record","created_at":"2026-07-05T11:51:17Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"2f7927240eadb768fdc5c3cfd60c9442821827506164c990f109089ae2721a75","cross_cats_sorted":["cs.AI","math.OC"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-09-07T13:55:45Z","title_canon_sha256":"b40b8a8041d9263fb771767fbbd59dbba3da93acb53336aef501d31708f9f5a8"},"schema_version":"1.0","source":{"id":"2409.04832","kind":"arxiv","version":2}},"canonical_sha256":"b677b8c8e3ba7dcc23a4d24672c96015a7d0529a51eef4856ed68cc0da0507f4","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"b677b8c8e3ba7dcc23a4d24672c96015a7d0529a51eef4856ed68cc0da0507f4","first_computed_at":"2026-07-05T11:51:17.272660Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:51:17.272660Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"aSvWYaKCwDUimSuNv9KylhT5y8Xfpk5Jc2vAlgYecerfERFDOtpcTi/BPtL+KiQDkKdpIi6ANJKmhyg3F4IfDg==","signature_status":"signed_v1","signed_at":"2026-07-05T11:51:17.273157Z","signed_message":"canonical_sha256_bytes"},"source_id":"2409.04832","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:83165f8d3de9cf15d900b680145d305010747146502a1118e1e8edb667665d6c","sha256:ba59901e6e622b07be5747a9dd2512909b0485961f266a012c8277e1db810b05"],"state_sha256":"609a90ab9342a8b40faea9dd03184019a2554e81e157e1d26c27b41ed945d365"}