{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NSXBVJCV5WOZB6OMW3NRWOAWXD","short_pith_number":"pith:NSXBVJCV","schema_version":"1.0","canonical_sha256":"6cae1aa455ed9d90f9ccb6db1b3816b8ed6811a018679a840f69e9a6a8a511e4","source":{"kind":"arxiv","id":"2502.11612","version":3},"attestation_state":"computed","paper":{"title":"Maximum Entropy Reinforcement Learning with Diffusion Policy","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Jian Cheng, Xiaoyi Dong, Xi Sheryl Zhang","submitted_at":"2025-02-17T09:55:58Z","abstract_excerpt":"The Soft Actor-Critic (SAC) algorithm with a Gaussian policy has become a mainstream implementation for realizing the Maximum Entropy Reinforcement Learning (MaxEnt RL) objective, which incorporates entropy maximization to encourage exploration and enhance policy robustness. While the Gaussian policy performs well on simpler tasks, its exploration capacity and potential performance in complex multi-goal RL environments are limited by its inherent unimodality. In this paper, we employ the diffusion model, a powerful generative model capable of capturing complex multimodal distributions, as the "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.11612","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-02-17T09:55:58Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"c19cb5a4658112cb978f87aa69357bf020dab8abdf8defb32b2a6d8b5889464c","abstract_canon_sha256":"e1eb27fcfb6d45ef4d96319d59f6029cc1efee437b5fbb45a4178f2fa1bf0eb7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:16:55.126735Z","signature_b64":"OjBV1PhjXckLKPEXCj/RrFWwNJUuo8jdNlOcYknHKR/8jCvWbYaoRQOw2mE67SSv3aVremg5lglCJp+/WAe7CA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6cae1aa455ed9d90f9ccb6db1b3816b8ed6811a018679a840f69e9a6a8a511e4","last_reissued_at":"2026-07-05T11:16:55.126260Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:16:55.126260Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Maximum Entropy Reinforcement Learning with Diffusion Policy","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Jian Cheng, Xiaoyi Dong, Xi Sheryl Zhang","submitted_at":"2025-02-17T09:55:58Z","abstract_excerpt":"The Soft Actor-Critic (SAC) algorithm with a Gaussian policy has become a mainstream implementation for realizing the Maximum Entropy Reinforcement Learning (MaxEnt RL) objective, which incorporates entropy maximization to encourage exploration and enhance policy robustness. While the Gaussian policy performs well on simpler tasks, its exploration capacity and potential performance in complex multi-goal RL environments are limited by its inherent unimodality. In this paper, we employ the diffusion model, a powerful generative model capable of capturing complex multimodal distributions, as the "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.11612","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.11612/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.11612","created_at":"2026-07-05T11:16:55.126319+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.11612v3","created_at":"2026-07-05T11:16:55.126319+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.11612","created_at":"2026-07-05T11:16:55.126319+00:00"},{"alias_kind":"pith_short_12","alias_value":"NSXBVJCV5WOZ","created_at":"2026-07-05T11:16:55.126319+00:00"},{"alias_kind":"pith_short_16","alias_value":"NSXBVJCV5WOZB6OM","created_at":"2026-07-05T11:16:55.126319+00:00"},{"alias_kind":"pith_short_8","alias_value":"NSXBVJCV","created_at":"2026-07-05T11:16:55.126319+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.06967","citing_title":"GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26282","citing_title":"Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2510.03508","citing_title":"D2 Actor Critic: Diffusion Actor Meets Distributional Critic","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2602.02924","citing_title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07101","citing_title":"Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17919","citing_title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","ref_index":63,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD","json":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD.json","graph_json":"https://pith.science/api/pith-number/NSXBVJCV5WOZB6OMW3NRWOAWXD/graph.json","events_json":"https://pith.science/api/pith-number/NSXBVJCV5WOZB6OMW3NRWOAWXD/events.json","paper":"https://pith.science/paper/NSXBVJCV"},"agent_actions":{"view_html":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD","download_json":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD.json","view_paper":"https://pith.science/paper/NSXBVJCV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.11612&json=true","fetch_graph":"https://pith.science/api/pith-number/NSXBVJCV5WOZB6OMW3NRWOAWXD/graph.json","fetch_events":"https://pith.science/api/pith-number/NSXBVJCV5WOZB6OMW3NRWOAWXD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD/action/storage_attestation","attest_author":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD/action/author_attestation","sign_citation":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD/action/citation_signature","submit_replication":"https://pith.science/pith/NSXBVJCV5WOZB6OMW3NRWOAWXD/action/replication_record"}},"created_at":"2026-07-05T11:16:55.126319+00:00","updated_at":"2026-07-05T11:16:55.126319+00:00"}