{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:WN3EH2EAALZNZMFWQWR5323EBO","short_pith_number":"pith:WN3EH2EA","schema_version":"1.0","canonical_sha256":"b37643e88002f2dcb0b685a3ddeb640bb58222a966590f53821d285fcbec5b47","source":{"kind":"arxiv","id":"2502.00361","version":4},"attestation_state":"computed","paper":{"title":"Efficient Online Reinforcement Learning for Diffusion Policy","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bo Dai, Haitong Ma, Kai Wang, Na Li, Tianyi Chen","submitted_at":"2025-02-01T07:55:06Z","abstract_excerpt":"Diffusion policies have achieved superior performance in imitation learning and offline reinforcement learning (RL) due to their rich expressiveness. However, the conventional diffusion training procedure requires samples from target distribution, which is impossible in online RL since we cannot sample from the optimal policy. Backpropagating policy gradient through the diffusion process incurs huge computational costs and instability, thus being expensive and not scalable. To enable efficient training of diffusion policies in online RL, we generalize the conventional denoising score matching "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.00361","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-02-01T07:55:06Z","cross_cats_sorted":[],"title_canon_sha256":"4217daa5cc37f0bef8423dae899a16f7ec7a13cfb167b31d2958006b1e71d153","abstract_canon_sha256":"5621d3b5f3850a9557bb78aba5530ca7721a3fb0fdb9f071ec66ac128e84c48e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:29:06.364887Z","signature_b64":"ci5cvlRCK7V9jDgevhq3815bFGWZfxRBdJNRrPR96nOgTyMtUC0U3VMPGJd7Emgp3g5KPXO7IEBMNO4IwlIBBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b37643e88002f2dcb0b685a3ddeb640bb58222a966590f53821d285fcbec5b47","last_reissued_at":"2026-07-05T11:29:06.364296Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:29:06.364296Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Efficient Online Reinforcement Learning for Diffusion Policy","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bo Dai, Haitong Ma, Kai Wang, Na Li, Tianyi Chen","submitted_at":"2025-02-01T07:55:06Z","abstract_excerpt":"Diffusion policies have achieved superior performance in imitation learning and offline reinforcement learning (RL) due to their rich expressiveness. However, the conventional diffusion training procedure requires samples from target distribution, which is impossible in online RL since we cannot sample from the optimal policy. Backpropagating policy gradient through the diffusion process incurs huge computational costs and instability, thus being expensive and not scalable. To enable efficient training of diffusion policies in online RL, we generalize the conventional denoising score matching "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.00361","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.00361/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.00361","created_at":"2026-07-05T11:29:06.364367+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.00361v4","created_at":"2026-07-05T11:29:06.364367+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.00361","created_at":"2026-07-05T11:29:06.364367+00:00"},{"alias_kind":"pith_short_12","alias_value":"WN3EH2EAALZN","created_at":"2026-07-05T11:29:06.364367+00:00"},{"alias_kind":"pith_short_16","alias_value":"WN3EH2EAALZNZMFW","created_at":"2026-07-05T11:29:06.364367+00:00"},{"alias_kind":"pith_short_8","alias_value":"WN3EH2EA","created_at":"2026-07-05T11:29:06.364367+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07967","citing_title":"Expressivity and Statistical Trade-offs in Diffusion Policy Learning","ref_index":41,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10825","citing_title":"MODIP: Efficient Model-Based Optimization for Diffusion Policies","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08602","citing_title":"Reinforcement Learning for Flow-Matching Policies with Density Transport","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30226","citing_title":"BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2510.03508","citing_title":"D2 Actor Critic: Diffusion Actor Meets Distributional Critic","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2509.22963","citing_title":"Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2602.02924","citing_title":"How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2603.04333","citing_title":"What Does Flow Matching Bring To TD Learning?","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11726","citing_title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11726","citing_title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10909","citing_title":"Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01356","citing_title":"Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09035","citing_title":"Advantage-Guided Diffusion for Model-Based Reinforcement Learning","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07101","citing_title":"Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17919","citing_title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","ref_index":62,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO","json":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO.json","graph_json":"https://pith.science/api/pith-number/WN3EH2EAALZNZMFWQWR5323EBO/graph.json","events_json":"https://pith.science/api/pith-number/WN3EH2EAALZNZMFWQWR5323EBO/events.json","paper":"https://pith.science/paper/WN3EH2EA"},"agent_actions":{"view_html":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO","download_json":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO.json","view_paper":"https://pith.science/paper/WN3EH2EA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.00361&json=true","fetch_graph":"https://pith.science/api/pith-number/WN3EH2EAALZNZMFWQWR5323EBO/graph.json","fetch_events":"https://pith.science/api/pith-number/WN3EH2EAALZNZMFWQWR5323EBO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO/action/storage_attestation","attest_author":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO/action/author_attestation","sign_citation":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO/action/citation_signature","submit_replication":"https://pith.science/pith/WN3EH2EAALZNZMFWQWR5323EBO/action/replication_record"}},"created_at":"2026-07-05T11:29:06.364367+00:00","updated_at":"2026-07-05T11:29:06.364367+00:00"}