{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:AYOYCHCAQB6NKCTXK5IIWBM36E","short_pith_number":"pith:AYOYCHCA","schema_version":"1.0","canonical_sha256":"061d811c40807cd50a7757508b059bf127b6dcadf2dd0fcea491b04a3b23ad65","source":{"kind":"arxiv","id":"2406.09030","version":1},"attestation_state":"computed","paper":{"title":"CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Arda Sarp Yenicesu, Furkan B. Mutlu, Ozgur S. Oguz, Suleyman S. Kozat","submitted_at":"2024-06-13T12:03:40Z","abstract_excerpt":"The utilization of the experience replay mechanism enables agents to effectively leverage their experiences on several occasions. In previous studies, the sampling probability of the transitions was modified based on their relative significance. The process of reassigning sample probabilities for every transition in the replay buffer after each iteration is considered extremely inefficient. Hence, in order to enhance computing efficiency, experience replay prioritization algorithms reassess the importance of a transition as it is sampled. However, the relative importance of the transitions und"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.09030","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-06-13T12:03:40Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"3957c28bb3cba8ed085e2e06d1e3d78809592068f3408d32adba29e18fd0fe4a","abstract_canon_sha256":"b7de7f86ccb5ed7c9a095f47ba56335791b0a3edd529517cc48beb55ea9d750d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:31:27.318349Z","signature_b64":"Eg53pYrcoVRdaez72Y2Ma6OLnBhofA1j2/ciqO9ff8K3P4xYAZnehEYMATNbbsKvYI47bH1OkwVPtDrxVzEaAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"061d811c40807cd50a7757508b059bf127b6dcadf2dd0fcea491b04a3b23ad65","last_reissued_at":"2026-07-05T08:31:27.317846Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:31:27.317846Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Arda Sarp Yenicesu, Furkan B. Mutlu, Ozgur S. Oguz, Suleyman S. Kozat","submitted_at":"2024-06-13T12:03:40Z","abstract_excerpt":"The utilization of the experience replay mechanism enables agents to effectively leverage their experiences on several occasions. In previous studies, the sampling probability of the transitions was modified based on their relative significance. The process of reassigning sample probabilities for every transition in the replay buffer after each iteration is considered extremely inefficient. Hence, in order to enhance computing efficiency, experience replay prioritization algorithms reassess the importance of a transition as it is sampled. However, the relative importance of the transitions und"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.09030","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.09030/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.09030","created_at":"2026-07-05T08:31:27.317900+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.09030v1","created_at":"2026-07-05T08:31:27.317900+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.09030","created_at":"2026-07-05T08:31:27.317900+00:00"},{"alias_kind":"pith_short_12","alias_value":"AYOYCHCAQB6N","created_at":"2026-07-05T08:31:27.317900+00:00"},{"alias_kind":"pith_short_16","alias_value":"AYOYCHCAQB6NKCTX","created_at":"2026-07-05T08:31:27.317900+00:00"},{"alias_kind":"pith_short_8","alias_value":"AYOYCHCA","created_at":"2026-07-05T08:31:27.317900+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2507.02712","citing_title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","ref_index":51,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E","json":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E.json","graph_json":"https://pith.science/api/pith-number/AYOYCHCAQB6NKCTXK5IIWBM36E/graph.json","events_json":"https://pith.science/api/pith-number/AYOYCHCAQB6NKCTXK5IIWBM36E/events.json","paper":"https://pith.science/paper/AYOYCHCA"},"agent_actions":{"view_html":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E","download_json":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E.json","view_paper":"https://pith.science/paper/AYOYCHCA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.09030&json=true","fetch_graph":"https://pith.science/api/pith-number/AYOYCHCAQB6NKCTXK5IIWBM36E/graph.json","fetch_events":"https://pith.science/api/pith-number/AYOYCHCAQB6NKCTXK5IIWBM36E/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E/action/storage_attestation","attest_author":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E/action/author_attestation","sign_citation":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E/action/citation_signature","submit_replication":"https://pith.science/pith/AYOYCHCAQB6NKCTXK5IIWBM36E/action/replication_record"}},"created_at":"2026-07-05T08:31:27.317900+00:00","updated_at":"2026-07-05T08:31:27.317900+00:00"}