{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:L2PQ3BQ5NJYDE7VWGS3UH77UVJ","short_pith_number":"pith:L2PQ3BQ5","schema_version":"1.0","canonical_sha256":"5e9f0d861d6a70327eb634b743fff4aa5bec16ef0230925fa7313955296d7c3c","source":{"kind":"arxiv","id":"2501.16142","version":1},"attestation_state":"computed","paper":{"title":"Towards General-Purpose Model-Free Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Amy Zhang, Michael Rabbat, Pierluca D'Oro, Scott Fujimoto, Yuandong Tian","submitted_at":"2025-01-27T15:36:37Z","abstract_excerpt":"Reinforcement learning (RL) promises a framework for near-universal problem-solving. In practice however, RL algorithms are often tailored to specific benchmarks, relying on carefully tuned hyperparameters and algorithmic choices. Recently, powerful model-based RL methods have shown impressive general results across benchmarks but come at the cost of increased complexity and slow run times, limiting their broader applicability. In this paper, we attempt to find a unifying model-free deep RL algorithm that can address a diverse class of domains and problem settings. To achieve this, we leverage"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.16142","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-01-27T15:36:37Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"22824e16616b995a91a6f142a51c4df2fdc0f0487a350b64d1e4872272d9f692","abstract_canon_sha256":"5894988ad09d4007e020e735a5d5d97363ed650f011ea0feb80b78be5b7324de"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:05:55.964557Z","signature_b64":"Mleh6I8eAjgDq8lB4W1IeOS9dj1q5ZT9Oq9eFSO86Jwht9ef2OQo11j9crGtjA9VP4JZiNVBkqUvt0ckahljDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5e9f0d861d6a70327eb634b743fff4aa5bec16ef0230925fa7313955296d7c3c","last_reissued_at":"2026-07-05T10:05:55.964046Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:05:55.964046Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Towards General-Purpose Model-Free Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Amy Zhang, Michael Rabbat, Pierluca D'Oro, Scott Fujimoto, Yuandong Tian","submitted_at":"2025-01-27T15:36:37Z","abstract_excerpt":"Reinforcement learning (RL) promises a framework for near-universal problem-solving. In practice however, RL algorithms are often tailored to specific benchmarks, relying on carefully tuned hyperparameters and algorithmic choices. Recently, powerful model-based RL methods have shown impressive general results across benchmarks but come at the cost of increased complexity and slow run times, limiting their broader applicability. In this paper, we attempt to find a unifying model-free deep RL algorithm that can address a diverse class of domains and problem settings. To achieve this, we leverage"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.16142","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.16142/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.16142","created_at":"2026-07-05T10:05:55.964108+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.16142v1","created_at":"2026-07-05T10:05:55.964108+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.16142","created_at":"2026-07-05T10:05:55.964108+00:00"},{"alias_kind":"pith_short_12","alias_value":"L2PQ3BQ5NJYD","created_at":"2026-07-05T10:05:55.964108+00:00"},{"alias_kind":"pith_short_16","alias_value":"L2PQ3BQ5NJYDE7VW","created_at":"2026-07-05T10:05:55.964108+00:00"},{"alias_kind":"pith_short_8","alias_value":"L2PQ3BQ5","created_at":"2026-07-05T10:05:55.964108+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.26282","citing_title":"Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10236","citing_title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04539","citing_title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2508.07722","citing_title":"Robust Remote Reinforcement Learning over Unreliable Communication Channels using Homomorphic State Encoding","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10236","citing_title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09364","citing_title":"Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10236","citing_title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04539","citing_title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","ref_index":17,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ","json":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ.json","graph_json":"https://pith.science/api/pith-number/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/graph.json","events_json":"https://pith.science/api/pith-number/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/events.json","paper":"https://pith.science/paper/L2PQ3BQ5"},"agent_actions":{"view_html":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ","download_json":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ.json","view_paper":"https://pith.science/paper/L2PQ3BQ5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.16142&json=true","fetch_graph":"https://pith.science/api/pith-number/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/graph.json","fetch_events":"https://pith.science/api/pith-number/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/action/storage_attestation","attest_author":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/action/author_attestation","sign_citation":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/action/citation_signature","submit_replication":"https://pith.science/pith/L2PQ3BQ5NJYDE7VWGS3UH77UVJ/action/replication_record"}},"created_at":"2026-07-05T10:05:55.964108+00:00","updated_at":"2026-07-05T10:05:55.964108+00:00"}