{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2023:XHPEH5OACJLUBSHR4ZLOIKKXVI","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"c23cf991c462b2a384589326fd91ca5f0026b07f89b87f32486f47eab2774087","cross_cats_sorted":["cs.AI","cs.RO"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-05-25T02:40:32Z","title_canon_sha256":"efd4fad4c8db92ae02b218002aeee066e283a7acadaf7484e3f6f2d5219c9942"},"schema_version":"1.0","source":{"id":"2305.15669","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2305.15669","created_at":"2026-07-05T06:13:43Z"},{"alias_kind":"arxiv_version","alias_value":"2305.15669v1","created_at":"2026-07-05T06:13:43Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.15669","created_at":"2026-07-05T06:13:43Z"},{"alias_kind":"pith_short_12","alias_value":"XHPEH5OACJLU","created_at":"2026-07-05T06:13:43Z"},{"alias_kind":"pith_short_16","alias_value":"XHPEH5OACJLUBSHR","created_at":"2026-07-05T06:13:43Z"},{"alias_kind":"pith_short_8","alias_value":"XHPEH5OA","created_at":"2026-07-05T06:13:43Z"}],"graph_snapshots":[{"event_id":"sha256:94a3081e73c5d0d90cadd7737cdc64a39fddb5ee4752a6856f0d181c75ffc259","target":"graph","created_at":"2026-07-05T06:13:43Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2305.15669/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Offline-to-online reinforcement learning (RL), by combining the benefits of offline pretraining and online finetuning, promises enhanced sample efficiency and policy performance. However, existing methods, effective as they are, suffer from suboptimal performance, limited adaptability, and unsatisfactory computational efficiency. We propose a novel framework, PROTO, which overcomes the aforementioned limitations by augmenting the standard RL objective with an iteratively evolving regularization term. Performing a trust-region-style update, PROTO yields stable initial finetuning and optimal fin","authors_text":"Haoran Xu, Jianxiong Li, Jingjing Liu, Xianyuan Zhan, Xiao Hu, Ya-Qin Zhang","cross_cats":["cs.AI","cs.RO"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-05-25T02:40:32Z","title":"PROTO: Iterative Policy Regularized Offline-to-Online Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.15669","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:ee1ef48086b69be8fadbc6f6d640766f292978e78d5676cb82bff2b1f474f043","target":"record","created_at":"2026-07-05T06:13:43Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"c23cf991c462b2a384589326fd91ca5f0026b07f89b87f32486f47eab2774087","cross_cats_sorted":["cs.AI","cs.RO"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-05-25T02:40:32Z","title_canon_sha256":"efd4fad4c8db92ae02b218002aeee066e283a7acadaf7484e3f6f2d5219c9942"},"schema_version":"1.0","source":{"id":"2305.15669","kind":"arxiv","version":1}},"canonical_sha256":"b9de43f5c0125740c8f1e656e42957aa00f2bb4d4836f4b731e7c80f1c7f46d8","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"b9de43f5c0125740c8f1e656e42957aa00f2bb4d4836f4b731e7c80f1c7f46d8","first_computed_at":"2026-07-05T06:13:43.075103Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T06:13:43.075103Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"ix16Ky1/+PhJuBJJHXqsULQMULNld3lYFWsGUxuvnT52l9/Y4/5hENDQgLQINNxZaIr1Xj2ykmRPrym3QXr5Bw==","signature_status":"signed_v1","signed_at":"2026-07-05T06:13:43.075571Z","signed_message":"canonical_sha256_bytes"},"source_id":"2305.15669","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:ee1ef48086b69be8fadbc6f6d640766f292978e78d5676cb82bff2b1f474f043","sha256:94a3081e73c5d0d90cadd7737cdc64a39fddb5ee4752a6856f0d181c75ffc259"],"state_sha256":"2a48ed7cfa1b0d25e00ad168ab95c729371c07fcf7fdc2dffe51f8dafe765a48"}