{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:RK36RLTV534C2FCSDSNPSTXHQW","short_pith_number":"pith:RK36RLTV","schema_version":"1.0","canonical_sha256":"8ab7e8ae75eef82d14521c9af94ee785a47dbdb468d5c92c1770afe2984a742a","source":{"kind":"arxiv","id":"2306.03552","version":4},"attestation_state":"computed","paper":{"title":"State Regularized Policy Optimization on Data with Dynamics Shift","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Bo An, Dong Zheng, Kun Gai, Peng Jiang, Qingpeng Cai, Shuchang Liu, Zhenghai Xue","submitted_at":"2023-06-06T10:06:09Z","abstract_excerpt":"In many real-world scenarios, Reinforcement Learning (RL) algorithms are trained on data with dynamics shift, i.e., with different underlying environment dynamics. A majority of current methods address such issue by training context encoders to identify environment parameters. Data with dynamics shift are separated according to their environment parameters to train the corresponding policy. However, these methods can be sample inefficient as data are used \\textit{ad hoc}, and policies trained for one dynamics cannot benefit from data collected in all other environments with different dynamics."},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2306.03552","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.LG","submitted_at":"2023-06-06T10:06:09Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"b31647ec3d80c6d86cfd1627ad97cdd8b4a011aec4f03f552828d8e613b7ae2d","abstract_canon_sha256":"a4b578f9eb5f16270eed17f8dc19ff5b04336312f2976a9164cf5460b5f7584c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:47:57.266867Z","signature_b64":"7TZ81f9ED6EmmZ0VhKWSD8xb3UZtl8V4zvvgABoS+qonxRz6wu7zpkhMldTaIVZxZT9y+7vb255nYD6kPWe4Dg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8ab7e8ae75eef82d14521c9af94ee785a47dbdb468d5c92c1770afe2984a742a","last_reissued_at":"2026-07-05T07:47:57.266225Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:47:57.266225Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"State Regularized Policy Optimization on Data with Dynamics Shift","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Bo An, Dong Zheng, Kun Gai, Peng Jiang, Qingpeng Cai, Shuchang Liu, Zhenghai Xue","submitted_at":"2023-06-06T10:06:09Z","abstract_excerpt":"In many real-world scenarios, Reinforcement Learning (RL) algorithms are trained on data with dynamics shift, i.e., with different underlying environment dynamics. A majority of current methods address such issue by training context encoders to identify environment parameters. Data with dynamics shift are separated according to their environment parameters to train the corresponding policy. However, these methods can be sample inefficient as data are used \\textit{ad hoc}, and policies trained for one dynamics cannot benefit from data collected in all other environments with different dynamics."},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2306.03552","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2306.03552/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2306.03552","created_at":"2026-07-05T07:47:57.266293+00:00"},{"alias_kind":"arxiv_version","alias_value":"2306.03552v4","created_at":"2026-07-05T07:47:57.266293+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2306.03552","created_at":"2026-07-05T07:47:57.266293+00:00"},{"alias_kind":"pith_short_12","alias_value":"RK36RLTV534C","created_at":"2026-07-05T07:47:57.266293+00:00"},{"alias_kind":"pith_short_16","alias_value":"RK36RLTV534C2FCS","created_at":"2026-07-05T07:47:57.266293+00:00"},{"alias_kind":"pith_short_8","alias_value":"RK36RLTV","created_at":"2026-07-05T07:47:57.266293+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW","json":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW.json","graph_json":"https://pith.science/api/pith-number/RK36RLTV534C2FCSDSNPSTXHQW/graph.json","events_json":"https://pith.science/api/pith-number/RK36RLTV534C2FCSDSNPSTXHQW/events.json","paper":"https://pith.science/paper/RK36RLTV"},"agent_actions":{"view_html":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW","download_json":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW.json","view_paper":"https://pith.science/paper/RK36RLTV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2306.03552&json=true","fetch_graph":"https://pith.science/api/pith-number/RK36RLTV534C2FCSDSNPSTXHQW/graph.json","fetch_events":"https://pith.science/api/pith-number/RK36RLTV534C2FCSDSNPSTXHQW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW/action/storage_attestation","attest_author":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW/action/author_attestation","sign_citation":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW/action/citation_signature","submit_replication":"https://pith.science/pith/RK36RLTV534C2FCSDSNPSTXHQW/action/replication_record"}},"created_at":"2026-07-05T07:47:57.266293+00:00","updated_at":"2026-07-05T07:47:57.266293+00:00"}