{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:TXLL4D3TIS5JYIS2FK3X5K64CP","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"d81788d1a3bf62418b9462820fc6ee3e777a9dd17c3a37218a0a6f4f1e8c5685","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-07-05T06:34:32Z","title_canon_sha256":"08914516ecb9db4aa8b9a8dc7eee7f8619ff84dc93764db5363042800836de17"},"schema_version":"1.0","source":{"id":"2407.04285","kind":"arxiv","version":4}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2407.04285","created_at":"2026-07-05T10:22:01Z"},{"alias_kind":"arxiv_version","alias_value":"2407.04285v4","created_at":"2026-07-05T10:22:01Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.04285","created_at":"2026-07-05T10:22:01Z"},{"alias_kind":"pith_short_12","alias_value":"TXLL4D3TIS5J","created_at":"2026-07-05T10:22:01Z"},{"alias_kind":"pith_short_16","alias_value":"TXLL4D3TIS5JYIS2","created_at":"2026-07-05T10:22:01Z"},{"alias_kind":"pith_short_8","alias_value":"TXLL4D3T","created_at":"2026-07-05T10:22:01Z"}],"graph_snapshots":[{"event_id":"sha256:37f6f15d4b26a911123854c993828b1eacf419fb8c33618d670eb68c5d1885c1","target":"graph","created_at":"2026-07-05T10:22:01Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2407.04285/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Learning policy from offline datasets through offline reinforcement learning (RL) holds promise for scaling data-driven decision-making while avoiding unsafe and costly online interactions. However, real-world data collected from sensors or humans often contains noise and errors, posing a significant challenge for existing offline RL methods, particularly when the real-world data is limited. Our study reveals that prior research focusing on adapting predominant offline RL methods based on temporal difference learning still falls short under data corruption when the dataset is limited. In contr","authors_text":"Baoxiang Wang, Feng Luo, Jiawei Xu, Lei Han, Meng Fang, Rui Yang, Shuang Qiu","cross_cats":["cs.AI"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-07-05T06:34:32Z","title":"Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.04285","kind":"arxiv","version":4},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:31cf8d70c410cf1ae104e09ad0f979bf0cc750f2076f936a2f8e0d8b97af3b5a","target":"record","created_at":"2026-07-05T10:22:01Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"d81788d1a3bf62418b9462820fc6ee3e777a9dd17c3a37218a0a6f4f1e8c5685","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-07-05T06:34:32Z","title_canon_sha256":"08914516ecb9db4aa8b9a8dc7eee7f8619ff84dc93764db5363042800836de17"},"schema_version":"1.0","source":{"id":"2407.04285","kind":"arxiv","version":4}},"canonical_sha256":"9dd6be0f7344ba9c225a2ab77eabdc13c42171eab61d5208717119f42c786dc9","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"9dd6be0f7344ba9c225a2ab77eabdc13c42171eab61d5208717119f42c786dc9","first_computed_at":"2026-07-05T10:22:01.842699Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:22:01.842699Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"NbTjb4oKJDPcWF/kTUezKWCj3ag+93jcWqXjG2Vs7lCZiQP0mAmVBacVDSkMYcJCUbr7u5DEMpPGLH4OTpPEBg==","signature_status":"signed_v1","signed_at":"2026-07-05T10:22:01.843276Z","signed_message":"canonical_sha256_bytes"},"source_id":"2407.04285","source_kind":"arxiv","source_version":4}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:31cf8d70c410cf1ae104e09ad0f979bf0cc750f2076f936a2f8e0d8b97af3b5a","sha256:37f6f15d4b26a911123854c993828b1eacf419fb8c33618d670eb68c5d1885c1"],"state_sha256":"02ce0f0d83aaa3a5f5e8c0d86ca346ae9b61a161766a3a5b1763e79868e2665e"}