{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:PA5QOHL6YEEE2IEX3PRSIH35ZR","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"7bc5330a60c1efdb5e8c39b8136b9af66bd6c0559bf645a64e68b6042b90fd7a","cross_cats_sorted":["cs.MA","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-02-08T18:09:17Z","title_canon_sha256":"e558e3776233060944ca31ce117ef4ad42c0710bc372ca877a8a341e2491bf23"},"schema_version":"1.0","source":{"id":"2402.05876","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2402.05876","created_at":"2026-07-05T07:43:04Z"},{"alias_kind":"arxiv_version","alias_value":"2402.05876v1","created_at":"2026-07-05T07:43:04Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.05876","created_at":"2026-07-05T07:43:04Z"},{"alias_kind":"pith_short_12","alias_value":"PA5QOHL6YEEE","created_at":"2026-07-05T07:43:04Z"},{"alias_kind":"pith_short_16","alias_value":"PA5QOHL6YEEE2IEX","created_at":"2026-07-05T07:43:04Z"},{"alias_kind":"pith_short_8","alias_value":"PA5QOHL6","created_at":"2026-07-05T07:43:04Z"}],"graph_snapshots":[{"event_id":"sha256:67e38b0f8589dde41a32f94ff7676e2fce8f64a250146b2687a23f978cd1cd78","target":"graph","created_at":"2026-07-05T07:43:04Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2402.05876/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Offline reinforcement learning (RL), which seeks to learn an optimal policy using offline data, has garnered significant interest due to its potential in critical applications where online data collection is infeasible or expensive. This work explores the benefit of federated learning for offline RL, aiming at collaboratively leveraging offline datasets at multiple agents. Focusing on finite-horizon episodic tabular Markov decision processes (MDPs), we design FedLCB-Q, a variant of the popular model-free Q-learning algorithm tailored for federated offline RL. FedLCB-Q updates local Q-functions","authors_text":"Gauri Joshi, Jiin Woo, Laixi Shi, Yuejie Chi","cross_cats":["cs.MA","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-02-08T18:09:17Z","title":"Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage Suffices"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.05876","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:27f61c13b4cb4808ca5a1339de3ba11e0eb9f06b6348e9f42b8caa7079308969","target":"record","created_at":"2026-07-05T07:43:04Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"7bc5330a60c1efdb5e8c39b8136b9af66bd6c0559bf645a64e68b6042b90fd7a","cross_cats_sorted":["cs.MA","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-02-08T18:09:17Z","title_canon_sha256":"e558e3776233060944ca31ce117ef4ad42c0710bc372ca877a8a341e2491bf23"},"schema_version":"1.0","source":{"id":"2402.05876","kind":"arxiv","version":1}},"canonical_sha256":"783b071d7ec1084d2097dbe3241f7dcc43619fce8033445024f4cd8da39837c9","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"783b071d7ec1084d2097dbe3241f7dcc43619fce8033445024f4cd8da39837c9","first_computed_at":"2026-07-05T07:43:04.479784Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T07:43:04.479784Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"JJwcB/sv6C1MYuqUzO5LIrp0vItFDanu5df41J7jeU3rPmdqOqso3qVfPfb9kIKy1O0Ww3dNTzdz0Bc3zENkAg==","signature_status":"signed_v1","signed_at":"2026-07-05T07:43:04.480294Z","signed_message":"canonical_sha256_bytes"},"source_id":"2402.05876","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:27f61c13b4cb4808ca5a1339de3ba11e0eb9f06b6348e9f42b8caa7079308969","sha256:67e38b0f8589dde41a32f94ff7676e2fce8f64a250146b2687a23f978cd1cd78"],"state_sha256":"3de6154fb07de8be4b304401c39b21ae7b97465073de5d88205648e2bf324248"}