{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2022:WRMNJCD2IAMMZ4GYIGNDCGY36F","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"cb9cd3920f686321499b048f90f846143267ff49acbca73846c726b49bcd1d0c","cross_cats_sorted":["cs.AI","math.ST","stat.ML","stat.TH"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-29T17:51:51Z","title_canon_sha256":"ae3ac778563897faa521b629fbdb70f3a83e939818e16b9446c0802bad3ac0bc"},"schema_version":"1.0","source":{"id":"2209.14990","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2209.14990","created_at":"2026-07-05T05:25:50Z"},{"alias_kind":"arxiv_version","alias_value":"2209.14990v2","created_at":"2026-07-05T05:25:50Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2209.14990","created_at":"2026-07-05T05:25:50Z"},{"alias_kind":"pith_short_12","alias_value":"WRMNJCD2IAMM","created_at":"2026-07-05T05:25:50Z"},{"alias_kind":"pith_short_16","alias_value":"WRMNJCD2IAMMZ4GY","created_at":"2026-07-05T05:25:50Z"},{"alias_kind":"pith_short_8","alias_value":"WRMNJCD2","created_at":"2026-07-05T05:25:50Z"}],"graph_snapshots":[{"event_id":"sha256:58ad2f05cf53851818c9aa834a27bdde1409470140fc42f5463dd06ac00ae077","target":"graph","created_at":"2026-07-05T05:25:50Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2209.14990/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Partial Observability -- where agents can only observe partial information about the true underlying state of the system -- is ubiquitous in real-world applications of Reinforcement Learning (RL). Theoretically, learning a near-optimal policy under partial observability is known to be hard in the worst case due to an exponential sample complexity lower bound. Recent work has identified several tractable subclasses that are learnable with polynomial samples, such as Partially Observable Markov Decision Processes (POMDPs) with certain revealing or decodability conditions. However, this line of r","authors_text":"Fan Chen, Song Mei, Yu Bai","cross_cats":["cs.AI","math.ST","stat.ML","stat.TH"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-29T17:51:51Z","title":"Partially Observable RL with B-Stability: Unified Structural Condition and Sharp Sample-Efficient Algorithms"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2209.14990","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:cd26312a90c367180376f21ee76b56187ac23ee55534fe55af881b23c33511f3","target":"record","created_at":"2026-07-05T05:25:50Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"cb9cd3920f686321499b048f90f846143267ff49acbca73846c726b49bcd1d0c","cross_cats_sorted":["cs.AI","math.ST","stat.ML","stat.TH"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-09-29T17:51:51Z","title_canon_sha256":"ae3ac778563897faa521b629fbdb70f3a83e939818e16b9446c0802bad3ac0bc"},"schema_version":"1.0","source":{"id":"2209.14990","kind":"arxiv","version":2}},"canonical_sha256":"b458d4887a4018ccf0d8419a311b1bf17df988ea7a5b660a8c89246a09670d2b","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"b458d4887a4018ccf0d8419a311b1bf17df988ea7a5b660a8c89246a09670d2b","first_computed_at":"2026-07-05T05:25:50.982721Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T05:25:50.982721Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"6IgxA90G9Khj2bXh7GkykhFAAuTRvRT8mIJcugBjDoizVEs1VfJeURgbRhRgsPDxBGXm8J5VLO7tbKdh5VUeDA==","signature_status":"signed_v1","signed_at":"2026-07-05T05:25:50.983123Z","signed_message":"canonical_sha256_bytes"},"source_id":"2209.14990","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:cd26312a90c367180376f21ee76b56187ac23ee55534fe55af881b23c33511f3","sha256:58ad2f05cf53851818c9aa834a27bdde1409470140fc42f5463dd06ac00ae077"],"state_sha256":"e601596ed7fa9fb9df55ef6b10f7a6e9e798ab22a5a10bb3afd1a9060e8152d8"}