{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2020:2PEDOMA4RZWIYLK3FN4EB5GCYC","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"c322ce3060d44c0d9f1b74e1ec5e756f7044e3a24dda803ca8c6112945fcf720","cross_cats_sorted":["cs.AI","math.OC","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-22T17:58:54Z","title_canon_sha256":"f84fe5b12c205cdf9dc53b20c5d6b22ff24893ed94384c28219af3d18ac49d03"},"schema_version":"1.0","source":{"id":"2006.12484","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2006.12484","created_at":"2026-07-05T01:45:43Z"},{"alias_kind":"arxiv_version","alias_value":"2006.12484v2","created_at":"2026-07-05T01:45:43Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2006.12484","created_at":"2026-07-05T01:45:43Z"},{"alias_kind":"pith_short_12","alias_value":"2PEDOMA4RZWI","created_at":"2026-07-05T01:45:43Z"},{"alias_kind":"pith_short_16","alias_value":"2PEDOMA4RZWIYLK3","created_at":"2026-07-05T01:45:43Z"},{"alias_kind":"pith_short_8","alias_value":"2PEDOMA4","created_at":"2026-07-05T01:45:43Z"}],"graph_snapshots":[{"event_id":"sha256:01e72f0593280cbf879fdafac09e55eb27cacf76ded032debf57c4b9e4bf74c6","target":"graph","created_at":"2026-07-05T01:45:43Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2006.12484/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Partial observability is a common challenge in many reinforcement learning applications, which requires an agent to maintain memory, infer latent states, and integrate this past information into exploration. This challenge leads to a number of computational and statistical hardness results for learning general Partially Observable Markov Decision Processes (POMDPs). This work shows that these hardness barriers do not preclude efficient reinforcement learning for rich and interesting subclasses of POMDPs. In particular, we present a sample-efficient algorithm, OOM-UCB, for episodic finite under","authors_text":"Akshay Krishnamurthy, Chi Jin, Qinghua Liu, Sham M. Kakade","cross_cats":["cs.AI","math.OC","stat.ML"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-22T17:58:54Z","title":"Sample-Efficient Reinforcement Learning of Undercomplete POMDPs"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2006.12484","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:bd2300f064bd2cd6941d0eb6af7ed73be2c4a904c0ac24267a3a68887b23b122","target":"record","created_at":"2026-07-05T01:45:43Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"c322ce3060d44c0d9f1b74e1ec5e756f7044e3a24dda803ca8c6112945fcf720","cross_cats_sorted":["cs.AI","math.OC","stat.ML"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-06-22T17:58:54Z","title_canon_sha256":"f84fe5b12c205cdf9dc53b20c5d6b22ff24893ed94384c28219af3d18ac49d03"},"schema_version":"1.0","source":{"id":"2006.12484","kind":"arxiv","version":2}},"canonical_sha256":"d3c837301c8e6c8c2d5b2b7840f4c2c0943f6c70792c04a5788c16f1029890aa","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"d3c837301c8e6c8c2d5b2b7840f4c2c0943f6c70792c04a5788c16f1029890aa","first_computed_at":"2026-07-05T01:45:43.698288Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T01:45:43.698288Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"WgNCHy8G29Ah6laBzC5l+Xkt4xCy9Im/jr/VKoLdNshPwy+4PbkQDL5O811iL1OOmcDBzT8IL9vSZSF+Yus/Bg==","signature_status":"signed_v1","signed_at":"2026-07-05T01:45:43.698824Z","signed_message":"canonical_sha256_bytes"},"source_id":"2006.12484","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:bd2300f064bd2cd6941d0eb6af7ed73be2c4a904c0ac24267a3a68887b23b122","sha256:01e72f0593280cbf879fdafac09e55eb27cacf76ded032debf57c4b9e4bf74c6"],"state_sha256":"b3fee5b222d8a28e2eaa5c023b0b2a2b46852be71ae0e467ecb1953b254da26e"}