{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:ZQ55PB4QFJWS7NPFWFRBMEJWRR","short_pith_number":"pith:ZQ55PB4Q","schema_version":"1.0","canonical_sha256":"cc3bd787902a6d2fb5e5b1621611368c5e9d36dc3c07b36657e531e63041b196","source":{"kind":"arxiv","id":"2310.11684","version":4},"attestation_state":"computed","paper":{"title":"Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","quant-ph"],"primary_cat":"cs.LG","authors_text":"Bhargav Ganguly, Vaneet Aggarwal, Yang Xu","submitted_at":"2023-10-18T03:17:51Z","abstract_excerpt":"This paper investigates the potential of quantum acceleration in addressing infinite horizon Markov Decision Processes (MDPs) to enhance average reward outcomes. We introduce an innovative quantum framework for the agent's engagement with an unknown MDP, extending the conventional interaction paradigm. Our approach involves the design of an optimism-driven tabular Reinforcement Learning algorithm that harnesses quantum signals acquired by the agent through efficient quantum mean estimation techniques. Through thorough theoretical analysis, we demonstrate that the quantum advantage in mean esti"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.11684","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-10-18T03:17:51Z","cross_cats_sorted":["cs.AI","quant-ph"],"title_canon_sha256":"10f4e700362498b4d3f0c1762d302e64bf9889268054c13487f2af0c56405773","abstract_canon_sha256":"1e13a34fa6caeff56859d5c3acc21278fcc74e86eda6cea05accc4b79b693f22"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:09:57.296991Z","signature_b64":"0K2+TAYRLEjH1BhvZ7z+qdv31x17vX3SWj2C751zyI1adMS4zVOi3OIR2tKFk+I7HGx1/rdd529tuwOrodHUDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"cc3bd787902a6d2fb5e5b1621611368c5e9d36dc3c07b36657e531e63041b196","last_reissued_at":"2026-07-05T11:09:57.296521Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:09:57.296521Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","quant-ph"],"primary_cat":"cs.LG","authors_text":"Bhargav Ganguly, Vaneet Aggarwal, Yang Xu","submitted_at":"2023-10-18T03:17:51Z","abstract_excerpt":"This paper investigates the potential of quantum acceleration in addressing infinite horizon Markov Decision Processes (MDPs) to enhance average reward outcomes. We introduce an innovative quantum framework for the agent's engagement with an unknown MDP, extending the conventional interaction paradigm. Our approach involves the design of an optimism-driven tabular Reinforcement Learning algorithm that harnesses quantum signals acquired by the agent through efficient quantum mean estimation techniques. Through thorough theoretical analysis, we demonstrate that the quantum advantage in mean esti"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.11684","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.11684/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.11684","created_at":"2026-07-05T11:09:57.296570+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.11684v4","created_at":"2026-07-05T11:09:57.296570+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.11684","created_at":"2026-07-05T11:09:57.296570+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZQ55PB4QFJWS","created_at":"2026-07-05T11:09:57.296570+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZQ55PB4QFJWS7NPF","created_at":"2026-07-05T11:09:57.296570+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZQ55PB4Q","created_at":"2026-07-05T11:09:57.296570+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2501.16243","citing_title":"Accelerating Quantum Reinforcement Learning with a Quantum Natural Policy Gradient Based Approach","ref_index":13,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR","json":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR.json","graph_json":"https://pith.science/api/pith-number/ZQ55PB4QFJWS7NPFWFRBMEJWRR/graph.json","events_json":"https://pith.science/api/pith-number/ZQ55PB4QFJWS7NPFWFRBMEJWRR/events.json","paper":"https://pith.science/paper/ZQ55PB4Q"},"agent_actions":{"view_html":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR","download_json":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR.json","view_paper":"https://pith.science/paper/ZQ55PB4Q","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.11684&json=true","fetch_graph":"https://pith.science/api/pith-number/ZQ55PB4QFJWS7NPFWFRBMEJWRR/graph.json","fetch_events":"https://pith.science/api/pith-number/ZQ55PB4QFJWS7NPFWFRBMEJWRR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR/action/storage_attestation","attest_author":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR/action/author_attestation","sign_citation":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR/action/citation_signature","submit_replication":"https://pith.science/pith/ZQ55PB4QFJWS7NPFWFRBMEJWRR/action/replication_record"}},"created_at":"2026-07-05T11:09:57.296570+00:00","updated_at":"2026-07-05T11:09:57.296570+00:00"}