{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:CQ2KQW3ICH7JMPNB5DJYEMCGJT","short_pith_number":"pith:CQ2KQW3I","schema_version":"1.0","canonical_sha256":"1434a85b6811fe963da1e8d38230464cfb022708bd85d147640158ae12f3178b","source":{"kind":"arxiv","id":"2405.20165","version":2},"attestation_state":"computed","paper":{"title":"Randomized Exploration for Reinforcement Learning with Multinomial Logistic Function Approximation","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"stat.ML","authors_text":"Joongkyu Lee, Min-hwan Oh, TaeHyun Hwang, Wooseong Cho","submitted_at":"2024-05-30T15:39:19Z","abstract_excerpt":"We study reinforcement learning with multinomial logistic (MNL) function approximation where the underlying transition probability kernel of the Markov decision processes (MDPs) is parametrized by an unknown transition core with features of state and action. For the finite horizon episodic setting with inhomogeneous state transitions, we propose provably efficient algorithms with randomized exploration having frequentist regret guarantees. For our first algorithm, $\\texttt{RRL-MNL}$, we adapt optimistic sampling to ensure the optimism of the estimated value function with sufficient frequency. "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.20165","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"stat.ML","submitted_at":"2024-05-30T15:39:19Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"128a16c3f9637fd26ef1905afc090551315dec013edb7a4f07c1a1905d39cd40","abstract_canon_sha256":"5b7edd125e25531c31f0d0b6023fdf8f87eff1568da0d74d49eb55774f1b0e07"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:28:50.685847Z","signature_b64":"+Cjez7ImlIE71CsTKE5imbp24cv6eA3PiByfD1xkWbk+19n2Dp17mijuQckIrwhU9udrHnRQS87HvlXbk9w/Cw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1434a85b6811fe963da1e8d38230464cfb022708bd85d147640158ae12f3178b","last_reissued_at":"2026-07-05T09:28:50.685345Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:28:50.685345Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Randomized Exploration for Reinforcement Learning with Multinomial Logistic Function Approximation","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"stat.ML","authors_text":"Joongkyu Lee, Min-hwan Oh, TaeHyun Hwang, Wooseong Cho","submitted_at":"2024-05-30T15:39:19Z","abstract_excerpt":"We study reinforcement learning with multinomial logistic (MNL) function approximation where the underlying transition probability kernel of the Markov decision processes (MDPs) is parametrized by an unknown transition core with features of state and action. For the finite horizon episodic setting with inhomogeneous state transitions, we propose provably efficient algorithms with randomized exploration having frequentist regret guarantees. For our first algorithm, $\\texttt{RRL-MNL}$, we adapt optimistic sampling to ensure the optimism of the estimated value function with sufficient frequency. "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.20165","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.20165/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.20165","created_at":"2026-07-05T09:28:50.685416+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.20165v2","created_at":"2026-07-05T09:28:50.685416+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.20165","created_at":"2026-07-05T09:28:50.685416+00:00"},{"alias_kind":"pith_short_12","alias_value":"CQ2KQW3ICH7J","created_at":"2026-07-05T09:28:50.685416+00:00"},{"alias_kind":"pith_short_16","alias_value":"CQ2KQW3ICH7JMPNB","created_at":"2026-07-05T09:28:50.685416+00:00"},{"alias_kind":"pith_short_8","alias_value":"CQ2KQW3I","created_at":"2026-07-05T09:28:50.685416+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2502.10020","citing_title":"Improved Online Confidence Bounds for Multinomial Logistic Bandits","ref_index":7,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT","json":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT.json","graph_json":"https://pith.science/api/pith-number/CQ2KQW3ICH7JMPNB5DJYEMCGJT/graph.json","events_json":"https://pith.science/api/pith-number/CQ2KQW3ICH7JMPNB5DJYEMCGJT/events.json","paper":"https://pith.science/paper/CQ2KQW3I"},"agent_actions":{"view_html":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT","download_json":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT.json","view_paper":"https://pith.science/paper/CQ2KQW3I","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.20165&json=true","fetch_graph":"https://pith.science/api/pith-number/CQ2KQW3ICH7JMPNB5DJYEMCGJT/graph.json","fetch_events":"https://pith.science/api/pith-number/CQ2KQW3ICH7JMPNB5DJYEMCGJT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT/action/storage_attestation","attest_author":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT/action/author_attestation","sign_citation":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT/action/citation_signature","submit_replication":"https://pith.science/pith/CQ2KQW3ICH7JMPNB5DJYEMCGJT/action/replication_record"}},"created_at":"2026-07-05T09:28:50.685416+00:00","updated_at":"2026-07-05T09:28:50.685416+00:00"}