{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:YZOYZIQJDDXQ5PYL675IIN4QGN","short_pith_number":"pith:YZOYZIQJ","canonical_record":{"source":{"id":"2504.11997","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-04-16T11:47:41Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"127adf4853833dfd8abf73bacb06fde4730e26babb7bdc5fbf1cc6722c248bff","abstract_canon_sha256":"931e186826244a7414a8daa30b083e3542a8e8c019d34678868ab7e0bd84fba6"},"schema_version":"1.0"},"canonical_sha256":"c65d8ca20918ef0ebf0bf7fa84379033668592d1e6127c13951691ef67858975","source":{"kind":"arxiv","id":"2504.11997","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2504.11997","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"arxiv_version","alias_value":"2504.11997v1","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.11997","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"pith_short_12","alias_value":"YZOYZIQJDDXQ","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"pith_short_16","alias_value":"YZOYZIQJDDXQ5PYL","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"pith_short_8","alias_value":"YZOYZIQJ","created_at":"2026-07-05T10:50:00Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:YZOYZIQJDDXQ5PYL675IIN4QGN","target":"record","payload":{"canonical_record":{"source":{"id":"2504.11997","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-04-16T11:47:41Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"127adf4853833dfd8abf73bacb06fde4730e26babb7bdc5fbf1cc6722c248bff","abstract_canon_sha256":"931e186826244a7414a8daa30b083e3542a8e8c019d34678868ab7e0bd84fba6"},"schema_version":"1.0"},"canonical_sha256":"c65d8ca20918ef0ebf0bf7fa84379033668592d1e6127c13951691ef67858975","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:50:00.984513Z","signature_b64":"eATPuiObw/LsbXZ9paiy9ZBDhWUktMWZLgR/pP5lrkh15R9mdBT3jMKVDApClS8wylY4uSDoX4e9wYVZLI/gAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c65d8ca20918ef0ebf0bf7fa84379033668592d1e6127c13951691ef67858975","last_reissued_at":"2026-07-05T10:50:00.984037Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:50:00.984037Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2504.11997","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:50:00Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"xaks+OLXCDe1N+t8nJv7UeLjqzRnkvT7XcxSap7ZSkYORQ/erEdoDocpgQGOBQLRtPo/dTyaR3iwLFzWDTNtDA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-21T07:33:58.449993Z"},"content_sha256":"a28a9043a7fc0941c6377d1e3902b830a0154d490628ef2c7bfc945f8e3dd9f7","schema_version":"1.0","event_id":"sha256:a28a9043a7fc0941c6377d1e3902b830a0154d490628ef2c7bfc945f8e3dd9f7"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:YZOYZIQJDDXQ5PYL675IIN4QGN","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Ambuj Tewari, Kihyuk Hong","submitted_at":"2025-04-16T11:47:41Z","abstract_excerpt":"We study reinforcement learning in infinite-horizon average-reward settings with linear MDPs. Previous work addresses this problem by approximating the average-reward setting by discounted setting and employing a value iteration-based algorithm that uses clipping to constrain the span of the value function for improved statistical efficiency. However, the clipping procedure requires computing the minimum of the value function over the entire state space, which is prohibitive since the state space in linear MDP setting can be large or even infinite. In this paper, we introduce a value iteration"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.11997","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.11997/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:50:00Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"Q8L5OubhlXgI2Vk46MPmcNs5KGfROqiYu5dnXzAzEbo7G23wtYXcWT5tP+9X/vbizNgVzACiZZNQIHRtQoFDDQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-21T07:33:58.450578Z"},"content_sha256":"d6d71495586c9d9e9537b3bdfb3eb7783a286bc8e3d46d09748a069cea9ae04c","schema_version":"1.0","event_id":"sha256:d6d71495586c9d9e9537b3bdfb3eb7783a286bc8e3d46d09748a069cea9ae04c"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/YZOYZIQJDDXQ5PYL675IIN4QGN/bundle.json","state_url":"https://pith.science/pith/YZOYZIQJDDXQ5PYL675IIN4QGN/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/YZOYZIQJDDXQ5PYL675IIN4QGN/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-21T07:33:58Z","links":{"resolver":"https://pith.science/pith/YZOYZIQJDDXQ5PYL675IIN4QGN","bundle":"https://pith.science/pith/YZOYZIQJDDXQ5PYL675IIN4QGN/bundle.json","state":"https://pith.science/pith/YZOYZIQJDDXQ5PYL675IIN4QGN/state.json","well_known_bundle":"https://pith.science/.well-known/pith/YZOYZIQJDDXQ5PYL675IIN4QGN/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:YZOYZIQJDDXQ5PYL675IIN4QGN","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"931e186826244a7414a8daa30b083e3542a8e8c019d34678868ab7e0bd84fba6","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-04-16T11:47:41Z","title_canon_sha256":"127adf4853833dfd8abf73bacb06fde4730e26babb7bdc5fbf1cc6722c248bff"},"schema_version":"1.0","source":{"id":"2504.11997","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2504.11997","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"arxiv_version","alias_value":"2504.11997v1","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.11997","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"pith_short_12","alias_value":"YZOYZIQJDDXQ","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"pith_short_16","alias_value":"YZOYZIQJDDXQ5PYL","created_at":"2026-07-05T10:50:00Z"},{"alias_kind":"pith_short_8","alias_value":"YZOYZIQJ","created_at":"2026-07-05T10:50:00Z"}],"graph_snapshots":[{"event_id":"sha256:d6d71495586c9d9e9537b3bdfb3eb7783a286bc8e3d46d09748a069cea9ae04c","target":"graph","created_at":"2026-07-05T10:50:00Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2504.11997/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"We study reinforcement learning in infinite-horizon average-reward settings with linear MDPs. Previous work addresses this problem by approximating the average-reward setting by discounted setting and employing a value iteration-based algorithm that uses clipping to constrain the span of the value function for improved statistical efficiency. However, the clipping procedure requires computing the minimum of the value function over the entire state space, which is prohibitive since the state space in linear MDP setting can be large or even infinite. In this paper, we introduce a value iteration","authors_text":"Ambuj Tewari, Kihyuk Hong","cross_cats":["cs.AI"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.11997","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:a28a9043a7fc0941c6377d1e3902b830a0154d490628ef2c7bfc945f8e3dd9f7","target":"record","created_at":"2026-07-05T10:50:00Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"931e186826244a7414a8daa30b083e3542a8e8c019d34678868ab7e0bd84fba6","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-04-16T11:47:41Z","title_canon_sha256":"127adf4853833dfd8abf73bacb06fde4730e26babb7bdc5fbf1cc6722c248bff"},"schema_version":"1.0","source":{"id":"2504.11997","kind":"arxiv","version":1}},"canonical_sha256":"c65d8ca20918ef0ebf0bf7fa84379033668592d1e6127c13951691ef67858975","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"c65d8ca20918ef0ebf0bf7fa84379033668592d1e6127c13951691ef67858975","first_computed_at":"2026-07-05T10:50:00.984037Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:50:00.984037Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"eATPuiObw/LsbXZ9paiy9ZBDhWUktMWZLgR/pP5lrkh15R9mdBT3jMKVDApClS8wylY4uSDoX4e9wYVZLI/gAw==","signature_status":"signed_v1","signed_at":"2026-07-05T10:50:00.984513Z","signed_message":"canonical_sha256_bytes"},"source_id":"2504.11997","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:a28a9043a7fc0941c6377d1e3902b830a0154d490628ef2c7bfc945f8e3dd9f7","sha256:d6d71495586c9d9e9537b3bdfb3eb7783a286bc8e3d46d09748a069cea9ae04c"],"state_sha256":"883de940239a2681d0ddc67b74e666447adf6d928dfa9a0e114ddbe295b0aead"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"+znd7hl8z4u/RH5iiyltZECptRcbPQGtBGmtWXw/uBtA8FkFUD0D+badsyjmKkP3XWmxBUYyFE4WsTBW0nqXAg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-21T07:33:58.455788Z","bundle_sha256":"baf601b6589bb03d908161d8ca6b06f4220d7767d2fb27e65689cc2d3d57b42d"}}