{"as_of":"2026-08-18T13:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44cf0bf8d71f7efe38c1de7aa6ab63e21b18cda2777446942184fb451bcd33a2","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:42:09.234480Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.11997/citation-record","integrity":"/paper/2504.11997/integrity","json":"/paper/2504.11997/citation-record.json","paper":"/paper/2504.11997"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.616121Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":"c86d0eef-cbe1-4890-9a9b-3e9eef557d64","year":2011},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.136777Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:7db27c7f9f89433ac57a7169c47602526b980a9ed85ecedcd34ffe97f7616641","observation_id":"bf20c210-1e8f-4150-a5b6-21453d6537d1","resolution":{"observed_at":"2026-08-16T12:42:09.620630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.602444Z","title":"Near-opt imal regret bounds for reinforcement learn- ing","venue":null,"work_id":"464ca4a7-fa90-4ab3-87d6-617920ac68d2","year":2008},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.141280Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:c0ec6cb2720a40a05b743832d5738ea70b249fd23d5099abeb1fcfac15fbb5da","observation_id":"5f0c9a4d-d416-4a2a-9d54-0666df91980e","resolution":{"observed_at":"2026-08-16T12:42:09.607023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.588544Z","title":"Model-based reinforcement learning with value-targeted regression","venue":null,"work_id":"ac477998-16c5-44c3-87f7-713eb4692fb0","year":2020},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.145088Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:d0bc370bfe31ceabb4654c5297bfa2a4fbed67a0f5a01af9569964f630d911c9","observation_id":"1ea6fd89-cdc6-48f4-8e41-2abc1102bf37","resolution":{"observed_at":"2026-08-16T12:42:09.593152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.575714Z","title":"REGAL: a regularizati on based algorithm for reinforcement learn- ing in weakly communicating MDPs","venue":null,"work_id":"fca2e07b-76b2-46ac-853b-dd63938315b1","year":2009},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.148984Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:8df6bd2e42f086bd87aa5f1945fbea070a38de42a5830e764073b6f0476a711d","observation_id":"002223ee-3be3-4914-972c-8bb3ae082ce9","resolution":{"observed_at":"2026-08-16T12:42:09.579572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.563388Z","title":"Learning Inﬁnite- Horizon Average-Reward Linear Mixture MDPs of Bounded Span","venue":null,"work_id":"1316fcf5-1668-4935-b141-25c3b1b21e59","year":2025},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.153118Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:cc285493853948a41c3760fc5fb992244af4f5caf69a1d5b4076d6ec776ddc3f","observation_id":"31c5fe95-e827-45d8-9aee-9d599ebdc74a","resolution":{"observed_at":"2026-08-16T12:42:09.567360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.550836Z","title":"Efﬁcient bias-span- constrained exploration-exploitation in reinforcement l earning","venue":null,"work_id":"ad2800cc-dd53-472d-bc91-93ddbf945eab","year":2018},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.157133Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:64050d7c80c33ada3d725f55fa12aa712f5b4abe4be19c4bfce5072bd5928699","observation_id":"3c9707ba-a4c4-41bd-9b5b-39656b819037","resolution":{"observed_at":"2026-08-16T12:42:09.554902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.537952Z","title":"Inven tory management in supply chains: a re- inforcement learning approach","venue":null,"work_id":"c0012716-8d83-433d-b1c8-1d85c2d34ea5","year":2002},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.161662Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:1a2f1ef0ad818c7af82b1553936a6e3c206fd3cf3b317143d9e8b2b0b7fcdc26","observation_id":"d93434ac-c213-49e1-85fb-85fb567db066","resolution":{"observed_at":"2026-08-16T12:42:09.542022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.524529Z","title":"Can deep reinforce- ment learning improve inventory management? performance o n lost sales, dual-sourcing, and multi- echelon problems","venue":null,"work_id":"11167bef-f1ab-4754-b79c-43478d2f7cc9","year":2022},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.165411Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:fbee2caebf14309dd00024766b101755acb4e687ca90bef7f2fdcce8c0a74c75","observation_id":"4fda9f0f-7d61-40fc-a096-0838a5d95c09","resolution":{"observed_at":"2026-08-16T12:42:09.529036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.511503Z","title":"Reinforcement learning for long-run a verage cost","venue":null,"work_id":"c0c55f18-e475-4aab-b5b6-71da5a1e6ca2","year":2004},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.168956Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:23cfda417b398412cb19d05bab2460959e1b4c571580b23e05083fc2055d530c","observation_id":"98eaf7ce-6c45-4b91-965b-db82a068ab8d","resolution":{"observed_at":"2026-08-16T12:42:09.515365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.498520Z","title":"Sample-efﬁ cient Learning of Inﬁnite-horizon Average-reward MDPs with General Function Approximation","venue":null,"work_id":"4b86694d-94f2-4e2e-85f5-7f13c5023b21","year":2024},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.172453Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:0622fec2cff7a9b289e520cdd6609b809abd73a0e9306c24df7e96c2706e2bd6","observation_id":"a373189d-04ed-4aea-bb3f-17d2dc51226c","resolution":{"observed_at":"2026-08-16T12:42:09.502455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.485169Z","title":"Reinforcement Learn- ing for Inﬁnite-Horizon Average-Reward Linear MDPs via App roximation by Discounted-Reward MDPs","venue":null,"work_id":"6e23c4e9-d818-4c48-b2f5-85fb1d86a6f5","year":2025},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.175983Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:89d2cabbc03b1694ab843e900aaecbbcfe91577ff9d63259ef1c1934abd210df","observation_id":"24fdec2c-618e-4828-b6ce-4d8d17d54ab2","resolution":{"observed_at":"2026-08-16T12:42:09.489896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.471264Z","title":"Provably efﬁcient reinforcement learning with linear function approximation","venue":null,"work_id":"95f72676-f761-407e-a427-57d9e3b220a6","year":2020},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.179550Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:4d30dad9f1e76cf7745868306338e6c26465166e4dea8b6115e4642053bf27c0","observation_id":"e391adbc-7cf0-4878-8159-94883c14b200","resolution":{"observed_at":"2026-08-16T12:42:09.475838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.457141Z","title":"Towards tight bounds on th e sample complexity of average-reward MDPs","venue":null,"work_id":"c2b26e2c-a3a5-4639-ba8b-65df2e0529e2","year":2021},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.183813Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:d01d383d6ae4ac274fe608bf0eb58e412947660ac9ffa16818d18c8f5a52bc7e","observation_id":"657a964b-9e31-40c9-b403-68f9bd3a29ce","resolution":{"observed_at":"2026-08-16T12:42:09.461767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.442202Z","title":"Reinforcement learning based routin g in networks: Review and classiﬁcation of approaches","venue":null,"work_id":"1b2b3328-c7fb-4a9b-a52b-3893e21da82d","year":2019},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.187438Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:a9ed2ef45519c5e98ab8ed783128715d056ab192c00ed14aa2840fd79a658999","observation_id":"cedffd33-f0b3-448f-8bf8-2e0fd7300a92","resolution":{"observed_at":"2026-08-16T12:42:09.446829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.427224Z","title":"Sample complexity of reinforcement learning using linearly combined model ensembles","venue":null,"work_id":"58458a39-9fe8-47f5-afd9-67bd9b22efa3","year":2020},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.191051Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:1cf7d481bc6d8f26f69fb4128c69ce0f663dff9b6506955479ba150a05a69aaa","observation_id":"0c11398c-0252-4f53-9d54-307eef909972","resolution":{"observed_at":"2026-08-16T12:42:09.431697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00603","last_updated":"2022-12-01T15:57:58Z","snapshot_observed_at":"2026-08-16T16:11:42.655602Z","submitted_at":"2022-12-01T15:57:58Z","title":"Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00603","snapshot_observed_at":"2026-08-16T12:42:09.194938Z","title":"Near sample- optimal reduction-based policy learn- ing for average reward mdp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.194938Z"},"links":{"cited_paper":"/paper/2212.00603","citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:4007f22a6a83b1c8c05707797073e7b082ca784fe021a8713481bdab370bc0ff","observation_id":"1dbf06e3-abd3-41d1-b432-3413b6dc6477","resolution":{"observed_at":"2026-08-16T12:42:09.194938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08833","last_updated":"2024-02-12T19:06:53Z","snapshot_observed_at":"2026-08-18T11:10:48.482919Z","submitted_at":"2023-10-13T03:08:59Z","title":"Optimal Sample Complexity for Average Reward Markov Decision Processes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08833","snapshot_observed_at":"2026-08-16T12:42:09.198958Z","title":"Optimal Sample Complexity for Average Reward Markov Decision Processes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.198958Z"},"links":{"cited_paper":"/paper/2310.08833","citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:f65f3e42533e06db6a9460b72637e60de24c964f8c7a7ccea2d997b1360b30d6","observation_id":"217f2d16-2c1e-46c1-8c2e-141cdeb8a9cc","resolution":{"observed_at":"2026-08-16T12:42:09.198958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.412501Z","title":"Learning inﬁnite-horizon average-reward mdps with linear function approximation","venue":null,"work_id":"5e771773-fbea-41e9-8cdc-cec339bdab51","year":2021},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.203038Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:93a10585330d657c3a7edfeed3991a56345bcdcc2d2454eb04e59cfb1bd5d32b","observation_id":"67fd2d37-9401-4a37-83f0-86ede1737eaa","resolution":{"observed_at":"2026-08-16T12:42:09.417503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.398067Z","title":"Model-free reinforcement learning in inﬁnite-horizon average-rewar d markov decision processes","venue":null,"work_id":"b06659c5-3544-459c-b554-19250213fa1e","year":2020},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.206780Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:9d3579da6e847496db348b5004d63c51764beb79c8b83460fac023b51eec60aa","observation_id":"53a1d58c-2ca8-4d3b-b05c-fcaf71db6ffc","resolution":{"observed_at":"2026-08-16T12:42:09.402404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.384282Z","title":"Nearly minimax o ptimal regret for learning inﬁnite- horizon average-reward mdps with linear function approxim ation","venue":null,"work_id":"5022bdd1-4a21-49bd-a3bc-bef37936c561","year":2022},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.210522Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:d308177efe3c34e635a658001d8ea3896110a6b7969babd0ad9d6fa6a5804598","observation_id":"d2731aac-4d0a-458c-b9a5-3e15acf4d278","resolution":{"observed_at":"2026-08-16T12:42:09.388691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.369599Z","title":"Joint optimiz ation of preventive maintenance and production scheduling for multi-state production systems based on reinforcement learning","venue":null,"work_id":"db380a97-7d3c-4b18-b2f7-28aeb0b63325","year":2021},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.214369Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:d0dacfbf3ec84a4788185bfb29e757ceac09ddd25831b6ad9c6a585de4102bc7","observation_id":"0345c7d6-3486-466a-958a-fabedd69edf8","resolution":{"observed_at":"2026-08-16T12:42:09.373977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.355852Z","title":"Regret minimization for reinforcement learning by evaluating the optimal bias function","venue":null,"work_id":"4b6d36e1-6bb2-4164-8063-e50f3c4abcc0","year":2019},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.217863Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:9b699c2aa445eef37b9a8446efd8d516b3867be237116625f269e3ae891e2e5f","observation_id":"990b21e2-c469-466b-a0bc-df1453fd3a51","resolution":{"observed_at":"2026-08-16T12:42:09.360091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.341533Z","title":"Sharper Model-free Reinf orcement Learning for Average-reward Markov Decision Processes","venue":null,"work_id":"10644361-f5f1-4abf-a8b5-f8d2c3f4fc3a","year":2023},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.221490Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:3a2987554dc8919f74c52ef2acb3e09ac30f647cde95737f1f84932d47784d8c","observation_id":"d57704ee-93b7-40f9-8cb2-ac9df73c03b4","resolution":{"observed_at":"2026-08-16T12:42:09.346138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13469","last_updated":"2024-03-19T18:24:43Z","snapshot_observed_at":"2026-08-18T04:14:42.921726Z","submitted_at":"2023-11-22T15:34:44Z","title":"Span-Based Optimal Sample Complexity for Average Reward MDPs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13469","snapshot_observed_at":"2026-08-16T12:42:09.225245Z","title":"Span-Based Optimal Sam ple Complexity for Average Reward MDPs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.225245Z"},"links":{"cited_paper":"/paper/2311.13469","citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:a3691efba76ad2f75b99b05bfe00dcb18bb0d140a08f0df9c87bcc24e8cc2188","observation_id":"486aa4c3-e495-49a0-8ec6-1b840927354f","resolution":{"observed_at":"2026-08-16T12:42:09.225245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.325388Z","title":"If n is odd, we can take φ n = 0 and similar argument holds","venue":null,"work_id":"ef125c21-63ad-48a6-b66e-35f1bfb6405c","year":null},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.229998Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:43ba1eca5d8467b060296ff5128c10e6587207bd825d7bd1fef3d997910efe8a","observation_id":"5c22267d-d48d-4aa0-9489-d9849a5e0a23","resolution":{"observed_at":"2026-08-16T12:42:09.331024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:42:09.309039Z","title":"By Lemma 6, we have for t≥ 4, Qt u(s, a)≤ r(s, a) + γ[P V t u+1](s, a) + 2β‖ϕ (s, a)‖Λ −1 t + 2(mt−3− mt)","venue":null,"work_id":"209354ba-87cc-498c-999a-83a45db31f4d","year":null},"citing_paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:42:09.234480Z"},"links":{"citing_paper":"/paper/2504.11997"},"observation_digest":"sha256:edb3166f6eb59b94307bdd0feb8036ed958c880dc968e79be53c7d91f1e1a09a","observation_id":"f18c35c9-61d7-4e3d-be48-0c3248b617e2","resolution":{"observed_at":"2026-08-16T12:42:09.314883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.11997","last_updated":"2025-04-16T11:47:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T12:37:59.695645Z","submitted_at":"2025-04-16T11:47:41Z","title":"A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2504.11997."}