{"as_of":"2026-08-21T02:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c3c16234471b13fad2833c97114fa5e17cbc52db54ca0c54acf7f7c038e28e2","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:18:52.722594Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.10906/citation-record","integrity":"/paper/2411.10906/integrity","json":"/paper/2411.10906/citation-record.json","paper":"/paper/2411.10906"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.387001Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"fd8369db-a125-450f-b53c-0ff9bc4f89b8","year":2008},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.540827Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:11a370d983c1d0e601954d906d966df2493be931b463daf6e3ff743343300187","observation_id":"1398c259-6c1b-47a2-8ff9-9a44ff679c91","resolution":{"observed_at":"2026-08-12T19:18:53.392987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.368771Z","title":"Modular multitask reinforcement learning with policy sketches","venue":null,"work_id":"01cb0afc-56c9-4f68-84f1-a77e34ae1ab2","year":2017},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.546721Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:f55005780f9077b91ff5aee3ca25ac524c9056c4e31d7fba7de631df583cb56e","observation_id":"a6b2ad8b-b71b-4e4b-9143-12d427be329c","resolution":{"observed_at":"2026-08-12T19:18:53.374662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.351790Z","title":"Litvak, Alain Pajor, and Nicole Tomczak-Jaegermann","venue":null,"work_id":"a37dac27-ec63-4328-b96a-7ff02555d8ae","year":2012},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.552482Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:95cbab3d249a46cef8c1daf80235476853d5280259dac2697bf7df3e38cdf305","observation_id":"b19f5de2-0bf4-413c-accf-cef2344cd4a5","resolution":{"observed_at":"2026-08-12T19:18:53.357070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.334696Z","title":"Logarithmic online regret bounds for undiscounted reinforcement learning","venue":null,"work_id":"6a47744d-1bb9-4a5f-95ce-0a51438fd75f","year":2006},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.557621Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:35e209f47488548cf59d852e6ff38d4bc877a65a3fe2dacccfa2b14b21dab06a","observation_id":"bf0b6466-2172-4009-8e4e-b2eb003ca2e0","resolution":{"observed_at":"2026-08-12T19:18:53.340239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.314569Z","title":"Bellemare, Joel Veness, and Michael Bowling","venue":null,"work_id":"48721e23-0e6a-44e3-9007-b11e86e186e1","year":2012},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.563350Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:0cac3858b2ab6a4412b4355aa4bdc6331b422c6fd3955e2c1046be50969ee2c7","observation_id":"e1ca11dc-8f20-4c53-8c7b-fe88ab9a6e1e","resolution":{"observed_at":"2026-08-12T19:18:53.321736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.296368Z","title":"Vallis, Bruno Lacerda, and Nick Hawes","venue":null,"work_id":"07e762db-a23a-471f-8415-50a955ad1c10","year":2023},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.568988Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:3216c8f4995b0848f31f70e4c2af2134b5a418a5475da34557e7c0d288460638","observation_id":"97a11bf9-ea1d-41d7-ab13-f446d8389c64","resolution":{"observed_at":"2026-08-12T19:18:53.302275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.276391Z","title":"Towards deployment-efficient reinforcement learning: Lower bound and optimality","venue":null,"work_id":"7b6eeb4a-e97c-4c89-bcdb-b6f61e9155d8","year":2022},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.574866Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:b526e970cacb602f5e09ddeffdda16c7647e0c8520161e5223f30212cba6b48a","observation_id":"d3c4d07f-28e5-4dea-8ca1-9d678e81d4e3","resolution":{"observed_at":"2026-08-12T19:18:53.283165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.257177Z","title":"Model-based reinforcement learning with multinomial logistic function approximation","venue":null,"work_id":"f51e6b73-96bc-4144-a247-29d8d9cd79ed","year":2023},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.580669Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:289b611d34fde1e989b72cb9f576de559693806a5d996c78e281e543f52f00b1","observation_id":"372f5dd2-d667-4c9a-aed9-75d1857ce6d9","resolution":{"observed_at":"2026-08-12T19:18:53.262635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.238114Z","title":"Nearly minimax optimal reinforcement learning for linear markov decision processes","venue":null,"work_id":"977a0159-856d-4473-b9e5-0cb80f6ef807","year":2023},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.586857Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:a1aa1bd6dd3a9c278eea40dcc6897fd611c3213ef937ca9bd2d4e2aada6e8493","observation_id":"f6552027-5548-461a-9955-079db7117c44","resolution":{"observed_at":"2026-08-12T19:18:53.245058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.216532Z","title":null,"venue":null,"work_id":"85fc5027-4672-45ae-bbeb-bd1614802e99","year":2023},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.592143Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:b4796745a151ee2ee865bdae9545c41eca427d2a0e7ddd7fdd4a67176c52bf9d","observation_id":"9bdbc462-3502-4ced-a7b9-6cc5e73d21a9","resolution":{"observed_at":"2026-08-12T19:18:53.221892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.196686Z","title":"Sample-efficient reinforcement learning is feasible for linearly realizable mdps with limited revisiting","venue":null,"work_id":"ce5a8a82-b7c5-440f-a18b-246af01e876c","year":2021},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.597152Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:9cd17e5ca3559470b020947afd5435e09d4212ad6a0d7e4479c08cb1b3b2db9d","observation_id":"f82889a5-f102-4f89-9389-c60329763d65","resolution":{"observed_at":"2026-08-12T19:18:53.202779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.177079Z","title":"Reinforcement learning and bandits for speech and language processing: Tutorial, review and outlook","venue":null,"work_id":"b3eece48-fa99-4aa7-a102-5e676596866d","year":2024},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.602688Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:aadb9c6b8f709db33d9fcd108368dc144b57047c4117c9b4da2859ac74030952","observation_id":"62607fc6-5394-4e64-bfc2-4c11e4c763b9","resolution":{"observed_at":"2026-08-12T19:18:53.183796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.158406Z","title":"Bandit Algorithms , 2020","venue":null,"work_id":"40cbd1d7-3cf2-4ce2-906d-ba6d755cb276","year":2020},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.608122Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:b00cfa425d532ebf5d1fc875608a4dda8771c3857554bd6594c22b093f35004a","observation_id":"363e5c45-ff6d-4d6b-84a0-5c2db4407193","resolution":{"observed_at":"2026-08-12T19:18:53.164415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-17T11:02:06.117758Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-12T19:18:52.613740Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.613740Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:71a05e622fb5546ab159e4d76a837d0ae08bfff82af2db4b89053c4ddbbbfa84","observation_id":"edf825ab-7dd8-48cd-9259-1bc7e99ec9f3","resolution":{"observed_at":"2026-08-12T19:18:52.613740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.140563Z","title":"Machado, Marc G","venue":null,"work_id":"5d4c733b-becd-4a6a-b329-ca29837eba51","year":2018},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.619774Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:5fde0128c046fd8ae2a61f1210c7829d186bd9e31f4b5178b4575b3e4a1f9819","observation_id":"3821c233-1aad-46e0-bef1-2349c716c40f","resolution":{"observed_at":"2026-08-12T19:18:53.145694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T19:18:52.625740Z","title":"Riedmiller","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.625740Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:3bfff979bb89935fdaaf7ff8f04bbeafcdd6352ff7ff878d488828ab11e8852f","observation_id":"32e0c405-9279-463b-ab75-872609f8c0fc","resolution":{"observed_at":"2026-08-12T19:18:52.625740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:52.631053Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.631053Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:89fbf89375da69cfca93caad2fc68896bce40d6cef4de50a5ad6223b8a817b61","observation_id":"d3e5d9aa-7d43-4023-9463-b9eaa3702465","resolution":{"observed_at":"2026-08-12T19:18:52.631053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07695","last_updated":"2023-02-15T14:46:19Z","snapshot_observed_at":"2026-08-16T15:55:09.009591Z","submitted_at":"2023-02-15T14:46:19Z","title":"Genetic multi-armed bandits: a reinforcement learning approach for discrete optimization via simulation","version":1},"cited_work":{"arxiv_id":"2302.07695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07695","snapshot_observed_at":"2026-08-12T19:18:52.818585Z","title":"Genetic multi-armed bandits: a reinforcement learning approach for discrete optimization via simulation","venue":"cs.NE","work_id":"bd490d53-8375-43ab-a85e-64fba318ba1c","year":2023},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.636418Z"},"links":{"cited_paper":"/paper/2302.07695","citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:ef680cba74da0a15c9b8c9e326aa1431d47c16178277591b2b8a9b1565224c79","observation_id":"b45d5a89-f0e8-47a8-a0c9-41a8f31d7b08","resolution":{"observed_at":"2026-08-12T19:18:52.825722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.106168Z","title":"Reinforcement learning in linear mdps: Constant regret and representation selection","venue":null,"work_id":"4d4f3582-feb0-4aaf-b9d8-9da06e0347e8","year":2021},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.641955Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:239f08e659e63b2b7c941497cf32442762498d8af3cddf5235bd23e0a0a863b2","observation_id":"24aae1bb-eed8-4143-8c25-ede472d695c1","resolution":{"observed_at":"2026-08-12T19:18:53.112624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.087428Z","title":"Markov decision processes: discrete stochastic dynamic programming, 2014","venue":null,"work_id":"c026f9bf-c970-42a4-8f5e-b2142e47e358","year":2014},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.647476Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:acee6b363cefc0ab46677e339aac5925d719832620d4d146be354f1e1c42b34c","observation_id":"83d266a6-519a-4f58-8dbe-b371f0cacf06","resolution":{"observed_at":"2026-08-12T19:18:53.093425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.067485Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":"15fd0fc5-3308-47e5-bb51-d53b468087c2","year":2018},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.653917Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:839ed64be5c4dd3cd87b8d2a8eb9684929bd3ecccb50000c627e5ea8c7b53444","observation_id":"c93c46c4-b60c-442f-ab8f-d8a4a63c2ca0","resolution":{"observed_at":"2026-08-12T19:18:53.073031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08285","last_updated":"2021-06-08T16:45:58Z","snapshot_observed_at":"2026-08-16T18:24:03.782939Z","submitted_at":"2021-05-18T05:23:53Z","title":"Sublinear Least-Squares Value Iteration via Locality Sensitive Hashing","version":2},"cited_work":{"arxiv_id":"2105.08285","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.08285","snapshot_observed_at":"2026-08-12T19:18:52.786525Z","title":"Sublinear Least-Squares Value Iteration via Locality Sensitive Hashing","venue":"cs.DS","work_id":"9659d269-a740-4b02-ad7d-0889864b4aa9","year":2021},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.659457Z"},"links":{"cited_paper":"/paper/2105.08285","citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:1ade18f326fb9979e8365f5eb1a399cef946958b35c7b8a26c27460582885e76","observation_id":"c47c58c6-9b23-4118-9462-ebd840b1094e","resolution":{"observed_at":"2026-08-12T19:18:52.794687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T19:18:52.665619Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.665619Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:d4a01b87e637b5659ec71062ec87c5448dd502e5814e68d22a65a27bc5968395","observation_id":"d6d8bb08-1128-40a9-a6f7-f0c9672a9860","resolution":{"observed_at":"2026-08-12T19:18:52.665619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.049485Z","title":"Sketching for first order method: Efficient algorithm for low-bandwidth channel and vulnerability","venue":null,"work_id":"479c5278-d944-43cd-9953-59972711d446","year":2023},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.670906Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:f1266302db9b65fc9119b5981596b11806cdb402d75494266d7f0873fcbec67e","observation_id":"bbcda732-6ebe-47c8-b30b-a4ea4e5ee5eb","resolution":{"observed_at":"2026-08-12T19:18:53.054990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.031179Z","title":"Sketching linear classifiers over data streams","venue":null,"work_id":"146399a4-bc78-4602-8ba7-b7820002d3e5","year":2018},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.676065Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:7a4973290a17e7c49e78d60c2e9ce9809b6f5e451dc2645f1c5a160c44a21d0d","observation_id":"ab10977e-602d-4db6-9050-5247ad61381b","resolution":{"observed_at":"2026-08-12T19:18:53.036963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:53.013096Z","title":"How close is the sample covariance matrix to the actual covariance matrix?, 2010","venue":null,"work_id":"5f2b0895-42a1-4f3e-94c6-73a3da456419","year":2010},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.681797Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:73d9b224814d8ba0635b140d34fe3da7a48fbc98ae81bbee526ba55655563acb","observation_id":"2717ec9d-87f1-4481-8d9b-643746ffa28a","resolution":{"observed_at":"2026-08-12T19:18:53.018862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:52.994584Z","title":"Wagenmaker, Yifang Chen, Max Simchowitz, Simon S","venue":null,"work_id":"7dda57b2-b63b-4c41-a279-1b64b9abe49e","year":2022},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.687293Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:cd91ddf3e240675043dc60a536af187a4cfc54b96287def95d0d87534808196f","observation_id":"b9dfbbbb-9606-49cd-b601-3f8bd5a893f5","resolution":{"observed_at":"2026-08-12T19:18:52.999857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:52.693929Z","title":"Woodruff","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.693929Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:616c75a6c1dccde04f722db4b98b4473ce0b8d3d1c29c1d260b91a083df4bcfc","observation_id":"cc067ae4-1ac6-4bc0-890f-d8d15c9095c4","resolution":{"observed_at":"2026-08-12T19:18:52.693929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:52.961568Z","title":"Provably efficient reinforcement learning with linear function approximation under adaptivity constraints","venue":null,"work_id":"56d2c25f-5b5d-463a-a3c0-a79ea59cc2a4","year":2021},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.699407Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:78f61730f5adb3151f4d8397defcbf33db816a7d26c0a73304eeb3f6e33a17ab","observation_id":"c4134514-bf53-49fa-abf3-c6881c820739","resolution":{"observed_at":"2026-08-12T19:18:52.967458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:52.943248Z","title":"A general framework for sequential decision-making under adaptivity constraints","venue":null,"work_id":"c4c7a354-1808-419d-a39c-00824dabf1af","year":2024},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.706073Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:ff0b7d46a95ea88d87db2781182922c0e67222fedf65db41f971f1d63151cb8d","observation_id":"4c7a4f59-bac1-4d04-95b2-77bf3ea2cd6c","resolution":{"observed_at":"2026-08-12T19:18:52.949510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:52.924752Z","title":"Reinforcement learning in feature space: Matrix bandit, kernels, and regret bound","venue":null,"work_id":"71cce1aa-7f6c-4387-b2b6-8ef2051aeffa","year":2020},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.711923Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:24af687ecf3db11a5ba754aee1ecee69fe605a27cc39d2c648121457906b638b","observation_id":"dd6ca5f4-986f-4186-9216-2d7eba72a948","resolution":{"observed_at":"2026-08-12T19:18:52.930717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:52.906053Z","title":"Varshney, and Ashish Jagmohan","venue":null,"work_id":"7803b124-4bed-461f-9a50-319d4091894e","year":2022},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.717114Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:a1fde0165fb3aa521a74821059883032d710909f6dfbeea0ae91cc70c81841d8","observation_id":"3ec2eaef-735e-4c4c-8eae-2c4b6c9f5d15","resolution":{"observed_at":"2026-08-12T19:18:52.911774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:18:52.883542Z","title":"Making linear mdps practical via contrastive representation learning","venue":null,"work_id":"b5e74edb-a5f9-4eeb-a5a3-f13629dccc9f","year":2022},"citing_paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T19:18:52.722594Z"},"links":{"citing_paper":"/paper/2411.10906"},"observation_digest":"sha256:bd39ff0424d7632389b81d58229c014755c8fb7cb5c5c0d3b4fb1fde59719522","observation_id":"17ccee87-b0e9-4823-b61d-0af3101ee28a","resolution":{"observed_at":"2026-08-12T19:18:52.892212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10906","last_updated":"2024-11-16T22:51:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T11:05:08.268686Z","submitted_at":"2024-11-16T22:51:52Z","title":"Efficient, Low-Regret, Online Reinforcement Learning for Linear MDPs"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2411.10906."}