{"as_of":"2026-08-07T18:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82ed8ae7100107f589e0cdd032f3246b798a81260656eb04ad4b8d16696c617a","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:35:27.824202Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.08436/citation-record","integrity":"/paper/2508.08436/integrity","json":"/paper/2508.08436/citation-record.json","paper":"/paper/2508.08436"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:36.585714Z","title":"Normal approximation for stochastic gradient descent via non-asymptotic rates of martingale clt","venue":null,"work_id":"2547aa7b-898f-4d82-bd98-c483c9765863","year":2019},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:23.798849Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:3bda958bde8bd14544ce398106ff0e5dad8c60ee8fa494a86cb83267b27a2c41","observation_id":"60bb9e6b-52c1-4116-9982-3b30e9f26cf4","resolution":{"observed_at":"2026-08-05T21:35:36.674006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:36.388232Z","title":"Adaptive control","venue":null,"work_id":"e1e9a84b-1220-4618-a61c-43f3e46769b3","year":1995},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:23.844321Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:d2f91f593b52b601bc12290bbbc1b95ccc15650818863d2f6314d69e97114c70","observation_id":"3199ac5b-498f-4ef3-9568-7f0e4bdfbafb","resolution":{"observed_at":"2026-08-05T21:35:36.464013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:36.248606Z","title":"Logarithmic regret for episodic continuous-time linear-quadratic reinforcement learning over a finite-time horizon","venue":null,"work_id":"b6837502-c252-4168-aade-dc1da49985a1","year":2022},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:23.885776Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:4438452a7df5d44a03abb6428fd8cf5f02fb4bc2e74c3361a8bcb6be252ffe85","observation_id":"ba82c5a5-668d-4e0b-9964-43deed480fbc","resolution":{"observed_at":"2026-08-05T21:35:36.327979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:36.019107Z","title":"Adaptive control with the stochastic approximation algorithm: Geometry and convergence","venue":null,"work_id":"3f3ded27-9577-463d-8527-5370a965b546","year":1985},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:23.974853Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:67ed3b129d065c389d817c2ba36a0746ece0767c9c6298c38d4da15469c45297","observation_id":"d460d6e4-d5e4-47c8-bee7-cdd8a10eb7c0","resolution":{"observed_at":"2026-08-05T21:35:36.121599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:35.836851Z","title":"Dynamic programming and optimal control: Volume I , volume 4","venue":null,"work_id":"5f903cd8-4d93-441a-9c79-a9292c1d223c","year":2012},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.061034Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:6fe28471c6d4b84530e58661f7b9ece328a715281dd436a8672d3b174574e062","observation_id":"aaad1fa6-b5a3-43de-927a-534f9dcfc526","resolution":{"observed_at":"2026-08-05T21:35:35.925538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:35.620017Z","title":"Reinforcement learning applied to linear quadratic regulation","venue":null,"work_id":"8792efb0-d896-4274-a8b0-ad655d56fb52","year":1992},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.177822Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:1286c11822620352cd793100b61eb76941f402e034015944577f5ada6a5d272f","observation_id":"9b498ff2-d462-4347-bcde-18f845d587a2","resolution":{"observed_at":"2026-08-05T21:35:35.688872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04295","last_updated":"2025-04-28T23:55:02Z","snapshot_observed_at":"2026-07-06T08:28:15.985260Z","submitted_at":"2019-10-09T23:19:39Z","title":"Linear-Quadratic Mean-Field Reinforcement Learning: Convergence of Policy Gradient Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04295","snapshot_observed_at":"2026-08-05T21:35:24.252521Z","title":"Linear-quadratic mean-field reinforcement learning: convergence of policy gradient methods","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.252521Z"},"links":{"cited_paper":"/paper/1910.04295","citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:0a5aa8a91a0a67e4b802d7500d5fa4bb2b4ae335fd74b25758892cd93a8cd0bd","observation_id":"1157fc72-6af4-465d-b37b-4467c5d41ba4","resolution":{"observed_at":"2026-08-05T21:35:24.252521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:35.446930Z","title":"Statistical inference for online decision making via stochastic gradient descent","venue":null,"work_id":"fa575e1c-1943-41f9-b5c2-96552d5c5ed0","year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.312545Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:4c34ed935c8f94023b28f2ab0f1f1a4f2da6e4dc445e0fd0349de35153d2293a","observation_id":"9542fdcd-b05b-4aa5-b292-357ad7a7166d","resolution":{"observed_at":"2026-08-05T21:35:35.529353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:35.260862Z","title":"Statistical inference for model parameters in stochastic gradient descent","venue":null,"work_id":"1d644ecf-f5b7-48b2-b388-2218c044c8e1","year":2020},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.351893Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:78e778a7c5ddbc0fb0094363b3fc4d366d5b2f7cb0e4dd1420484dba214a1e9c","observation_id":"39472f0f-c982-4e40-b087-97cc71a7fa31","resolution":{"observed_at":"2026-08-05T21:35:35.356129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:35.049109Z","title":"Robust inference via multiplier bootstrap","venue":null,"work_id":"9ebec241-6ed1-4baa-88e6-54e244e482f6","year":2020},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.431215Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:7269c8ab9cc0de4681d3daac3b91e285f525cffc161d0dc59882cc2f9d6a1739","observation_id":"c2c11bd4-9725-4966-ba3b-3c76681f879b","resolution":{"observed_at":"2026-08-05T21:35:35.130232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:24.507547Z","title":"On the sample complexity of the linear quadratic regulator","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.507547Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:76fd97332fd217823f597401302c7e01a8868bd573e5a6418b73534aeabcc631","observation_id":"618178cc-5fd5-4d0c-90fc-dc6a9eebd61d","resolution":{"observed_at":"2026-08-05T21:35:24.507547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:34.879160Z","title":"Challenges of reinforcement learning","venue":null,"work_id":"3d58bc67-e6a3-4731-afd1-7d1d415d3c3f","year":2020},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.579776Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:a1bf54e9dafeb15c9e5ecfc23947228fbfe9364baf2a0cc222bb10ee1fa51f98","observation_id":"a2d1892e-a99d-49fe-a8bd-3a3e62f4c9fe","resolution":{"observed_at":"2026-08-05T21:35:34.966921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:34.694240Z","title":"Challenges of real-world reinforcement learning: definitions, benchmarks and analysis","venue":null,"work_id":"0078ba38-faeb-4465-9120-809622910d0e","year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.650888Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:a0071720b5c9ad75bbb1864050b682bc0ab8ade7174928bf7a9975e0bb5c2c0f","observation_id":"61a1fb16-e1db-4c3e-a0b2-89e0f6070336","resolution":{"observed_at":"2026-08-05T21:35:34.812742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:34.440168Z","title":"On the convergence theory of debiased model-agnostic meta-reinforcement learning","venue":null,"work_id":"89a4a5f4-3177-4bb9-bf91-7d0510b4262f","year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.720287Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:1e43569c3fd0973f5bb4095ba1c7beb3fde7511bc56972f5758409bc296ed357","observation_id":"16510445-8a5f-40b8-98ab-4543b24c3fb7","resolution":{"observed_at":"2026-08-05T21:35:34.551613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:34.148635Z","title":"Online bootstrap confidence intervals for the stochastic gradient descent estimator","venue":null,"work_id":"7b727514-5684-4c99-8827-c43eaa38da5b","year":2018},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.763782Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:52577f8fa985ab89dd5e63ab6873fed4b46dde2d80675936e6f9d6f526bb9974","observation_id":"5d085cb1-e113-402c-9a05-f1995d8cebc5","resolution":{"observed_at":"2026-08-05T21:35:34.253477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:33.988005Z","title":"Global convergence of policy gradient methods for the linear quadratic regulator","venue":null,"work_id":"8b235a74-2498-480b-99c7-de200c48c837","year":2018},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.816293Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:5cbbe357d0ae9fb9f08a1579c9526d96baf4dd9beaf345cd46e11f45eccfc02d","observation_id":"43d704f2-298b-4d3d-a850-d1d5cad672cc","resolution":{"observed_at":"2026-08-05T21:35:34.063605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:33.675720Z","title":"Convergence of policy gradient methods for finite-horizon exploratory linear-quadratic control problems","venue":null,"work_id":"1f589a16-58b6-4191-8ab9-2c2d89a50452","year":2024},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.894628Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:667928efd696b89eec4a70affbeb8ba7162fb8a97f4d54c2302d8a380784dd25","observation_id":"784d7f5b-b5ee-4f7f-9fc0-2518b2c347cc","resolution":{"observed_at":"2026-08-05T21:35:33.832945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:33.390447Z","title":"Reinforcement learning for linear-convex models with jumps via stability analysis of feedback controls","venue":null,"work_id":"8d4d4a44-d39f-419a-9522-cf15df633e41","year":2023},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:24.975470Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:b910307b983ede218304a48045c58f79321aa051ff3fb7f695f5170bb7dad226","observation_id":"56470e8b-ced4-404f-8470-f61f57a7ba36","resolution":{"observed_at":"2026-08-05T21:35:33.518251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:33.197532Z","title":"Policy gradient methods for the noisy linear quadratic regulator over a finite horizon","venue":null,"work_id":"5b8db4eb-2f94-4967-be5f-0320d97a3616","year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.083912Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:881ead5f95fb2001e2f9bafaf23c546e37dbb05c9af2d0c8463f797c7c9526cf","observation_id":"5e84d419-1be6-43ef-a171-90223ace1d2d","resolution":{"observed_at":"2026-08-05T21:35:33.307106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:32.938223Z","title":"Bootstrapping upper confidence bound","venue":null,"work_id":"483fa3e2-a601-4f22-9500-a0ae0e175ade","year":2019},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.186107Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:c734ac5df55b23aaa801d507cfcd5d980b398fae91dd2f106ffb5de90524e2ae","observation_id":"230fdaaf-92fe-43e4-b115-fa6a57d1d6fb","resolution":{"observed_at":"2026-08-05T21:35:33.045307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:32.643259Z","title":"Model-based or model-free, a review of approaches in reinforcement learning","venue":null,"work_id":"81d54f4e-e8b0-408a-b641-ed475f04dfd5","year":2020},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.271012Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:0521d6e669d0e416b21d78d4a747405ab891956f6709a2141bb1fa0ee5e849c1","observation_id":"1824c0d6-9934-4a8b-875a-ce502789a0ba","resolution":{"observed_at":"2026-08-05T21:35:32.809383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:32.373564Z","title":"Improved zeroth-order variance reduced algorithms and analysis for nonconvex optimization","venue":null,"work_id":"5317134f-40d8-4940-9f56-e55a3c38e065","year":2019},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.382262Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:1ff6139f159925b8feabaf9f62b991d452c758b75f88029873d6bd5679915701","observation_id":"d3bd7a1f-f21a-4334-be3d-23566858cd6c","resolution":{"observed_at":"2026-08-05T21:35:32.496520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:32.104741Z","title":"On incomplete learning and certainty-equivalence control","venue":null,"work_id":"da37d780-f401-4399-9e86-1cc519ae50ec","year":2018},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.472692Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:3f8e764d94115f938d21d9f738b8b31fd58f949c3fd12cc00ee9f89c7c96599f","observation_id":"66e8339b-58a2-4b8c-ba4f-0dbee8facd9e","resolution":{"observed_at":"2026-08-05T21:35:32.213608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:31.925491Z","title":"Iterated least squares in multiperiod control","venue":null,"work_id":"fbe95867-0121-4a6e-baca-489a28d28c21","year":1982},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.550290Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:d7c996b4025eda54bd856a6a0aa0a275a09f230c7b28147188ddddb37127c79a","observation_id":"bc17931f-76a1-4e95-8317-0c21a9ca6694","resolution":{"observed_at":"2026-08-05T21:35:32.019692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:31.806124Z","title":"Fast inference for quantile regression with tens of millions of observations","venue":null,"work_id":"51c2c807-e73e-4dcf-821a-595c3eb7d295","year":2024},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.619163Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:4132458bd29091a51d647006e217cabe84462d828ee6840c461903384230ca73","observation_id":"2257be21-7815-492a-a897-19265deda77c","resolution":{"observed_at":"2026-08-05T21:35:31.868085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01326","last_updated":"2021-12-17T13:07:02Z","snapshot_observed_at":"2026-07-06T11:43:57.564136Z","submitted_at":"2021-09-03T06:02:19Z","title":"Statistical Estimation and Inference via Local SGD in Federated Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01326","snapshot_observed_at":"2026-08-05T21:35:25.666238Z","title":"Statistical estimation and inference via local sgd in federated learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.666238Z"},"links":{"cited_paper":"/paper/2109.01326","citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:5cb3fbc3e8bfdb0fb61c1ddf28a3ca517cdf68cf023520888550ff4ac71d1957","observation_id":"589ef146-8f4a-4082-a5fc-dee4d511edaf","resolution":{"observed_at":"2026-08-05T21:35:25.666238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:31.503650Z","title":"Unifying offline causal inference and online bandit learning for data driven decision","venue":null,"work_id":"e4b2027c-884c-4feb-b574-ef81526339e9","year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.727112Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:50004d1c40de24df41dbddbfb40d9e553c3625f477f4a75b7b57279cf9792d5d","observation_id":"3d1b0510-8ed4-43e9-87d0-08bd5e84a753","resolution":{"observed_at":"2026-08-05T21:35:31.661794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:31.240744Z","title":"A generalized reinforcement-learning model: Convergence and applications","venue":null,"work_id":"058bb0c0-c9ac-45f1-824c-e45f90744273","year":1996},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.776992Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:6024d0c90083b479bc08e8673a979723b9795a4a13e9f57f590326e1f00be4d0","observation_id":"4d034d63-7a58-4444-8405-6dffb8f0d0c5","resolution":{"observed_at":"2026-08-05T21:35:31.373166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:30.929027Z","title":"A review of uncertainty for deep reinforcement learning","venue":null,"work_id":"b01560e8-ee66-4cc8-8449-3b9b9bd3608a","year":2022},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.853537Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:6bf893535b225dec1e76362f42993e7373e1046779a824fab8c70905196f599d","observation_id":"97fa945a-a8a3-4591-bb2f-d8e8db676be7","resolution":{"observed_at":"2026-08-05T21:35:31.091172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:30.734556Z","title":"Gradient estimation in model-based reinforcement learning: a study on linear quadratic environments","venue":null,"work_id":"7a282917-3537-4325-b28d-1b9a6d0381a1","year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:25.986287Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:053aa22bfd98d0c56ec116a895958b82e42e696fc2f95e1e713b224fb15f3f77","observation_id":"3d0b37d9-9973-49f8-8287-d6ee78c67900","resolution":{"observed_at":"2026-08-05T21:35:30.798966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:30.650069Z","title":"Certainty equivalence is efficient for linear quadratic control","venue":null,"work_id":"2b9d3f5e-a72b-4854-a748-12f6afbb47d0","year":2019},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.049926Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:e19c9cbcee5235653775856fa62508d09649d9f92478073614465315a1d81596","observation_id":"f34550ab-8f43-4611-bf02-7b9c047cc283","resolution":{"observed_at":"2026-08-05T21:35:30.689389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:30.475539Z","title":"A linear quadratic regulator based speed control for remote-controlled racing cars","venue":null,"work_id":"c36573ad-d015-4cfc-8773-430916ded6a4","year":2022},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.115250Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:8f07651a5b2ae5d9c8873435a204ac7282579cb784618c86863e17c7d30f8f7d","observation_id":"63d803c6-3821-42da-8ab8-8c9b79cc96e4","resolution":{"observed_at":"2026-08-05T21:35:30.563763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:30.357991Z","title":"Black-box generalization: Stability of zeroth-order learning","venue":null,"work_id":"0968f19f-9cc8-4e09-a4e5-853e503004bb","year":2022},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.193252Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:c0d820157f752ff50732a265eacaeb121729f1cf87eca3042eb08919b970788f","observation_id":"ee475c6d-d57e-4554-b11f-910186482ddd","resolution":{"observed_at":"2026-08-05T21:35:30.405457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:30.225656Z","title":"Acceleration of stochastic approximation by averaging","venue":null,"work_id":"f56ab835-4fce-47ab-94f0-ceb9dde65f18","year":1992},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.241782Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:8e531eec14bc857579ba9767c0beb0bf8dda35382e187bdaf04cb4f253654a5d","observation_id":"a09a9f0a-2c0a-41fd-8c4a-7349123df957","resolution":{"observed_at":"2026-08-05T21:35:30.283756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09081","last_updated":"2020-02-24T06:34:11Z","snapshot_observed_at":"2026-08-03T22:54:06.625783Z","submitted_at":"2018-02-25T21:14:44Z","title":"Temporal Difference Models: Model-Free Deep RL for Model-Based Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09081","snapshot_observed_at":"2026-08-05T21:35:26.295386Z","title":"Temporal difference models: Model-free deep rl for model-based control","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.295386Z"},"links":{"cited_paper":"/paper/1802.09081","citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:969317dbcef5feaa81aec2e9e35a763dbe9b1801982f9353ca29fe678b1abd50","observation_id":"73f85c50-cd5d-4224-b957-f177ab39d3e0","resolution":{"observed_at":"2026-08-05T21:35:26.295386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:30.076869Z","title":"Online bootstrap inference for policy evaluation in reinforcement learning","venue":null,"work_id":"3a43f46c-3364-429d-8aac-6140e1ab931f","year":2023},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.387339Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:53eaaf5d1849701a7f899c8c265bc3c4b0ecfd7bfc941b09034e04443e2dc842","observation_id":"70c83ace-2b1b-4688-a7de-a53ab20b67fd","resolution":{"observed_at":"2026-08-05T21:35:30.143073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:29.921260Z","title":"The unintended consequences of discount regularization: Improving regularization in certainty equivalence reinforcement learning","venue":null,"work_id":"bdda6c48-3c3f-47a2-a4b6-3091e3ac1927","year":2023},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.452152Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:78c473783ff10b08679175c73c024fe86a3e25e56a85c99fdf0834fea225b1cc","observation_id":"0a0be36e-29f1-4e77-8f9e-722e063a427e","resolution":{"observed_at":"2026-08-05T21:35:29.983187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07875","last_updated":"2024-06-01T18:17:12Z","snapshot_observed_at":"2026-07-06T17:29:05.185768Z","submitted_at":"2024-02-12T18:41:31Z","title":"Implicit Bias of Policy Gradient in Linear Quadratic Control: Extrapolation to Unseen Initial States","version":2},"cited_work":{"arxiv_id":"2402.07875","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.07875","snapshot_observed_at":"2026-08-05T21:35:28.012371Z","title":"Implicit Bias of Policy Gradient in Linear Quadratic Control: Extrapolation to Unseen Initial States","venue":"cs.LG","work_id":"64b6107a-39fd-4c2d-a1bf-8cf6fad92fba","year":2024},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.554802Z"},"links":{"cited_paper":"/paper/2402.07875","citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:7f543d68b858d11202b167bffd48a70c9967cd455579dd4330faa5e3f361eed5","observation_id":"33bd0d6e-8c77-488e-8e73-9b1ae9647dd4","resolution":{"observed_at":"2026-08-05T21:35:28.059162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:26.641853Z","title":"Efficient estimations from a slowly convergent robbins-monro process","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.641853Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:9d619ead10b552e572ac24691ed22647d90bd3cca9d54fa95d474b7c0e189746","observation_id":"5b898f0e-802a-4fc5-a8c1-7309592af786","resolution":{"observed_at":"2026-08-05T21:35:26.641853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:29.793514Z","title":"Gaussian approximation and multiplier bootstrap for polyak-ruppert averaged linear stochastic approximation with applications to td learning","venue":null,"work_id":"05c41dc7-dcb7-4a88-a05d-0e47c6b33dc4","year":2024},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.704743Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:6c58c19ccc6daea13948f1b4e610b9b9a71bdb53d4ec89a8436e3976fc68992e","observation_id":"16618310-e5ab-42c0-a114-9808f6df6232","resolution":{"observed_at":"2026-08-05T21:35:29.854106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:29.655479Z","title":"Dynamic causal effects evaluation in a/b testing with a reinforcement learning framework","venue":null,"work_id":"8c0479b9-1cbd-4d41-9bda-b4cc3c7ef4c2","year":2059},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.808715Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:7edc897645de63e6dd6d9460cbae17411b5a0f47f1ec39113ce65435a597af61","observation_id":"9853206d-8b5a-4474-862e-f13eda4574c2","resolution":{"observed_at":"2026-08-05T21:35:29.720305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:29.545104Z","title":"Learning optimal controllers by policy gradient: Global optimality via convex parameterization","venue":null,"work_id":"5a784280-7a0a-4ac0-880b-79e6522a8e3a","year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.899905Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:615b2850ba8237981eb257369aba5e70ea86264c4a90506075e317b9d1e1b568","observation_id":"f24ae1fc-815c-4c3c-a630-755deec6d106","resolution":{"observed_at":"2026-08-05T21:35:29.598742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:29.413229Z","title":"Optimal scheduling of entropy regularizer for continuous-time linear-quadratic reinforcement learning","venue":null,"work_id":"1d473bc0-2058-4de7-87f8-a99ee7e5b942","year":2024},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:26.983368Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:1b4c658f9e7fc94b08419dd77647cd506e75a8314aeafcc2a14797bc98c19843","observation_id":"82b60fb8-3072-4679-a76d-90a8211c62c1","resolution":{"observed_at":"2026-08-05T21:35:29.477974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:29.289858Z","title":"Robust exploration in linear quadratic reinforcement learning","venue":null,"work_id":"3c0d06dd-acdf-4565-99d6-0830ea44e8d6","year":2019},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.100028Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:7c24f690f66bcfeec97bdbb760af02bc9626ab0072e14b94ae3d1934be4592af","observation_id":"ec2992d7-cfff-4afc-8363-59c56f6cce3f","resolution":{"observed_at":"2026-08-05T21:35:29.368728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:29.170494Z","title":"Distributed lqr design for identical dynamically coupled systems: Application to load frequency control of multi-area power grid","venue":null,"work_id":"816fa6ca-276c-4fae-bb95-743bbbbc128f","year":2019},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.194448Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:ae7934f313cf2f22f53a13cc1a1aa2d43818eba0d232fca3a74050957de31371","observation_id":"1b34a2f0-c3bf-415c-bbaf-e3679dd4cd02","resolution":{"observed_at":"2026-08-05T21:35:29.230310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:29.016712Z","title":"First-order regret in reinforcement learning with linear function approximation: A robust estimation approach","venue":null,"work_id":"7e1cb8aa-8961-4594-afbc-9da34b1c0635","year":2022},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.316145Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:bfc46db27b4373387eb7d2fe107750bc73825987d7f97ef4470d057f191cec04","observation_id":"d9516177-5a22-4215-8422-76abd2bc77a3","resolution":{"observed_at":"2026-08-05T21:35:29.081763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08436","last_updated":"2020-02-19T20:43:27Z","snapshot_observed_at":"2026-08-02T16:13:54.228417Z","submitted_at":"2020-02-19T20:43:27Z","title":"Residual Bootstrap Exploration for Bandit Algorithms","version":1},"cited_work":{"arxiv_id":"2002.08436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.08436","snapshot_observed_at":"2026-08-05T21:35:27.923201Z","title":"Residual Bootstrap Exploration for Bandit Algorithms","venue":"stat.ML","work_id":"8d8de83c-e3d4-43b6-b130-31301eeedae3","year":2020},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.400756Z"},"links":{"cited_paper":"/paper/2002.08436","citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:d3209999e5282fb3db929305116389d272e6c0abfab2f358eae36ba7d043a3b7","observation_id":"0771b835-b586-4bf6-bf9a-a262f3fbfb0f","resolution":{"observed_at":"2026-08-05T21:35:27.961339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:28.870556Z","title":"Exact asymptotics for linear quadratic adaptive control","venue":null,"work_id":"766daae0-f006-47cd-8090-ea7b0498084d","year":2021},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.481427Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:8f2dfcdc8e0821ed627ce621be7c473e166f86e8adaebed19e97d5f11a4dd9be","observation_id":"d0e2f6e8-73f4-4fb0-a457-ff4d79088e7b","resolution":{"observed_at":"2026-08-05T21:35:28.929421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:28.778315Z","title":"Continuous-time mean--variance portfolio selection: A reinforcement learning framework","venue":null,"work_id":"c52b99b7-c97e-42ce-b852-743cc0571ced","year":2020},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.551758Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:0ce65c232504b426291d46a241bbfcf34917b344968cc5688200627bb94d32d7","observation_id":"8503830b-2585-4327-9b3c-0e64e498b5cf","resolution":{"observed_at":"2026-08-05T21:35:28.818138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:28.645479Z","title":"Stochastic zeroth-order optimization in high dimensions","venue":null,"work_id":"eb23f66a-7b67-4c56-a67c-5cab887dcd06","year":2018},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.632695Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:c3ddd3edf14451cc00958a77daf53e633f9dc99c55c1085d9b054b6dc24f9af3","observation_id":"2331a859-145c-48a3-9385-e20128b4e3ea","resolution":{"observed_at":"2026-08-05T21:35:28.720661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:28.519243Z","title":"Leveraging linear quadratic regulator cost and energy consumption for ultrareliable and low-latency iot control systems","venue":null,"work_id":"70da26a4-f3e3-428d-9c87-5b849e2eb277","year":2020},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.691248Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:0a13ea299adf834fdc3974c06e7e6a08daf1b7105659658bf46aafbe1be8af8f","observation_id":"adc91b51-daa4-48e6-b62d-13db23fe28cf","resolution":{"observed_at":"2026-08-05T21:35:28.601244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:28.364288Z","title":"Provably global convergence of actor-critic: A case for linear quadratic regulator with ergodic cost","venue":null,"work_id":"8dbe6672-a6ed-4756-be28-29b111641d70","year":2019},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.726098Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:65205d9b5d4bc31d823ac3de472d4b9f34fb9966fe73845d7a4c58fd64fe8460","observation_id":"e1e7ea49-2d11-44bf-b1b8-8a2588cd0fe3","resolution":{"observed_at":"2026-08-05T21:35:28.461702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:28.253179Z","title":"Online covariance matrix estimation in stochastic gradient descent","venue":null,"work_id":"d4e7c29b-43b2-4f1c-a234-3b12b6e050fa","year":2023},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.778578Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:388a3ffbb16fb1ebc53b24e9da058941ba3d927eec0d561fdb55eceb0b49b0a3","observation_id":"1456cc1b-6615-44cd-b6f3-899786ffcef2","resolution":{"observed_at":"2026-08-05T21:35:28.305913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:35:28.126428Z","title":"Uncertainty quantification and exploration for reinforcement learning","venue":null,"work_id":"258ad618-a470-40e2-b95b-b7ccc6d79339","year":2024},"citing_paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T21:35:27.824202Z"},"links":{"citing_paper":"/paper/2508.08436"},"observation_digest":"sha256:3a4c342d044f7a5f5a4292a8e8fa1941ea68ff3b77c5a29a4ed621154dce8d91","observation_id":"a418e2f7-6b01-417e-86f2-07c3a8339bae","resolution":{"observed_at":"2026-08-05T21:35:28.187289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.08436","last_updated":"2025-08-11T19:53:24Z","latest_version":1,"primary_category":"math.ST","snapshot_observed_at":"2026-08-05T21:35:13.638864Z","submitted_at":"2025-08-11T19:53:24Z","title":"Toward Optimal Statistical Inference in Noisy Linear Quadratic Reinforcement Learning over a Finite Horizon"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":47},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2508.08436."}