{"as_of":"2026-08-23T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3fd94644b361bcbf07a75f2552d8f3f2c102b14f30cedcd5c1a305f0c97ecd07","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:49:33.177939Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:03:42.755190Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T00:03:43.422793Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"cited_work":{"arxiv_id":"1908.10479","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.10479","snapshot_observed_at":"2026-08-16T00:03:43.422793Z","title":"Exploration-Enhanced POLITEX","venue":"cs.LG","work_id":"9892fb4d-9d6c-4296-8ba8-71f6a1f4007a","year":2019},"citing_paper":{"arxiv_id":"2505.03155","last_updated":"2025-05-06T04:03:06Z","snapshot_observed_at":"2026-08-19T07:09:04.799423Z","submitted_at":"2025-05-06T04:03:06Z","title":"Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:03:42.755190Z"},"links":{"cited_paper":"/paper/1908.10479","citing_paper":"/paper/2505.03155"},"observation_digest":"sha256:8405f774a9d1188d988fb72a833eec9f396abd6e1f69a6f35a7cc7d0c9f7b13c","observation_id":"8773c8a5-d5a1-4949-925b-58fe74f2e113","resolution":{"observed_at":"2026-08-16T00:03:43.433698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.10479/citation-record","integrity":"/paper/1908.10479/integrity","json":"/paper/1908.10479/citation-record.json","paper":"/paper/1908.10479"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.582762Z","title":"POLITEX : Regret bounds for policy iteration using expert prediction","venue":null,"work_id":"266cfefc-b93e-4100-ae19-fd0e871218a4","year":2019},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.039204Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:ce1ce4f1c5bd97a993f03a0692362631240a8a204b129880791350522ab7a7c0","observation_id":"48ef1794-c2dd-4d7b-8323-0adabe0aecef","resolution":{"observed_at":"2026-08-14T10:49:33.586541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.571546Z","title":"Model-free linear quadratic control via reduction to expert prediction","venue":null,"work_id":"b11e290d-ef6c-4cfa-97c8-5c3eca103625","year":2019},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.043436Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:8528984c8237f0699c87124966cdeade92aca261dce2ad83fd04ca73230e8e93","observation_id":"fd36366b-2485-42d4-8228-1936d8644c7c","resolution":{"observed_at":"2026-08-14T10:49:33.575488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.560589Z","title":"Learning near-optimal policies with Bellman-residual minimization based fitted policy iteration and a single sample path","venue":null,"work_id":"8018119b-6646-4253-994e-2df5c32781a5","year":2008},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.047195Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:bdc7d88f324bdca74b877297ed1be28ba0ca36a9d511fbf83ac0b1a58d45a45d","observation_id":"01862f8c-70b0-4346-87cb-27b89e6e07ae","resolution":{"observed_at":"2026-08-14T10:49:33.564109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01327","last_updated":"2018-06-11T22:01:57Z","snapshot_observed_at":"2026-08-19T16:39:33.208334Z","submitted_at":"2017-03-03T20:19:08Z","title":"Multi-step Reinforcement Learning: A Unifying Algorithm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01327","snapshot_observed_at":"2026-08-14T10:49:33.051233Z","title":"Fernando Hernandez - Garcia, G","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.051233Z"},"links":{"cited_paper":"/paper/1703.01327","citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:177d9cb5bb753450a8f8e61c911423e31b5454d136332691acb0c2cae949958a","observation_id":"2818fad7-6aa2-45d7-a873-dd6db7f25f31","resolution":{"observed_at":"2026-08-14T10:49:33.051233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.550156Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":"c6725c8e-6160-40d8-ab1e-e4a3baf18fe0","year":2017},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.055695Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:7213327614598cf000f5ddbc118a1ae1742279762dda2c7ecca182427b865b9c","observation_id":"7fa4bafc-96cb-423e-af40-3a321bfe4cf3","resolution":{"observed_at":"2026-08-14T10:49:33.553879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.539522Z","title":"Approximate policy iteration: A survey and some new methods","venue":null,"work_id":"aa33d23f-77ba-4c0f-9b7e-d6aae9bde8ba","year":2011},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.059970Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:c0c8a1731039be6394a8c8a26c4a4e22055738181d60b5e5f134956dd4224413","observation_id":"e70bac70-f61a-4cce-a353-bf5fc3d8656f","resolution":{"observed_at":"2026-08-14T10:49:33.543068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.527928Z","title":"Temporal differences-based policy iteration and applications in neuro-dynamic programming","venue":null,"work_id":"1be4c179-cf33-47b8-be0b-83e44ca19739","year":1996},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.064174Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:3babc0784d6ed499385a32b7d3b72f296be1ed711bf8c6a35307eeb5f87c8926","observation_id":"4dd4e0e3-c6b0-431f-8048-9e3e111e0541","resolution":{"observed_at":"2026-08-14T10:49:33.532219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.517138Z","title":null,"venue":null,"work_id":"31602dbb-467d-4286-b40a-71d145fabb92","year":2019},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.068513Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:b78078573db61a6d670a911b552f609481c6a379e09655ba89a5ac0745a12805","observation_id":"4dcfc5f9-2f35-41fd-9c8b-de263ca7e93f","resolution":{"observed_at":"2026-08-14T10:49:33.520710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.505068Z","title":"Regularized policy iteration with nonparametric function spaces","venue":null,"work_id":"8f2ab718-8a84-4424-9b5e-da8b241c897e","year":2016},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.072931Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:b45263faa8fb569cfff870a39a4a0de41d062384b8fe6789fa6364a81c8433e3","observation_id":"92f9c96b-aeee-4646-b179-6d00e11ed4bb","resolution":{"observed_at":"2026-08-14T10:49:33.509328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.493856Z","title":"Off-policy learning with eligibility traces: A survey","venue":null,"work_id":"3f366b1f-3ed5-4f30-a1b9-3de0170acc8e","year":2014},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.077195Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:afcca347ed5a020c6cdb6e53388eab3ae57ec65e64a7593fe37450702b0c8e8e","observation_id":"150164ba-4d00-40dc-89bf-5c3c9b507d97","resolution":{"observed_at":"2026-08-14T10:49:33.497765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.482177Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":"b62d32c7-5780-4919-9b0d-d1be0a443913","year":2019},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.081374Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:04c52aa850bcb2e94ef9ecd13f45d3ff2820352eaa39d326972d18796a6c6bd2","observation_id":"3911b1cf-d4f8-4e78-8fd4-a1bfef26719b","resolution":{"observed_at":"2026-08-14T10:49:33.486557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00933","last_updated":"2018-03-02T16:21:46Z","snapshot_observed_at":"2026-08-14T19:40:13.717780Z","submitted_at":"2018-03-02T16:21:46Z","title":"Distributed Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00933","snapshot_observed_at":"2026-08-14T10:49:33.086022Z","title":"Distributed prioritized experience replay","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.086022Z"},"links":{"cited_paper":"/paper/1803.00933","citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:4bd9961529042b1aaec3d59c2d5f414c441473922013008ad3e2a1fa53b44798","observation_id":"6f5641a9-04f6-4347-af17-f545a49de972","resolution":{"observed_at":"2026-08-14T10:49:33.086022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.470985Z","title":null,"venue":null,"work_id":"932e2d0b-a507-4be8-b6f6-9c73a68fd6fa","year":2018},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.089703Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:5f49e780f4dea1d2f2bac2f761bdcfcf8173990dc83299b50bcdb0a892e35ba5","observation_id":"119329cf-cced-4c11-b5a4-9a92a66ce64e","resolution":{"observed_at":"2026-08-14T10:49:33.474588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.459815Z","title":"Finite-sample analysis of least-squares policy iteration","venue":null,"work_id":"9400986a-e1fd-46b6-8b56-d84b337a9a23","year":2012},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.093664Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:f049263aae4b3392e895f8ac07b14f7f24734332dab80d498184fb2ae089d1d2","observation_id":"1ef180e9-b097-4d0b-a139-cc258494d1c7","resolution":{"observed_at":"2026-08-14T10:49:33.463846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.447861Z","title":"Regularized off-policy TD -learning","venue":null,"work_id":"43dd385b-1872-4de7-a5f0-b926e862f642","year":2012},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.097990Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:7bf2f1c6c4acbf28d767e70b43e97c4c9f25116cd6708ae657f664dcae8e8633","observation_id":"32fe44af-31a9-4e3d-94b5-822ac92be12d","resolution":{"observed_at":"2026-08-14T10:49:33.451767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.434593Z","title":"Finite-sample analysis of proximal gradient TD algorithms","venue":null,"work_id":"ed18b12c-55ae-4b2f-ae82-f66ab70ff439","year":2015},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.101809Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:6a2f19303081b2e483f48cf028cf94812467e9957713ecb8b8bce9086122fa97","observation_id":"bf4622c3-436d-47f7-851a-5806330e576a","resolution":{"observed_at":"2026-08-14T10:49:33.439104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.423290Z","title":null,"venue":null,"work_id":"dab4cc97-28ef-4cf8-ab6b-65c6be42cd00","year":2010},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.105720Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:cd37baf8c8e2f4374b9098bdd8b7b56545ea0247ec2bf8d69c9e8960d1fa4176","observation_id":"d696bc50-07a6-454b-861a-9b17281ec7d5","resolution":{"observed_at":"2026-08-14T10:49:33.427193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.412573Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"5570a613-8718-48eb-bc7b-6696348464a8","year":2015},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.109950Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:d036ee16a3be5d44ec8bd5f97d0fbf5d3a7eef71086420abf6841ecbde8d0600","observation_id":"f55adedd-70ee-49cc-8135-33279b812910","resolution":{"observed_at":"2026-08-14T10:49:33.416139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.401338Z","title":"Scale-free algorithms for online linear optimization","venue":null,"work_id":"b2bc330d-2298-4fdc-9139-25a96ad9854d","year":2015},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.113990Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:eabede1029840a9c71522b33d3f2585cc71ce15899f4608406d8259ffca9d0d4","observation_id":"1c481485-fdc4-41c5-9296-3fd39b20ef00","resolution":{"observed_at":"2026-08-14T10:49:33.405308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.388893Z","title":"Generalization and exploration via randomized value functions","venue":null,"work_id":"29eed2f4-9d81-4006-9c76-304bbecc4860","year":2016},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.118323Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:2feaa4eb56ae6fbaab16be7f02d8d1d8e16ba5ac6d5dea90ad5c88072d2269f8","observation_id":"b301f1c8-0099-461c-8985-b71b77f20c04","resolution":{"observed_at":"2026-08-14T10:49:33.393205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.378074Z","title":"Puterman","venue":null,"work_id":"b8d4bbf4-01b8-43e2-9d97-2d281ee2a443","year":1994},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.122121Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:f4c2b4fa9cc3a27ea40d59635313e7e589b14bf68690f1ff327f8cda1fbae125","observation_id":"217eb29d-4adb-4868-bf0c-6afc9121e184","resolution":{"observed_at":"2026-08-14T10:49:33.381734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-21T06:19:51.244525Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-14T10:49:33.126218Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.126218Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:c0bd7c258e7d1a57662f924b4d68dd744ce1c56cf88e414e8982ecc20fe20dfe","observation_id":"5c59fedf-5489-4d13-a167-40afcd39d61b","resolution":{"observed_at":"2026-08-14T10:49:33.126218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.366941Z","title":"Adaptive confidence and adaptive curiosity","venue":null,"work_id":"38aeed4d-6bcd-4f52-815b-5d86700c5cde","year":1991},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.130160Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:bc4ffd5251fb8b5bd409ee18a99eccdb14fde0a86fcfdaf29dde91338f4ab169","observation_id":"7d37fd51-0cf9-4b9c-8ed4-175cec303a1d","resolution":{"observed_at":"2026-08-14T10:49:33.370843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.355328Z","title":"Strehl, Lihong Li, Eric Wiewiora, John Langford, and Michael L","venue":null,"work_id":"382ee59f-dc40-4b74-9ad3-d86fcc0f724d","year":2006},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.134516Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:f73037bea5cde52fd928e5ec2c675473a3a6fdda631a983ceea35f45cfb95dae","observation_id":"6a7a1475-8128-41e0-99f1-85ec335a5981","resolution":{"observed_at":"2026-08-14T10:49:33.359154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.344171Z","title":null,"venue":null,"work_id":"9ae2b7c1-2820-4ea4-9284-6f5afca1f957","year":2009},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.138301Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:b7d456ac78374e6a8fafd5608811ca7af883a89eb0b833fcb37df0b3f9097669","observation_id":"6c5b7489-d6d7-4573-b0c7-5becb7ddfad4","resolution":{"observed_at":"2026-08-14T10:49:33.348019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.142285Z","title":"Learning to predict by the methods of temporal differences","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.142285Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:2a906c5bbdd41fe84b4b12d0d8d2bbda4c9512286db2134fe458e7b42c5a4e19","observation_id":"358f5f31-fe06-454e-91fa-60d182157560","resolution":{"observed_at":"2026-08-14T10:49:33.142285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-20T08:13:02.541942Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-14T10:49:33.146230Z","title":"Deepmind control suite","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.146230Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:c780bd23ac6def1def05f25795c5b6447db3e01776462a14d77ad6e5733ac686","observation_id":"d999fd21-c414-4317-8ded-21298ed57e68","resolution":{"observed_at":"2026-08-14T10:49:33.146230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.324558Z","title":"Active exploration in dynamic environments","venue":null,"work_id":"3659eb3e-3726-4abc-ae45-d4071bc604c8","year":1992},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.150267Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:3dfeb37aa56ab4ea30f8a8d8e81db23f9521c33b60079e742a1344684e54228f","observation_id":"d49b2a35-4d3b-4464-89e3-4c7f54b60dfb","resolution":{"observed_at":"2026-08-14T10:49:33.328788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.311322Z","title":"Tsitsiklis and Benjamin Van Roy","venue":null,"work_id":"fcefc9b3-edcb-4d47-8ce3-601347771c45","year":1997},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.154018Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:f388e24c87b74711b14aa39c262e5d5320c29ade6d8f504806fcf1c4f00207f8","observation_id":"db1c6b24-923a-423c-b1ae-af0bfae17c19","resolution":{"observed_at":"2026-08-14T10:49:33.315837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.300244Z","title":"Tsitsiklis and Benjamin Van Roy","venue":null,"work_id":"65d547b6-c324-4f49-b5dd-377047b555dd","year":1999},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.157670Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:e16f1fb94e585b2783f7cd4bfcbc1f86d8c50021195607cf3965f01732aa6239","observation_id":"f2a7ef33-16d8-429d-8f71-556d9cec8dea","resolution":{"observed_at":"2026-08-14T10:49:33.304244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-14T10:49:33.161700Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.161700Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:46cbbddc667fcc07fd1c1ccdf14ff35d7f5cd5180cbc2f4b5260effc11bab11a","observation_id":"70a53df3-c5cd-4e5c-b051-a6ab4c4ea169","resolution":{"observed_at":"2026-08-14T10:49:33.161700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06581","last_updated":"2016-04-05T09:03:06Z","snapshot_observed_at":"2026-08-18T06:21:07.128252Z","submitted_at":"2015-11-20T13:07:54Z","title":"Dueling Network Architectures for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06581","snapshot_observed_at":"2026-08-14T10:49:33.165609Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.165609Z"},"links":{"cited_paper":"/paper/1511.06581","citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:f696c77118f8d43326b6e0c013c532e14b679157015acb66b9f8cc9c1bee4b6a","observation_id":"63fd6f24-10ca-4fca-93a6-421e704b76f8","resolution":{"observed_at":"2026-08-14T10:49:33.165609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.289299Z","title":"Convergence of least squares temporal difference methods under general conditions","venue":null,"work_id":"d4bc0dc1-5a68-4364-9271-3f94e5fa3ac3","year":2010},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.169650Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:5841bae7a9daf899019ccaeadbe4d17fdf5c85b80523b2e2985638ef0f365ea2","observation_id":"da53bf8a-c7da-4036-8103-49e8dd40661e","resolution":{"observed_at":"2026-08-14T10:49:33.293128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.278038Z","title":"Convergence results for some temporal difference methods based on least squares","venue":null,"work_id":"c61c76cf-7ead-44cf-b7bd-be1882c87af6","year":2009},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.173306Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:74a0a3ffd60c482186330895855274e1dceb825e6bd9fa1dd4f569772e521535","observation_id":"876a06b6-9a15-47ca-86ec-f3e88429d4ed","resolution":{"observed_at":"2026-08-14T10:49:33.281903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:49:33.264496Z","title":"Error bounds for approximations from projected linear equations","venue":null,"work_id":"837260e2-4a0e-4ab4-9b84-5e6d20a91785","year":2010},"citing_paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T10:49:33.177939Z"},"links":{"citing_paper":"/paper/1908.10479"},"observation_digest":"sha256:bf7d8227cfcafc582c91a3fc65e265e2db5278a0c39d060e9b6ec3ef5f8fbe1f","observation_id":"0e71d808-5563-48ff-9b46-a24dd1ae57c4","resolution":{"observed_at":"2026-08-14T10:49:33.270198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.10479","last_updated":"2019-08-27T21:53:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-22T07:50:05.431030Z","submitted_at":"2019-08-27T21:53:42Z","title":"Exploration-Enhanced POLITEX"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:1908.10479."}