{"as_of":"2026-08-14T06:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a817514c36500917f487a626b74eb887550a8782e127ed362c42b1a771dca33","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":3,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":3,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:48:41.884736Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T21:26:16.372690Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.01552","last_updated":"2019-02-13T16:33:26Z","snapshot_observed_at":"2026-07-06T07:19:06.439388Z","submitted_at":"2018-12-04T17:46:06Z","title":"Exploration versus exploitation in reinforcement learning: a stochastic control approach","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01552","snapshot_observed_at":"2026-08-12T10:48:41.884736Z","title":"Exploration ve rsus exploitation in reinforcement learning: A stochastic cont rol approach,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18892","last_updated":"2025-02-01T23:49:26Z","snapshot_observed_at":"2026-08-13T05:19:39.475481Z","submitted_at":"2024-11-28T03:53:14Z","title":"A Comprehensive Survey of Reinforcement Learning: From Algorithms to Practical Challenges","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:41.884736Z"},"links":{"cited_paper":"/paper/1812.01552","citing_paper":"/paper/2411.18892"},"observation_digest":"sha256:2494bbc42fc8547f76be6a29af72b7f7c7964beffcce1ca1834c06d46918de97","observation_id":"5ec1c723-0024-4eca-ad5e-4cdcedb912f5","resolution":{"observed_at":"2026-08-12T10:48:41.884736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01552","last_updated":"2019-02-13T16:33:26Z","snapshot_observed_at":"2026-07-06T07:19:06.439388Z","submitted_at":"2018-12-04T17:46:06Z","title":"Exploration versus exploitation in reinforcement learning: a stochastic control approach","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01552","snapshot_observed_at":"2026-08-10T22:51:52.660325Z","title":"Exploration v ersus exploita- tion in reinforcement learning: A stochastic control appro ach,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00562","last_updated":"2025-01-03T06:28:02Z","snapshot_observed_at":"2026-08-13T16:02:30.119046Z","submitted_at":"2024-12-31T17:48:33Z","title":"An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems","version":2},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-10T22:51:52.660325Z"},"links":{"cited_paper":"/paper/1812.01552","citing_paper":"/paper/2501.00562"},"observation_digest":"sha256:3fdc37a4f64578b866c1d85aef59d85c30836e808c57a4379740620ce6700a02","observation_id":"d6c6c8ab-2ce1-4c7e-b881-331b1997f2d2","resolution":{"observed_at":"2026-08-10T22:51:52.660325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01552","last_updated":"2019-02-13T16:33:26Z","snapshot_observed_at":"2026-07-06T07:19:06.439388Z","submitted_at":"2018-12-04T17:46:06Z","title":"Exploration versus exploitation in reinforcement learning: a stochastic control approach","version":3},"cited_work":{"arxiv_id":"1812.01552","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.01552","snapshot_observed_at":"2026-07-01T21:26:16.372690Z","title":"Exploration versus exploitation in reinforcement learning: a stochastic control approach","venue":"math.OC","work_id":"155dfe4f-626f-4c1e-952f-42f917d262ca","year":2018},"citing_paper":{"arxiv_id":"2606.01058","last_updated":"2026-05-31T07:01:06Z","snapshot_observed_at":"2026-08-03T20:03:26.834777Z","submitted_at":"2026-05-31T07:01:06Z","title":"Relaxed Control with Entropy Regularization for It\\^o Stochastic Systems with Input Delay","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T16:54:43.186933Z"},"links":{"cited_paper":"/paper/1812.01552","citing_paper":"/paper/2606.01058"},"observation_digest":"sha256:bf8cf025e02cd9b5d8aa180370390809d81071d3dbb95db5ce7fe0a44df75d33","observation_id":"a16eba3a-5462-43e1-b113-a7db73d83994","resolution":{"observed_at":"2026-07-01T21:26:16.374436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1812.01552/citation-record","integrity":"/paper/1812.01552/integrity","json":"/paper/1812.01552/citation-record.json","paper":"/paper/1812.01552"},"outbound":[],"paper":{"arxiv_id":"1812.01552","last_updated":"2019-02-13T16:33:26Z","latest_version":3,"primary_category":"math.OC","snapshot_observed_at":"2026-07-06T07:19:06.439388Z","submitted_at":"2018-12-04T17:46:06Z","title":"Exploration versus exploitation in reinforcement learning: a stochastic control approach"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 3 inbound Pith citation observations for arXiv:1812.01552."}