{"as_of":"2026-08-09T08:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c0ffb679111abba25978d3f4341e87384cf08c46b22cfc6f4db84bf85df7ebc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:35:12.088553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:18:43.049717Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-07T14:35:12.088553Z","title":"Tang and X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18529","last_updated":"2026-07-28T03:10:35Z","snapshot_observed_at":"2026-08-07T14:27:49.993554Z","submitted_at":"2025-05-24T05:47:23Z","title":"Beyond separability: convergence rate of vanishing viscosity approximations to mean field games via FBSDE stability","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:35:12.088553Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2505.18529"},"observation_digest":"sha256:bc39fb4092b06c8a7a347f90e0fc31fcccb0b2e4502702e184cada947286de7f","observation_id":"16902dd1-f9ca-46cb-999f-a6f9e1d98eef","resolution":{"observed_at":"2026-08-07T14:35:12.088553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-07T12:50:56.214175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23541","last_updated":"2025-06-16T08:53:57Z","snapshot_observed_at":"2026-08-07T12:41:36.730930Z","submitted_at":"2025-05-29T15:21:06Z","title":"Upper and lower bounds for local Lipschitz stability of Bayesian posteriors","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:56.214175Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2505.23541"},"observation_digest":"sha256:d309203bc45499f38922215bb50c005a56cf1895fd595a0eacaa04fc38e20fd0","observation_id":"1ee90eef-f7da-4936-9625-53dedca82274","resolution":{"observed_at":"2026-08-07T12:50:56.214175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-06T21:33:38.321579Z","title":"Regret of exploratory policy improvement and q-learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T01:00:57.003536Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:38.321579Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:c0c6d9a8e94805a868fb8ca543c3978a9c8a27710a75fb716bf3a0b1c1e88a76","observation_id":"8fcc4cb7-4208-41ba-83b1-a123ac4ebeb2","resolution":{"observed_at":"2026-08-06T21:33:38.321579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-03T18:40:33.523529Z","title":"Tang and X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-08T07:29:46.503525Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:33.523529Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:d3c0bb21f042baf191f9111ddee945e0873a4941119975b7cbfaad9d43241603","observation_id":"aa758c4c-9bfa-4c24-a10a-f3f9ce6b2f26","resolution":{"observed_at":"2026-08-03T18:40:33.523529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":"2411.01302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-07-03T17:18:43.049717Z","title":"Wang, H., Zariphopoulou, T., and Zhou, X","venue":null,"work_id":"eb09a1d3-e966-4775-b2f7-3da4efd83484","year":2024},"citing_paper":{"arxiv_id":"2601.18681","last_updated":"2026-05-08T00:14:56Z","snapshot_observed_at":"2026-07-06T22:43:02.453697Z","submitted_at":"2026-01-26T16:56:40Z","title":"ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T10:42:23.768313Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2601.18681"},"observation_digest":"sha256:926626880439a2d7bd80c66f4c425331c22eb432facbd540b1a55a6ab4496dd8","observation_id":"f992bf67-3ff9-4351-92c9-233dce063556","resolution":{"observed_at":"2026-05-16T10:42:45.291381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-03T04:22:32.991605Z","title":"Tang and X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05533","last_updated":"2026-06-18T02:47:04Z","snapshot_observed_at":"2026-08-09T01:17:57.736271Z","submitted_at":"2026-02-05T10:46:20Z","title":"Conditional Diffusion Guidance under Hard Constraint: A Stochastic Analysis Approach","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:32.991605Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2602.05533"},"observation_digest":"sha256:14cde5669b52b184a7ada791cd58065d0db89e7f27d0da4c2426701b97232fae","observation_id":"0769ca52-5e5d-4178-af31-555dd1da43d9","resolution":{"observed_at":"2026-08-03T04:22:32.991605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":"2411.01302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-07-03T17:18:43.049717Z","title":"Wang, H., Zariphopoulou, T., and Zhou, X","venue":null,"work_id":"eb09a1d3-e966-4775-b2f7-3da4efd83484","year":2024},"citing_paper":{"arxiv_id":"2605.13010","last_updated":"2026-05-13T05:02:47Z","snapshot_observed_at":"2026-08-03T02:37:11.973206Z","submitted_at":"2026-05-13T05:02:47Z","title":"Amortized Guidance for Image Inpainting with Pretrained Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T19:33:27.641167Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2605.13010"},"observation_digest":"sha256:2b5e88c093c385de7b0c511cc6099f9c52af1b6de38ad4a51486cac219d6b76b","observation_id":"d49273f0-8ba8-43eb-bdab-8fa3f4fd8fbc","resolution":{"observed_at":"2026-05-14T19:37:52.622190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":"2411.01302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-07-03T17:18:43.049717Z","title":"Wang, H., Zariphopoulou, T., and Zhou, X","venue":null,"work_id":"eb09a1d3-e966-4775-b2f7-3da4efd83484","year":2024},"citing_paper":{"arxiv_id":"2607.02137","last_updated":"2026-07-03T02:14:28Z","snapshot_observed_at":"2026-08-08T05:30:20.123996Z","submitted_at":"2026-07-02T13:13:19Z","title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T17:14:04.821073Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.02137"},"observation_digest":"sha256:b2d74794b5d7e526c0989f9936d617ed479a42bd7769b11970c5def71cb9a97b","observation_id":"d3f5a2e7-5589-424f-b2e4-a564f8992746","resolution":{"observed_at":"2026-07-03T17:18:43.051182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-07-12T08:25:48.021715Z","title":"Haoran Wang, Thaleia Zariphopoulou, and Xun Yu Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02137","last_updated":"2026-07-03T02:14:28Z","snapshot_observed_at":"2026-08-08T05:30:20.123996Z","submitted_at":"2026-07-02T13:13:19Z","title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T08:25:48.021715Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.02137"},"observation_digest":"sha256:ae10c778e8f5f0194d23e6b9c5fd525d21cc2181d737efd2585b4dcbc59a433b","observation_id":"74239336-d89e-431c-8d7b-b46b887269a7","resolution":{"observed_at":"2026-07-12T08:25:48.021715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-02T01:57:50.446846Z","title":"Wenpin Tang and Xun Yu Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14522","last_updated":"2026-07-16T03:19:53Z","snapshot_observed_at":"2026-08-06T20:30:24.377697Z","submitted_at":"2026-07-16T03:19:53Z","title":"A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T01:57:50.446846Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.14522"},"observation_digest":"sha256:f89785d928e621eb6ab1201980c037c10aefb125038bb86130521b7b59f039c8","observation_id":"e94006f6-03e4-4e2e-963a-39107ecb0fa9","resolution":{"observed_at":"2026-08-02T01:57:50.446846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-01T11:22:20.704553Z","title":"Regret of exploratory policy improvement and q- learning.arXiv:2411.01302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.704553Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:1c5f448941179a73857e478f640e2b6615f023197faea8e1a8f09453ca155381","observation_id":"4c764ff7-65ef-41ed-ac5a-2d826cecf34a","resolution":{"observed_at":"2026-08-01T11:22:20.704553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.01302/citation-record","integrity":"/paper/2411.01302/integrity","json":"/paper/2411.01302/citation-record.json","paper":"/paper/2411.01302"},"outbound":[],"paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:15:02.287096Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2411.01302."}