{"as_of":"2026-08-06T19:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d76851de5f79d1bdda07ce1bae04fadaea8410b2c2f9125ee4175c764322c3cd","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T14:15:45.030536Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24740/citation-record","integrity":"/paper/2605.24740/integrity","json":"/paper/2605.24740/citation-record.json","paper":"/paper/2605.24740"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:35:46.406605Z","title":"and Henzinger, M","venue":null,"work_id":"e616cc67-847c-487b-bf83-b81222ee8f6f","year":2011},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:0777a137d06c4a90048174c11339603bcd04d05a25285e3b18617d2bfab82297","observation_id":"dc37688e-fad1-4a27-b913-fcfa6d0a94f4","resolution":{"observed_at":"2026-07-08T23:35:46.407810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:35:46.399173Z","title":"Faster algorithm for turn-based stochastic games with bounded treewidth","venue":null,"work_id":"e4ae2331-ae0d-487c-9ac8-ca16e14d4cfe","year":2023},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:4efb94d9e0e4f175104cd01ecf530bd70f55ada295cdf6b0e177cb96a52b0917","observation_id":"6b5e19c7-318f-4292-9c11-3b8442c99c18","resolution":{"observed_at":"2026-07-08T23:35:46.400422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08099","last_updated":"2019-02-16T18:11:58Z","snapshot_observed_at":"2026-07-06T06:20:06.058179Z","submitted_at":"2018-01-24T17:50:30Z","title":"Logically-Constrained Reinforcement Learning","version":8},"cited_work":{"arxiv_id":"1801.08099","doi":"10.48550/arxiv.1801.08099","metadata_source":"pith","pith_arxiv_id":"1801.08099","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Logically-Constrained Reinforcement Learning","venue":"cs.LG","work_id":"3041c692-fe71-436e-a380-a1462bf74f97","year":2018},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"cited_paper":"/paper/1801.08099","citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:19e5f055913ab48bd77244e9ec5ba9a41a158195dd1037990a73e382d03325f8","observation_id":"2674e2d9-34b6-4938-9cde-0dd0bc93af4d","resolution":{"observed_at":"2026-06-30T14:24:45.265320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12248","last_updated":"2024-02-21T01:43:56Z","snapshot_observed_at":"2026-07-06T16:35:15.777674Z","submitted_at":"2023-10-18T18:33:41Z","title":"A PAC Learning Algorithm for LTL and Omega-regular Objectives in MDPs","version":3},"cited_work":{"arxiv_id":"2310.12248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12248","snapshot_observed_at":"2026-06-30T14:24:45.266443Z","title":"A pac learning algorithm for ltl and omega-regular objectives in mdps","venue":null,"work_id":"574e48bd-90cc-4b2b-9ee6-a511c14bbd62","year":null},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"cited_paper":"/paper/2310.12248","citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:301650888407190e3efddcea3eb1bdfdd8fedff6cb1e23fad6e34dd77b1937d6","observation_id":"3925b654-030c-4fcf-94b1-ce8a278426c3","resolution":{"observed_at":"2026-06-30T14:24:45.267833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:35:46.401241Z","title":"On the complexity of omega-automata","venue":null,"work_id":"b33d93a6-6825-4273-9a12-4cbb6da04716","year":1988},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:1730daf01afc6e8f13cc7bdd97a29de81c4477f7054a08614038be116be5d7b5","observation_id":"428610bf-446d-44d5-8a7e-ecf0d9f56e65","resolution":{"observed_at":"2026-07-08T23:35:46.402304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:35:46.404804Z","title":"Reinforcement learning from reachability specifications: PAC guaran- tees with expected conditional distance","venue":null,"work_id":"f47bee75-c3f8-41a7-8fcc-8f97a4553585","year":2024},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:ea36541754246f8fb25d815b97ba41980e7c2798768d62d3f2597fee8f124851","observation_id":"42cc6dc3-819c-40b0-87fa-d18166e2366b","resolution":{"observed_at":"2026-07-08T23:35:46.406030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11591","last_updated":"2019-11-22T12:57:35Z","snapshot_observed_at":"2026-07-06T08:24:32.545342Z","submitted_at":"2019-09-23T18:10:00Z","title":"Modular Deep Reinforcement Learning with Temporal Logic Specifications","version":2},"cited_work":{"arxiv_id":"1909.11591","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11591","snapshot_observed_at":"2026-07-02T12:06:55.347413Z","title":"Z., Hasanbeig, M., Abate, A., and Kroening, D","venue":null,"work_id":"77541537-cde8-463d-8cbf-a826be76129c","year":1909},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"cited_paper":"/paper/1909.11591","citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:8417071d520c77b4d4592a0b84e1adbd421dd51454c39fc5f45766757be04718","observation_id":"e1a92c9d-f4d2-41d6-ae61-2b33d703ebf1","resolution":{"observed_at":"2026-06-30T14:24:45.270482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:35:46.395516Z","title":"In the case of transition probabilities, the empirical and true mean translate to the empirical and true probability of a transition’s probability of occurring","venue":null,"work_id":"2c71fa11-7663-4023-8382-0dd3f2ae36e5","year":2017},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:caf258e10cb971b1b4ef49c028f514806a216102bbf3c45299b3567cc601ab1f","observation_id":"83e3207b-b765-44b2-8e29-f07ae4d6cdbe","resolution":{"observed_at":"2026-07-08T23:35:46.396870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:35:46.397413Z","title":"The algorithm runs BVI on the collapsed MDP, which is derived from the discovered partial MDP, as mentioned in Section 3.2","venue":null,"work_id":"bf2f828a-64e3-45bd-b8fd-d959aaaecf46","year":2019},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:3e9f585ea2c44afedca875627b65c79c96483f6c12e969066b3ec77dc14d008e","observation_id":"4fd95968-cfc9-451d-8298-26696dcf9a19","resolution":{"observed_at":"2026-07-08T23:35:46.398648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:35:46.402854Z","title":"By this definition V( ˆMC) is the limit of the best lower bound, L(sC,0), which BVI can obtain using ˆP","venue":null,"work_id":"6f9d1f13-a8fa-4da2-bb9d-d1f646253a97","year":2019},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:cc6d10ba8d4f7741e355b5e3c1b91b083208b9adb7c92293756d449a5dc4cd42","observation_id":"2779ab9a-8a80-4a1c-ac12-8d86de9b3511","resolution":{"observed_at":"2026-07-08T23:35:46.404204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:35:46.408366Z","title":"We define Ds,a = lcms′∈S(q(s,a),s′), where lcm is the lowest common multiple of inputs","venue":null,"work_id":"a9e11dbc-382c-417d-881e-270282d69584","year":2012},"citing_paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T14:15:45.030536Z"},"links":{"citing_paper":"/paper/2605.24740"},"observation_digest":"sha256:2b9d16f17e02cf57ab7b59f1d48da3b0fd95a9acd7187ae40ab0449859ff535b","observation_id":"9c27cfb6-76a6-45d5-8bf2-dffe75ce1282","resolution":{"observed_at":"2026-07-08T23:35:46.413907Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24740","last_updated":"2026-05-23T21:29:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:34:47.734159Z","submitted_at":"2026-05-23T21:29:15Z","title":"Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":3,"verified_fuzzy":7},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2605.24740."}