{"as_of":"2026-08-08T07:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f1c621d31f09acafb12d8d3a45826673fe9c1e8a6ca590d72b2ea49d5b70ef8","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:33:38.321579Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:22:20.635669Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:18:43.032059Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":"2507.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-07-03T17:18:43.032059Z","title":"Huang, Y ., Jia, Y ., and Zhou, X","venue":null,"work_id":"aaaa680e-b21e-4694-9227-0deb1d653524","year":2025},"citing_paper":{"arxiv_id":"2601.18681","last_updated":"2026-05-08T00:14:56Z","snapshot_observed_at":"2026-07-06T22:43:02.453697Z","submitted_at":"2026-01-26T16:56:40Z","title":"ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T10:42:23.768313Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2601.18681"},"observation_digest":"sha256:daf7406eb4ad10793b0bdac3e77fcfa15aae9c05a1cb1f8544f74f67b5e47bc3","observation_id":"ec665d63-6095-424a-ab99-5b351f53c8d3","resolution":{"observed_at":"2026-05-16T10:42:45.321033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":"2507.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-07-03T17:18:43.032059Z","title":"Huang, Y ., Jia, Y ., and Zhou, X","venue":null,"work_id":"aaaa680e-b21e-4694-9227-0deb1d653524","year":2025},"citing_paper":{"arxiv_id":"2605.13010","last_updated":"2026-05-13T05:02:47Z","snapshot_observed_at":"2026-08-03T02:37:11.973206Z","submitted_at":"2026-05-13T05:02:47Z","title":"Amortized Guidance for Image Inpainting with Pretrained Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:33:27.641167Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2605.13010"},"observation_digest":"sha256:c6a5c93bf954d448e36cc3e9d43a02922bd9aeb9ffa53d7da7f5df84ce18f47f","observation_id":"9818ebf3-6f70-41c9-8d27-84dac68bed2a","resolution":{"observed_at":"2026-05-14T19:37:52.603822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":"2507.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-07-03T17:18:43.032059Z","title":"Huang, Y ., Jia, Y ., and Zhou, X","venue":null,"work_id":"aaaa680e-b21e-4694-9227-0deb1d653524","year":2025},"citing_paper":{"arxiv_id":"2607.02137","last_updated":"2026-07-03T02:14:28Z","snapshot_observed_at":"2026-08-08T05:30:20.123996Z","submitted_at":"2026-07-02T13:13:19Z","title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T17:14:04.821073Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2607.02137"},"observation_digest":"sha256:73ba636aa69c0e214e8a4124ab2f7ac26213389b48cd533c14bfad9c48b36923","observation_id":"dd9a3f69-c1e9-47d8-9199-dfe392315231","resolution":{"observed_at":"2026-07-03T17:18:43.033802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-07-12T08:25:48.021715Z","title":"Yilie Huang, Yanwei Jia, and Xunyu Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02137","last_updated":"2026-07-03T02:14:28Z","snapshot_observed_at":"2026-08-08T05:30:20.123996Z","submitted_at":"2026-07-02T13:13:19Z","title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T08:25:48.021715Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2607.02137"},"observation_digest":"sha256:063532d5250e13b955b11e988f7537fbed0f694da2a44d0ca9211fd5c33e368a","observation_id":"10076fa3-b771-462d-89e9-b6081230cc75","resolution":{"observed_at":"2026-07-12T08:25:48.021715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-08-01T11:22:20.635669Z","title":"Data-driven exploration for a class of continuous-time indefinite linear-quadratic reinforcement learning problems.arXiv:2507.00358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.635669Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:926d98cc64da7a2a900447cd7e1556bf0542610a25219464cf5366835cfb9c8a","observation_id":"2a8504d5-6aa5-4220-9480-8210bd94ac96","resolution":{"observed_at":"2026-08-01T11:22:20.635669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00358/citation-record","integrity":"/paper/2507.00358/integrity","json":"/paper/2507.00358/citation-record.json","paper":"/paper/2507.00358"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17226","last_updated":"2025-07-24T15:32:35Z","snapshot_observed_at":"2026-08-01T16:37:37.972314Z","submitted_at":"2024-07-24T12:26:21Z","title":"Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17226","snapshot_observed_at":"2026-08-06T21:33:32.491006Z","title":"Sublinear regret for a class of continuous-time linear– quadratic reinforcement learning problems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.491006Z"},"links":{"cited_paper":"/paper/2407.17226","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:d5fa8d76fd09135a9198056345e8ff001f6c53b59d627e13fdc031b5d9a933c1","observation_id":"53c011f9-07ed-4843-baeb-28990310a5df","resolution":{"observed_at":"2026-08-06T21:33:32.491006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:50.452651Z","title":null,"venue":null,"work_id":"3eb8be7d-b96f-44f6-b3e0-be98a0829397","year":2007},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.598128Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:0d3b439efc214c6f0afe00e09376d178d3f9079c48275b3c35476589eb3360eb","observation_id":"a416a5af-1070-4a81-87d0-f759c5104c62","resolution":{"observed_at":"2026-08-06T21:33:50.572667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:50.247219Z","title":"Yong and X","venue":null,"work_id":"2f16ad14-82b1-47e1-bf05-036eb8218146","year":1999},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.682350Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:4bcb04be170cc3d2a4a3a06650f02b10d38b6087ae73df35de5c26f1eda4cc0f","observation_id":"3319b20d-c984-487a-8f7e-7b9980ff7326","resolution":{"observed_at":"2026-08-06T21:33:50.346689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:49.987126Z","title":"Stochastic linear quadratic regulators with indefinite control weight costs,","venue":null,"work_id":"bc9bcf4d-e7c5-432d-8616-8f67e2c4e88e","year":1998},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.785792Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:e731fefebf9eaad2e37b8a0a4ceada1803a370dce66bf4b4fe7e708d593992f1","observation_id":"a0260570-6ce0-4368-bfca-79e54bd1e914","resolution":{"observed_at":"2026-08-06T21:33:50.100535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:49.745884Z","title":"Well-posedness and attainability of indefinite stochastic linear quadratic control in infinite time horizon,","venue":null,"work_id":"95c70543-8543-4f23-9523-a128e213ea3f","year":2000},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.875427Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:76ea00cfeecccbcfb99942c0b59e8fb42cc110e5dee64ad14cdfb958b8972f52","observation_id":"9a56b895-bbdd-4b7b-9b39-ad595502bcb5","resolution":{"observed_at":"2026-08-06T21:33:49.849387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:49.500679Z","title":"Linear matrix inequalities, riccati equations, and indefinite stochastic linear quadratic controls,","venue":null,"work_id":"02231572-152f-4909-b056-5a67d3f8d046","year":2000},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.970981Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:11f08abc8548d102b6bce2e2725aed8f952dcd3777b6132a7fa2a5f3f9a5107c","observation_id":"56b4a220-ed46-4e8d-bf98-140e0303d25c","resolution":{"observed_at":"2026-08-06T21:33:49.628482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:49.265061Z","title":"Solvability and asymptotic behavior of generalized riccati equations arising in indefinite stochastic lq controls,","venue":null,"work_id":"3cc41afa-e9a5-4dcc-9afd-9b7763c760c7","year":2001},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.097423Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:07fa24658a3ea5a64bad80e42446bc94702654be1e591a9f5f6ff4b65de55b80","observation_id":"6a310869-e25f-46c5-b6e2-e8ea4743ab12","resolution":{"observed_at":"2026-08-06T21:33:49.359104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:47.164994Z","title":"A primal-dual semi-definite programming approach to linear quadratic control,","venue":null,"work_id":"223a4799-0429-4da4-b92b-22b94439c368","year":2001},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.187398Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:9b442b1b211fb890f778510b339630526ecd4fa6a026b66129dc2d5db2da1805","observation_id":"5304aed6-de98-4bb2-9c9f-dd2410cfa39f","resolution":{"observed_at":"2026-08-06T21:33:47.792609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:46.803150Z","title":"Stabilization control for itˆ o stochastic system with indefinite state and control weight costs,","venue":null,"work_id":"931067e5-691e-48c9-9d3d-c0e18b26227b","year":2022},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.296546Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:6413dcf30baf02e30ce8f8315b0d5f920e5e0d80484a1177bc95b9479f4178d5","observation_id":"c4910c53-0ea6-4635-b660-f8dc3fdc3498","resolution":{"observed_at":"2026-08-06T21:33:47.001170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:46.463860Z","title":"Optimal regulators for a class of nonlinear stochastic systems,","venue":null,"work_id":"ca99f069-3f23-423f-bbe8-869c1cfa028b","year":2023},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.397836Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:cdb2def0bf1323b8c966138e29f253c5d046265d79f0c6f620e5e986c18a01b1","observation_id":"0cc3dcd9-378d-4d3e-a63d-a3fe1fe2e24e","resolution":{"observed_at":"2026-08-06T21:33:46.604066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:46.121153Z","title":"Indefinite linear-quadratic optimal control of mean-field stochas- tic differential equation with jump diffusion: an equivalent cost functional method,","venue":null,"work_id":"c7d8dd7a-4277-4a0f-ab9d-7b2139b2c49a","year":2024},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.501366Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:d8586008b6f5a949ba73478cc9e8256084322202dd5a9aed77c66295421e1e4c","observation_id":"224c8670-cdc7-48ce-bd8a-0e48d8985ff7","resolution":{"observed_at":"2026-08-06T21:33:46.262692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:45.738292Z","title":"Stochastic linear quadratic optimal control problems with regime- switching jumps in infinite horizon,","venue":null,"work_id":"e1444e65-acea-49f4-90b3-f9de9ba5468a","year":2025},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.595650Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:9ab080ea3942917e0d4bc8f3a78f54c1660259aa03ca7d81ae5bf5a3aff0f5e6","observation_id":"9ffde277-e768-4d2b-a6fa-a3f77730792b","resolution":{"observed_at":"2026-08-06T21:33:45.935693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:45.456936Z","title":"On estimating the expected return on the market: An exploratory investiga- tion,","venue":null,"work_id":"7f4583c9-c7e8-4934-a430-fce2a0b9883a","year":1980},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.693784Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:cd88c50848405fe717840de22f5c043acf797d9bc4fd39592608719e6341268c","observation_id":"c30d62f0-e968-4f7c-925b-97b18f70c6c6","resolution":{"observed_at":"2026-08-06T21:33:45.607054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:45.132753Z","title":null,"venue":null,"work_id":"3e5438a8-ffec-4bb8-9809-01017e4e74dd","year":1998},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.776096Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:d1b921fc94d0d3460bcbccaa9fbffebefdfe57fa4596a6b78b681b00cb1ced49","observation_id":"22553b20-340f-4dc7-840b-ee89e39fa168","resolution":{"observed_at":"2026-08-06T21:33:45.269404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:44.871005Z","title":"Rustem and M","venue":null,"work_id":"7a9a804d-12dd-4b12-a5f2-d41b46b75f8d","year":2009},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.870263Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:8b3043ce6f6e933ab862491e7a7b7272bcd7136415240488329c2981847f46e0","observation_id":"7081615b-f0b1-426c-86b4-783149d67788","resolution":{"observed_at":"2026-08-06T21:33:45.008450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:44.585002Z","title":null,"venue":null,"work_id":"0da80364-002c-43b4-9648-834c8273f859","year":2018},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.944653Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:c451c27b687e4b14f2c9abfeab77907ff7176ffe96df77f63839d632049e97d0","observation_id":"37632502-7169-4d11-845d-733f8f20b593","resolution":{"observed_at":"2026-08-06T21:33:44.729693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06976","last_updated":"2019-11-19T14:40:14Z","snapshot_observed_at":"2026-07-06T08:15:23.057129Z","submitted_at":"2019-08-19T16:22:20Z","title":"A survey on intrinsic motivation in reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06976","snapshot_observed_at":"2026-08-06T21:33:34.035769Z","title":"A survey on intrinsic motivation in reinforcement learning,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.035769Z"},"links":{"cited_paper":"/paper/1908.06976","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:cdb8f9620bfde0617abfa59e63d186e1238a635143128d1b22147b0f78cda3d7","observation_id":"c75ffc6c-70b2-4f62-ae92-8ac9ea4ad5bf","resolution":{"observed_at":"2026-08-06T21:33:34.035769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:44.298464Z","title":"Formal theory of creativity, fun, and intrinsic motivation (1990–2010),","venue":null,"work_id":"b8ce0088-a1b2-4e64-972e-fbc2450a4913","year":1990},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.126427Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:47889d0b48cf310bf1370cdaa3fd3ee9c494feaead3204bda471a06376e1ccc4","observation_id":"5ec4e6e4-16a0-4143-a74f-b77f89cebd07","resolution":{"observed_at":"2026-08-06T21:33:44.443994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01732","last_updated":"2017-03-06T05:51:42Z","snapshot_observed_at":"2026-07-06T05:32:27.193419Z","submitted_at":"2017-03-06T05:51:42Z","title":"Surprise-Based Intrinsic Motivation for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01732","snapshot_observed_at":"2026-08-06T21:33:34.257469Z","title":"Surprise-based intrinsic motivation for deep reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.257469Z"},"links":{"cited_paper":"/paper/1703.01732","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:2709e546e783627b5405494ab9336df9014cd361505c46f5c6643dc885b8de3f","observation_id":"86e125e1-8cb6-47dd-acbd-2a38acffa9ff","resolution":{"observed_at":"2026-08-06T21:33:34.257469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:43.964852Z","title":"Curiosity-driven exploration by self- supervised prediction,","venue":null,"work_id":"663c0761-72f3-45f1-b8f6-7f8046365784","year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.353252Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:ba0b4d98a5aff59327ce41d35cfdfd8d4c1a91e30cac0c2a1af240a083573e5a","observation_id":"347fd813-d80b-41d9-a067-a87eebf867ef","resolution":{"observed_at":"2026-08-06T21:33:44.157257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-02T13:41:53.507553Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-06T21:33:34.448173Z","title":"Large-scale study of curiosity-driven learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.448173Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:dca9b24071f0c86be3fbd2b77bd9213d39169861ad572eece6df1fe0292eb7ad","observation_id":"84763f26-e404-4299-83e2-4f9271c8ff3d","resolution":{"observed_at":"2026-08-06T21:33:34.448173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-06T21:33:34.568573Z","title":"Exploration by random network distilla- tion,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.568573Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:1d881cefa49df692940e7986698055bba16c189fa68625dcd875a3c1a6d0b7dc","observation_id":"10d21d05-a695-4b4e-9f32-1cfd6bd8fa23","resolution":{"observed_at":"2026-08-06T21:33:34.568573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:43.694303Z","title":"Randomized prior functions for deep reinforcement learning,","venue":null,"work_id":"d3df819c-cb12-4cbe-89ba-2d7dafa90e5f","year":2018},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.642461Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:31e3775a5c64c50feec93119eda7424a4a412b1b1350dd27c84487386a3510f6","observation_id":"d9708eae-0a06-4e27-8b0a-39fdd77d889f","resolution":{"observed_at":"2026-08-06T21:33:43.818381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:43.435125Z","title":"Fast active learning for pure exploration in reinforcement learning,","venue":null,"work_id":"30ff41e3-fdec-4412-9fb4-b07372bd8341","year":2021},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.727222Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:a99ca2a4cb6ceb06edf67f7d74ffb77a51883459361c62c8c41d4aa42c46cc1b","observation_id":"bc9ef8ca-a6c4-49c3-b588-e076d4af1322","resolution":{"observed_at":"2026-08-06T21:33:43.572233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:43.195025Z","title":"# exploration: A study of count-based exploration for deep reinforcement learning,","venue":null,"work_id":"4c3c6730-5e0c-4adc-97e9-546aa948a79a","year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.830998Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:8c02d63074a2a374e61a5b88fda514b6f2ec66662e0018cf07daf512e2010a6c","observation_id":"e0d6309e-1719-4bf5-a7d2-7193a8dae6a2","resolution":{"observed_at":"2026-08-06T21:33:43.310875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-07-06T07:30:05.397042Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-06T21:33:34.943251Z","title":"Go-explore: A new approach for hard-exploration problems,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.943251Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:7b928216842ce7f26c1302587a768c430c1da1deaba501ffa35c019eac850d4b","observation_id":"16a5722b-ccca-4208-bb58-b7412a6a7e36","resolution":{"observed_at":"2026-08-06T21:33:34.943251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:42.884907Z","title":"First return, then explore,","venue":null,"work_id":"26fcf69f-0178-4e21-8ffe-04e16b6d42ba","year":2021},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.051690Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:dc2330137b98e9ccdc0c22850274972422715ec04bf9dda5ec83a6eb7e879c34","observation_id":"d28035f0-aadb-4915-83d3-90f2e7e7cc3d","resolution":{"observed_at":"2026-08-06T21:33:43.039615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-02T04:07:03.272158Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-06T21:33:35.132039Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.132039Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:d2fa7d37c94d4077905ba3437d03c36d940f877e3c50c6737c738665e9e0ad95","observation_id":"b25f14d2-0ef2-4fc4-98fc-5b3db13d6108","resolution":{"observed_at":"2026-08-06T21:33:35.132039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:42.562956Z","title":"A comprehensive survey on safe reinforcement learning,","venue":null,"work_id":"69c8e704-36e2-4510-85f3-2ad2f9f13959","year":2015},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.225247Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:995a7362eb3f9b282f12c0011d386c9e9eb66e3e93df29c4f563fe6f2f607ca7","observation_id":"3f31a89c-dfa3-46ad-a787-31beb912227c","resolution":{"observed_at":"2026-08-06T21:33:42.698606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05173","last_updated":"2017-07-17T14:13:40Z","snapshot_observed_at":"2026-08-03T08:03:37.092983Z","submitted_at":"2017-07-17T14:13:40Z","title":"Trial without Error: Towards Safe Reinforcement Learning via Human Intervention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05173","snapshot_observed_at":"2026-08-06T21:33:35.315253Z","title":"Trial without error: Towards safe reinforcement learning via human intervention,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.315253Z"},"links":{"cited_paper":"/paper/1707.05173","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:246926ed78f0406beec584c887511888699cb10208f8e1429a6736b6e9e71564","observation_id":"4a86cb93-5458-470a-acfa-5d08381dd836","resolution":{"observed_at":"2026-08-06T21:33:35.315253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:42.372115Z","title":"Policy gradient in continuous time,","venue":null,"work_id":"047eedf6-d1e6-4a0d-96b0-f50c7d9c6b14","year":2006},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.459696Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:1bef1ad2c7dc60378e323549201aaf9ff312982b171c36fd5101b78096970a91","observation_id":"2e800d42-c001-4948-8579-cb69a9048ba5","resolution":{"observed_at":"2026-08-06T21:33:42.482119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:42.153627Z","title":"Making deep Q-learning methods robust to time dis- cretization,","venue":null,"work_id":"69671a33-6400-4bbc-ad46-85097fe4cc73","year":2019},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.546997Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:7a57d6682b9b9be3309dba4219c3fc2e8f058dce84b0b02e2ebd9e33ba0d5749","observation_id":"12a82e21-f152-4421-bd38-9659339fcf81","resolution":{"observed_at":"2026-08-06T21:33:42.225469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.948362Z","title":"Time discretization-invariant safe action repetition for policy gradient methods,","venue":null,"work_id":"f9c9f47e-f33e-4fb6-aab8-5b93dcc0e2ce","year":2021},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.719240Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:0b3aff13dfed5dc1ae7c4b4bd03f77f0413d9a56c68b863fad051f5c7c60d1b3","observation_id":"9bf35128-1d6c-40f9-8dff-3e1a08431cdc","resolution":{"observed_at":"2026-08-06T21:33:42.037479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.788951Z","title":"Optimal scheduling of entropy regularizer for continuous-time linear-quadratic reinforcement learning,","venue":null,"work_id":"bf6b0f70-aa98-456d-890d-8e5b9df5332b","year":2024},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.850763Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:8cbee79835d082df70884b6dcdd22decb46d1aa0ab74d1babb6d33379cd1627f","observation_id":"6a3f0064-a959-44be-bc37-060185985191","resolution":{"observed_at":"2026-08-06T21:33:41.858896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.620404Z","title":"Indefinite stochastic riccati equations,","venue":null,"work_id":"2aae6aac-610f-41a1-b612-3b02e19d1338","year":2003},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.049474Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:c9b011a82e068bd55d098f477b3fd809353eac578c5fc018acfca9e9275f9c4d","observation_id":"a8021655-0c66-493c-bb20-04aee29c2885","resolution":{"observed_at":"2026-08-06T21:33:41.714543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.448763Z","title":"Existence of solutions to a class of indefinite stochastic riccati equations,","venue":null,"work_id":"71c578b1-e938-4739-ac67-71be16be4052","year":2013},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.115610Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:5e0c74b4333dd24a64a0a91fe96a848f276611bfa71040cce83d6077084f88c1","observation_id":"7accc150-d4ad-4931-80bc-e33c5cef8d0a","resolution":{"observed_at":"2026-08-06T21:33:41.550446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.295118Z","title":"Reinforcement learning in continuous time and space: A stochastic control approach,","venue":null,"work_id":"076096af-2fc5-43e4-9cce-d84a38764a02","year":2020},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.290103Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:a807089f33d477ff1489339bf0d41f88a5f06bc4c07f404b81b024dd85e88b5b","observation_id":"ccc0b981-160e-4ae4-9d31-cb9faf4049c9","resolution":{"observed_at":"2026-08-06T21:33:41.370950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10264","last_updated":"2021-12-19T21:47:04Z","snapshot_observed_at":"2026-08-06T17:21:50.888775Z","submitted_at":"2021-12-19T21:47:04Z","title":"Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10264","snapshot_observed_at":"2026-08-06T21:33:36.415315Z","title":"Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.415315Z"},"links":{"cited_paper":"/paper/2112.10264","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:1221c8308b1c82dda84ba91e3ebdf797d0a2ebd8f364cd0481c49f005e13ff8d","observation_id":"8f088e2d-74bb-468c-8c19-ee4d41f8cfcc","resolution":{"observed_at":"2026-08-06T21:33:36.415315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.128173Z","title":"Policy gradient and actor-critic learning in continuous time and space: Theory and algorithms,","venue":null,"work_id":"87cca34a-ae0a-4174-ab92-2ebb2a7958a4","year":2022},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.559039Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:1843d9b5928c70f4188bd2ac5bfbe10953f238043f1e74cef3ae5db6bbfef611","observation_id":"dd631aed-b86c-4aaf-a250-0ecdc1143c55","resolution":{"observed_at":"2026-08-06T21:33:41.177508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.959284Z","title":"Policy evaluation and temporal-difference learning in continuous time and space: A martingale approach,","venue":null,"work_id":"63890e96-2f4f-40d3-97bb-1d042d545912","year":2022},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.759306Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:5eaa330b733ef38b8e5d40ef9e15de751acdb44f29c9b76233601927068fb8be","observation_id":"99628674-cdfd-489c-8807-1efccfe2d68d","resolution":{"observed_at":"2026-08-06T21:33:41.048499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.762159Z","title":"A stochastic approximation method,","venue":null,"work_id":"0bb61205-2bf0-4067-8809-49561912fd49","year":1951},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.893967Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:bd74c06e5af083d1ada5dc1709a5208d9526d3aa1f10f8d9bb6309e6d91cba57","observation_id":"d2f9f109-02ae-4cbe-a0d1-57cad82d45d9","resolution":{"observed_at":"2026-08-06T21:33:40.850349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.534701Z","title":"Stochastic approximation,","venue":null,"work_id":"03a597b0-54fb-41bc-9631-bcf69622fc9c","year":2003},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.102211Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:2fd2f322bb2172fbda81d83603f463525e2ac342398fa8e3c7cd13ca55aa5f01","observation_id":"bddc39d1-6174-4d91-ba31-6f58c63fe5d9","resolution":{"observed_at":"2026-08-06T21:33:40.619413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.333108Z","title":null,"venue":null,"work_id":"f8748257-3e78-4df3-a40d-c7cc825a4b31","year":2009},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.259548Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:513439d6767e31332998dd022728230c5ab0965fb3c8209c9ba3c0efbab40520","observation_id":"52b5835a-44b2-4069-ac9a-03d5f5a4f485","resolution":{"observed_at":"2026-08-06T21:33:40.425098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.059936Z","title":"An overview of stochastic approximation,","venue":null,"work_id":"60985caf-04e0-45c0-ab57-2c8d9498273e","year":2014},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.457228Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:f1f4950b22cdb3ca236fe88682944eb642c544a766a7711c9a8147f037111223","observation_id":"ddca0fb6-7710-483a-9b99-e3eade5a629b","resolution":{"observed_at":"2026-08-06T21:33:40.198447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:39.666989Z","title":"A stochastic approximation algorithm with varying bounds,","venue":null,"work_id":"472b25af-f6e7-42e9-8b50-e88dae0a9dea","year":1995},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.676106Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:283825701e5c1ae1bc9d158d3969beb5c834e0d117765723ace5f264e2ff4bc4","observation_id":"ac6aff8d-77e2-43be-a347-3e08a1c4bc21","resolution":{"observed_at":"2026-08-06T21:33:39.861209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:39.392313Z","title":"General bounds and finite-time improvement for the Kiefer-Wolfowitz stochastic approximation algorithm,","venue":null,"work_id":"f5102e24-4942-4f91-8079-b22114e6dbd8","year":2011},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.874175Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:aa0cb91c2fab6b19922487bca122a44d64e4de6afd1e34d05409820789ff8ad9","observation_id":"a05ae417-2113-4264-88f5-45e8b3888bc7","resolution":{"observed_at":"2026-08-06T21:33:39.528730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:39.040745Z","title":"A convergence theorem for non negative almost supermartin- gales and some applications,","venue":null,"work_id":"d91b1fad-9bf0-4406-95f5-72682489ab8a","year":1971},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:38.010679Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:2aea88058c21f196067ae8cff9de8301ab519579e54d3ee6d2a0e4c90a11b508","observation_id":"3d5c3919-a8a0-4fce-80c2-6332c5d319a7","resolution":{"observed_at":"2026-08-06T21:33:39.185660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:38.643661Z","title":null,"venue":null,"work_id":"730feb15-6585-4b8e-9d67-b996c22716e8","year":1992},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:38.138033Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:4dda1a7a4ef88a74bebd113349e210cbb8f4baa9fe95f7881ec9435591a1286f","observation_id":"9b5aaec9-6d3e-4734-8818-9053c94d0707","resolution":{"observed_at":"2026-08-06T21:33:38.840537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-06T11:05:28.221806Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-06T21:33:38.321579Z","title":"Regret of exploratory policy improvement and q-learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:38.321579Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:0d13f6349ba248f825d4f776e7bb20e186227d4a44b2faa277ade58acabba81b","observation_id":"8fcc4cb7-4208-41ba-83b1-a123ac4ebeb2","resolution":{"observed_at":"2026-08-06T21:33:38.321579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T00:01:35.223450Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 5 inbound Pith citation observations for arXiv:2507.00358."}