{"as_of":"2026-08-08T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f4a2eb50bbc352ea2641b489da0f748a216b2200338189fbbcf8b5748e3ed46","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:04:00.844121Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00962/citation-record","integrity":"/paper/2506.00962/integrity","json":"/paper/2506.00962/citation-record.json","paper":"/paper/2506.00962"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:08.116054Z","title":"M., and Sun, W","venue":null,"work_id":"78e7f7b9-81d7-4c8d-8d06-c88c5726e5a3","year":2022},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:57.285325Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:dcb1f22ff41689fbea992c9e11ac545a7e0959cd71d18df855f39df1b859d7cf","observation_id":"c17865b5-f16c-417e-a61e-14af8991c27a","resolution":{"observed_at":"2026-08-07T12:04:08.314379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:07.784156Z","title":"An optimal control perspective on diffusion-based generative modeling","venue":null,"work_id":"99cb9683-9009-44d9-a8ae-f9517180ff2e","year":2024},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:57.399726Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:4aed7e08272b5642e5b4e01a54600609c791fd00d7a9047e40ddfaee8de43c99","observation_id":"3d79a602-1722-42b5-8dcc-109581632a6f","resolution":{"observed_at":"2026-08-07T12:04:07.943354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:07.417424Z","title":"Steady state analysis of episodic reinforcement learning","venue":null,"work_id":"54bb3326-a7df-4a5f-b98c-0a841de0cad4","year":2020},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:57.573753Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:fdf2682a25f6a6f29a1d54a4a59a33f693b5f6cc9eda38421a304086b37ce8b8","observation_id":"11848eba-7792-4a3a-8349-4313dd1673b4","resolution":{"observed_at":"2026-08-07T12:04:07.587976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02994","last_updated":"2024-10-03T21:11:29Z","snapshot_observed_at":"2026-07-06T19:27:20.458797Z","submitted_at":"2024-10-03T21:11:29Z","title":"Finite-Sample Analysis of the Monte Carlo Exploring Starts Algorithm for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2410.02994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02994","snapshot_observed_at":"2026-08-07T12:04:01.281028Z","title":"Finite-Sample Analysis of the Monte Carlo Exploring Starts Algorithm for Reinforcement Learning","venue":"cs.LG","work_id":"d6001fdd-8b35-4853-9c29-b3b82acc2113","year":2024},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:57.759352Z"},"links":{"cited_paper":"/paper/2410.02994","citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:3aa1c96f1f86ec3c0c72654b246c4ba91283ed7b1762cbfa69619db34681f98f","observation_id":"7d63d11e-ac53-4719-9996-b3efa119e559","resolution":{"observed_at":"2026-08-07T12:04:01.429448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:07.054586Z","title":null,"venue":null,"work_id":"bcd94b59-4a77-4f5a-92af-13e29a73a7cc","year":2012},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:57.847987Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:7cf178a926e75da40bf20558785e6284593718c7af43669aef7d92b03b2fbf67","observation_id":"6def04ef-1c65-4891-bbd3-dd906e61c7cd","resolution":{"observed_at":"2026-08-07T12:04:07.258358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:06.626589Z","title":"Finite state Markovian decision processes","venue":null,"work_id":"418946aa-9c6c-487c-bc26-dc955057e130","year":1970},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:57.919722Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:13c8f825e7a70d8c1559d58e485b84d5ae45b09256266ae094a0100dadc41947","observation_id":"bb57821f-0633-4c4a-bde4-23972733b118","resolution":{"observed_at":"2026-08-07T12:04:06.807588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:06.252172Z","title":"and Sch \\\"u tte, C","venue":null,"work_id":"91cc2ae6-8687-4d04-b2cf-e1025b5b5c30","year":2012},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:58.057033Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:996b05584af83df4c6e3973e6b125dcfa7b9ebac56c7cf4a9e4474642ddb904f","observation_id":"1d87063d-636e-4e13-9170-a787eb8f0b5f","resolution":{"observed_at":"2026-08-07T12:04:06.403025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:06.124837Z","title":"Variational characterization of free energy: Theory and algorithms","venue":null,"work_id":"1638ebb9-faf4-49c1-8f1e-46e50fd4bfbd","year":2017},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:58.160551Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:fa24d871131af9a6e61956c1ba4a43827b9b8f060c5f3acbf69b4d0e488bd6c7","observation_id":"0438410c-f251-4002-a688-757897fd52a0","resolution":{"observed_at":"2026-08-07T12:04:06.142821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09149","last_updated":"2021-06-16T21:52:27Z","snapshot_observed_at":"2026-08-08T13:07:49.100567Z","submitted_at":"2021-06-16T21:52:27Z","title":"Fr\\'{e}chet derivatives of expected functionals of solutions to stochastic differential equations","version":1},"cited_work":{"arxiv_id":"2106.09149","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.09149","snapshot_observed_at":"2026-08-07T12:04:01.022177Z","title":"Fr\\'{e}chet derivatives of expected functionals of solutions to stochastic differential equations","venue":"math.PR","work_id":"7980f920-ff95-47bd-92b4-a8e60f0eb8f3","year":2021},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:58.220862Z"},"links":{"cited_paper":"/paper/2106.09149","citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:4a443a5a3eb130337e6e53c79839b10c1d74f1d170d6c4b523a760d7188c6cd3","observation_id":"d7fc37ce-0105-45ca-a973-6348e1cdcb16","resolution":{"observed_at":"2026-08-07T12:04:01.138144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:05.805868Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":"e381e6d7-a2f5-42af-9f44-e86f91c58f92","year":2016},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:58.355556Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:031f37564ad20a84c230f3baa89e9c7c3b3b7ea03de5bea6f54d7d285152c9b6","observation_id":"40fdb2c6-5c4c-4d16-97fb-d3442c12ae7c","resolution":{"observed_at":"2026-08-07T12:04:05.961251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:05.564022Z","title":"Online reinforcement learning with uncertain episode lengths","venue":null,"work_id":"36d94864-bd62-44f1-9a9e-51a590f7318f","year":2023},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:58.543579Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:ff14b1f7dbdcea9f6554516b8ec938bcaaee348f267b4fe7f0f704766978c631","observation_id":"e76d062e-9886-463a-884d-8ed878b4972b","resolution":{"observed_at":"2026-08-07T12:04:05.662630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-07T12:03:58.652529Z","title":"Playing A tari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:58.652529Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:1b3d447cae1fff4882958987429ef717cc33b4f86bebb1ea335945a15df769dc","observation_id":"ff03ed89-d27d-491b-a17e-dde9b5b8bc02","resolution":{"observed_at":"2026-08-07T12:03:58.652529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:05.245781Z","title":"and Thomas, P","venue":null,"work_id":"fd0135a7-21e6-4d13-b54d-3c39da842516","year":2020},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:58.796246Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:f5194c377e8f12b96c98c20167c3b2e3b61d2f22b4d00885f6f648e1c3004f87","observation_id":"fb4803f5-2282-4267-bdea-77254ea5029f","resolution":{"observed_at":"2026-08-07T12:04:05.402213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:05.014796Z","title":"and Richter, L","venue":null,"work_id":"49f342b9-871d-4af0-ac3a-320c795bf160","year":2021},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:58.952385Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:124fb405dc597a6c4f410e1adcca9d2099e6eecfcbab63fc4c7bee6442a7e6ab","observation_id":"f83b191f-1f2c-4bbc-aedc-fded12b0ad2d","resolution":{"observed_at":"2026-08-07T12:04:05.128034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:04.887227Z","title":"Stochastic control foundations of autonomous behavior","venue":null,"work_id":"3c1573f6-eb9c-4b7d-9f84-68c120166717","year":2018},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.075138Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:b204398d2c19eb4f35641146c2e48e2e117dc800832b2f15ceb68b1090d66af8","observation_id":"285f59f2-a65c-4643-9515-7d892ef44a37","resolution":{"observed_at":"2026-08-07T12:04:04.952143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:04.494496Z","title":"Continuous-time stochastic control and optimization with financial applications, volume 61","venue":null,"work_id":"399b4ec5-1c16-44da-b09b-8dc3b201f543","year":2009},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.188297Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:bf468a45df677b80cafff59536f237fde53fea77c6014bb5d80803dbdfb202bf","observation_id":"fea4c62f-45d4-416b-aed7-d4b9cf0e2e99","resolution":{"observed_at":"2026-08-07T12:04:04.648176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:59.268173Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.268173Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:d0e3cb8e1308e8edc52e5c0c7df65fc643f125d44b037895614c7cce2b9d8db5","observation_id":"620359c4-2a76-4563-93ca-4493dc8d1dee","resolution":{"observed_at":"2026-08-07T12:03:59.268173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:04.140690Z","title":"and Ribera Borrell, E","venue":null,"work_id":"76ba5310-f5b3-4e0a-948a-a9de3770847a","year":2024},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.385860Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:c22163127f21c1a5ab74b3286fb4990166a44429b392273cac9e1558321f1b17","observation_id":"ef440227-290e-422e-bb6f-112ee4e62c7e","resolution":{"observed_at":"2026-08-07T12:04:04.333644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:03.754827Z","title":"Improving control based importance sampling strategies for metastable diffusions via adapted metadynamics","venue":null,"work_id":"9bec4d7c-9a1a-4454-b560-323a0a3bbd16","year":2024},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.489656Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:c6d5995ce6e5f56447eb973ccb605abe37cf2e607f575e63799cf89ccbed5d63","observation_id":"ea9911ac-36ec-477e-8832-9d4d67f16afd","resolution":{"observed_at":"2026-08-07T12:04:03.911120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:03.400257Z","title":"Trust region policy optimization","venue":null,"work_id":"d740e01c-fae9-4c2e-ab53-c789fa29337f","year":2015},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.583527Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:829fad9c0b7d34cf30c357fae0f2eda7d1d77c49ace57225eeba6e1929865d0a","observation_id":"f08cd45a-5b85-4937-8c03-6786bf0f78e3","resolution":{"observed_at":"2026-08-07T12:04:03.590012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:03:59.660830Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.660830Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:043fcff71dae606a409427b1fde033d36dfea093cf385c07a149e6d7ce46cee1","observation_id":"48911a4b-217a-475a-967a-300416e5dee8","resolution":{"observed_at":"2026-08-07T12:03:59.660830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:03.096593Z","title":"Overcoming the timescale barrier in molecular dynamics: Transfer operators, variational principles and machine learning","venue":null,"work_id":"fd2127cf-78d2-45d1-897c-87e04ae8e6a9","year":2023},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.730277Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:362587b1484df4a9359979850b6b49abd64b073211e8f27af99eb04099fd42fa","observation_id":"26949471-6f45-4a5c-b5a4-1cd2faf1e4a7","resolution":{"observed_at":"2026-08-07T12:04:03.235858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:02.920715Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":"61955ebd-5da4-4f6a-a42b-8a993ae004c6","year":2014},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.821771Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:8bf996610e6772a35bd5e9944480703a39aa3846198ed88cc16b5fa97139131e","observation_id":"0d10f094-e17d-4716-a164-1eab4003f514","resolution":{"observed_at":"2026-08-07T12:04:03.022097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:02.730152Z","title":null,"venue":null,"work_id":"85c01de4-38e9-4305-9db1-74a70a4182ca","year":1996},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:59.947299Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:078fd588bbad81cdf848c71ce4fef64a7845d1b47e481c263084c3e14388d917","observation_id":"512c57e3-5cc5-4688-a4b3-e7b465b16bc0","resolution":{"observed_at":"2026-08-07T12:04:02.819558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:02.553185Z","title":null,"venue":null,"work_id":"6102449b-6287-4bc8-ae8c-d02b6fb5f064","year":2018},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:00.091133Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:25cc897d03f848b08a851480868b1bf7c282e4b8a58854516ad63ef7cd55a69a","observation_id":"7646e382-a65e-4fb0-aff2-83722a1e2c91","resolution":{"observed_at":"2026-08-07T12:04:02.645742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:00.247441Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:00.247441Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:4aee26fe681d75d14231d3c51ea9afd7c66a48d8c63edcbac687f8f47a4c0523","observation_id":"11121e87-018f-471b-a95d-7e2d24782b50","resolution":{"observed_at":"2026-08-07T12:04:00.247441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:02.391995Z","title":"U., De Cola, G., Deleu, T., Goulão, M., Kallinteris, A., Krimmel, M., KG, A., Perez-Vicente, R., Pierré, A., Schulhoff, S., Tai, J","venue":null,"work_id":"50ae741d-b711-4135-8a9c-021013509c88","year":2024},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:00.334819Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:2439f5bd48f84847a782c762a0e13dc9b26dabfdbb43625b2ffb1d9d7b2327d2","observation_id":"08383ad2-08e0-4ec9-99b2-ab3491473147","resolution":{"observed_at":"2026-08-07T12:04:02.457682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:02.225158Z","title":null,"venue":null,"work_id":"46c19707-9796-40ea-a17d-515b2e98295b","year":2020},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:00.441945Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:59db387d0078fc6c1887193509b7bd19975bf39e9af50e5e6c50e54a5b519bc2","observation_id":"49aa1aca-32ea-4a76-8e4a-7c88dab3e0fc","resolution":{"observed_at":"2026-08-07T12:04:02.298815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:02.030183Z","title":"Unifying task specification in reinforcement learning","venue":null,"work_id":"477cd563-ada9-48e3-8102-f65b27f22772","year":2017},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:00.568325Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:67990889858ff6ff0d2f23689aedac0476aab798cc3dac987758fa6ec7501b5e","observation_id":"eb154fd5-b6ac-41cd-bb99-d20188244c60","resolution":{"observed_at":"2026-08-07T12:04:02.124196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:01.816591Z","title":"Global convergence of policy gradient methods to (almost) locally optimal policies","venue":null,"work_id":"89a61a74-4c8e-4fa3-8c0b-e737959a7074","year":2020},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:00.723411Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:bdbbb1a997c85f5933f33c51f47b99caacf12c8cf19510c75d07d4bf1b0e0f1e","observation_id":"066d052c-99c8-4bcb-a21f-1bb88685fb30","resolution":{"observed_at":"2026-08-07T12:04:01.909939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:04:01.586852Z","title":"Actor-critic method for high dimensional static H amilton-- J acobi-- B ellman partial differential equations based on neural networks","venue":null,"work_id":"fa97bd86-5250-4862-8abb-3bf5cba7d9ce","year":2021},"citing_paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:00.844121Z"},"links":{"citing_paper":"/paper/2506.00962"},"observation_digest":"sha256:bce4b8288c8e60f61147731cd1661085d4c5435fa9a3b20277db1615fabd1fb7","observation_id":"53440e3e-290b-41e0-bdcc-7bd52c7f6e3f","resolution":{"observed_at":"2026-08-07T12:04:01.708906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00962","last_updated":"2025-08-13T21:46:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:51:40.354611Z","submitted_at":"2025-06-01T11:22:45Z","title":"Reinforcement Learning with Random Time Horizons"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2506.00962."}