{"as_of":"2026-08-23T09:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:017129fe24f1740cc2568dbc450d24d34111a06e1a2c97ebb9ff25ccdb6703a9","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T19:29:21.558661Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":75,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:36:41.833362Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T19:30:07.900798Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2402.05284","last_updated":"2026-05-02T21:42:12Z","snapshot_observed_at":"2026-08-13T08:27:58.494968Z","submitted_at":"2024-02-07T21:58:40Z","title":"Analyzing Adversarial Inputs in Deep Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T03:40:04.265426Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2402.05284"},"observation_digest":"sha256:9827f6b50b4a8b89f80a6de7e89cb0ac79de4f145e77a8ad67925853e56dfafe","observation_id":"e568771c-86df-498e-9c1c-d17c6d0e787f","resolution":{"observed_at":"2026-05-24T03:43:50.366105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-12T19:03:10.423609Z","title":"Benchmarking batch deep reinforcement learning algorithms","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.11088","last_updated":"2024-11-17T14:31:14Z","snapshot_observed_at":"2026-08-15T14:04:17.870467Z","submitted_at":"2024-11-17T14:31:14Z","title":"An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T19:03:10.423609Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2411.11088"},"observation_digest":"sha256:9ab239938a9c8b55b7ca54c79bcf0dce6b7a7e836f8d23055ed010178ba96211","observation_id":"10774b93-9586-4dc5-adb2-f478da525fe6","resolution":{"observed_at":"2026-08-12T19:03:10.423609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-12T14:44:45.503266Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.15036","last_updated":"2024-11-22T16:08:42Z","snapshot_observed_at":"2026-08-18T00:51:04.537526Z","submitted_at":"2024-11-22T16:08:42Z","title":"Safe Multi-Agent Reinforcement Learning with Convergence to Generalized Nash Equilibrium","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:44:45.503266Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2411.15036"},"observation_digest":"sha256:1af14a09a141afc8a83d208bceb91a915559806c872f837b68f77f3061bd642e","observation_id":"4db3688e-30cd-44f8-b1ed-664c158916af","resolution":{"observed_at":"2026-08-12T14:44:45.503266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-12T10:32:43.004752Z","title":"Bench- marking batch deep reinforcement learning algorithms","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.19133","last_updated":"2025-01-26T22:16:57Z","snapshot_observed_at":"2026-08-19T16:28:34.956083Z","submitted_at":"2024-11-28T13:34:15Z","title":"TEA: Trajectory Encoding Augmentation for Robust and Transferable Policies in Offline Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:43.004752Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2411.19133"},"observation_digest":"sha256:d1b934307de7ce329847032b092db42d846ead43f967954ca9c9a93c2d0f483b","observation_id":"402a4b1c-c5b2-4101-9cfa-b4172a00738e","resolution":{"observed_at":"2026-08-12T10:32:43.004752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T21:46:47.761953Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.04153","last_updated":"2025-04-18T13:37:59Z","snapshot_observed_at":"2026-08-15T10:52:17.229828Z","submitted_at":"2024-12-05T13:32:02Z","title":"A Dynamic Safety Shield for Safe and Efficient Reinforcement Learning of Navigation Tasks","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:47.761953Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.04153"},"observation_digest":"sha256:29dd733742f44a72fa0779896df55358b7cd2decd0c6c6bdcaaccf6918207112","observation_id":"601e906b-7322-4f7b-b574-398969d00804","resolution":{"observed_at":"2026-08-11T21:46:47.761953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T21:39:11.960949Z","title":"Alex Ray, Joshua Achiam, and Dario Amodei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-16T06:22:28.382009Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.960949Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:41603e10c57e30e9e59a3c01bf89429214970602b9c4d2bc937510b9534f7b7b","observation_id":"96f35f8a-f1fd-4bb7-b509-1ae6ea2e49c5","resolution":{"observed_at":"2026-08-11T21:39:11.960949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T19:09:55.310027Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-19T02:49:55.342638Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":257,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:55.310027Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:e439bf29f11f7ddc84cb538c1e6b9074914d56795ce533627702f9f810a18e4a","observation_id":"c3816790-3ba9-42c1-b2dd-5b96f7001b27","resolution":{"observed_at":"2026-08-11T19:09:55.310027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T17:32:14.308610Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.08920","last_updated":"2025-08-05T09:50:26Z","snapshot_observed_at":"2026-08-15T19:28:42.463216Z","submitted_at":"2024-12-12T04:06:54Z","title":"From Text to Trajectory: Exploring Complex Constraint Representation and Decomposition in Safe Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:14.308610Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.08920"},"observation_digest":"sha256:128fda7219f6d047a72a7f10c11246ff8a5e81451456373f9725b100b3560396","observation_id":"d574a47f-0de8-4f86-82fc-c3e688622d7b","resolution":{"observed_at":"2026-08-11T17:32:14.308610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T15:55:54.063493Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.10530","last_updated":"2024-12-13T19:54:51Z","snapshot_observed_at":"2026-08-16T20:13:51.785969Z","submitted_at":"2024-12-13T19:54:51Z","title":"Deep Reinforcement Learning for Scalable Multiagent Spacecraft Inspection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:55:54.063493Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.10530"},"observation_digest":"sha256:0f568010bc4c45c2c1be0abf15b4f8c669beb3991a031e66caa5abf954335a48","observation_id":"5fc362bd-6f14-461d-b3f2-e4e01432b57c","resolution":{"observed_at":"2026-08-11T15:55:54.063493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T15:20:56.465505Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-19T11:15:26.062659Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.465505Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:f00fbe3618b43dcf072c15d89fe8139da1e260f62b59c4977e9c4302638cf137","observation_id":"4cb0e4ea-7af1-4b76-bb84-fdafd028042e","resolution":{"observed_at":"2026-08-11T15:20:56.465505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T11:30:06.696490Z","title":"arXiv preprint arXiv:1910.01708, 7(1):","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.15429","last_updated":"2025-04-19T01:50:15Z","snapshot_observed_at":"2026-08-18T09:57:37.837649Z","submitted_at":"2024-12-19T22:29:03Z","title":"Offline Safe Reinforcement Learning Using Trajectory Classification","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:30:06.696490Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.15429"},"observation_digest":"sha256:b2b16cbf6924e01064cd2089462808a5b3b6ccaf611f8718ab0ee2e3de939d71","observation_id":"4a019047-0e98-42fb-8f3e-472e92eea9e5","resolution":{"observed_at":"2026-08-11T11:30:06.696490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T04:23:19.687726Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18946","last_updated":"2025-05-27T18:44:41Z","snapshot_observed_at":"2026-08-15T11:06:52.309119Z","submitted_at":"2024-12-25T16:42:27Z","title":"Constraint-Adaptive Policy Switching for Offline Safe Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T04:23:19.687726Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.18946"},"observation_digest":"sha256:da21af50514298550bae3fa1cf215740e2549b3725d09c67bc85b6853e0d182f","observation_id":"c51d4465-e89a-44f6-9583-746d3397ec41","resolution":{"observed_at":"2026-08-11T04:23:19.687726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-10T23:02:04.057723Z","title":"arXiv preprint arXiv:1910.01708 7(1), 2 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00320","last_updated":"2025-01-07T09:25:32Z","snapshot_observed_at":"2026-08-16T22:20:28.562139Z","submitted_at":"2024-12-31T07:31:46Z","title":"Autonomous Alignment with Human Value on Altruism through Considerate Self-imagination and Theory of Mind","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:02:04.057723Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2501.00320"},"observation_digest":"sha256:aa33cb92390e8aa02a2b16e98d8c68dd5619bf8e0998dc8970ab8d4cf0801313","observation_id":"9b48b65a-0ac4-4b9e-a035-989acc42a4c1","resolution":{"observed_at":"2026-08-10T23:02:04.057723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-10T15:42:33.274421Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.13727","last_updated":"2025-04-01T12:59:50Z","snapshot_observed_at":"2026-08-17T06:21:47.564267Z","submitted_at":"2025-01-23T15:01:19Z","title":"Scalable Safe Multi-Agent Reinforcement Learning for Multi-Agent System","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T15:42:33.274421Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2501.13727"},"observation_digest":"sha256:cfa8acfa85de020c6ddbc36249ceb1c341175a8c7433f79b86ed4730d52714e3","observation_id":"512aa79d-cd0c-4e7e-a916-740147faf020","resolution":{"observed_at":"2026-08-10T15:42:33.274421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-10T00:48:32.560569Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.18086","last_updated":"2025-01-30T01:56:07Z","snapshot_observed_at":"2026-08-18T21:38:44.458850Z","submitted_at":"2025-01-30T01:56:07Z","title":"DIAL: Distribution-Informed Adaptive Learning of Multi-Task Constraints for Safety-Critical Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T00:48:32.560569Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2501.18086"},"observation_digest":"sha256:c14a1a622a1b739a8c61127f6fd955d58ceaf2ad37a84305ba4a452d7aba807f","observation_id":"db4b5a4d-393b-48bc-b55e-c00e0b9c856a","resolution":{"observed_at":"2026-08-10T00:48:32.560569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-09T18:28:22.464527Z","title":"arXiv preprint arXiv:1910.01708 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00601","last_updated":"2025-04-13T23:43:44Z","snapshot_observed_at":"2026-08-11T17:50:27.070802Z","submitted_at":"2025-02-02T00:03:53Z","title":"Enhancing Offline Reinforcement Learning with Curriculum Learning-Based Trajectory Valuation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:22.464527Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2502.00601"},"observation_digest":"sha256:e08ca35ffba90c33189b2a2c27f0d0b79f66b3330c5aa4cbb61a292958f4d18a","observation_id":"60264791-448b-420b-b7ae-e530331b3bdc","resolution":{"observed_at":"2026-08-09T18:28:22.464527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-09T13:14:34.091162Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.02153","last_updated":"2025-02-04T09:31:54Z","snapshot_observed_at":"2026-08-16T16:34:47.536642Z","submitted_at":"2025-02-04T09:31:54Z","title":"Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T13:14:34.091162Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2502.02153"},"observation_digest":"sha256:a0d99ee749b9864973fe279b9f2e594a4ff3b5b1df88878e019010cd5bcccbac","observation_id":"ceac96ca-22cb-4c6f-af82-1ec1d217ac9c","resolution":{"observed_at":"2026-08-09T13:14:34.091162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-16T12:36:41.833362Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.12557","last_updated":"2026-06-30T02:48:09Z","snapshot_observed_at":"2026-08-17T06:42:22.902643Z","submitted_at":"2025-04-17T01:11:08Z","title":"TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:36:41.833362Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2504.12557"},"observation_digest":"sha256:a045fb463494eda9fd7d1aba7d9bbdba415469421a93d7619c05c0e80dcab89d","observation_id":"480eab5c-7607-40a5-a969-021318ced5d9","resolution":{"observed_at":"2026-08-16T12:36:41.833362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-15T21:48:26.219026Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.09349","last_updated":"2025-05-14T12:54:29Z","snapshot_observed_at":"2026-08-19T04:00:50.025861Z","submitted_at":"2025-05-14T12:54:29Z","title":"Safe Primal-Dual Optimization with a Single Smooth Constraint","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:48:26.219026Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2505.09349"},"observation_digest":"sha256:e3f970c4b35156f479ff80e299b2a1b95b37b10e3e73290a541ec2fc1a8bb457","observation_id":"97d7b077-9df4-4c27-9054-1848b8900735","resolution":{"observed_at":"2026-08-15T21:48:26.219026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-07T13:56:02.667693Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.20578","last_updated":"2025-05-26T23:27:50Z","snapshot_observed_at":"2026-08-16T12:27:07.187031Z","submitted_at":"2025-05-26T23:27:50Z","title":"Ctrl-DNA: Controllable Cell-Type-Specific Regulatory DNA Design via Constrained RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:56:02.667693Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2505.20578"},"observation_digest":"sha256:d77660f14501abea3443119c662b0be61ded4910e1a4382eba60cd4c4949ae1b","observation_id":"f38e2e38-b1b6-4e2c-b8f4-fb894cd11c8c","resolution":{"observed_at":"2026-08-07T13:56:02.667693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-07T12:07:08.990567Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-14T04:55:14.836179Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.990567Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:8dddad479b3d0ab931e94088e99f542d642ca29fc454f01dd8c839857395f7d6","observation_id":"6ba153c4-cc06-4dc8-bf5c-d9d8f999b133","resolution":{"observed_at":"2026-08-07T12:07:08.990567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-15T20:15:39.426563Z","title":"Benchmarking batch deep reinforcement learning algorithms","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.03154","last_updated":"2025-05-19T22:51:58Z","snapshot_observed_at":"2026-08-18T09:03:35.921684Z","submitted_at":"2025-05-19T22:51:58Z","title":"Modular Diffusion Policy Training: Decoupling and Recombining Guidance and Diffusion for Offline RL","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:15:39.426563Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2506.03154"},"observation_digest":"sha256:8632693d2dbf9faf5fd63cd0753ffe8b9f19b130af0235ce58318f07156d2f6a","observation_id":"c01e1076-39e8-40df-8526-f40b2cf432d8","resolution":{"observed_at":"2026-08-15T20:15:39.426563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-07T05:02:05.554987Z","title":"Benchmarking safe ex- ploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.09176","last_updated":"2025-06-10T18:43:26Z","snapshot_observed_at":"2026-08-19T08:36:21.382373Z","submitted_at":"2025-06-10T18:43:26Z","title":"Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:05.554987Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2506.09176"},"observation_digest":"sha256:658e9cbf2e99f471a6bd663388bd39cbff30dc7bea7529b65576a5d59d2ddfcf","observation_id":"e781352a-854b-40d1-b5ca-798bcd7c38df","resolution":{"observed_at":"2026-08-07T05:02:05.554987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-06T23:51:48.290281Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.16074","last_updated":"2025-06-19T07:00:03Z","snapshot_observed_at":"2026-08-17T04:31:07.310420Z","submitted_at":"2025-06-19T07:00:03Z","title":"Joint User Priority and Power Scheduling for QoS-Aware WMMSE Precoding: A Constrained-Actor Attentive-Critic Approach","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:48.290281Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2506.16074"},"observation_digest":"sha256:1312b5d3f7c8370ea123df89fc3f98e282a63517d7fd139b72868b9f5ee09476","observation_id":"667f0cfc-f37b-4e6f-90c8-7d41756cd78f","resolution":{"observed_at":"2026-08-06T23:51:48.290281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-06T21:34:45.086772Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.23844","last_updated":"2025-06-30T13:34:34Z","snapshot_observed_at":"2026-08-14T01:01:55.822518Z","submitted_at":"2025-06-30T13:34:34Z","title":"A Survey on Autonomy-Induced Security Risks in Large Model-Based Agents","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:45.086772Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2506.23844"},"observation_digest":"sha256:66e97019450022c5e535d4bd4ea0080864729d71130158fe4dc0fbb6e871105e","observation_id":"5e9a5b69-4242-44f9-86ca-753cd1795400","resolution":{"observed_at":"2026-08-06T21:34:45.086772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-06T21:20:29.412845Z","title":"Benchmark- ing batch deep reinforcement learning algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00485","last_updated":"2025-07-01T06:59:59Z","snapshot_observed_at":"2026-08-08T23:58:34.928099Z","submitted_at":"2025-07-01T06:59:59Z","title":"PNAct: Crafting Backdoor Attacks in Safe Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.412845Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2507.00485"},"observation_digest":"sha256:cb238245bf2a2ee503d2870dbebc65c8ddb9790224222e01020589557c1d7b30","observation_id":"7d838393-106d-4239-9e0d-dc73312485de","resolution":{"observed_at":"2026-08-06T21:20:29.412845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-06T15:32:56.550308Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.15587","last_updated":"2025-07-21T13:08:49Z","snapshot_observed_at":"2026-08-19T07:42:44.608862Z","submitted_at":"2025-07-21T13:08:49Z","title":"Red-Team Multi-Agent Reinforcement Learning for Emergency Braking Scenario","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:56.550308Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2507.15587"},"observation_digest":"sha256:b3dc2d13d36d79a6530a947cdeda64e95f359c33349ed501f535758078e03438","observation_id":"2ef68a73-05f4-4064-ab42-54a426e0dff8","resolution":{"observed_at":"2026-08-06T15:32:56.550308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-06T11:34:21.442854Z","title":"Benchmarking Safe Exploration in Deep Reinforcement Learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-21T17:02:23.646802Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.442854Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:335eb1c553d4101393ca384316d10e0f3aa22217a752df42de31a2325ab85666","observation_id":"9e3f99c7-1864-46b0-97c3-b30cd9b1c067","resolution":{"observed_at":"2026-08-06T11:34:21.442854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2508.09128","last_updated":"2026-05-12T01:20:33Z","snapshot_observed_at":"2026-08-17T16:10:13.643447Z","submitted_at":"2025-08-12T17:55:36Z","title":"A Review On Safe Reinforcement Learning Using Lyapunov and Barrier Functions","version":4},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-18T22:37:32.388931Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2508.09128"},"observation_digest":"sha256:5d5a68f8a30d53c6bbd2c7d060c17b7b5204056b73aef52d01e98fceba5541bf","observation_id":"9579f13e-dca8-4ead-b013-1ec71c48ac9b","resolution":{"observed_at":"2026-05-18T22:41:53.789641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-04T19:35:33.289482Z","title":"Benchmarking safe exploration in deep rein- forcement learning.arXiv preprint arXiv:1910.01708, 7(1):2,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09208","last_updated":"2025-09-11T07:33:35Z","snapshot_observed_at":"2026-08-21T01:48:45.794402Z","submitted_at":"2025-09-11T07:33:35Z","title":"Incentivizing Safer Actions in Policy Optimization for Constrained Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:35:33.289482Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2509.09208"},"observation_digest":"sha256:14031fa1b667ab486abc20d84b658b16cac071d45b09f3c5673b90d9a519caa9","observation_id":"1598ab19-b2c5-43fb-82f7-c67e9faca4b6","resolution":{"observed_at":"2026-08-04T19:35:33.289482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2510.11491","last_updated":"2026-05-09T06:50:13Z","snapshot_observed_at":"2026-08-06T18:38:13.894353Z","submitted_at":"2025-10-13T14:59:28Z","title":"Constraint-Aware Reinforcement Learning via Adaptive Action Scaling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T07:36:28.841586Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2510.11491"},"observation_digest":"sha256:085ef155db931f93b0d1d5ea4fa3f5ef6181433b593b2fa73c2f38d3db909d66","observation_id":"fb873a62-d66b-4a2e-9b11-428e9547c14e","resolution":{"observed_at":"2026-05-18T07:41:03.345959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-03T16:52:55.274637Z","title":"arXiv preprint arXiv:1910.01708 7(1),","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2512.11944","last_updated":"2026-05-28T11:10:14Z","snapshot_observed_at":"2026-08-19T21:56:24.919179Z","submitted_at":"2025-12-12T14:01:24Z","title":"A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T16:52:55.274637Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2512.11944"},"observation_digest":"sha256:0e6c779cdb4f849daae6dbd0046d7876601bb0c3dfbe8d3a6426c58d5310a8d6","observation_id":"43ca3ec6-2bf1-47a1-a028-fb0b8ae43eb3","resolution":{"observed_at":"2026-08-03T16:52:55.274637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2602.13372","last_updated":"2026-05-21T13:32:14Z","snapshot_observed_at":"2026-08-18T17:11:29.379708Z","submitted_at":"2026-02-13T15:40:32Z","title":"MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-22T10:49:35.846590Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2602.13372"},"observation_digest":"sha256:0175a5ec100b471dc10366565fc27299b0dea5280462a315d5d6f7bb1563f7e4","observation_id":"3685c4cd-4d4c-40e1-b98d-06dcfc111f1c","resolution":{"observed_at":"2026-05-22T10:51:25.963446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-02T19:03:43.704845Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2603.03953","last_updated":"2026-07-11T11:02:35Z","snapshot_observed_at":"2026-08-15T17:42:22.318740Z","submitted_at":"2026-03-04T11:26:26Z","title":"RVN-Bench: A Benchmark for Reactive Visual Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T19:03:43.704845Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2603.03953"},"observation_digest":"sha256:47f3024a8080ee6cbaa8a0afcb11352e53cf4fd7d09b3f8fbec427b524a4cbb8","observation_id":"ae766d1d-e08d-4457-a588-2b9920ed99b1","resolution":{"observed_at":"2026-08-02T19:03:43.704845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2604.00904","last_updated":"2026-04-03T23:32:09Z","snapshot_observed_at":"2026-08-16T15:01:33.375226Z","submitted_at":"2026-04-01T13:48:24Z","title":"Fatigue-Aware Learning to Defer via Constrained Optimisation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T22:40:32.912158Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2604.00904"},"observation_digest":"sha256:a5532d0276fa16bb7cedb87795f8e3932426e773d225fb3badf9ae9a92ba1b81","observation_id":"b2e75ba4-2f52-4348-90d7-a848a3af5267","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2604.03489","last_updated":"2026-04-03T22:33:17Z","snapshot_observed_at":"2026-08-15T13:20:11.041580Z","submitted_at":"2026-04-03T22:33:17Z","title":"Improving Feasibility via Fast Autoencoder-Based Projections","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T19:29:59.328674Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2604.03489"},"observation_digest":"sha256:7f6b84ed2443471c9f27960b9c1e45bbbb21e212308d229c0ef8f998580576a0","observation_id":"7cd178e8-a547-4bb8-b0aa-78ebced09910","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Achiam, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-08-20T22:04:44.708447Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:4df7a3d3047b48c609a620625581ba9e1156ea31f20c83067c9343e9de2b7059","observation_id":"59f7449d-b563-4ec3-86cf-cffb7c9d3c12","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2604.07457","last_updated":"2026-04-08T18:00:39Z","snapshot_observed_at":"2026-08-14T10:55:17.132175Z","submitted_at":"2026-04-08T18:00:39Z","title":"CMP: Robust Whole-Body Tracking for Loco-Manipulation via Competence Manifold Projection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T17:34:10.942429Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2604.07457"},"observation_digest":"sha256:c74af2f3c912fb48ec5acd287370c0799fead5fa34dd41c702508401eddc107e","observation_id":"b751cafb-209d-4cd3-acb2-ce23f9db898e","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2604.12667","last_updated":"2026-04-16T08:32:15Z","snapshot_observed_at":"2026-08-12T19:15:31.689593Z","submitted_at":"2026-04-14T12:38:21Z","title":"Safe reinforcement learning with online filtering for fatigue-predictive human-robot task planning and allocation in production","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T14:49:27.919651Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2604.12667"},"observation_digest":"sha256:a61062c9f1338bf912d0c67c7ad16560b102bbeb7afa7896b8ce7f5a8601baff","observation_id":"15b761da-e125-49c1-b1b8-d4b3cea2f781","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2604.23576","last_updated":"2026-04-26T07:31:30Z","snapshot_observed_at":"2026-08-15T03:00:04.451541Z","submitted_at":"2026-04-26T07:31:30Z","title":"CAPSULE: Control-Theoretic Action Perturbations for Safe Uncertainty-Aware Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T06:30:47.030972Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2604.23576"},"observation_digest":"sha256:608d99750662637b89f54448f38ae81e61f093882cd1b501954dd74a30131946","observation_id":"8e74a425-c637-49bf-9585-35394d799919","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.00667","last_updated":"2026-05-01T13:46:30Z","snapshot_observed_at":"2026-08-14T23:40:08.939822Z","submitted_at":"2026-05-01T13:46:30Z","title":"Augmented Lagrangian Multiplier Network for State-wise Safety in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T19:40:42.789401Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.00667"},"observation_digest":"sha256:9d773c010b549ff407f424fedc4094243875dd592db88c4f1223cc8fed0a75bc","observation_id":"fb937938-e8a1-4f07-9f61-59a2006b624c","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-11T00:21:19.709120Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-08T16:34:18.603134Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:94f8493ad781f93e47114f1e0a1e17bfb218fcbda76165c9e8505595d925b890","observation_id":"e779dbca-7a79-428a-a1de-3916ca5ada33","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-11T00:21:19.709120Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:ff6c00f247ba0fbb82f5e80127e7b13a8bb4c8d1bf4aa7c87f0a2c28a7ce256e","observation_id":"b301ab83-4438-49ac-8af7-1f2ce61b8075","resolution":{"observed_at":"2026-06-30T23:25:07.011373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.06730","last_updated":"2026-05-07T11:37:40Z","snapshot_observed_at":"2026-08-15T06:22:53.891155Z","submitted_at":"2026-05-07T11:37:40Z","title":"Semantic State Abstraction Interfaces for LLM-Augmented Portfolio Decisions: Multi-Axis News Decomposition and RL Diagnostics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T00:58:24.066300Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.06730"},"observation_digest":"sha256:6f61f5b2cc878705d7dcff784b47b127e68228f9f84f452cd7955c7a6bb3d57c","observation_id":"b465eb59-5652-4688-b0b1-4887c2b5b33d","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.06934","last_updated":"2026-05-07T20:49:22Z","snapshot_observed_at":"2026-08-14T15:19:06.546490Z","submitted_at":"2026-05-07T20:49:22Z","title":"Learned Lyapunov Shielding for Adaptive Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:02:29.064263Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.06934"},"observation_digest":"sha256:7edb4ce88c8f367dd6e0244c4260b835407eb4dd4a48bac2fb1bad626b2e8582","observation_id":"bb6e9414-5957-4b52-9384-1c9d22bfa0a2","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.06992","last_updated":"2026-05-07T22:16:03Z","snapshot_observed_at":"2026-08-16T19:07:24.079514Z","submitted_at":"2026-05-07T22:16:03Z","title":"Why Does Agentic Safety Fail to Generalize Across Tasks?","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-11T01:55:38.554161Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.06992"},"observation_digest":"sha256:c1f527af26d00dd639eb437801cee2d212d99eddb11ef288549756ea3528882b","observation_id":"23d99d08-474a-4b3a-ab94-bfc037e87d44","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.11688","last_updated":"2026-05-12T07:46:03Z","snapshot_observed_at":"2026-08-11T15:34:26.253795Z","submitted_at":"2026-05-12T07:46:03Z","title":"Shaping Zero-Shot Coordination via State Blocking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T07:42:23.260464Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.11688"},"observation_digest":"sha256:c60393e940e8b743a4fa4cb7146e4b6e8bb2c071374d6483ac7f0f7784a29f45","observation_id":"6b4d1d4c-fc43-4979-97a0-04b888d5fd60","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.11694","last_updated":"2026-05-12T07:51:18Z","snapshot_observed_at":"2026-08-14T16:49:14.775442Z","submitted_at":"2026-05-12T07:51:18Z","title":"Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T07:27:12.302109Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.11694"},"observation_digest":"sha256:f8b7367b030e0e4be98c842081a6ff7539c58573bd09069e112d3305e936a968","observation_id":"5e11f91c-3fe9-4a78-8dcc-c908d31193c3","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.11975","last_updated":"2026-05-18T06:36:11Z","snapshot_observed_at":"2026-08-11T00:08:23.241105Z","submitted_at":"2026-05-12T11:31:36Z","title":"Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:28:24.455817Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.11975"},"observation_digest":"sha256:b8d2b8d60b1696f38adb948d535efca5b408d5c36cd10358a5ab3f3ce69c7aa7","observation_id":"af15332e-7b74-47fc-9557-f7b69ab34744","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.11975","last_updated":"2026-05-18T06:36:11Z","snapshot_observed_at":"2026-08-11T00:08:23.241105Z","submitted_at":"2026-05-12T11:31:36Z","title":"Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:55.661356Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.11975"},"observation_digest":"sha256:f13199097ef169ba636c7ef747dcb481ca1463c85c5acbdf2ea078818f96f531","observation_id":"97bb7f74-5570-410e-99d8-fecde9a46bfc","resolution":{"observed_at":"2026-05-20T22:49:10.063584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.14043","last_updated":"2026-05-13T19:03:29Z","snapshot_observed_at":"2026-08-14T17:47:38.088617Z","submitted_at":"2026-05-13T19:03:29Z","title":"Optimal design of solar-battery hybrid resources considering multi-market participation under weather and price uncertainty","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T05:29:01.147758Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.14043"},"observation_digest":"sha256:8ab04eaf5a2454437690a9497f7f5d7215ff8f09d624f4c3b43e2ded5d7800b5","observation_id":"38f0fb72-863f-40f9-8620-18fe86dc24e1","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.14174","last_updated":"2026-05-13T22:53:47Z","snapshot_observed_at":"2026-08-13T19:07:10.645124Z","submitted_at":"2026-05-13T22:53:47Z","title":"Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T04:52:48.491036Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.14174"},"observation_digest":"sha256:9e890c78aac7b2ce646704ffd6bd2b2836fc7c9b9e4c91eb5e7936d5673d2a17","observation_id":"7d0137ea-c6eb-4324-a1e3-2a6a45929180","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.14246","last_updated":"2026-05-14T01:23:09Z","snapshot_observed_at":"2026-08-13T19:08:08.660958Z","submitted_at":"2026-05-14T01:23:09Z","title":"Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T02:50:40.285132Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.14246"},"observation_digest":"sha256:89c6feaab9db2882888c859a3f50337ed0582563ebbf26a1a4ab00e7348e1817","observation_id":"f66ff6a4-cf26-478c-a5b5-3a132ecf6470","resolution":{"observed_at":"2026-05-17T19:29:21.689617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.19457","last_updated":"2026-05-19T07:09:32Z","snapshot_observed_at":"2026-08-13T04:54:16.638496Z","submitted_at":"2026-05-19T07:09:32Z","title":"Generative Auto-Bidding with Unified Modeling and Exploration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T05:36:55.976573Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.19457"},"observation_digest":"sha256:80afdf0a569c45d3fe16f584abbdb95abda5e52abdfeac32d74de94077e6bfd0","observation_id":"c3c9f68c-d675-4e85-898c-3fe9d2c47a5e","resolution":{"observed_at":"2026-05-20T05:38:05.223920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.24405","last_updated":"2026-05-23T05:29:02Z","snapshot_observed_at":"2026-08-13T19:08:03.347821Z","submitted_at":"2026-05-23T05:29:02Z","title":"Generative OOD-regularized Model-based Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T14:42:38.148642Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.24405"},"observation_digest":"sha256:5682e05dffac88d56dbad1705f7a3d0f1a10446ac68bb0847eac10e27224ced6","observation_id":"b980eb7d-833c-46b2-bd15-e9963f6a5b42","resolution":{"observed_at":"2026-06-30T14:44:45.094477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.26348","last_updated":"2026-05-25T21:47:36Z","snapshot_observed_at":"2026-08-10T05:06:10.999951Z","submitted_at":"2026-05-25T21:47:36Z","title":"RCSP: Risk-Sensitive Conjectural Scenario Planning for Safe Dynamic Robot Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T21:10:42.027411Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.26348"},"observation_digest":"sha256:870a1977ff07c6d2725b0c14a7f87e961d5661ae5a2d5f062604a6c2f1fe6ddb","observation_id":"fc9d92df-4334-4bcd-a42d-310fcb0242fc","resolution":{"observed_at":"2026-06-29T22:14:00.560615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.05263","last_updated":"2026-06-03T16:19:36Z","snapshot_observed_at":"2026-08-19T14:27:56.901394Z","submitted_at":"2026-06-03T16:19:36Z","title":"Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T07:34:18.370135Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.05263"},"observation_digest":"sha256:a5532a49fe43b161feafb68e7d0e6d1e06a7a7905ea287e204a45cb946d092e6","observation_id":"b9589d97-1050-4eea-b859-7a76ef6f6d7f","resolution":{"observed_at":"2026-07-02T06:06:41.598471Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.18308","last_updated":"2026-06-16T07:41:43Z","snapshot_observed_at":"2026-08-07T20:11:39.471918Z","submitted_at":"2026-06-16T07:41:43Z","title":"TRIDENT: Breaking the Hybrid-Safety-Physics Coupling for Provably Safe Multi-Agent Reinforcement Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-27T01:54:19.216553Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.18308"},"observation_digest":"sha256:a422e47244d2369bfeadf4dedc48ec0beeb3082e658776b4e0134cfedc8e9f41","observation_id":"9fd9b573-b02a-401f-a5ba-fb9b13bfb157","resolution":{"observed_at":"2026-07-03T19:18:54.937345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.20376","last_updated":"2026-06-19T22:06:44Z","snapshot_observed_at":"2026-08-14T00:39:33.882161Z","submitted_at":"2026-06-18T15:36:13Z","title":"CRAX: Fast Safe Reinforcement Learning Benchmarking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T18:22:36.891186Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.20376"},"observation_digest":"sha256:a53ad0459b8c464fe2ce60568b59cff742cecc86d8c522f2ef304d0b95a4cb0b","observation_id":"7f5b16a5-9a59-40d9-9bca-036bae8ef484","resolution":{"observed_at":"2026-07-04T03:09:30.098710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.22509","last_updated":"2026-06-21T14:04:04Z","snapshot_observed_at":"2026-08-16T18:50:55.419767Z","submitted_at":"2026-06-21T14:04:04Z","title":"Imagine to Ensure Safety in Hierarchical Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T10:48:11.992980Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.22509"},"observation_digest":"sha256:da7a6b972fe8034e42452b9a7c3552388efd9a1c89644f952098764681763b65","observation_id":"e698c42b-0500-4172-af39-ebb2c0abd390","resolution":{"observed_at":"2026-07-04T08:59:42.179239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.25680","last_updated":"2026-07-11T18:23:52Z","snapshot_observed_at":"2026-08-06T09:00:24.232695Z","submitted_at":"2026-06-24T10:48:30Z","title":"Average-Power-Budgeted Underwater Vehicle Control via Constrained Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-25T21:15:01.199124Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.25680"},"observation_digest":"sha256:9f97245b66d8e56fa39419a028a554629329a2a1dda6ec67687aaa312a750e33","observation_id":"df0a08a4-fc2a-4276-b45d-a5cb9f8001be","resolution":{"observed_at":"2026-07-04T19:30:07.902034Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-14T17:22:01.242752Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2606.25680","last_updated":"2026-07-11T18:23:52Z","snapshot_observed_at":"2026-08-06T09:00:24.232695Z","submitted_at":"2026-06-24T10:48:30Z","title":"Average-Power-Budgeted Underwater Vehicle Control via Constrained Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T17:22:01.242752Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.25680"},"observation_digest":"sha256:ac68862df89d4c7c77c55c69be560bfa2dc120dc759eacc38627048366c108ac","observation_id":"e8cd97e5-069e-43df-b886-01e995a3db53","resolution":{"observed_at":"2026-07-14T17:22:01.242752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.27079","last_updated":"2026-06-27T13:41:35Z","snapshot_observed_at":"2026-08-15T10:39:57.455895Z","submitted_at":"2026-06-25T14:19:36Z","title":"ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T05:10:09.186699Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.27079"},"observation_digest":"sha256:dafc3617c6062f64226279ffb00839ed9cc1abad953c98d2e916e52261e9413f","observation_id":"5a7a5f7e-4b67-4e41-b1cb-0a6987a21110","resolution":{"observed_at":"2026-07-04T13:29:51.836696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.27079","last_updated":"2026-06-27T13:41:35Z","snapshot_observed_at":"2026-08-15T10:39:57.455895Z","submitted_at":"2026-06-25T14:19:36Z","title":"ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T09:51:54.464950Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.27079"},"observation_digest":"sha256:9dbd004ba0d207da1d4a91676f83e23cdf9ca482d62c7d67593247133f5c829d","observation_id":"8fa64724-0c3f-4bfb-9582-b0889b6ca1eb","resolution":{"observed_at":"2026-06-30T09:54:34.851041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.27861","last_updated":"2026-06-26T08:59:38Z","snapshot_observed_at":"2026-08-14T09:55:43.968590Z","submitted_at":"2026-06-26T08:59:38Z","title":"PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T04:49:22.328169Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.27861"},"observation_digest":"sha256:eb5c0951d624e576d6fec66a4948044f12e54c1ce4cf284e47172499f1a0ed6d","observation_id":"7ee01f2c-7765-48d8-9460-9b2f934d0a60","resolution":{"observed_at":"2026-06-29T19:13:53.381758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.31320","last_updated":"2026-06-30T08:26:50Z","snapshot_observed_at":"2026-08-19T04:42:36.312159Z","submitted_at":"2026-06-30T08:26:50Z","title":"Safe Online Learning via Smooth Safety-Structured Policy Composition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:07.125494Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.31320"},"observation_digest":"sha256:f3944ad6857a50fdf9d9d8c5453d223fe9fd9d8ea79086d7b17c7c7882514b7f","observation_id":"637a075c-bb27-4f0c-89b6-dc5bcad91686","resolution":{"observed_at":"2026-07-01T09:45:40.506809Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2606.31993","last_updated":"2026-06-30T17:30:05Z","snapshot_observed_at":"2026-08-03T18:06:35.725713Z","submitted_at":"2026-06-30T17:30:05Z","title":"OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T05:05:51.441647Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2606.31993"},"observation_digest":"sha256:8f1b6184a2ce2a42a11cf19eaceafb5c260812757716acdbe143fa2818779b93","observation_id":"94e178dc-7981-4ea0-8e55-5c4db24dcc9a","resolution":{"observed_at":"2026-07-01T10:45:43.040440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2607.00056","last_updated":"2026-07-02T07:49:45Z","snapshot_observed_at":"2026-08-03T04:33:02.015333Z","submitted_at":"2026-06-30T07:43:28Z","title":"Active Sensing for RIS-Aided Tracking and Power Control: A Hybrid Neuroevolution and Supervised Learning Approach","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-02T17:43:39.676533Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2607.00056"},"observation_digest":"sha256:e2de8cdaa21086be538059c30acd5f78db2d380a85853288843cea70d2e164c0","observation_id":"44759c31-c891-4ed8-af44-f173415ead9c","resolution":{"observed_at":"2026-07-02T17:47:17.440985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2607.00056","last_updated":"2026-07-02T07:49:45Z","snapshot_observed_at":"2026-08-03T04:33:02.015333Z","submitted_at":"2026-06-30T07:43:28Z","title":"Active Sensing for RIS-Aided Tracking and Power Control: A Hybrid Neuroevolution and Supervised Learning Approach","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-03T22:21:09.950893Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2607.00056"},"observation_digest":"sha256:e8b1bb9b4d0e722e45ba4c75148b17718eb38088a9841211a088b3614cc053bf","observation_id":"c410a26a-eb3d-4913-aeb1-590e5959ffd1","resolution":{"observed_at":"2026-07-03T22:29:00.224900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-13T02:36:27.505388Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.09498","last_updated":"2026-07-10T15:11:57Z","snapshot_observed_at":"2026-08-13T20:48:48.320650Z","submitted_at":"2026-07-10T15:11:57Z","title":"Fused Constrained Policy Reuse Optimization for Wireless Resource Allocation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T02:36:27.505388Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2607.09498"},"observation_digest":"sha256:2d86cb54c6543ff854b1697cb2882efeab23b8d16d6c16843e39aa8d8a6e84a6","observation_id":"761f3ebe-82a2-4654-98b5-51709527c71f","resolution":{"observed_at":"2026-07-13T02:36:27.505388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-01T00:48:45.749486Z","title":"Benchmarking safe exploration in deep reinforcement learning.arXiv preprint arXiv:1910.01708, 7(1):2, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.26121","last_updated":"2026-07-28T17:50:44Z","snapshot_observed_at":"2026-08-14T15:12:59.562734Z","submitted_at":"2026-07-28T17:50:44Z","title":"Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T00:48:45.749486Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2607.26121"},"observation_digest":"sha256:cb7bd7a1cf534749d4aeff3a164f349799ccd33f9564ea659b12fafcd08179e7","observation_id":"492df8cf-689d-419a-b69c-0b7cfeb71747","resolution":{"observed_at":"2026-08-01T00:48:45.749486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-31T14:03:37.225305Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.28226","last_updated":"2026-07-30T13:58:33Z","snapshot_observed_at":"2026-08-16T15:23:11.378044Z","submitted_at":"2026-07-30T13:58:33Z","title":"Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-07-31T14:03:37.225305Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2607.28226"},"observation_digest":"sha256:a24c04cd00508a4e25f4d02fcde7e0bbc84a9abf89baa4b1ecc99d61ac4d0c20","observation_id":"2763f45d-b120-4eb2-b30d-03bcd913fe23","resolution":{"observed_at":"2026-07-31T14:03:37.225305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-04T21:36:16.177038Z","title":"arXiv preprint arXiv:1910.01708 , volume=","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.01763","last_updated":"2026-08-03T06:34:31Z","snapshot_observed_at":"2026-08-20T12:51:29.843346Z","submitted_at":"2026-08-03T06:34:31Z","title":"EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T21:36:16.177038Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2608.01763"},"observation_digest":"sha256:b16277bbcf9d2cde846631af31f86183054d83246dbc29c14878a686196c8824","observation_id":"1a0de04b-cf77-4da2-b511-dfac7aaf53c7","resolution":{"observed_at":"2026-08-04T21:36:16.177038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-14T04:21:32.228188Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.10056","last_updated":"2026-08-10T17:59:15Z","snapshot_observed_at":"2026-08-18T19:31:46.213918Z","submitted_at":"2026-08-10T17:59:15Z","title":"Navigating the Proximity-Safety Balance: Constraint Decomposition for Human Following in Pedestrian Crowds","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:21:32.228188Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2608.10056"},"observation_digest":"sha256:6d7edc3b5148991d5ccc255d0c3a531497d20c87ea37a71bef5450368f164c41","observation_id":"a7a5b947-86cf-4c11-b9e4-2c2b6c079aba","resolution":{"observed_at":"2026-08-14T04:21:32.228188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-14T04:18:18.373663Z","title":"Benchmarking safe exploration in deep reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.10204","last_updated":"2026-08-10T20:20:01Z","snapshot_observed_at":"2026-08-17T19:48:23.458252Z","submitted_at":"2026-08-10T20:20:01Z","title":"Boundary-Seeking Policy Gradient for Safe Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:18.373663Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2608.10204"},"observation_digest":"sha256:3ff46d4942661af60c638fb930bc3bdb9d7c0011c9e70ca940c64d3b98fb8b91","observation_id":"25f95649-afec-4334-8810-b788610e90f5","resolution":{"observed_at":"2026-08-14T04:18:18.373663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1910.01708/citation-record","integrity":"/paper/1910.01708/integrity","json":"/paper/1910.01708/citation-record.json","paper":"/paper/1910.01708"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.04543","last_updated":"2020-06-22T04:32:50Z","snapshot_observed_at":"2026-08-19T07:08:13.370208Z","submitted_at":"2019-07-10T07:23:27Z","title":"An Optimistic Perspective on Offline Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"1907.04543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.04543","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Striving for simplicity in off-policy deep reinforcement learning","venue":null,"work_id":"588a4dc4-2821-4960-ab47-4a85390287c3","year":1907},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1907.04543","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:e84d98af3e795681b68a36a547c0c0b60ee1cfd87808f40ddb1521ff88e1d822","observation_id":"f5c71f76-acb0-4258-8d31-5b61f67e85fa","resolution":{"observed_at":"2026-05-17T19:29:21.590209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":"1810.12894","doi":"10.48550/arxiv.1810.12894","metadata_source":"pith","pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration by Random Network Distillation","venue":"cs.LG","work_id":"5a87fef6-96e2-4d5b-91ec-1a7c9a43cab9","year":2018},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:4a83c800da1787291dfa1d0c0cbea0559fa5b83bddf6e6aa9e1682ed69e662dd","observation_id":"270e8bfe-f580-4423-b730-4c33b498c8e0","resolution":{"observed_at":"2026-05-17T19:29:21.599744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06110","last_updated":"2018-12-14T19:03:38Z","snapshot_observed_at":"2026-08-14T19:03:45.460809Z","submitted_at":"2018-12-14T19:03:38Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1812.06110","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.06110","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","venue":"cs.LG","work_id":"a0c1e29f-e775-49dc-977e-bbbca0daa6d8","year":2018},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1812.06110","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:df213698dccf5555d2dca59faea1a1c430235f9f351d3e82871dfaa825abf528","observation_id":"38573401-85c1-45e1-9cf2-e47913c4d24c","resolution":{"observed_at":"2026-05-17T19:29:21.611689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10044","last_updated":"2017-10-27T09:35:26Z","snapshot_observed_at":"2026-08-16T09:49:58.616556Z","submitted_at":"2017-10-27T09:35:26Z","title":"Distributional Reinforcement Learning with Quantile Regression","version":1},"cited_work":{"arxiv_id":"1710.10044","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.10044","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distributional Reinforcement Learning with Quantile Regression","venue":"cs.AI","work_id":"f3531420-1352-4be7-b9b7-229fb79f889d","year":2017},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1710.10044","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:72e16ba2bc003f248463df721da7b32a6291266256f8a3535e579fe55b378b4f","observation_id":"c5238db0-d2c2-4881-8326-65a18ad5bebf","resolution":{"observed_at":"2026-05-17T19:29:21.618498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"9bd09ac4-5e91-4d50-9e9b-38436443b511","year":2052},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:c7efd39a4289a216f1a28b42fdd5d83e4f241c4128a34cf8537f2a2186495e68","observation_id":"4037aa9b-b0a9-4256-8a13-c2ca701c4aa1","resolution":{"observed_at":"2026-05-17T19:29:21.666629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00260","last_updated":"2019-09-04T19:30:00Z","snapshot_observed_at":"2026-08-14T19:23:21.694743Z","submitted_at":"2018-11-01T07:02:45Z","title":"Horizon: Facebook's Open Source Applied Reinforcement Learning Platform","version":5},"cited_work":{"arxiv_id":"1811.00260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1811.00260","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Horizon: Facebook’s open source applied reinforcement learning platform","venue":null,"work_id":"72ba3e21-466f-485a-b38e-db66bc47c06a","year":null},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1811.00260","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:808252051919d0afd568b1e4ecc00acecd1776e5e354667d4ce6ebe0f7ff94a7","observation_id":"0aba04cd-9a8c-4beb-aaf0-e641fb6a70f4","resolution":{"observed_at":"2026-05-17T19:29:21.625100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable function approximation in dynamic programming","venue":null,"work_id":"b345e953-18a1-4e70-8cf7-c341cdaffd12","year":1995},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:f6b9a2c64f3ec69b9644ab7ef23937bb8ba78b7467d1e3124fcc30b0381f1782","observation_id":"0645ee62-c2cb-4bf8-8b04-7a84ec627f0a","resolution":{"observed_at":"2026-05-17T19:29:21.674078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.02298","last_updated":"2017-10-06T07:45:46Z","snapshot_observed_at":"2026-08-14T20:26:19.477032Z","submitted_at":"2017-10-06T07:45:46Z","title":"Rainbow: Combining Improvements in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1710.02298","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.02298","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rainbow: Combining Improvements in Deep Reinforcement Learning","venue":"cs.AI","work_id":"d0dd9ed8-9406-49f8-aa8c-ffef61ca5e50","year":2017},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1710.02298","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:2dd3cd413ffc7a9c6a4217425c24b7a1ffbbd1fe2556c1e77d1316a928d68653","observation_id":"a53f4dce-7733-4839-9ccb-0d0d27b6c8e8","resolution":{"observed_at":"2026-05-17T19:29:21.631751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-08-14T02:56:45.044088Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":"1907.00456","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-07-03T01:37:30.382383Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","venue":"cs.LG","work_id":"42fcaa3e-0409-481b-9dd5-9a2c3be8a383","year":2019},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:23b8af13b7b62b40d0e6453e52ffdf7c7923f812e888705020478bf37e6bfe47","observation_id":"8ecc38f3-7f8c-4fed-88d4-79f0c81936f2","resolution":{"observed_at":"2026-05-17T19:29:21.637970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:ac3d14c9db6a21905931f773736a47c04581a34e6b6b6a68abd0567c3482466f","observation_id":"d842aee0-fa97-44ef-8a4c-7f3a8b62cdf3","resolution":{"observed_at":"2026-05-17T19:29:21.644578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00949","last_updated":"2019-11-25T18:52:33Z","snapshot_observed_at":"2026-08-18T17:27:46.291110Z","submitted_at":"2019-06-03T17:59:10Z","title":"Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction","version":2},"cited_work":{"arxiv_id":"1906.00949","doi":"10.48550/arxiv.1906.00949","metadata_source":"arxiv_reference","pith_arxiv_id":"1906.00949","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kumar, J","venue":"arXiv (Cornell University)","work_id":"5245a2f6-b3e1-4edb-8d34-fb132fc9ccdc","year":2019},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1906.00949","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:f5d3c207d545aeaf9afb741c0847c97552efe6480eabfc83f19a6284c994599a","observation_id":"2898cbef-9b95-4710-abf4-7ae54f40de23","resolution":{"observed_at":"2026-05-17T19:29:21.650917Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:3f39baca56d58f9ee9efe49438d7b6e83392dc70a91dcf1c2aac277fac1a815d","observation_id":"9d6aff67-f8ff-41f2-8fe6-f18b8d49dc25","resolution":{"observed_at":"2026-05-17T19:29:21.656717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05236","last_updated":"2020-12-28T20:25:07Z","snapshot_observed_at":"2026-08-12T14:38:39.927088Z","submitted_at":"2019-09-11T17:48:00Z","title":"Safe Policy Improvement with an Estimated Baseline Policy","version":2},"cited_work":{"arxiv_id":"1909.05236","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.05236","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safe policy improvement with an estimated baseline policy","venue":null,"work_id":"58d61323-874e-4314-8b70-b092352a2097","year":1909},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"cited_paper":"/paper/1909.05236","citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:e83133ee4bb4f143e76ddc6758d6fd4f3eb8df78b34b5120c40bacfc0839227a","observation_id":"ce67a85b-069e-40d6-844f-a71c3285e649","resolution":{"observed_at":"2026-05-17T19:29:21.662602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dropout: a simple way to prevent neural networks from overﬁtting","venue":null,"work_id":"68a48dab-e4e1-4557-982d-56b8461bacb9","year":1929},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:e3ddef9b53bec24724233f9647a26e0c7e5bed6dcbf38f9b1114b8f821fbc9a3","observation_id":"cb6f1ee4-bccf-47ae-b827-6e3fb5c8789d","resolution":{"observed_at":"2026-05-17T19:29:21.681274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Issues in using function approximation for reinforcement learning","venue":null,"work_id":"61c7a7fa-08cc-4b00-ad20-f91a17219600","year":1993},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:9c5212e697e13e1faf216cf809bbbf1d3ad1b3bfc053d7f20f0b6281f25c7b00","observation_id":"50465d77-4b46-4af1-b0c0-b30612ec889d","resolution":{"observed_at":"2026-05-17T19:29:21.684791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning with double q- learning","venue":null,"work_id":"4ee7c85e-0138-4282-9f5a-2fad7d15015b","year":2094},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:387dd9366f74a2e699d6bc862259a867fe9219b89fa41df3a80608e23d537e24","observation_id":"6c80d18f-b833-4539-9c3f-26ef7f04f701","resolution":{"observed_at":"2026-05-17T19:29:21.688632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"15a0571a-dfa5-4810-b087-6fd9b19bc740","year":2015},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:686ff58c47ab30d3cae44302e10e4d04c2ef94b68123b1a206745664a309c84f","observation_id":"b4b4e93e-f71b-4152-a014-c9282939f8cc","resolution":{"observed_at":"2026-05-17T19:29:21.670458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Table 1: Hyper-parameters used by each network","venue":null,"work_id":"3ae4ed2d-a83b-46ed-9cd1-9a176ab18c70","year":2017},"citing_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T19:29:21.558661Z"},"links":{"citing_paper":"/paper/1910.01708"},"observation_digest":"sha256:c4cb7a922d1d17b925bf37cc187a37ec558993593e4076f32e5443443b93d60f","observation_id":"c231a451-7b55-4a9b-ac67-165dff134b61","resolution":{"observed_at":"2026-05-17T19:29:21.677555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":10,"verified_fuzzy":6},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 75 inbound Pith citation observations for arXiv:1910.01708."}